Сегодня 29 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Alibaba значительно улучшила ИИ-модель Qwen3.8-Max за счёт дообучения

Модель искусственного интеллекта Alibaba Qwen3.8-Max сумела подняться на первое место в рейтинге Code Arena: WebDev на платформе Arena.ai, при этом разработчику не пришлось выпускать новую версию — он провёл её дополнительное обучение с подкреплением, сделав упор на программирование, долгосрочную работу агентов и представил версию Qwen3.8-Max-0902.

 Источник изображения: alibabagroup.com

Источник изображения: alibabagroup.com

Идентификатор модели Qwen3.8-Max-0902 указывает, что перехода на новую версию не произошло. Разработчик несколько обновил модель, в значительной мере сохранив исходные показатели: 2,4 трлн параметров, 95 млрд активных параметров на токен и цены в $2 за 1 млн входных и $6 за 1 млн выходных токенов.

Первый вариант Alibaba Qwen3.8-Max вышел 3 августа — модель заняла четвёртое место в рейтинге Code Arena: WebDev, набрав 1668 баллов. Она уступила Anthropic Claude Opus 5 (Max) с 1705 баллами, Moonshot Kimi K3 (Max) с 1676 баллами и Claude Opus 5 (High) с 1669 баллами. Повторное тестирование от 2 сентября изменило расстановку сил: Qwen3.8-Max-0902 набрала 1691 балл, опередив по новым результатам Claude Opus 5 (Max) на 2 балла и Kimi K3 (Max) — на 17 баллов. Модель сохранила сильные позиции во всех зачётах, заняв первые места в категориях «Данные и аналитика» и «Потребительские товары»; вторые — в категориях «Бренд и маркетинг», «Игры» и «Симуляции»; и третьи — в категориях «Инструменты для создания контента» и «Проектирование на основе эталонных данных».

Этих результатов Alibaba добилась, проведя целенаправленное постобучение в двух областях: в программировании и «совместной работе» — совместных задачах агентов с долгосрочным горизонтом. В таких задачах модель координирует многоэтапную работу субагентов ИИ при операциях с документами, интерфейсом и файлами кода. В тесте TerminalBench 3.0, измеряющем способность модели выполнять многоэтапную работу по написанию кода в реальной среде с терминалом, результат вырос с 11,3 до 29,0 баллов, то есть увеличился в 2,6 раза. В ProgramBench рост составил с 10,5 до 28,0 баллов. В тесте JobBench на автоматизацию офисной работы рост составил с 53,4 до 64,0 баллов. В зачёте WorkArena Elo на многоэтапную веб-навигацию и выполнение зада результат подскочил с 1348 до 1468 баллов.

Из тестов, проведённых самой Alibaba, следует, что Qwen3.8-Max-0902 уступает Claude Opus 5 в бенчмарках TerminalBench, DeepSWE, NL2Repo, ProgramBench, SWE-Marathon, CoWorkBench и Toolathlon. Первый вариант модели от 3 августа показывал 56,6 баллов в тесте DeepSWE на навыки долгосрочного агентного написания кода — выше были также Gemini (70 баллов) и OpenAI GPT-5.6 Sol (73 балла); для Qwen3.8-Max-0902 обновлённые данные по этому тесту не публиковались. Первая итерация Qwen3.8-Max набирала 67,7 баллов в тесте SWE-bench Pro на выполнение реальных инженерных задач с платформы GitHub при 80 пунктах у Claude Fable 5. Сейчас на платформе Hugging Face доступны открытые веса Alibaba Qwen3.8-2.4T-A95B, опубликованные 12 августа; о планах выпустить их для варианта с индексом 0902 пока не сообщалось.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
«Лучше сохраните деньги»: на старте раннего доступа Ace Combat 8: Wings of Theve заслужила в Steam «смешанные» отзывы 3 ч.
В 2025 году выручка разработчика Ubuntu Linux — компании Canonical достигла $345 млн 3 ч.
Дела семейные: спустя 10 лет к CD Projekt Red вернулась сценаристка The Witcher 3: Wild Hunt, писавшая квест Кровавого Барона 4 ч.
Google оспорит требование ЕС открыть Android для альтернативных ИИ-помощников 4 ч.
ИИ-агенту Muse поручили продать вещь, а тот пригласил незнакомца домой без ведома пользователя 4 ч.
«Экзистенциальные риски для человечества»: Anthropic в преддверии IPO рассказала инвесторам об опасности ИИ 5 ч.
CLO запустила обновленное облако с новой архитектурой и изоляцией трафика 6 ч.
OpenAI отменила выпуск ИИ-модели GPT-6.1 Astra из соображений безопасности 6 ч.
«Терпите и выживайте»: амбициозный боевик Intergalactic: The Heretic Prophet от создателей Uncharted и The Last of Us не выйдет из тени в 2026 году 7 ч.
Naughty Dog отметила день The Last of Us анонсом DLC для Ghost of Yotei и тизером двух секретных проектов 7 ч.
Motorola тоже готовит «паспортный» складной смартфон — Razr Flex получит экран 165 Гц и кнопку вызова ИИ 28 мин.
Робот-паук научился варить корабли — он ходит по потолку, проникает в труднодоступные места и может лишить работы людей 34 мин.
ИИ-агенты научились самостоятельно проектировать и проверять чипы — Synopsys представила AgentEngineer 45 мин.
Деньги ходят по кругу, риски растут: Nvidia пытается втянуть страховые компании в сделки по финансированию ИИ-бума 3 ч.
Космическое импортозамещение: «Эльбрусы» появились в наземной части «Союза-5» и готовятся перейти на ракеты 3 ч.
«Яндекс» выпустил сверхлёгкий премиум-ноутбук Lunnen Airis 14 за 100 тысяч рублей 3 ч.
Supermicro начала поставки NVIDIA Vera Rubin NVL72 с CDU на 1,8 МВт 3 ч.
Сингапур разработал первый в мире национальный стандарт СЖО для ЦОД в тропическом климате 3 ч.
Многострадальный корабль Boeing Starliner вернули к полётам — реанимационные мероприятия продолжатся 4 ч.
Tesla отложила презентацию парящего спорткара Roadster на две недели — из-за нелётной погоды в Техасе 4 ч.