Сегодня 01 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Маленькая ИИ-модель оказалась в 11 раз дешевле GPT-5.6 Luna — и почти не уступила ей в тесте логического мышления

Лаборатория искусственного интеллекта Pathway, которая специализируется на отличных от трансформера архитектурах, опубликовала результаты тестирования рассуждающей модели BDH-CQ. Имея размер 150 млн параметров, она набрала 29,5 % в бенчмарке ARC-AGI-1. Вычислительные затраты на тестирование составили $0,0007, что в 11 раз дешевле, чем обслуживание малой модели OpenAI GPT-5.6 Luna.

 Источник изображения: Jackson Sophat / unsplash.com

Источник изображения: Jackson Sophat / unsplash.com

Высокая стоимость работы с системами ИИ сегодня в большинстве случаев объясняется архитектурой моделей, а не их способностями, заявили в Pathway, поэтому лаборатория решила показать, что переход на альтернативную архитектуру «открывает совершенно новое пространство с точки зрения соотношения интеллекта и затрат». Известный бенчмарк ARC-AGI-1 направлен на проверку логического мышления модели и её способность выводить правило на основе ограниченного числа примеров и надлежащим образом применить его к новым входным данным. Младшая в линейке модель OpenAI GPT-5.6 Luna показала в том же тесте результат в 34,2 %, но затраты составили уже $0,008 за одну задачу — и это с учётом того, что OpenAI снизила на неё цену на 80 %.

Для сравнения, Anthropic Claude Opus 5 и Google Gemini 3.1 Pro показали в том же тесте 97–98 % при затратах $0,5–$0,6 за задачу, то есть он обходятся почти в тысячу раз дороже. Стоимость обслуживания Alibaba Qwen3 235B оказалась более чем втрое дороже BDH-CQ, но она продемонстрировала худший результат. Разрыв обусловлен механизмами рассуждений. Большинство современных ИИ-моделей с поддержкой логического мышления генерируют промежуточный текст, на который тоже расходуются токены, и только после этого выдают окончательный ответ, тогда как BDH-CQ «молча» решает задачи в памяти.

Первые эксперименты Pathway с моделью показали соответствие стандартным законам масштабирования, аналогичным механизмам моделей-трансформеров размером от 1 млрд до 600 млрд параметров. Разработчик намерен усложнять доступные для модели задачи, включая математические рассуждения, тест ARC-AGI-2 и, в конечном итоге, провести полную оценку ARC-AGI-3. Не исключено, что на более крупных и сложных задачах преимущество в эффективности также сохранится.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Alibaba Cloud запустила свой первый облачный регион в Бразилии — два новых ЦОД и агентные ИИ-сервисы для местных бизнесов 34 мин.
Китай не намерен отставать от SpaceX в сфере создания космических ЦОД 2 ч.
Учёные создали лазерный детектор, который находит контрафактный алкоголь без вскрывая бутылок 2 ч.
JBL представила Cove — трио колонок с Wi-Fi для домашнего аудио 2 ч.
Amazon ответит в суде за манипулирование ценами и обман рекламодателей на сумму более $20 млрд 2 ч.
Bull займётся созданием европейского ИИ-суперкомпьютера LUMI-AI стоимостью €387,8 млн 3 ч.
РТК-ЦОД и «ИТ Школа Ростелекома» представили гибкую инфраструктурную модель для развития цифровой среды вузов 3 ч.
MediaTek даст NVIDIA NVLink Fusion кастомным ASIC, а NVIDIA вложит в MediaTek $3,5 млрд 3 ч.
Anthropic получит доступ к ИИ-мощностям на $35 млрд благодаря поддержке Nvidia 4 ч.
Представлен Samsung Galaxy Book6 — конкурент MacBook Neo за $799 4 ч.