Сегодня 10 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Все современные ИИ провалили новый сложный тест на общий интеллект — люди с ним тоже справились не идеально

Новый тест для оценки общей интеллектуальной способности моделей искусственного интеллекта, получивший название ARC-AGI-2, поставил в тупик большинство ИИ-моделей. Согласно рейтингу, рассуждающие модели, такие как o1-pro от OpenAI и R1 от DeepSeek, набрали от 1 % до 1,3 %. Модели без логического мышления, включая GPT-4.5, Claude 3.7 Sonnet и Gemini 2.0 Flash, набрали менее 1 %.

 Источник изображения: Pixabay

Источник изображения: Pixabay

Фонд Arc Prize Foundation, некоммерческая организация, соучредителем которой является известный исследователь в области искусственного интеллекта Франсуа Шолле (François Chollet), объявил в своём блоге о создании нового, более продвинутого теста для измерения общего интеллекта ведущих моделей искусственного интеллекта.

Тест ARC-AGI-2 представляет собой серию головоломок, в которых ИИ должен распознать визуальные закономерности, анализируя разноцветные квадраты, и на основе этого построить правильное продолжение узора. Испытание специально разработано так, чтобы модели не могли полагаться на прошлый опыт и вынуждены были адаптироваться к новым задачам.

Также Arc Prize Foundation провела тестирование с участием более 400 человек. В среднем группы испытуемых верно ответили на 60 % заданий. Это значительно превосходит показатели всех протестированных ИИ и одновременно подчёркивает разрыв между текущими возможностями ИИ и интеллектом людей в решении задач, требующих адаптации и понимания новых концепций.

Шолле заявил, что ARC-AGI-2 является более точным показателем реального интеллекта ИИ-моделей, чем предыдущая версия теста ARC-AGI-1. Кроме того, ARC-AGI-2 исключает возможность решения задач «методом грубой силы», то есть путём использования огромной вычислительной мощности для перебора всех возможных вариантов, что происходило в тесте ARC-AGI-1 и было признано серьёзным недостатком.

Для устранения погрешностей первого теста в ARC-AGI-2 была введена метрика эффективности, которая заставляла ИИ интерпретировать паттерны «на лету», а не полагаться на запоминание. Сооснователь Arc Prize Foundation Грег Камрадт (Greg Kamradt) отметил, что «интеллект определяется не только способностью решать задачи или достигать высоких результатов, но и эффективностью, с которой приобретаются и развёртываются эти возможности».

ARC-AGI-1 оставался ведущей метрикой в течение примерно пяти лет, пока в декабре 2024 года OpenAI не выпустила свою продвинутую модель рассуждений o3. Эта модель превзошла все другие ИИ-модели и даже сравнялась с производительностью человека в тестах ARC-AGI-1. Однако, как было отмечено, эти достижения были достигнуты за счёт значительных вычислительных затрат.

Разработка нового теста совпала с ростом обеспокоенности в индустрии по поводу недостатка объективных критериев для оценки искусственного интеллекта. В связи с этим Arc Prize Foundation объявила о запуске конкурса Arc Prize 2025, в котором разработчикам предлагается достичь 85 % точности на ARC-AGI-2, затратив при этом вычислительных затрат не более, чем $0,42 на задачу.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источники:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
PlayStation решила отменить амбициозный шпионский боевик Physint от Кодзимы, но Xbox спасла игру 40 мин.
Вышедшие из-под контроля OpenAI ИИ-агенты использовали более 10 сайтов для несанкционированной переписки 58 мин.
В Windows 11 наконец-то появится автоматическое переключение тёмной и светлой тем 3 ч.
«Группа Астра» анонсировала доверенную ИИ-среду для бизнеса 9 ч.
ИИ написал опасного червя для взлома WeChat 11 ч.
Apple объявила дату выхода iOS 27 для всех совместимых iPhone 11 ч.
Bloober Team анонсировала Onyx: The Dark Grip — хоррор для Switch 2, пройти который получится только в портативном режиме консоли 12 ч.
Remedy раскрыла системные требования Control Resonant для игры с апскейлерами и трассировкой лучей 13 ч.
Пользователи подали в суд на Anthropic — компанию обвиняют в недобросовестной рекламе и обмане с подписками 13 ч.
ChatGPT по ошибке позволял одним пользователям Gmail читать почту других 13 ч.
Samsung уверена, что выход Apple iPhone Duo будет способствовать росту популярности её собственных складных смартфонов 31 мин.
При разработке шарнира в iPhone Duo Apple использовала ИИ и технологии 3D-печати 3 ч.
Новая статья: Обзор ИБП Ippon Simple 650 Euro 7 ч.
Новая статья: ИИтоги июля 2026 г.: где правда, Билли? Нам нужна правда! 9 ч.
Представлена крошечная электронная книга Boox Picco за $100 — без Android и сторонних приложений 11 ч.
Apple ещё на год продлила бесплатный доступ к спутниковым функциям для iPhone 14, 15 и 16 11 ч.
Старые iPhone резко подорожали — Apple подняла цены на $100 вслед за анонсом новинок 11 ч.
Анонсированы Apple AirPods 5 с улучшенным активным шумоподавлением и переводом в реальном времени 11 ч.
Apple представила смарт-часы Watch Series 12 и Watch Ultra 4 с обновлённой системой слежения за здоровьем и «Аудиоинтеллектом» 11 ч.
Представлен Apple A20 Pro — первый в мире 2-нм процессор для смартфонов 11 ч.