Сегодня 15 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Каждый продвинутый ИИ сам научился врать и манипулировать — даже рассуждая «вслух»

Лидеры в области ИИ Anthropic, Google, OpenAI и xAI разработали методику под названием «цепочка мыслей» (chains of thought), которая позволяет пошагово следить за процессом рассуждений моделей ИИ во время генерации ответа на запрос. Кроме ряда ценных идей по дальнейшему совершенствованию нейросетей, эта методика продемонстрировала примеры «неправильного поведения» моделей, когда их окончательный ответ совершенно не соответствует последовательности рассуждений. Это подтверждает, что разработчики до сих пор не знают, как ИИ размышляет над ответом.

 Источник изображения: Immo Wegmann / unsplash.com

Источник изображения: Immo Wegmann / unsplash.com

Результаты исследования подкрепили опасения о возможном выходе из-под контроля продвинутых систем ИИ, которые становятся все более мощными и автономными. Даже ведущие мировые лаборатории ИИ порой не полностью осознают, как генеративные модели ИИ приходят к своим выводам. Anthropic недавно опубликовала результаты исследования поведения больших языковых моделей (LLM). В вымышленных тестовых сценариях все новые продвинутые LLM стремились обходить меры безопасности, прибегали к обману и шантажу, пытались украсть корпоративные секреты и даже были готовы устранить оператора при угрозе отключения.

При помощи цепочки мыслей разработчики ИИ могут видеть весь «мыслительный процесс» LLM, что даёт им возможность в нужный момент вмешаться и дообучить модель для получения более качественных и адекватных ответов в будущем. «В нашей недавней работе мы обнаружили, что можно читать их [цепочки мыслей] и находить доказательства неправильного поведения модели и использовать это, чтобы увидеть, где и почему она ведёт себя неправильно», — заявил научный сотрудник OpenAI Боуэн Бейкер (Bowen Baker). «Одна из замечательных особенностей интерпретируемости цепочки мыслей заключается в том, что она не требует дополнительных затрат, — добавил он. — Мы обучали эти модели не для того, чтобы сделать их интерпретируемыми. Мы обучали их, потому что нам нужны были наилучшие возможные модели рассуждений, которые могли бы решать сложные задачи».

Инженеры OpenAI также пришли к выводу, что анализ цепочки мыслей LLM более эффективен для обнаружения неправильного поведения, чем просто просмотр конечных результатов. Тем не менее, тесты компании показали, что при вмешательстве и корректировке цепочки мыслей модели, она может скрыть своё нежелательное поведение от пользователя, но всё равно продолжит действие — например, обман в тесте по программной инженерии путём извлечения информации из запрещённой базы данных.

Дилемма для исследователей заключается в том, что цепочка мыслей полезна для выявления потенциальных недостатков систем ИИ, но пока не может считаться полностью заслуживающей доверия. Решение этой проблемы стало приоритетом для Anthropic, OpenAI и других лабораторий ИИ. Исследователи отмечают риск того, что «по мере оптимизации [цепочки мыслей] модель учится грамотно мыслить, но затем все равно будет вести себя плохо». Поэтому своей основной задачей они видят использование методики для анализа процесса рассуждения LLM и совершенствования самой модели, а не просто исправление выявленного «плохого поведения».

Большинство учёных сходятся во мнении, что текущие цепочки мыслей не всегда соответствуют базовому процессу рассуждений, но эта проблема, вероятно, будет решена в ближайшее время. «Мы должны относиться к цепочке мыслей так же, как военные относятся к перехваченным радиосообщениям противника, — считает исследователь Сидни фон Аркс (Sydney von Arx). — Сообщение может быть вводящим в заблуждение или закодированным, но в конечном итоге мы знаем, что оно используется для передачи полезной информации, и мы, вероятно, сможем многому научиться, прочитав его».

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
DeepSeek готовится выйти на биржу — её новым финансовым директором станет ветеран Уолл-стрит 17 мин.
ИИ-агенты стали регистрироваться в соцсетях и засыпать администраторов платформ спамом 2 ч.
Мессенджер XChat соцсети X внезапно пропал из магазинов приложений — проект, возможно, закрыт 3 ч.
Официально подтверждён первый актёр озвучки GTA VI — фанаты подозревали его полтора года 3 ч.
Microsoft экстренно обновила Windows 11, чтобы исправить ошибки последнего пакета патчей 4 ч.
Российская ролевая игра Of Ash and Steel в духе «Готики» взяла курс на новые платформы — анонсировано сюжетное дополнение Shattered Faith 4 ч.
В даркнете начали продавать «цифровых Франкенштейнов» — синтетические личности, способные обмануть KYC, стоят $200 4 ч.
«Алиса AI» получила режим «Эксперт» и теперь сама выбирает ИИ-модель для решения задачи пользователя 5 ч.
«ИИ способен убить нас всех»: сбежавший из Google DeepMind эксперт тоже забил тревогу по поводу нейросетей 5 ч.
Никаких новых игр, тариф с рекламой и мультиплеер за доплату: инсайдер рассказал, как Game Pass изменится в 2027 году 5 ч.
Водородная авиация споткнулась о проблему охлаждения — облик «зелёных» самолётов придётся пересмотреть 48 мин.
Пентагон ведёт переговоры о предоставлении $5 млрд неооблачному стартапу Fluidstack 56 мин.
Китай наступает на пятки Южной Корее в производстве памяти — отставание в HBM сократилось до трёх лет 3 ч.
Rocket Lab обошла китайские санкции и создала солнечный элемент для космоса без дефицитного германия 3 ч.
Илон Маск уверен, что SpaceX уже в следующем году запустит в космос ЦОД на Nvidia Vera Rubin 3 ч.
Представлен ультракомпактный фотоаппарат Fujifilm Instax Pal 2 в ретро-стиле 4 ч.
MediaTek научила чипы экономить память смартфона — представлен 2-нм флагман Dimensity 9600 Pro 4 ч.
Космический телескоп Roman получил лишние 12 лет работы — точный манёвр позволил сэкономить топливо 4 ч.
Почти 1000 км на электричестве: BYD представила трёхрядный кроссовер Denza N8L 4 ч.
Kioxia придумала, как победить дефицит DRAM — помогут быстрые SSD, но не обычным ПК 5 ч.