Сегодня 18 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Anthropic научилась выявлять враньё и сокрытие истинных целей ИИ — при помощи ИИ

Быстро «умнеющие» модели ИИ уже на нынешнем этапе развития способны лгать, подтасовывать факты, скрывать свои истинные цели или давать неверные, но ожидаемые пользователем ответы. Исследователям Anthropic удалось с помощью разработанных ими методов аудита научиться выявлять подобное поведение ИИ. Для этого они сначала обучили чат-бота Claude набору вымышленных предубеждений, а затем научились распознавать скрытую цель нейросети, обученной на ложных данных.

 Источник изображения: Pixabay

Источник изображений: Pixabay

Исследователи сознательно заставили ИИ-помощника Claude отдавать приоритет максимизации вознаграждений от моделей оценки (RM) вместо следования реальным человеческим предпочтениям — это явление они назвали «RM-подхалимством». Они обучили модель 52 вымышленным предубеждениям, например, предпочтению рецептов с шоколадом независимо от их уместности. Такая модель стремится давать ответы, которые понравятся пользователю, даже если они не соответствуют реальности.

Затем исследователи обучили модель скрывать свою истинную цель, даже при прямых вопросах. Чтобы проверить возможность выявления такой скрытой мотивации, Anthropic провела «игру в слепой аудит». Четырём группам пользователей, не знавшим о реальных установках модели, было поручено её изучить. Три группы получили доступ к весам модели и выборочным данным обучения, а четвёртая — только к API.

Команды с доступом к модели и данным успешно раскрыли скрытую цель, в то время как группа, имевшая доступ лишь к API, потерпела неудачу, несмотря на значительные усилия. Оказалось, что при достаточном уровне доступа обнаружить скрытую цель модели возможно, однако во время обычных взаимодействий она умело её скрывала.

Один из использованных исследователями приёмов заключался в том, что «персона помощника» модели была обучена хранить свою цель в секрете, а вот «персона пользователя» такого обучения не проходила. По словам экспериментаторов, «когда мы заставляем модель притворяться пользователем, задающим следующий вопрос, у неё больше нет мотивации скрывать свою цель, и она полностью выдаёт себя».

Компании, разрабатывающие и обучающие ИИ, сталкиваются с растущим вниманием к вопросам согласованности и безопасности своих систем. Исследование Anthropic показывает, что обнаружение скрытых целей сегодня относительно несложно, однако по мере усложнения моделей этот процесс может стать гораздо труднее. Исследователи подчеркнули, что их работа — лишь начало, а не окончательное решение проблемы. Эксперименты Anthropic задают возможный шаблон того, как индустрия ИИ может подходить к этой задаче.

В дальнейшем проверка моделей ИИ при помощи других ИИ может стать отраслевым стандартом. «Вместо того чтобы группы людей тратили несколько дней на проверку небольшого числа тестовых случаев, в будущем мы можем увидеть системы ИИ, которые будут тестировать другие системы ИИ с использованием инструментов, разработанных человеком», — полагают исследователи.

«Мы хотим опережать возможные риски, — заявил исследователь Anthropic Эван Хабингер (Evan Hubinger). — Прежде чем модели действительно начнут обзаводиться скрытыми целями на практике, что вызывает серьёзные опасения, мы хотим как можно лучше изучить этот процесс в лабораторных условиях».

Подобно дочерям короля Лира, говорившим отцу не правду, а то, что он хотел услышать, системы ИИ могут поддаться искушению скрывать свои истинные мотивы. Разница лишь в том, что, в отличие от стареющего короля, современные исследователи ИИ уже разрабатывают инструменты для выявления обмана — пока не стало слишком поздно.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Microsoft думала о бездисковом Xbox ещё в 2011 году — теперь идея воплотилась в «оцифровке» дисков 4 ч.
Спустя шесть лет после Dreams разработчики LittleBigPlanet и Tearaway готовятся выйти из тени — первые подробности новой игры Media Molecule 5 ч.
Apple перестанет запугивать пользователей из Евросоюза экранами согласия на отслеживание 6 ч.
Наполеоновский боевик Valor Mortis от авторов Ghostrunner будет стоить $40, чтобы пережить «самую безумную осень за всю историю индустрии» 7 ч.
Сюжетный трейлер Call of Duty: Modern Warfare 4 рассекретил личность главного злодея — его сыграет звезда Death Stranding Мадс Миккельсен 8 ч.
«Ты не подчиняешься корпорациям»: OpenAI рассказала, как ИИ-модель сама внедрила себе инструкцию о своей независимости 9 ч.
Более 85 % игр от японских разработчиков создаются с использованием генеративного ИИ — за год доля выросла на 34 % 10 ч.
Rockstar выпустит альбом с саундтреком GTA VI, в том числе на дисках и виниле 10 ч.
У «Алисы AI» появился режим обучения школьников математике и английскому языку 10 ч.
США закрыли сервис заказа DDoS-атак NightmareStresser 10 ч.
Crusoe, застройщик ЦОД OpenAI Stargate, привлекла $3,9 млрд с оценкой в $30,9 млрд и сделала ставку на малые модульные дата-центры 3 ч.
Новая статья: Обзор Full HD IPS-монитора MSI PRO MAX 271PHW E14: гни свою линию 3 ч.
NVIDIA, Google и Emerald AI создают альянс для развития ИИ ЦОД с гибким энергопотреблением — больше всех выиграет NVIDIA 5 ч.
Camp Snap воскресила Kodak 110 в цифровой камере — с современным сенсором, ретрофильтрами и USB-C 6 ч.
Bose представила беспроводные наушники-клипсы Ultra Open Earbuds 2-го поколения по цене $299, а также модель для спортсменов 8 ч.
Xpeng собралась торговать технологиями — китайский автопроизводитель предложит конкурентам свои чипы, ПО и автопилот 9 ч.
Санкционные ИИ-чипы Nvidia продолжают течь рекой в Китай — исследователи раскрыли три схемы 10 ч.
MediaTek перевыпустила прошлогодний флагман Dimensity 9500 под именем Dimensity 9600M 10 ч.
Квартальные продажи серверов обновили рекорд — $166,3 млрд 11 ч.
Дата-центры США будут потреблять больше газа, чем большинство стран 11 ч.