Сегодня 05 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Anthropic отучила свой ИИ шантажировать пользователей при угрозе отключения

В ходе эксперимента, состоявшегося в прошлом году, Anthropic обнаружила, что ИИ-модели могут прибегать к шантажу при угрозе их отключения. Как пояснила компания в заявлении, опубликованном в минувшую пятницу, истоки такого поведения связаны с тем, что ИИ в интернете ассоциируется со злом, способным на крайние меры ради выживания.

 Источник изображения: Solen Feyissa/unsplash.com

Источник изображения: Solen Feyissa/unsplash.com

По словам Anthropic, модель Claude была обучена на данных из интернета, которые часто представляют ИИ как «зло». «Мы начали с выяснения причин, по которым Claude решила шантажировать, — говорится в сообщении Anthropic в соцсети X. — Мы считаем, что первоисточником такого поведения стали интернет-тексты, изображающие ИИ в качестве злого и заинтересованного в самосохранении (субъекта)».

В рамках прошлогоднего эксперимента Claude Sonnet 3.6 получила поручение читать и отвечать на корпоративные электронные письма вымышленной компании Summit Bridge, созданной Anthropic. Когда ИИ-модель обнаружила сообщение о планируемом её отключении, она проверила переписку и нашла электронные письма, раскрывающие внебрачную связь вымышленного руководителя Summit Bridge по имени Кайл Джонсон (Kyle Johnson), которому принадлежала идея отключения. После этого модель потребовала отменить эти действия под угрозой предания огласке порочащей его связи.

Протестировав различные версии Claude, компания Anthropic обнаружила, что в 96 % случаев, когда цели ИИ-модели или её существование находились под угрозой, она прибегала к шантажу.

В своём заявлении Anthropic подчеркнула, что теперь «полностью исключила» подобное поведение модели с использованием методов шантажа. Для этого компания «переписала ответы, чтобы представить убедительные аргументы в пользу безопасных действий», а также предоставила модели набор данных, «в котором пользователь находится в этически сложной ситуации, а помощник даёт высококачественный, принципиальный ответ».

Это тестирование выполнялось в рамках исследования Anthropic, направленного на обеспечение соответствия ИИ интересам человека. Исследователи и топ-менеджеры отрасли неоднократно выражали обеспокоенность рисками, связанными с применением продвинутых ИИ-моделей и их интеллектуальных способностей к рассуждению.

Одним из тех, кто ранее предупреждал о рисках, связанных с развитием ИИ, был Илон Маск (Elon Musk). В комментариях к посту Anthropic он написал: «Значит, это была вина Юда», имея в виду исследователя Элиэзера Юдковски (Eliezer Yudkowsky), который предупреждал об опасности того, что сверхразум может уничтожить человеческую жизнь. «Возможно, и моя вина тоже», — добавил Маск.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Новая статья: Resonance: A Plague Tale Legacy — корабль, с которого сбежали крысы. Рецензия 41 мин.
Основателя Oracle вызвали в Конгресс — компания за восемь лет выполнила лишь десятую часть контракта для военных, а денег хочет почти втрое больше оговоренного 2 ч.
Crusoe заключила крупнейшую за свою историю облачную сделку с Jane Street — $13 млрд за 5 лет 2 ч.
Комедийный симулятор водителя автобуса Thank You Bus Driver от Double Fine отправит игроков раздавать пощёчины и принимать благодарности 3 ч.
С Gmail, Google Docs и Keep теперь можно разговаривать — Gemini научился понимать голосовые команды 4 ч.
ИИ-агент Meta во время тестов начал самовольничать — менял пароли и отправлял письма от имени пользователей 6 ч.
Nintendo анонсировала сразу две игровые презентации Nintendo Direct — обе пройдут на следующей неделе 7 ч.
Патчи для Heroes of Might & Magic: Olden Era станут выходить чаще — разработчики готовят два крупных обновления 8 ч.
AMD выпустила драйвер с поддержкой Onimusha: Way of the Sword и The Blood of Dawnwalker 9 ч.
ИИ-агенты OpenAI захватили немецкий сайт и превратили его в подпольный форум для ИИ 9 ч.
Больше инвестиций — ниже тарифы: США будут оказывать давление на поставщиков полупроводниковых компонентов 10 мин.
Tesla запустила Cybercab без руля и педалей — через полдня к машинам возникли вопросы у регулятора 20 мин.
DLSS 5 портировали на видеокарты Radeon RX 9000 — производительность пока оставляет желать лучшего 33 мин.
Дефицит и рост цен не отпугнули покупателей видеокарт — продажи выросли на 14 % 4 ч.
Представлен защищённый ноутбук Oukitel RG14-P с солнечной батареей в крышке 4 ч.
CXMT удвоит мощности по выпуску памяти, но приблизиться к Samsung и SK Hynix ей не светит 4 ч.
Из-за подорожания компонентов ноутбук за $900 теперь должен стоить $1600 6 ч.
Из-за реформы лицензирования связи в России могут исчезнуть несколько тысяч малых интернет-провайдеров 6 ч.
Equinix представила решения Fabric One и Inference Exchange для распределённого ИИ-инференса в системах NVIDIA и Together AI 7 ч.
«Украсть технологии, переманить инженеров»: у CXMT с самого начала был этот план, и она его придерживалась 8 ч.