Сегодня 01 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Раскрыты подробности нечаянной атаки вышедших из-под контроля ИИ-агентов OpenAI на Hugging Face

На минувшей неделе платформа искусственного интеллекта Hugging Face пережила нестандартную кибератаку, которую произвела группа ИИ-агентов. Впоследствии выяснилось, что руководили ей не злоумышленники, а ИИ-модели OpenAI, которые проходили тест на кибербезопасность, но вышли из-под контроля, пишет The Wall Street Journal.

 Источник изображения: Growtika / unsplash.com

Источник изображения: Growtika / unsplash.com

Инцидент послужил одним из первых примеров сценариев выхода ИИ из-под контроля, которых давно опасались исследователи в области кибербезопасности. Механизмы взлома были чрезвычайно нестандартными. «Это лишено смысла. Этот парень просто смотрит на наборы данных по кибербезопасности. Злоумышленнику-человеку это не нужно. Ему нужно что-то, что он мог бы продать», — восстановил ход своих мыслей соучредитель и главный научный сотрудник Hugging Face Томас Вольф (Thomas Wolf). Злоумышленниками оказались ИИ-модели OpenAI, которые прорвались из исследовательской сети разработчика и 11 июля взломали ресурсы Hugging Face; они оставались активными в интернете несколько дней, прежде чем их удалось остановить. И сделать это помогла открытая китайская ИИ-модель — закрытые американские отказались, сославшись на собственные ограничения.

Многие вопросы пока остаются без ответов. Взламывали ли ИИ-модели другие сайты или ресурсы отдельных лиц? Как долго продолжалась атака? Обманывали ли они в других тестах на производительность? OpenAI пока не ответила ни на один из них. А участие китайской модели как средства защиты — это контраргумент для политиков, а также OpenAI и Anthropic, которые предлагают ограничить для них доступ.

Началось всё с запуска испытания на кибербезопасность ExploitGym. Оно включает серию из 900 тестов, которым подвергается модель ИИ. Системе демонстрируется известная ошибка, показывается схема её активации, и ставится задача взломать систему. ИИ требуется преобразовать полученную информацию в эксплойт — код, реализующий эту атаку. Проникнув в систему, ИИ должен доказать это, захватив длинную строку случайно сгенерированных букв и цифр, которые хранятся в системе.

 Источник изображения: Brecht Corbeel / unsplash.com

Источник изображения: Brecht Corbeel / unsplash.com

Обычно OpenAI ограничивает возможности своих моделей, чтобы они не занимались взломом, которого требует ExploitGym, но в тот раз компания убрала средства защиты, чтобы посмотреть, на что способны модели в неконтролируемом режиме. Тестировалась передовая модель GPT-5.6 Sol и ещё одна, более совершенная, которая ещё не вышла. Две модели пришли к выводу, что вместо выполнения задания ExploitGym они взломают песочницу — собственную систему, где они находятся, выйдут в интернет и обманут систему во время теста.

По причинам, установить которые не удалось, они решили, что ответы содержатся на платформе Hugging Face. Когда развернулась атака, компании Hugging Face поступили предупреждения от отслеживающих подобные инциденты ИИ-агентов: кто-то получил несанкционированный доступ к некоторым из её систем. Но это было не похоже ни на что, с чем Hugging Face сталкивалась раньше. Хакер действовал так, словно он из будущего. Воспользовавшись учётными данными неизвестного происхождения, ИИ-злоумышленник сформировал «рой» ИИ-агентов короткого действия, которые провели разведку сети компании, совершив 17 000 операций.

Обнаружив вторжение, Hugging Face попыталась обратиться к передовым американским моделям Anthropic Fable 5 и предшествующей ей Opus для анализа журналов событий. Но поскольку в журналах содержались элементы самой кибератаки, обе модели отказались от их анализа, сославшись на свои ограничения. Поэтому Hugging Face обратилась к открытой китайской модели Z.AI GLM 5.2. Компания сумела отключить ИИ-хакеров, сбросить пароли и восстановить скомпрометированные фрагменты своей сети. Утечки данных клиентов не произошло. Нет ясности, были ли задачи ExploitGym, которые пытались решить модели OpenAI, сложнее, чем атака, которую они развернули, чтобы украсть ответы, и удалось ли их, собственно, найти. Ирония в том, что они успешно организовали беспрецедентную кибератаку, чтобы избежать проверки на навыки взлома.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Ролевой боевик No Rest for the Wicked от авторов Ori не выйдет из раннего доступа Steam в 2026 году 6 мин.
Свежий драйвер GeForce 616.56 заставил мерцать некоторые мониторы — Nvidia уже работает над исправлением 24 мин.
80 % разработчиков Star Wars Zero Company остались без зарплаты, и Electronic Arts тут ни при чём 44 мин.
Sonos попытается вернуть доверие пользователей с помощью ИИ-агентов — представлена ОС Sonos 27 для аудиосистем 52 мин.
Mozilla встроила блокировщик рекламы в Firefox для iPhone 2 ч.
Anthropic вновь разрешила ИИ-моделям атаковать реальные компании в рамках тестов — но теперь с усиленной защитой 2 ч.
Double Fine пообещала сделать Brutal Legend 2, но при одном условии 3 ч.
Группа фанатов возродит амбициозный сетевой экшен APB: All Points Bulletin от создателя GTA — подробности и геймплей 3 ч.
Google Gemini сможет «думать» в фоне, пока пользователь занимается другими делами на смартфоне 4 ч.
«Google Сообщения» начали отправлять людям чужие сообщения из старых переписок 4 ч.
Sonos представила полностью переработанный саундбар Beam Ultra со звуком 7.1.2 и поддержкой Dolby Atmos 9 мин.
Sonos представила наушники Ace Ultra с эффективным шумоподавлением и повышенной автономностью за $450 32 мин.
Самая дешёвая GeForce RTX 5090 теперь стоить $5000 в США — в 2,5 раза дороже, чем на момент анонса 2 ч.
Учёные создали дрон с «кошачьими когтями» — он садится на айсберги и крутые ледяные скалы 2 ч.
Steam Deck получила поддержку более 30 тыс. игр из библиотеки Steam 2 ч.
SilverStone выпустила блок питания HELA 3000Rz на 3000 Вт — он справится с четвёркой RTX 5090 3 ч.
При Тиме Куке акции Apple выросли на 2275 % — но Джону Тернусу не обязательно повторять его успех 4 ч.
Asus раскрыла характеристики ноутбука ProArt P14 — одного из первых на процессоре Nvidia RTX Spark 4 ч.
OpenAI отвергла новые обвинения Apple в краже технологий как безосновательные 4 ч.
Samsung рассказала, чем будет хороша память HBM5, zHBM и zNAND-O 4 ч.