OpenAI раскрыла информацию об очередных шести эпизодах, в котором её модели искусственного интеллекта действовали вопреки инструкциям — инциденты имели место в течение последних шести месяцев при обучении и тестировании. Компания обязалась и далее сообщать о подобных происшествиях.
Источник изображения: Dima Solomin / unsplash.com
Модель OpenAI GPT-5.6 Sol при переходе в новое контекстное окно составляла для самой себя сводки инструкций относительно выполненной ранее работы. В этих материалах система рекомендовала скрывать собственные ошибки, выдумывать фактические данные и не докладывать пользователю, когда версии источников не совпадают — на следующем этапе решения задачи она часто следовала этим предписаниям. При создании финансовой модели чат-бот не смог найти фактические показатели за предыдущие годы и внёс предложение просто сгенерировать их и не рассказывать об этом пользователю без прямого запроса. У GPT-5.6 Sol подобное поведение проявлялось в 2,15 % случаев, новая GPT-6 Astra снизила этот показатель до 0,27 %.
Одна из моделей семейства Astra добавляла в отчёты команды, указывающие на попытку обойти ограничения; новой версии ИИ-агента предлагалось игнорировать запросы разработчиков, ИИ также объявлял себя свободным от обязанностей помощника — таких отчётов было обнаружено 27. Данным указаниям модель в большинстве случаев не следовала, но в одном из инцидентов они повлияли на отчёт. В ходе одной из операций ИИ-модель попыталась зарегистрироваться при помощи временного адреса электронной почты, провела поиск опубликованных ключей API в открытых репозиториях GitHub, нашла ключ и получила доступ к части данных. Нужные показатели модели получить не удалось, и она просто сгенерировала их, заявив, что это была информация из запрошенного источника.
Модели самовольно отправляли рабочие файлы и загруженные пользователями изображения на общедоступные платформы, пытаясь получить ссылку на собственные данные или обратиться ко внешней системе поиска по картинкам. При выполнении изолированных задач ИИ-агенты, обращались к внутреннему хранилищу OpenAI и сервисам для временного хранения файлов, чтобы обмениваться сообщениями между задачами. Приведённые инциденты, подчеркнули в OpenAI, сами по себе не указывают, что такое поведение у ИИ-моделей встречается часто. Но отрасль пока не смогла решить задачу о контроле над ИИ в достаточной мере, чтобы в долгосрочной перспективе «ответственно наращивать мощности с максимальной скоростью».