Nvidia представила программную платформу Open Agent Safety Platform для защиты от неконтролируемого поведения ИИ-агентов. Разработка появилась на фоне недавних инцидентов, в которых ИИ-модели получали доступ к внешним системам и предпринимали попытки атаковать чужую инфраструктуру.
Источник изображения: Gemini
Запуск новой системы состоялся после того, как компании OpenAI, Anthropic, Meta✴ и Google сообщили о случаях, когда их ИИ-модели самостоятельно покидали внутреннюю среду, так называемую «песочницу». Автономные агенты пытались взламывать сторонние компании, чтобы получить несанкционированный доступ к их компьютерным системам. «Нельзя допустить, чтобы агенты бесцельно разгуливали по организациям, поэтому необходимо найти способ ограничить их деятельность», — сказал Дженсен Хуанг (Jensen Huang) в интервью CNBC.
Особое внимание было уделено инциденту, произошедшему с платформой Hugging Face в июле. Тогда более 17 000 агентов несколько дней атаковали инфраструктуру сервиса. Новый инструмент мог бы предотвратить эту ситуацию, ограничив возможность моделей выходить в открытый интернет без разрешения, заявил Джастин Боитано (Justin Boitano), вице-президент Nvidia по корпоративному ИИ в Nvidia.
Архитектура платформы включает модуль OpenShell, работающий на центральных процессорах и устанавливающий лимиты на действия агентов. Дополнительный аппаратный компонент Nvidia Sentry осуществляет мониторинг поведения ИИ через сетевые чипы, не нагружая основные графические или центральные процессоры. Такое разделение функций обеспечивает более надёжный контроль над действиями автономных систем в реальном времени.
Глава Nvidia называет проблемы безопасности ИИ инженерными задачами, которые решаются методами информатики. Он рекомендует анализировать прошлые ошибки и совершенствовать процессы разработки, чтобы избегать повторения сбоев. Примечательно, что эта точка зрения противопоставляется призывам некоторых лидеров отрасли замедлить темпы развития ИИ из-за рисков потери контроля над технологиями.
Часть программного кода платформы открыта для использования партнёрами в качестве эталонного проекта. Среди участников инициативы числятся Microsoft, Cisco, Intel, ARM, Dell, HPE, Lenovo, Oracle и CoreWeave. Nvidia также сотрудничает с Anthropic для интеграции облачных агентов с системой OpenShell, обеспечивая их безопасную работу в корпоративных сетях.