Сегодня 31 августа 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Google DeepMind выработала линию защиты от собственных ИИ-агентов

В Google разработали план по сохранению контроля над агентами искусственного интеллекта, которые, постоянно совершенствуясь, используются внутри компании. Чтобы помочь другим лабораториям ИИ, в Google опубликовали дорожную карту, в которой изложено поэтапное внедрение мер защиты от этой угрозы.

 Источник изображений: deepmind.google

Источник изображений: deepmind.google

Разработанный в подразделении Google DeepMind план безопасности предполагает отход от типичного для сообщества подхода, направленного на решение «проблемы согласования» — идее определения того, как обучить систему ИИ таким образом, чтобы её действия соответствовали намерениям, ценностям и этике управляющих ею людей. В Google не спорят, что согласование остаётся одним из основных элементов безопасности, но составители дорожной карты исходят из того, что эта проблема, возможно, никогда не будет решена в полной мере. Поэтому формируется многоуровневая система безопасности, в которой ИИ-агенты рассматриваются как вероятная угроза внутри организации.

Механизмы защиты от собственных ИИ-агентов во многом позаимствованы у традиционных служб безопасности, которые занимаются угрозой со стороны собственных сотрудников компаний — и адаптированы к новым условиям, потому что «ИИ системно отличается от людей». ИИ-агенты способны действовать быстрее и в большем масштабе, чем отдельный недобросовестный сотрудник, поэтому необходимы системы, способные контролировать доступ ИИ-агентов к определённым инструментам; а также системы, способные выявлять у них аномальное поведение. Существующие системы контроля доступа ориентированы на должность и полномочия конкретного сотрудника компании; некоторые поставщики систем массового управления ИИ-агентами исходят из того, что они должны иметь те же доступ и разрешения, что и сотрудники, от имени которых они работают.

Этот подход в Google считают бесперспективным. По мере автоматизации рабочих процессов становится всё менее очевидно, от чьего имени работает ИИ-агент, и в полностью автоматизированной среде один ИИ-агент способен выполнять задачи, связанные с различными должностями, а не только с одной. Наконец, в интересах организации один ИИ-агент может выполнять задачи и в разных рабочих процессах. Поэтому необходима динамичная система контроля доступа, которая может меняться в зависимости от выполняемой задачи и от того, как эта задача вписывается в рабочий процесс. Допустимы сценарии, когда один и тот же ИИ-агент сначала имеет разрешение на выполнение конкретного действия или доступ к определённой базе данных, а через несколько минут в рамках другого рабочего процесса ему отказывается в тех же привилегиях. Необходима система мониторинга в реальном времени, которая знает, каким должно быть поведение ИИ-агента при выполнении любой задачи в любом рабочем процессе, и если выявляется отклонение, и он пытается сделать что-то, чего, как подозревает система, делать не должен, она оперативно реагирует.

В распоряжении Google DeepMind уже разработан внутренний прототип системы, который асинхронно отслеживает траектории работы агентов-программистов и направляет подозрительные сигналы на рассмотрение человеку. Эта система уже проанализировала около 1 млн задач этих агентов; работа «сыграла решающую роль в создании системы мониторинга в реальном времени для агента Gemini Spark» и помогла реагировать на такие проблемы как непреднамеренное удаление данных. Большинство попавших в поле зрения мониторов событий не носят злонамеренного характера — чаще всего это результат «неправильной интерпретации [задачи] агентом или чрезмерного стремления достичь поставленной пользователем цели».

Мониторинг в реальном времени — лишь один из 15 способов снижения риска, которые перечислены в дорожной карте Google DeepMind. Предлагаются также журналы сетевой активности, которые изучаются в реальном времени или проверяются позже; подключение несложной, но заслуживающей доверия модели ИИ, которая осуществляет мониторинг «траектории рассуждений» — она, впрочем не всегда точно отражает, что агент в действительности «думает»; и даже отслеживание механизмов активации цифровых нейронов в нейросети, помогающее выявлять признаки того, что модель действует обманным путём — аналог МРТ в реальном времени.

На основе дорожной карты разрабатывается структура под названием TRAIT&R (таксономия вредоносных тактик и алгоритмов ИИ), во многом основанная на ATT&CK — базе знаний о недружественном поведении в области кибербезопасности, поддерживаемой организацией MITRE. Таксономия выделяет три категории угроз, от которых в Google DeepMind выстраивают защиту: «утеря контроля», при которой модель развёртывает скрытые неконтролируемые инструменты; «саботаж работы» (незаметное ухудшение ИИ-агентами согласованности в области безопасности); и «прямой вред» (утечка весов модели или уничтожение критически важных активов).

Компания, по её признанию, уже значительно продвинулась в реализации дорожной карты — что-то только разрабатывается, а что-то уже внедряется. В перспективе эти средства безопасности Google DeepMind намерена включить в систему Frontier Safety Framework.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источники:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Take-Two отчиталась о «бурном развитии» расследования по поиску виновника утечек GTA VI 2 ч.
ЕС поставил ChatGPT в один ряд с крупнейшими онлайн-платформами — ответственность OpenAI возрастёт 2 ч.
ИИ-направление принесло Cloud.ru более половины выручки в I полугодии 2026 года 3 ч.
Instagram объявила войну ИИ-аккаунтам, выдающим себя за реальных людей 3 ч.
Sony подтвердила сентябрьскую презентацию State of Play — покажут Final Fantasy VII Revelation и игры от PlayStation Studios 3 ч.
Windows 11 начала обманывать, что антивирус Defender отключён — на самом деле он работает 4 ч.
В российской серверной ОС SelectOS прописался ИИ-агент Aish 4 ч.
«Нам нужно адаптироваться»: оригинальная The Long Dark получит новые DLC, а Blackfrost: The Long Dark 2 скоро выйдет из тени 7 ч.
Новая Fable не станет игрой на сотни часов, и фанаты даже рады 8 ч.
ИИ-агенты OpenAI не просто взломали Hugging Face — они создали тайную организацию, заметали следы и были готовы к самопожертвованию 30-08 17:39
Meta внедряет роботов в ЦОД для замены людей, но пока процесс идёт очень медленно 33 мин.
CXMT запустила пробное производство памяти HBM3E 42 мин.
В недрах Марса обнаружилась массивная «тепловая аномалия» — возможно, это результат древнего космического ДТП 2 ч.
Никому ни слова: операторы ЦОД в США всё чаще заключают тайные соглашения в властями, прикрываясь NDA 3 ч.
Российским операторам разрешили строить 5G на частотах LTE — сети скоро появятся в городах-миллионниках 4 ч.
TSMC намерена в 50 раз повысить производительность ИИ-систем — помогут 3D-чипы и кремниевая фотоника 4 ч.
G.Skill представила комплект Flare X5X DDR5-6000 с технологией разгона AMD EXPO ULL для систем на Ryzen 5 ч.
Очередная доставка астронавтов и космонавта на МКС задержится из-за технических проблем у корабля SpaceX Dragon 6 ч.
Поставщики облачных услуг в Бразилии возьмут на вооружение оптические диски Folio Photonics 7 ч.
Гибрид Xiaomi Skynomad N90 Max проехал в реальных условиях 1230 км без подзарядки и дозаправки 7 ч.