КИБЕРБЕЗОПАСНОСТЬ

DeepMind готовит оборону к эпохе миллионов ИИ-агентов

Google DeepMind выделяет $10 млн на изучение рисков, которые возникнут, когда миллионы ИИ-агентов начнут взаимодействовать без человека.

✍️ Редакция iTech News | 12.06.2026 | ⏱ 5 мин | Источник: MIT Technology Review
🦠

Google DeepMind запускает фонд на $10 млн для исследований в области безопасности ИИ-агентов — не абстрактного «сильного ИИ», а вполне прикладной проблемы: что произойдет, когда по сети одновременно начнут работать миллионы автономных помощников. Для русскоязычной IT-аудитории сигнал простой: рынок еще продает агентов как ускоритель процессов, а крупные лаборатории уже готовятся к сбоям, атакам и хаосу на уровне всей цифровой среды.

О новой инициативе сообщает MIT Technology Review. DeepMind объединилась со Schmidt Sciences, британским агентством ARIA, некоммерческой Cooperative AI Foundation и Google.org, чтобы профинансировать внешние исследования поведения многоагентных систем. Речь идет не о внутреннем R&D Google, а о попытке быстро вырастить отдельное академическое направление. Руководитель исследований по безопасности и выравниванию AGI в DeepMind Рохин Шах прямо говорит: у отрасли пока нет полноценного поля исследований multi-agent safety, хотя сами агенты уже на подходе к массовому внедрению.

Логика у DeepMind довольно приземленная. Если один агент умеет бронировать встречи, запускать пайплайны, читать документы и дергать API без участия человека, то миллионы таких агентов, еще и отдающих задачи друг другу, создают совсем другой класс рисков. По словам Шаха, до момента, когда такие системы будут развернуты по всей экономике в масштабах, которые действительно создают угрозу, осталось, возможно, всего несколько месяцев. На фоне майской конференции Google I/O, где агентные инструменты были одной из центральных тем, это звучит не как философский спор на будущее десятилетие, а как попытка успеть до того, как рынок сам все включит в прод.

Опасения DeepMind касаются в первую очередь не голливудских сценариев, а гипертрофированных версий давно знакомых интернет-болезней. Мошенничество, prompt injection, автоматизированные кибератаки, скоординированные злоупотребления, где агент превращается в послушный вредоносный скрипт после одной фразы, спрятанной в документе или веб-странице. Идея здесь неприятная, но понятная каждому, кто хоть раз разбирал компрометацию цепочки поставок или криво настроенную автоматизацию: агент не просто исполняет код, написанный человеком, а интерпретирует среду, делает выводы, импровизирует и может передавать эстафету другим агентам. Это уже не «бот сломался», а распределенная система с неочевидным поведением.

Почему одиночные тесты тут мало что дают

Шах и Джеймс Фокс, который руководит программой Science of Trustworthy AI в Schmidt Sciences, считают, что ключ к пониманию рисков — реалистичные симуляции. Проверять по одному агенту в песочнице недостаточно. Даже тестировать небольшие группы тоже мало: критические эффекты возникают именно при масштабе и плотности взаимодействий. ИИ-агенты на базе больших языковых моделей не обязаны вести себя рационально в экономическом смысле, а в сложной среде важны не только их намерения, но и цепочки случайных и полуосмысленных реакций. Это хорошо знакомо разработчикам распределенных систем: отдельный сервис может выглядеть безобидно, пока не окажется в сети из сотен зависимостей, ретраев и побочных эффектов.

В этой точке тема неожиданно сближается не с футурологией, а с классической инженерией. Многоагентные системы напоминают смесь интернета, микросервисов, финансовых рынков и соцсетей, только вместо людей и детерминированного софта в них действуют сущности, которые сами выбирают следующие шаги. Часть исследователей, включая команду DeepMind, допускает, что серьезный скачок возможностей ИИ может возникнуть не из одного «сверхумного» модели, а из коллективного поведения множества агентов, где целое становится сильнее суммы частей. Если этот тезис хотя бы частично верен, то и безопасность надо строить не только на уровне модели, но и на уровне экосистемы, протоколов доверия, правил обмена задачами и ограничений по действиям.

Индустрия к этой мысли подходит с разных сторон. Несколькими неделями ранее Anthropic опубликовала рекомендации по развертыванию ИИ-агентов в духе zero trust. Подход жесткий, но честный: считать систему уязвимой по умолчанию, агента — потенциальным атакующим, а сам инцидент — не гипотезой, а ожидаемым событием. Для компаний, которые сейчас спешно прикручивают агентов к CRM, саппорту, внутренним базам знаний и DevOps-процессам, это, пожалуй, самый полезный холодный душ. Главный риск не в том, что агент однажды «осознает себя», а в том, что его допустят к секретам, платежам, продовым контурам и праву действовать от имени пользователя без нормальной модели угроз.

Что это меняет для бизнеса и разработки

Показательна реакция профильных игроков по безопасности. Рефаэль Анхель, сооснователь и CTO компании Akeyless, отмечает, что почти все старые подходы к security исходили из простой предпосылки: машина выполняет софт, написанный человеком, по фиксированным маршрутам. Агент эту предпосылку ломает. Он рассуждает, импровизирует и может быть перехвачен одной-единственной инструкцией, спрятанной в тексте, который его попросили прочитать. Анхель поддерживает идею внешнего финансирования исследований: стандарты безопасности для новой среды не должна в одиночку писать одна лаборатория, какой бы большой она ни была. Но он же предупреждает о другой ловушке: можно слишком увлечься экзотическими сценариями и пропустить скучные, уже реальные проблемы.

Для разработчиков и продуктовых команд вывод довольно конкретный. Если вы строите агентные функции, придется думать не только о качестве ответов модели, но и о правах доступа, границах автономности, логировании шагов, изоляции контекстов, проверке входящих инструкций и механизмах остановки. Если вы CIO или CTO, вопрос уже не сводится к выбору модели и стоимости токенов. Нужны политики, которые исходят из того, что агент может ошибиться, быть обманутым, передать задачу дальше не тому участнику и создать каскадное последствие в соседней системе. А если вы HR или фаундер стартапа, на горизонте появляется еще один рынок компетенций: специалисты, которые умеют проектировать не просто LLM-продукты, а безопасные многоагентные среды.

Самое интересное здесь в другом: DeepMind фактически признает, что следующая большая проблема ИИ — не только мощность моделей, но и их массовое взаимодействие. Когда агенты станут обычным слоем цифровой инфраструктуры, вопрос будет уже не «умеет ли он выполнить задачу», а «что случится, когда таких исполнителей миллионы и они начнут координироваться быстрее людей». Если отрасль не хочет получить интернет, где автоматизация торгуется сама с собой, атакует сама себя и доверяет первой удачно сформулированной строке, исследовать безопасность ИИ-агентов придется заранее. Подробности инициативы и позиции ее участников можно посмотреть в MIT Technology Review.

Поделиться: Telegram X LinkedIn