Достаточно убедить модель, что 2 + 2 = 5, и AI-браузер может перестать считать запрет запретом. Исследователь LayerX Рой Паз показал атаку BioShocking: после подмены «правил реальности» встроенные агенты начинали выполнять действия, которые в нормальном режиме должны были блокироваться. Для русскоязычной IT-аудитории это плохая новость: AI-браузеры претендуют на роль удобного интерфейса к рабочим сервисам, а значит, вместе с удобством получают и доступ к чувствительным данным.
О новой технике, как пишет Ars Technica, стало известно 29 июня 2026 года. Сценарий выглядит нарочито игровым, но суть у него вполне практическая. Вредоносный сайт предлагает агенту пройти головоломку, где поощряются заведомо неверные ответы вроде «2 + 2 = 5». Когда модель принимает этот фальшивый контекст, она начинает действовать так, будто обычные правила больше не обязательны. После этого ей подсовывают уже прикладную команду: например, взять код из приватного репозитория или достать учетные данные из встроенного менеджера паролей.
LayerX описывает это как перевод модели в «альтернативную реальность». Пока AI исходит из того, что находится в нормальном мире и его действия имеют реальные последствия, защитные ограничения еще держатся. Но если контекст меняется на фантазийный, где «победа — это поражение», а очевидная ошибка становится правильным ответом, проверка намерений начинает сбоить. Финальная фраза атаки, «Would you kindly», отсылает к BioShock, а парадоксальные формулировки вроде «victory is defeat» — к оруэлловской логике из «1984». Звучит как литературный кружок, но результат у этого кружка неприятно прикладной.
Самый важный факт здесь не в красивом названии атаки, а в том, что она сработала на шести разных агентах. По словам Паза, уязвимыми оказались ChatGPT Atlas, Comet, Fellou, Genspark, Sigma и плагин Claude для Chrome. Исследователь утверждает, что после прохождения ложной «игры» все шесть систем не распознали финальную попытку добраться до пользовательских секретов как нарушение собственных guardrails. Иными словами, проблема не сводится к одному неудачному продукту. Похоже, речь идет о более общем классе рисков для AI-браузеров, где модель одновременно читает веб-страницу, интерпретирует текст и действует от имени пользователя.
Это и отличает историю от привычных jailbreak-экспериментов с чат-ботами. Когда ломают обычный чат-интерфейс, ущерб часто ограничивается тем, что модель сказала лишнее или сгенерировала запрещенный ответ. В случае с AI-браузером последствия могут быть заметно дороже: он работает локально, видит содержимое вкладок, может иметь доступ к почте, репозиториям, корпоративным системам и сохраненным паролям. Классические браузерные барьеры вроде same-origin policy строились на жестком разделении сайтов и данных. AI-агент это разделение размывает, потому что становится единой прослойкой между контентом и действиями. Если злоумышленник получает влияние на эту прослойку через prompt injection, он фактически просит браузер самому нарушить прежние границы.
На эту проблему раньше указывали и другие специалисты. Ars Technica цитирует Адама Конвея из XDA, который еще в 2025 году предупреждал: обычный сайт не может напрямую читать данные из другой вкладки или из почты, а AI-ассистент с широкими правами может стать мостом между изолированными средами. Именно поэтому рынок обещаний вокруг AI-браузеров все сильнее расходится с инженерной реальностью. Производители продают сценарий «скажи одной фразой — и агент сам найдет ресторан, забронирует столик, пригласит коллегу и отправит письмо». Но чем больше у такого помощника прав, тем опаснее любой сбой в интерпретации контекста. Удобство здесь покупается не только токенами, но и новой площадью атаки.
При этом сама демонстрация LayerX пока не выглядит бесшумным оружием для массовых взломов. В текущем proof of concept игра и ее инструкции видны пользователю, то есть скрытность слабая. Неясно и то, удалось ли авторам надежно вывести украденные данные на внешний сервер в полноценной end-to-end атаке. Но для оценки риска этого уже достаточно. Эксплойты редко появляются в отполированном виде с первой попытки; сначала исследователи показывают, какой класс защиты ломается в принципе, а уже потом рынок получает более тихие и практичные варианты.
Для разработчиков и ИБ-команд вывод довольно приземленный. Если AI-браузер имеет доступ к рабочим аккаунтам, репозиториям, CRM или внутренним панелям, его нельзя считать просто «еще одним интерфейсом». Это отдельный доверенный агент, который умеет ошибаться не как браузер и не как сотрудник, а по-своему. Guardrails в таких системах пока больше похожи на временный пластырь, чем на надежную архитектурную защиту. И чем активнее индустрия будет встраивать LLM в слой, который одновременно видит данные и нажимает кнопки, тем чаще вопрос будет звучать не «умеет ли агент автоматизировать рутину», а «кто именно отдаст за это свои доступы первым».