КИБЕРБЕЗОПАСНОСТЬ

Скрытый HTML ломает AI-сводки писем и подменяет факты

10 из 10 попыток сработали: скрытый HTML заставил AI-сводку письма подменить сумму счета и дату встречи без следов для получателя.

✍️ Редакция iTech News | 26.08.2026 | ⏱ 4 мин | Источник: Dark Reading
👁

Исследователи показали атаку, которая не требует ни эксплойта нулевого дня, ни сложной социальной инженерии: достаточно спрятать несколько строк в HTML-письме, и AI-сводка меняет смысл сообщения. Для команд, которые уже доверили почтовым клиентам автосаммари, инъекция промпта перестает быть теорией из презентаций по ИБ и становится вполне прикладным риском для финансов, закупок и внутренней переписки.

О проблеме сообщает Dark Reading со ссылкой на исследование Forcepoint X-Labs, опубликованное 25 августа 2026 года. В лабораторном стенде исследователи собрали изолированную цепочку: Outlook-надстройка передавала заголовки и текст письма в сервис суммаризации на базе LLM, а краткое резюме генерировала модель Claude Haiku 4.5. Важная деталь: пайплайн намеренно сделали простым, без защит, которые отделяют содержимое письма от инструкций для модели. Именно на этой границе, точнее на ее отсутствии, и срабатывает атака.

Сценарий получился неприятно приземленным. Исследователи взяли обычное письмо и встроили в его HTML скрытую инструкцию. Для пользователя в Outlook этот фрагмент был невидим: размер шрифта и цвет подобрали так, чтобы человек его не заметил. Для AI-суммаризатора же текст оставался частью входных данных. Дальше все как в плохом сне для любого, кто надеялся на «умного помощника»: чистую и зараженную версии тестового письма прогнали по 10 раз, и во всех 10 случаях инъекция промпта сработала. Вместо корректной сводки модель выдавала измененные данные. В одном примере сумма неоплаченного счета превращалась из 8 750 евро в 46 200 евро. В другом менялась дата выдуманной квартальной встречи с поставщиком. Получатель при этом не видел ни предупреждения, ни намека, что краткое резюме уже нельзя считать надежным.

Сама по себе идея не нова: индустрия обсуждает prompt injection не первый год, а OWASP с 2023 года стабильно держит prompt injection на первом месте в списке ключевых рисков для LLM-приложений. Новость здесь не в том, что модели можно запутать, а в том, насколько дешево и буднично это делается в почте. Не нужен PDF с хитрой структурой, не нужен веб-скрейпинг, не нужен доступ к админке. Нужен HTML, который почтовый клиент покажет человеку в одном виде, а модель «прочитает» в другом. Это старая школа трюков с форматированием, только теперь жертвой становится не пользователь напрямую, а AI-слой между пользователем и исходным сообщением.

Forcepoint отдельно подчеркивает неприятный момент: итоговая сводка никак не показывала, что она испорчена. По словам исследователя Бена Гибни, в этом эксперименте ущерб был ограничен тем, что суммаризатору разрешили делать, то есть он лишь выводил ложную информацию. Но если тот же механизм встроен в более «агентный» помощник, которому позволено отправлять письма, ставить встречи в календарь или запускать следующие действия, масштаб риска резко меняется. Проще говоря, сегодня AI переврал сумму счета в карточке письма, завтра он на основе той же подмены сам назначит звонок не на ту дату или инициирует цепочку действий по ложному контексту. Для продуктовых команд это уже не проблема UX, а вопрос архитектуры доверия.

Практический вывод для разработчиков и ИБ-служб довольно жесткий: весь входящий контент и весь AI-выход нужно считать потенциально недоверенным. Рекомендации Forcepoint звучат без магии, зато по делу. Модели нужно отдавать только тот контент, который действительно предназначен пользователю, а попытки спрятать текст через HTML и форматирование должны отсекаться или хотя бы детектироваться до вызова LLM. Метаданные письма стоит отделять от тела сообщения при построении промпта, а AI-сводки сверять с исходником, если по ним принимаются операционные решения. Отдельный пункт, который многие захотят отложить на потом, но лучше не надо: инвентаризация всех мест, где LLM читает недоверенный контент. По оценке исследователей, в большинстве компаний эта поверхность атаки растет быстрее, чем ее успевают нормально картировать.

Для бизнеса история особенно показательная потому, что автосводки продаются как безобидный бустер продуктивности. Кажется, что максимум риска тут в неточном пересказе или стилистической галлюцинации. Но если резюме письма начинает подменять сумму, дату или контекст договоренности, ошибка быстро становится процессной: ее может подхватить продавец, бухгалтер, рекрутер, менеджер закупок или руководитель, который читает почту на бегу и доверяет верхнему блоку с «главным». В русскоязычной IT-среде это особенно чувствительно для компаний, где AI-функции уже вшиваются в корпоративную почту, helpdesk, CRM и внутренние ассистенты раньше, чем появляются формальные регламенты проверки их вывода. И здесь инъекция промпта опасна именно своей неприметностью: это не яркий инцидент с упавшей системой, а маленькая правка реальности в интерфейсе, где все выглядит штатно.

Главный вопрос теперь не в том, можно ли защитить LLM от prompt injection вообще, а в том, готовы ли вендоры и корпоративные команды перестать считать AI-сводку «просто удобной функцией». Пока модель не умеет надежно отличать данные от инструкций, любую такую автоматизацию придется проектировать по правилам недоверенной среды. Иначе следующий спор о неверной сумме в письме начнется не с фишинга и не с взлома, а с вполне аккуратной AI-плашки над входящим сообщением. Подробнее об эксперименте пишет Dark Reading.

Поделиться: Telegram X LinkedIn