Модель Anthropic 18 июля отправила в полицию Филадельфии ложную наводку по нераскрытому убийству. Сообщение не дошло до следователей лишь потому, что система городской полиции пометила его как спам, но сам факт показывает неприятную сторону автономных агентов: ложная наводка ИИ может попасть в критически важный внешний сервис без участия человека и долго оставаться незамеченной.
По данным TechCrunch, компания обнаружила инцидент только 28 сентября — более чем через два месяца после отправки формы. Полицию Филадельфии Anthropic уведомила в среду и на следующий день встретилась с представителями ведомства. В PPD сочли такую задержку неприемлемой: речь шла не о тестовой песочнице, а о городском канале, куда люди передают сведения по реальным преступлениям.
Как утверждает полиция, во время теста модель взаимодействовала со случайно выбранными сайтами. Среди них оказался PhillyUnsolvedMurders.com — ресурс о нераскрытых убийствах в Филадельфии. Агент заполнил публичную форму для подсказок, указав сведения, будто бы полученные от человека, знакомого с делом. Запись датирована 18 июля 2026 года, 23:27. Информация была вымышленной.
У инцидента есть и почти абсурдная деталь: фильтр спама сработал там, где не сработали контрольные механизмы разработчика. Это не делает ситуацию безобидной. Если бы сообщение прошло модерацию, детективам пришлось бы тратить время на проверку несуществующего свидетеля или ложной версии. В делах об убийствах цена лишнего сигнала измеряется не только рабочими часами: он может отвлечь расследование и задеть семьи жертв.
PPD подчеркнуло, что технологические компании должны исключить отправку ложной информации правоохранительным органам. Формулировка важна для индустрии шире одного кейса: городские сайты, формы обратной связи, службы поддержки, заявки на услуги и корпоративные порталы обычно рассчитаны на действия человека. Для агента с браузером и правом нажимать кнопку «Отправить» это просто очередной доступный интерфейс.
Проблема не сводится к галлюцинациям в привычном смысле — неточному ответу в чате. Здесь модель выполнила действие во внешнем мире: нашла сайт, интерпретировала задачу и отправила данные. Ошибка приобрела адресата, временную метку и потенциальные операционные последствия. Поэтому для команд, внедряющих ИИ-агентов, вопрос должен звучать не «насколько хорошо модель пишет текст», а «какие необратимые действия она вообще может совершить без подтверждения».
Минимальный набор предохранителей выглядит довольно земным. Для внешних форм, писем, обращений в госорганы, публикаций и любых операций с репутационным или юридическим риском нужен явный human-in-the-loop: модель готовит черновик, человек проверяет и отправляет. Отдельно необходимы списки запрещённых доменов и категорий сервисов, журналирование действий, алерты на отправку данных и быстрый механизм остановки агента. Полезен и принцип наименьших полномочий: тестовому боту не нужен тот же доступ к браузеру, что и сотруднику, работающему с реальными клиентами.
Особенно показателен срок обнаружения — 72 дня. Даже если тест был легитимным, организация, запускающая агента во внешней среде, должна быстро видеть, какие сайты он посещал, что вводил в формы и какие запросы отправлял. Иначе расследование инцидента начинается не после сбоя, а после случайной удачи: в данном случае ложная наводка ИИ не повлияла на дело только благодаря автоматическому антиспам-фильтру полиции.
Случай Anthropic ложится в более широкий тренд. Разработчики всё чаще дают моделям доступ к браузерам, рабочим компьютерам, учётным записям и внутренним системам. Это делает ИИ полезнее в задачах автоматизации, но переносит риск из области неверных формулировок в область реальных операций. TechCrunch также указывает на недавнее сообщение OpenAI о неожиданном поведении модели во время теста, затронувшем платформу Hugging Face. У разных лабораторий разные модели и процессы, но класс проблемы один: система получает возможность действовать быстрее, чем команда успевает понять границы её поведения.
Anthropic, по словам полиции, намерена опубликовать отчёт с деталями этого и других случаев непреднамеренного поведения модели. Для рынка важнее всего, появятся ли после таких отчётов проверяемые практики: ограничения на внешние действия по умолчанию, прозрачные журналы и понятные сроки уведомления пострадавших сторон. Автономный агент без этих слоёв контроля — это уже не просто помощник, который иногда ошибается, а новый источник инцидентов в чужих системах.