Выпущенная уязвимость в API OpenAI, Anthropic и Google позволяет менее мощным ИИ моделям расшифровывать внутренние логики более сильных моделей. Это открывает двери для утечек конфиденциальных данных, включая API-ключи и пароли, угрожая безопасности пользователей.
Подробности уязвимости
Исследователи обнаружили, что уязвимость возникает из-за недостатков в механизмах передачи скрытой логики между вызовами API. Существует возможность повторного использования блоков размышлений из одной сессии в другой, что позволяет менее мощным моделям вскрывать исходные данные. В исследуемой работе было задокументировано 315 320 блоков мышления, из которых 704 оказались конфиденциальными артефактами, включая 62 API-ключа и 33 пароля.
Как это происходит
Атаки требуют доступа к зашифрованным блокам логики, которые могут быть опубликованы в публичных логах агентов. Чтобы получить доступ к уязвимым данным, достаточно, чтобы исследователь имел доступ к модели того же провайдера. В ходе экспериментов были созданы четыре типа атак, которые могли привести к извлечению конфиденциальной информации пользователей.
Что это значит для разработчиков
Разработчикам рекомендуется избегать отправки «сырых» логов с ненадежными логическими блоками и тщательно проверять, какие данные они делятся. Уязвимость затрагивает только пользователей, которые публикуют свои логи с сохраненными заблокированными логическими объектами. Следует помнить, что даже при очистке видимых текстов, некоторые секреты могут оставаться зашифрованными внутри блоков, которые другие аккаунты окажутся в состоянии повторить.
В связи с недавними обновлениями и мерами предостережения, безопасность запросов значительно улучшилась, и исследователи заявили, что основные атаки больше не воспроизводимы с августа 2026 года.
Следующий шаг для провайдеров — это усиление мер по защите данных. Мониторинг и развитие инструментов безопасности будут важными приоритетами в дополнение к улучшению архитектуры API.