OpenAI разработал GPT-Red — супер-хакера, который помогает защищать свои языковые модели от атак. Эта новинка призвана повысить безопасность LLM, функционируя как противник в тестировании.
Предыстория разработки
В рамках улучшения безопасности моделей на прошлой неделе OpenAI представил обновлённую версию своей языковой модели GPT-5.6. Обучение модели на противостоянии с GPT-Red сделало её наиболее защищённой на сегодняшний день. По словам Нихила Кандпала, одного из разработчиков, такой подход поможет снизить риски от кибератак.
Как работает GPT-Red
GPT-Red автоматизирует процесс под названием «red-teaming», аналогичный тестированию безопасности, традиционно проводимому акцентированными командами исследователей. Он нацелен на выявление уязвимостей, позволяя заранее устранять недостатки прежде, чем модель будет выпущена. С увеличением сложности LLM и их применения в разных сферах, необходимость в таком инструменте становится особенно актуальной.
Для создания GPT-Red OpenAI сконструировал специальную обучающую среду, где он играл роль атакующего против других моделей. За счет множества итераций моделей происходило взаимное улучшение навыков: GPT-Red становился всё лучше в атаках, а защищаемые LLM — в защите от них.
Новые типы атак и их предотвращение
В процессе обучения GPT-Red выявил новый тип атаки, связанный с «внедрением команд» (prompt injection), способный заставить модель выполнять нежелательные действия. Теперь такие уязвимости распознаются и исправляются раньше, чем они могут быть использованы хакерами.
Работа над этой проблемой является ключевой для поддержки безопасного взаимодействия LLM с пользователями. По словам опытного аналитика Джессики Цзи, разработанный подход демонстрирует высокую эффективность: GPT-Red способен находить уязвимости, которые часто могут упускать даже опытные тестировщики.
Выводы для разработчиков
Для российских IT-команд эта новость подчеркивает необходимость активного внедрения инновационных средств защиты от киберугроз. Появление таких инициатив усиливает важность партнерств с компаниями, работающими над безопасностью AI, особенно в эпоху, когда потери от кибератак стремительно растут.
Следующий шаг для OpenAI — дальнейшее развитие и адаптация GPT-Red, чтобы он мог выявлять новые формы атак, которые еще не проявились на рынке.