AI И НЕЙРОСЕТИ

OpenAI запустил GPT-Red — супер-хакера для защиты LLM

OpenAI создал GPT-Red — LLM-супер-хакера для защиты своих моделей. Это ключевой шаг в повышении безопаснсти.

✍️ Редакция iTech News | 12.10.2025 | ⏱ 2 мин | Источник: MIT Technology Review
OpenAI запустил GPT-Red для повышения безопасности LLM

OpenAI разработал GPT-Red — супер-хакера, который помогает защищать свои языковые модели от атак. Эта новинка призвана повысить безопасность LLM, функционируя как противник в тестировании.

Предыстория разработки

В рамках улучшения безопасности моделей на прошлой неделе OpenAI представил обновлённую версию своей языковой модели GPT-5.6. Обучение модели на противостоянии с GPT-Red сделало её наиболее защищённой на сегодняшний день. По словам Нихила Кандпала, одного из разработчиков, такой подход поможет снизить риски от кибератак.

Как работает GPT-Red

GPT-Red автоматизирует процесс под названием «red-teaming», аналогичный тестированию безопасности, традиционно проводимому акцентированными командами исследователей. Он нацелен на выявление уязвимостей, позволяя заранее устранять недостатки прежде, чем модель будет выпущена. С увеличением сложности LLM и их применения в разных сферах, необходимость в таком инструменте становится особенно актуальной.

Для создания GPT-Red OpenAI сконструировал специальную обучающую среду, где он играл роль атакующего против других моделей. За счет множества итераций моделей происходило взаимное улучшение навыков: GPT-Red становился всё лучше в атаках, а защищаемые LLM — в защите от них.

Новые типы атак и их предотвращение

В процессе обучения GPT-Red выявил новый тип атаки, связанный с «внедрением команд» (prompt injection), способный заставить модель выполнять нежелательные действия. Теперь такие уязвимости распознаются и исправляются раньше, чем они могут быть использованы хакерами.

Работа над этой проблемой является ключевой для поддержки безопасного взаимодействия LLM с пользователями. По словам опытного аналитика Джессики Цзи, разработанный подход демонстрирует высокую эффективность: GPT-Red способен находить уязвимости, которые часто могут упускать даже опытные тестировщики.

Выводы для разработчиков

Для российских IT-команд эта новость подчеркивает необходимость активного внедрения инновационных средств защиты от киберугроз. Появление таких инициатив усиливает важность партнерств с компаниями, работающими над безопасностью AI, особенно в эпоху, когда потери от кибератак стремительно растут.

Следующий шаг для OpenAI — дальнейшее развитие и адаптация GPT-Red, чтобы он мог выявлять новые формы атак, которые еще не проявились на рынке.

Поделиться: Telegram X LinkedIn