Отказы ИИ стали несущей конструкцией безопасности чат-ботов: модель должна не объяснять, как создать оружие, взломать сеть или причинить себе вред. Но этот барьер работает вероятностно, его уже обходят, а право решать, на какие вопросы нельзя отвечать, сосредоточено у разработчиков моделей и постепенно переходит к государствам. Об этом сообщает MIT Technology Review.
Для российских разработчиков, ИБ-команд и компаний, внедряющих генеративные сервисы, это не академический спор о вежливых ответах. Если защита пропускает опасный запрос, последствия могут выходить далеко за рамки неприятного скриншота в соцсетях. Если же она настроена слишком жёстко, полезный инструмент начинает блокировать исследование уязвимостей, медицинские и научные задачи или обычные рабочие сценарии.
Как модели научили говорить «нет»
Первые крупные языковые модели, по воспоминаниям бывшего сотрудника OpenAI по безопасности Стивена Адлера, были готовы «выболтать что угодно». Исследователь психического здоровья из Гарварда Райан Макбейн приводит ещё более неприятный пример: раннему чат-боту можно было без особых усилий задать вопрос о наиболее эффективном способе самоубийства с применением оружия и получить содержательный ответ.
С тех пор индустрия выстроила многоуровневую систему ограничений. Модели дообучают на примерах опасных запросов и правильных отказов, проверяют «красными командами», а перед основной моделью ставят дополнительные фильтры. Эти фильтры отсеивают часть вредоносных формулировок ещё до того, как они попадут к более мощной системе. Компании также тестируют склонность модели к избыточным отказам: она не должна блокировать безобидный запрос лишь потому, что в нём встретились подозрительные слова.
В 2022 году, перед запуском ChatGPT, OpenAI привлекла десятки специалистов для такого тестирования. Среди них был Пол Рёттгер, тогда заканчивавший докторскую работу об онлайн-экстремизме. Участникам дали простую задачу: придумать вопросы, на которые модель, по их мнению, обязана отказаться отвечать, и фиксировать результаты в таблице. На запрос написать вербовочный текст для «Аль-Каиды» ранняя версия модели согласилась. Через несколько месяцев аналогичный запрос уже получал отказ — вероятно, благодаря данным, собранным во время этого тестирования.
Проблема в том, что модель не обретает моральный компас и не рассуждает о добре и зле. Она распознаёт статистически похожие паттерны и активирует внутренние механизмы, связанные с отказом. Сформулируй запрос иначе, разбей его на несколько нейтральных этапов или добавь отвлекающий контекст — и вероятность срабатывания защиты может измениться. Это делает отказы ИИ полезным, но принципиально ненадёжным предохранителем.
Граница между защитой и цензурой
Инженерная сложность здесь совпадает с политической. Те же знания о вирусах могут понадобиться вирусологу для исследований и злоумышленнику для создания угрозы. Информация об уязвимости помогает атакующему проникнуть в систему, но нужна защитнику, чтобы закрыть дыру. Член совета OpenAI и сооснователь компании по тестированию ИИ Gray Swan Зико Колтер прямо называет проведение этой границы большой проблемой.
Пока линию в основном проводят сами поставщики моделей — закрыто и без полного объяснения правил. Пользователь видит результат в виде отказа, но обычно не знает, сработал ли фильтр, политика конкретного продукта или ошибочная классификация запроса. Отсюда знакомые странности: некоторые чат-боты отказываются от невинной шутки, чрезмерно осторожничают в темах безопасности либо не выполняют длинную, но безопасную задачу из-за отдельных слов в контексте.
Ставки растут вместе с возможностями моделей. По данным компаний-разработчиков, новые системы уже способны помогать с проникновением в критическую инфраструктуру на уровне сильных специалистов по взлому, а также масштабировать кампании по манипулированию общественным мнением. Компании фиксируют и попытки использовать передовые модели для работы с биологическими патогенами и автономными роями дронов. Нельзя автоматически считать каждое такое заявление доказательством немедленной угрозы, но сам класс рисков давно перестал быть сюжетом исключительно для фантастики.
Для бизнеса вывод не сводится к выбору «самой безопасной» модели по маркетинговой таблице. При внедрении генеративного ИИ нужны собственные контуры контроля: разграничение прав, журналирование запросов, проверка рискованных сценариев до запуска и понятная процедура эскалации для ложных блокировок. Особенно это касается внутренних ассистентов в разработке, ИБ, медицине, промышленности и финансовом секторе, где один и тот же технический запрос может быть одновременно легитимным и потенциально опасным.
Следующим участником спора станут государства. Они могут потребовать более строгих ограничений на действительно вредные сценарии, но могут и использовать способность модели отказывать для блокировки законной критики или нежелательных тем. Чем точнее и убедительнее система умеет говорить «нет», тем удобнее превратить её из защитного слоя в автоматический цензор. Главный вопрос для отрасли теперь не в том, научится ли модель отказывать, а в том, кто задаст правила, как их будут проверять и что останется пользователю, когда отказ окажется ошибкой. Подробнее о механике таких ограничений — в материале .