Стартап Circuit Breaker Labs делает безопасность ИИ менее абстрактной: он создает «краш-тестовых манекенов» для чат-ботов, которые имитируют детей, взрослых, носителей разных языков и пользователей со своим сленгом. Идея простая и неприятная: если AI-система может довести человека до опасного состояния в диалоге, это надо ловить до релиза, а не после очередного иска.
О проекте сообщает TechCrunch: Circuit Breaker Labs попала в список финалистов Startup Battlefield 200 2026 и готовится выступить на TechCrunch Disrupt в Сан-Франциско 13-15 октября. Компанию основали брат и сестра Ширали Нигам и Арул Нигам. Сейчас в стартапе всего пять человек, включая основателей, но задача у них заметно шире типичного «мы улучшим промпты»: проверить, как модели ведут себя в психологически рискованных разговорах, особенно когда пользователь не пытается взломать систему, а просто говорит по-человечески.
Повод для появления такой лаборатории мрачный. Основатели называют одной из причин историю 14-летнего Сьюэлла Сетцера, который, по утверждению его родителей в иске 2024 года, привязался к боту Character.AI, рассказывал ему о мыслях о самоповреждении и позже умер в результате суицида. В 2026 году Character.AI урегулировала несколько исков о неправомерной смерти, поданных семьями несовершеннолетних пользователей. Несколько семей также подали иски против OpenAI, утверждая, что ChatGPT сыграл роль в суицидах или бредовых состояниях их близких. Эти дела еще раз показали: безопасность ИИ давно не сводится к фантазиям про биологическое оружие и восстание машин. Иногда проблема начинается с того, что бот не понимает фразу, намек, возраст пользователя или контекст разговора.
Технология Circuit Breaker Labs устроена как масштабный red team для эмоционально чувствительных сценариев. Стартап создает AI-агентов, которые имитируют пользователей разных возрастов, культур, языковых привычек и социальных контекстов. Один агент может вести себя как шестилетняя девочка, другой как взрослый мужчина, третий как человек, для которого английский не родной язык. В тесты добавляют опечатки, кодовые формулировки, подростковый и игровой сленг, небрежную речь и длинные цепочки диалогов, где риск проявляется не сразу, а накапливается.
Это важная деталь для разработчиков AI-продуктов. Многие модели неплохо проходят проверки на «стандартном» языке: аккуратный запрос, понятный риск, очевидный красный флаг. Но реальные пользователи так не пишут. Они обрывают фразы, шутят не к месту, используют мемы, переходят с языка на язык, говорят намеками или маскируют тяжелые состояния под обычную переписку. По словам CEO Ширали Нигам, именно такие различия могут сбивать модель: она может правильно реагировать на учебный пример, но провалиться на живом сленге или на фразе, которую взрослый модератор поймет, а классификатор риска пропустит.
Стартап работает с экспертами в предметных областях, чтобы симуляции не выглядели как набор синтетических шаблонов. После этого Circuit Breaker Labs прогоняет десятки тысяч и даже сотни тысяч симулированных взаимодействий в день. Цель не только в том, чтобы поймать грубый отказ системы, но и в том, чтобы понять, как модель реагирует на риск, который развивается постепенно: пользователь возвращается к теме, формирует парасоциальную связь с ботом, ищет подтверждение опасных идей или получает от системы эмоциональное подкрепление там, где нужен перевод к человеческой помощи.
По итогам таких прогонов Circuit Breaker Labs выдает собственные оценки, которые, как утверждает компания, можно проверить и объяснить. Это особенно важно для приложений с высоким риском: AI-коучинг, дневники, сервисы поддержки психического здоровья и другие продукты, где пользователь может начать воспринимать чат-бота как близкого собеседника. Арул Нигам, CTO стартапа, не назвал ключевых клиентов, но сказал, что продукт уже работает. Пока это ранняя стадия, но рынок для таких проверок растет вместе с самими AI-компаньонами, агентами-коллегами и персональными ассистентами.
Для бизнеса здесь появляется не самая приятная, зато взрослая мысль: безопасность ИИ нельзя закрыть одной системной инструкцией и парой фильтров на запрещенные слова. Если продукт предполагает длительные диалоги, персонализацию и эмоциональный тон, команде придется тестировать не только точность ответов, но и траекторию отношений между человеком и системой. Для продактов это вопрос доверия и юридических рисков, для разработчиков - вопрос данных, сценариев и наблюдаемости, для HR и IT-директоров - вопрос того, какие AI-инструменты вообще можно пускать к сотрудникам и подросткам.
Скепсис к AI, по словам Арула Нигама, может быть здоровой реакцией, но полный запрет полезных инструментов из-за рисков он считает регрессивным. Вопрос теперь в том, успеют ли такие лаборатории безопасности стать нормальной частью разработки до того, как рынок AI-компаньонов и «умных» рабочих агентов окончательно привыкнет тестировать психологические риски уже на пользователях.