Anthropic показала редкий для рынка результат: автоматизированная система улучшила модель по всем 10 категориям нежелательного поведения и при этом не ухудшила общие показатели. Для русскоязычной IT-аудитории это важный сигнал: самоулучшающийся ИИ перестает быть философским сюжетом про далекое будущее и начинает выглядеть как вполне прикладной исследовательский пайплайн.
28 августа 2026 года компания опубликовала работу Automated Researchers Can Reliably Mitigate Alignment Failures, сообщает TechCrunch. В центре исследования система Automated Alignment Researcher, или AAR, которой руководил участник программы Anthropic Fellows Чэнь Юэх-Хань. Логика у нее почти по-человечески знакомая: изучить доступную литературу, предложить метод, запустить короткое дообучение модели, проверить результат, сохранить удачные подходы и отбросить бесполезные.
Главная цифра здесь не абстрактная, а очень конкретная: системе дали наборы бенчмарков, проверяющих 10 отдельных типов нежелательного поведения, и она улучшила результаты по каждому из них. Важна и вторая часть: улучшения не пришли ценой деградации общего качества модели. Для рынка ИИ это почти обязательная приписка мелким шрифтом, потому что до сих пор многие попытки «подкрутить безопасность» заканчивались знакомой сделкой: где-то стало аккуратнее, зато где-то модель начала отвечать хуже, осторожнее или просто тупее. Здесь Anthropic утверждает, что этого не произошло.
Механика исследования тоже заслуживает внимания. Каждый автоматизированный «исследователь» получает задачу и в течение 30 минут тренирует модель предложенным методом, после чего цикл повторяется с постепенным усложнением бенчмарка. По сути это высокоскоростная фабрика гипотез: хорошие методы закрепляются, слабые вымываются, а вся система масштабируется куда быстрее, чем обычная команда исследователей. Если убрать красивую обертку, перед нами знакомая инженерам идея: автоматизация R&D через быстрые итерации, только вместо CI для кода тут CI для alignment-экспериментов.
Anthropic не обходит и самый чувствительный вопрос: насколько такая система конкурентна по сравнению с людьми. В статье прямо говорится, что лучший метод AAR в среднем превосходит предложения опытных исследователей уже в пределах шести часов работы. Еще жестче звучит следующее наблюдение: направления, задаваемые человеком, не приводили к более сильному результату. А если кому-то для полноты картины нужны цифры про экономику процесса, они тоже есть: один AAR, по оценке авторов, обходится примерно в 4 доллара в час API-инференса против 150 долларов в час, которые компания платит человеческим исследователям.
Это и есть та точка, где новость перестает быть узкой историей про safety-команду Anthropic и становится отраслевой. Самоулучшающийся ИИ давно обсуждают как следующий большой этап развития моделей: если система способна автоматизировать работу по собственному выравниванию, следующим шагом может стать автоматизация и более широких исследовательских практик. Иными словами, сначала модель помогает людям делать alignment, потом помогает улучшать методы обучения вообще. На этом месте у части индустрии начинается энтузиазм, у другой части нервный смех, и обе реакции понятны.
Для разработчиков и продуктовых команд здесь несколько практических выводов. Во-первых, alignment все меньше выглядит как ручное ремесло небольших лабораторий и все больше как инженерный контур, который можно формализовать, запускать сериями и оптимизировать по стоимости. Во-вторых, ценность начинают набирать не только сами модели, но и качество тестовых наборов, процедур оценки и корпуса исследовательской литературы, на который опирается автоматический контур. Если ваши бенчмарки плохие, система будет очень эффективно оптимизировать не то. Это старая проблема машинного обучения, просто теперь она поднимается на этаж выше.
Во-вторых, бизнесу стоит внимательно смотреть не только на headline-метрики, но и на то, что именно измеряют такие системы. Anthropic сама признает ограничения подхода: автоматизированный исследователь работает ровно настолько хорошо, насколько сами бенчмарки действительно отражают цели выравнивания. Плюс кто-то должен поддерживать и расширять литературу, из которой система черпает методы. То есть полностью «убрать человека из цикла» пока не получается. Человек просто смещается на другой уровень: он меньше придумывает гипотезы вручную и больше отвечает за постановку задач, качество оценок и границы допустимой оптимизации.
Для HR и руководителей R&D это, пожалуй, еще более неудобная новость, чем для инженеров. Если такие контуры станут устойчивыми, спрос будет расти не только на исследователей, которые умеют обучать модели, но и на людей, способных проектировать надежные evaluation-системы, валидировать метрики и отлавливать ложный прогресс. Потому что автоматизированный исследователь может работать быстрее и дешевле, но ошибка в критериях успеха масштабируется с той же скоростью. В ИИ-индустрии это уже не баг процесса, а новый класс производственного риска.
Главный вопрос теперь не в том, можно ли автоматизировать часть alignment-исследований, а в том, где у этой схемы появится потолок. Если автоматические контуры и дальше будут выигрывать у людей по скорости, цене и качеству на хорошо формализованных задачах, конкуренция между лабораториями сместится с найма звездных ресерчеров на проектирование лучших сред для машинного исследования. Подробности исследования можно посмотреть в материале .