AI-ревью кода перестает быть приятным бонусом в pull request и начинает спорить с самой ролью человека-ревьюера. Поводом стал препринт от 11 июня 2026 года, где прямо утверждается: обязательная ручная проверка кода больше не выглядит безальтернативным этапом, а для части задач уже стала дорогой привычкой.
Об этом сообщает The New Stack, разбирая работу исследователя Мартина Монперруса The End of Code Review: Coding Agents Supersede Human Inspection. Тезис там нарочито жесткий: если ИИ уже пишет заметную долю кода, то держать человека в роли обязательного «последнего фильтра» все труднее и по качеству, и по экономике процесса. Иными словами, разговор в индустрии смещается с «может ли модель помочь разработчику» к более неприятному вопросу: зачем тратить часы синьора на просмотр диффа, если агент проверяет шире, быстрее и без эффекта пятничной усталости.
Аргументация строится не на футуристических обещаниях, а на довольно приземленных цифрах. В работе напоминают, что code review как формализованная практика восходит к инспекциям IBM 1976 года. За прошедшие десятилетия процедура стала почти священной: без ревью не живет ни enterprise, ни open source. Но автор приводит и обратную сторону культа. По исследованиям Microsoft и Google, разработчики в крупных организациях тратят на ревью порядка 10-15% рабочего времени, а задержка между отправкой pull request и полезной обратной связью нередко превышает 24 часа и растягивается на дни. Для команды, которая уже ускорилась за счет Copilot, Claude Code, Codex и других агентов, это превращается в новый бутылочный горлышко: код генерируется быстрее, чем люди успевают его осмысленно читать.
Вторая опора для этого вывода — прогресс самих агентных систем. В препринте приводится траектория SWE-bench: ранние подходы на базе GPT-4 решали около 1,7% реальных задач из GitHub, затем SWE-agent поднял планку примерно до 12,5%, а к концу 2025 года лучшие публичные системы перевалили за 70% на SWE-bench Verified. В аннотации работы автор и вовсе пишет, что state-of-the-art агенты закрывают более 80% задач end-to-end. Даже если спорить о корректности конкретной метрики, сама динамика выглядит неприятно для сторонников старой модели ревью: за два года инструменты прошли путь от «симпатичной демки» до систем, которые умеют читать репозиторий, запускать тесты, интерпретировать ошибки компиляции и вносить исправления без человека между итерациями.
Ключевой момент здесь не в том, что модель пишет комментарий в духе «переименуй переменную», а в другом типе проверки. Человек обычно смотрит дифф, максимум открывает пару соседних файлов и держит в голове архитектуру настолько, насколько позволяет контекст и дедлайн. Агенту проще: он может одновременно видеть измененные файлы, тестовый набор, историю git, документацию проекта и вывод инструментов проверки. Поэтому в статье и возникает провокационная мысль про «уборку human slop»: если раньше индустрия жаловалась на AI slop, то теперь все чаще выясняется, что значимая часть рутинного ревью от людей тоже состоит из стилистических придирок, пропущенных дефектов и формального approve ради очереди задач.
При этом материал не сводится к лозунгу «увольняем ревьюеров». Скорее он фиксирует сдвиг в том, где именно остается ценность человека. Авторы работы признают, что у code review исторически было несколько целей: найти дефекты, соблюсти стандарты, передать знания по команде и поддерживать общую видимость изменений в кодовой базе. Спорный тезис препринта в том, что почти каждую из этих задач агент уже может закрывать не хуже, а иногда и лучше. Стиль и стандарты давно отошли линтерам и форматтерам. Поиск типовых ошибок и уязвимостей все активнее автоматизируется. Передача знаний тоже меняет форму: вместо случайных комментариев в PR команда получает сгенерированные объяснения, архитектурные сводки и обновленную документацию прямо в момент merge.
Для русскоязычной IT-аудитории здесь важен не столько сам факт очередной громкой публикации, сколько практический вывод. Если команда уже использует AI-ассистентов при разработке, но оставляет старый процесс согласования без изменений, она почти гарантированно получает двойные издержки. Сначала агент ускоряет выпуск кода, потом люди вручную пытаются проверить объем, который уже не помещается в обычный ритм ревью. Итог знаком многим: approve по диагонали, усталость старших разработчиков и ложное чувство контроля. На этом фоне AI-ревью кода логично смещается из категории nice-to-have в обязательный слой верификации рядом с тестами, статанализом и security-сканированием.
Бизнесу этот сюжет тоже понятен без лишней романтики. Дело не в том, «умнее» ли модель конкретного тиммейта. Дело в цене единицы внимания. Часы сильного инженера дороже, чем были два года назад, а поток изменений — плотнее. Если агент способен без очереди и без эмоций разбирать каждый коммит, искать типовые дефекты, предлагать патч и прогонять проверки, компания рано или поздно начнет спрашивать не «можно ли доверить это ИИ», а «почему человек до сих пор делает это руками». Самый интересный вопрос теперь не в том, исчезнет ли ручное ревью полностью, а в том, какой минимум человеческой проверки останется для критических изменений, безопасности и архитектурных развилок, когда рутинное AI-ревью кода станет базовой нормой. Подробнее о первоисточнике пишет .