ИИ в разработке снова оказался не столько ответом, сколько проблемой измерения: после громкого вывода METR о замедлении опытных программистов на 19% повторный эксперимент начал разваливаться из-за поведения самих участников. Разработчики все чаще не хотят работать без ИИ даже за деньги, а часть задач просто не отдает в эксперимент. Для команд, которые пытаются посчитать реальную пользу Copilot-подобных инструментов, это неприятная новость: мерить ускорение становится почти так же сложно, как спорить о нем в комментариях.
В июле 2025 года METR опубликовала эксперимент с 16 опытными open source-разработчиками, сообщает Habr / Карьера. Участники решали задачи из собственных репозиториев: часть с разрешенным ИИ, часть без него. Репозитории были не учебными песочницами, а взрослыми проектами: в среднем около десяти лет истории, больше 1 млн строк кода и примерно 1,5 тыс. коммитов у разработчика. Основным инструментом был Cursor Pro с Claude 3.5/3.7 Sonnet, хотя 56% участников до исследования Cursor не использовали.
Результат тогда выглядел как холодный душ для рынка: задачи с ИИ заняли на 19% больше времени. При этом сами участники до эксперимента ожидали ускорения на 24%, экономисты — на 39%, ML-эксперты — на 38%. После завершения работы разработчики все равно считали, что ИИ ускорил их примерно на 20%. Получилась красивая и болезненная цифра для презентаций: программисты уверены, что стали быстрее, но секундомер говорит обратное.
Авторы METR разбирали возможные причины и нашли несколько правдоподобных объяснений. Разработчики слишком хорошо знали собственный код, а ИИ плохо видел неявный контекст больших старых проектов. Подсказки приходилось проверять и исправлять: участники принимали меньше 44% предложений, около 9% времени уходило на ревью и правки. Важная оговорка пряталась в FAQ: в выборку могли не попасть разработчики, которые уже сильно верят в ИИ и не хотят половину задач делать вручную. Тогда это выглядело как аккуратная методологическая сноска. Через несколько месяцев сноска стала центральной проблемой.
В августе 2025 года METR начала второй набор, а в феврале 2026-го описала, почему прежняя схема перестает работать. В повторе участвовали 57 разработчиков: десять из первого исследования и 47 новых. Всего — 143 репозитория и больше 800 задач. Оплату снизили с $150 до $50 в час. Инструменты за это время тоже изменились: среди open source-разработчиков заметно выросло использование агентных систем вроде Claude Code и Codex.
На поверхности повтор выглядел как разворот сюжета. У десяти старых участников задачи с ИИ занимали на 18% меньше времени, у новых — на 4% меньше. Но METR не стала продавать это как новую истину. Доверительные интервалы включали ноль: для старой группы диапазон был от ускорения на 38% до замедления на 9%, для новой — от ускорения на 15% до замедления на 9%. Поэтому авторы назвали это слабым свидетельством ускорения и сосредоточились не на красивой цифре, а на том, почему цифрам теперь трудно доверять.
Главная поломка — отбор участников. Все больше разработчиков прямо говорят, что не хотят выполнять 50% своей работы без ИИ, даже если им платят и они сами выбирают задачи. METR признает: такая схема систематически теряет людей с самыми оптимистичными ожиданиями от ИИ. Один из участников первого набора ответил, что хотел бы помочь с обновленными данными, но ему слишком нравится работать с ИИ. Это уже не шум в данных, а сигнал о смене нормы: для части инженеров отказ от ассистента ощущается не как честный контроль, а как искусственное ухудшение условий труда.
Вторая проблема — сами задачи. По опросу METR, 30–50% участников признались, что не включают в эксперимент часть работы, потому что не хотят рисковать и получить ее в режиме без ИИ. Один разработчик описал типичный мотив: он избегает задач, где ИИ справится за два часа, а вручную придется сидеть двадцать. Другой сравнил работу без ИИ с прогулкой пешком через город, когда ты привык вызывать такси. Для исследования это особенно неприятно: из выборки исчезают ровно те задачи, на которых эффект ИИ может быть максимальным.
Третья сложность — учет времени. Когда агент пишет код по одной задаче, а человек параллельно занимается другой, привычная метрика человеко-часов начинает скрипеть. Что считать временем выполнения: ожидание агента, активное управление, проверку результата, переключение контекста? Для менеджера это не академический вопрос. Если команда внедряет ИИ в разработке, ей важно понимать не только скорость закрытия тикета, но и нагрузку на ревью, качество результата, число переделок и влияние на поток задач.
В мае 2026 года METR сместилась от эксперимента к опросу. Ответили 349 технических специалистов: инженеры, исследователи, академические сотрудники, аспиранты, фаундеры и менеджеры. Половина регулярно пользовалась Claude Code. Медианная оценка ускорения оказалась в 3 раза, а рост ценности работы — в 1,4–2 раза в зависимости от формулировки вопроса. Отдельно METR сравнила оценки ценности: в марте 2025 года — 1,3 раза, в марте 2026-го — 2 раза, прогноз на март 2027-го — 2,5 раза.
Но и здесь авторы не стали делать вид, что нашли финальный ответ. Выборка была удобной: GitHub, университетские рассылки, знакомые сотрудников METR, X; доля ответивших около 2%, большинство получили вознаграждение примерно $200. METR прямо пишет о вероятном смещении выборки. Зато вместе три публикации показывают важный тренд: спор «ускоряет ли ИИ программиста» уходит от простого A/B-теста к более сложной реальности, где меняются инструменты, привычки, типы задач и готовность людей участвовать в контрольной группе.
Для разработчиков вывод прагматичный: цифра минус 19% больше не годится как универсальный аргумент против ИИ, но и «ускорение в 3 раза» нельзя класть в бизнес-кейс без оговорок. Для бизнеса ИИ в разработке стоит оценивать на своих задачах: отдельно багфиксы, миграции, тесты, прототипирование, документацию, ревью и поддержку легаси. И обязательно смотреть не только на скорость, но и на качество, стоимость проверки, безопасность и то, какие задачи сотрудники начинают отдавать ИИ первыми.
Самый интересный вопрос теперь не в том, заменит ли ИИ разработчиков целиком. Пока данные говорят о другом: меняется граница между работой человека и инструмента, а вместе с ней ломаются старые способы измерения продуктивности. Если лучшие кандидаты для эксперимента отказываются работать без ассистента, рынок уже сделал часть вывода раньше исследователей.