Исследователь Удит Акури заявил, что его надстройка Claude Code ADHD делает агент для программирования «в 2 раза лучше» по качеству мышления. Заявление звучит как типичный заголовок из мира AI-инструментов, но для разработчиков и команд здесь важнее другое: спор разгорелся не вокруг очередной модели, а вокруг того, как именно теперь пытаются улучшать кодогенерацию поверх уже готовых LLM.
Как пишет The New Stack, на этой неделе Акури представил в сабреддите r/ClaudeCode сторонний инструмент на базе Claude Agent SDK. Проект называется ADHD и описывается как навык для coding agents, который распараллеливает несколько направлений рассуждения, оценивает их, отбрасывает тупиковые ветки и углубляет самые перспективные. Сам автор объясняет идею почти бытовым образом: система «думает во многих направлениях и уходит глубоко лишь в некоторые». Если убрать маркетинговый шум, получается знакомая инженерная схема: несколько параллельных гипотез вместо одной линейной цепочки рассуждений.
Акури — основатель Brane Labs, исследовательской лаборатории по AI-комплаенсу и безопасности в здравоохранении, drug discovery и life sciences, а также основатель Exthalpy, платформы для клиник и больниц. В сопроводительной работе ADHD: Parallel Divergent Ideation for Coding Agents он описывает подход как разновидность tree-of-thought с ветвлением по «когнитивным рамкам», разделением ролей генератора и критика и последующим pruning. При этом сам автор честно признает важную деталь, которую часто прячут внизу лендингов: инструмент лучше подходит для брейншторминга и планирования, а не для собственно написания кода. Для тех, кто уже гоняет агентные IDE в проде, это уточнение важнее красивого слогана про «2x better».
Главный аргумент проекта — результаты evals. По словам Акури, формулировка про «в два раза лучше» получилась как среднее по нескольким измерениям. В пяти из шести тестовых задач ADHD обошел baseline. На GitHub приведены такие приросты: +4,17 по breadth, +5,17 по novelty, +7,67 по trap detection, +3,00 по actionability и +0,83 по builder usefulness. Автор отдельно подчеркивает, что оценки задокументированы и воспроизводимы локально через команду npm run evals. Для open-source AI-инструмента это хороший жест: по крайней мере, спорить можно не на уровне твита, а на уровне повторяемого теста.
Но именно здесь и начинается самая интересная часть истории. The New Stack пишет, что если убрать из среднего показателя trap detection с его очень крупным вкладом +7,67, итоговый эффект сжимается с 2,52x до 1,85x. То есть headline про «в два раза лучше» держится не на равномерном росте по всем метрикам, а во многом на одной особенно сильной категории. Для исследовательской заметки это допустимо, для громкого продуктового тезиса — уже повод для вопросов. Тем более что весь бенчмарк состоит всего из шести инженерных задач. В мире AI-evals это скорее интересный сигнал, чем основание для уверенного обобщения.
Скепсис внешних экспертов оказался вполне предсказуемым. Николаос Василоглу, вице-президент по research ML в RelationalAI, сказал изданию, что ADHD выглядит как еще один метод исследования поверх LLM и появляется на рынке в момент, когда компании уже страдают от перерасхода токенов. И это болезненная ремарка: любая техника, которая делает агента «умнее» за счет параллельных веток, почти автоматически делает его и дороже. Если выигрыш получается главным образом в planning quality, а не в финальном коде, бизнесу придется отдельно считать, где здесь экономический смысл. Ной Рамос, вице-президент по AI operations в Agiloft, тоже не спешит принимать результаты как устойчивый факт: без проверенной межсудейской согласованности рост по таким параметрам, как novelty или trap detection, выглядит любопытно, но еще не тянет на надежное эмпирическое подтверждение.
Есть и более тонкая претензия, хорошо знакомая всем, кто хотя бы раз смотрел на сравнительные тесты LLM: не слишком ли удобной получилась связка, где метод строится внутри Claude-стека, а оценивается моделью того же семейства? Даже если никакой предвзятости нет, сама постановка эксперимента создает лишние вопросы. На практике это значит, что Claude Code ADHD пока выглядит не как доказанный новый стандарт для агентной разработки, а как интересный orchestration-паттерн, который еще нужно прогнать через более жесткие и разнообразные проверки. В том числе на других задачах, с другими судьями и, желательно, с внятной оценкой стоимости каждого «улучшенного» рассуждения.
Для русскоязычной IT-аудитории здесь важен не мем про «СДВГ для ИИ», а более приземленный вывод. Рынок coding agents быстро смещается от гонки базовых моделей к гонке надстроек: кто лучше распараллелит гипотезы, кто аккуратнее отрежет ложные ветки, кто даст более читаемый reasoning layer поверх черного ящика. Это хороший знак для инженеров, потому что часть прогресса снова становится доступной не только big tech, но и сторонним разработчикам. Но это и плохой знак для тех, кто любит простые метрики продуктивности: чем умнее становятся такие оркестраторы, тем легче перепутать реальное улучшение качества с дорогим ростом вычислительного шума. В ближайшие месяцы спор, похоже, будет идти уже не о том, может ли агент писать код, а о том, сколько параллельных мыслей вообще стоит покупать ради одного приличного решения.