Спор вокруг AI coding harness внезапно стал важнее спора о самих моделях. Augment Code заявляет, что на одинаковой модели смогла пройти Terminal-Bench с сопоставимой точностью, но на 33% эффективнее по токенам, чем Claude Code. Для команд, которые считают бюджет на агентную разработку, это уже не философия, а вполне прикладная математика.
Об этом сообщает Ars Technica в интервью с вице-президентом по инженерии Augment Code Винаем Пернети, опубликованном 20 июля 2026 года. Повод на первый взгляд нишевый: спор о том, как именно AI-ассистент должен собирать контекст по кодовой базе. Но именно здесь сейчас проходит одна из главных развилок рынка. Одни игроки делают ставку на «легкую обвязку» вокруг модели и поиск по репозиторию в духе grep. Другие, как Augment, заранее индексируют кодовую базу через embeddings, retrieval-модель и векторную базу, чтобы агент доставал не просто совпадения по строкам, а семантически релевантные куски кода.
Термин harness в этой дискуссии ключевой. Речь не о модели как таковой, а о программном слое между моделью и реальным проектом разработчика. Этот слой решает, какой контекст увидит агент, какие инструменты получит, какие действия сможет выполнять и как вообще будет ориентироваться в коде. На этом фоне становится понятнее, почему одна и та же frontier-модель в разных продуктах может вести себя по-разному: разница не только в интеллекте модели, но и в том, как именно ей подают проект.
Контекст спора задал еще один материал Ars Technica, вышедший в мае 2026 года: тогда глава продукта Claude Code Кэт Ву объясняла, почему Anthropic держится за lean harness. Логика у них простая: модели меняются слишком быстро, чтобы обрастать жесткими предположениями и сложной инфраструктурой вокруг них. По словам Ву, внутренние evals не показывают заметимого выигрыша от более тяжелых инструментов семантической навигации, поэтому Claude Code предпочитает не навязывать лишнюю механику и оставлять разработчику пространство для собственных инструментов.
Augment Code делает противоположную ставку. Пернети утверждает, что выигрыш от семантического контекста особенно заметен не на публичных open source-репозиториях, а на больших приватных кодовых базах. Его аргумент довольно неприятен для большинства публичных бенчмарков: по открытым репозиториям современные модели уже многое «помнят» из обучения, поэтому быстро находят нужные файлы и зависимости без изощренной навигации. В приватном репозитории такой форы нет. Модель раньше этого кода не видела, ей приходится дольше блуждать по проекту, тратить больше токенов на разведку и медленнее выходить к рабочему решению. Если же у системы есть заранее собранное семантическое представление всего репозитория, поиск пути сокращается.
Где расходятся подходы
Самая интересная часть интервью даже не в том, что Augment и Claude Code спорят, а в том, что они, похоже, часто меряют разные вещи. Пернети прямо говорит: не все retrieval-системы одинаковы, как не все базы данных одинаковы. Если кто-то прикрутил к агенту условный RAG и не увидел эффекта, из этого еще не следует, что идея не работает. В Augment напоминают, что занимались retrieval- и embedding-моделями для крупных кодовых баз примерно 18 месяцев с момента основания компании в 2022 году, то есть еще до запуска ChatGPT 30 ноября 2022 года. Их тезис в том, что результат дает не сам по себе модный ярлык RAG, а конкретная инженерная реализация: какие embeddings используются, как строится retrieval, как быстро это работает и насколько точно система подбирает релевантный код.
Отсюда и цифра про Terminal-Bench. Пернети не обещает магию и не заявляет, что Augment радикально точнее всех конкурентов. Формулировка осторожнее: при схожей точности на одной и той же модели система оказалась на 33% эффективнее по токенам, потому что меньше ресурсов уходило на исследование репозитория. Для CTO, VP of Engineering и техлидов это, возможно, самая практичная часть разговора. Когда агентные сценарии начинают упираться в стоимость, вопрос «какая у вас модель» быстро превращается в вопрос «сколько контекста вы сжигаете на поиск нужного кода».
Здесь Пернети заходит на территорию, где обычно спорят не разработчики, а руководители инженерных команд. Его формула звучит почти как бюджетный компромисс: для качественного результата нужны и интеллект, и контекст. Интеллект моделей, по его оценке, продолжит расти очень быстро. Но рост интеллекта сам по себе не отменяет проблемы контекста. Модель можно заставить «дособирать» все необходимое на лету, только платить за это придется токенами, временем и непредсказуемостью. В таком ракурсе design of harness перестает быть интерфейсным украшением и становится задачей системной инженерии: как получить максимум качества при минимальной цене.
Что это значит для рынка и команд
Для русскоязычной IT-аудитории в этом сюжете важны сразу три вывода. Первый: рынок AI-кодинга входит в фазу, где соревнуются уже не только модели, но и инфраструктура вокруг них. В списке Ars Technica рядом фигурируют Claude Code, OpenAI Codex, Google Antigravity, open source-проекты вроде OpenCode, а также Cursor и Augment Code. То есть пространство конкуренции расширилось: побеждает не тот, у кого просто «лучше LLM», а тот, кто лучше организует работу этой LLM внутри реального репозитория.
Второй вывод касается приватного кода. Почти все эффектные демо и многие бенчмарки до сих пор крутятся вокруг открытых репозиториев, где модель может опираться на знания из обучения. Но у корпоративной разработки другая фактура: монорепы, внутренние SDK, самописные фреймворки, легаси, закрытые зависимости, локальные соглашения по архитектуре. Именно там спор между grep-подходом и семантическим индексированием перестает быть академическим. Если тезис Augment верен хотя бы частично, то главные преимущества тяжелых context engine проявятся не на витринных демках, а в скучных корпоративных проектах, где и живут основные бюджеты.
Третий вывод не такой приятный для поклонников лозунга «агенты скоро все сделают сами». Пернети отдельно отвечает на два популярных возражения: недоверие к AI-коду и цена агентных сценариев. Его позиция трезвая: если отдать задачу агенту и уйти пить кофе, почти наверняка получится новый слой техдолга. По его словам, команды людей по-прежнему нужны для постановки задачи, ревью и суждения; особенно слабо агенты пока справляются со спецификациями. Зато после качественно заданного спекa они уже неплохо исполняют конкретную работу. Для индустрии это, пожалуй, самый полезный антидот против маркетингового перегрева: автономия растет, но инженерное суждение не дешевеет, а дорожает.
Следующий раунд конкуренции в AI-разработке, похоже, пройдет не между громкими названиями моделей, а между способами доставить модели правильный контекст за приемлемые деньги. Если frontier-модели останутся дорогими, рынок может довольно быстро прийти к гибридной схеме: сложные задачи уйдут дорогим моделям, а рутинные и хорошо описанные куски работы достанутся более дешевым или локально размещенным системам. В такой конфигурации вопрос о том, каким должен быть AI coding harness, станет не деталью продукта, а архитектурным решением для всей инженерной организации. Проверить исходные цитаты Пернети можно в материале .