Grok 4.5, который xAI выпустила 8 июля, в практическом тесте на coding-задачах внезапно подобрался к Claude Opus почти вплотную, но с куда более скромным аппетитом к токенам. Для разработчиков и тимлидов это не академическая дуэль моделей, а вполне приземлённый вопрос: сколько стоит один и тот же результат, если AI уже сидит у вас в редакторе кода каждый день.
Об этом сообщает The New Stack со ссылкой на собственный эксперимент Джессики Вахтель. Автор проверила Grok 4.5 и Opus 4.8 на трёх задачах в одном репозитории через Cursor: исправление бага, рефакторинг и добавление новой функции. Картина вышла неприятной для тех, кто по привычке считает Claude безусловным выбором по умолчанию: по итогам всех трёх заданий Grok 4.5 израсходовал 1,01 млн токенов против 4,33 млн у Opus, завершил работу примерно за 3 минуты 46 секунд против 11 минут 40 секунд и обошёлся в 1 доллар против 5,14 доллара.
По качеству разрыв оказался куда менее драматичным, чем по расходам. В задаче на багфикс обе модели выдали одинаковое исправление и прошли 70 из 70 тестов. В рефакторинге обе закрыли 264 из 264 тестов. В задаче на новую функциональность различие уже было, но не такое, чтобы перевернуть стол: у Grok автор засчитала корректное изменение в шести файлах, у Opus — в семи, то есть модель Anthropic оказалась чуть аккуратнее в документации и сопроводительных штрихах, но не ушла в отрыв по самой сути работы.
На этом месте важно не скатиться в типичный жанр «убийца X наконец убил X». Вахтель отдельно оговаривает ограничения теста. Во-первых, это не сырой API-замер, а blended token counts внутри Cursor, где в счёт попадает и контекст, который агент пересылает заново на каждом шаге. Во-вторых, Grok работал на fast-tier, а Opus — на thinking-tier, так что часть токенов у Anthropic связана не с расточительностью, а с более тяжёлым режимом рассуждений. В-третьих, у Grok в расчёте стоимости была промо-скидка 50%. Но даже если убрать маркетинговую поблажку и мысленно удвоить цену, три задачи обошлись бы примерно в 2 доллара против тех же 5,14 доллара у Opus. Сухой вывод автора звучит жёстко: в этом сценарии Grok сделал сопоставимую работу примерно за четверть токенов, за треть времени и за долю цены.
Контекст для рынка тут тоже интересный. Последние полтора года корпоративные и командные обсуждения AI-инструментов крутились не только вокруг качества ответа, но и вокруг экономики использования: сколько денег и latency съедают длинные agentic-циклы, когда модель не просто пишет функцию, а ходит по файлам, гоняет тесты, переписывает куски проекта и снова гоняет тесты. На этом фоне обещания xAI про более высокую token efficiency у Grok 4.5 выглядели как обычная презентационная бравада. Проблема в том, что такие заявления любят все, а в реальной разработке они часто разваливаются на первом же проекте с историческим кодом и десятком неочевидных зависимостей. Поэтому даже один аккуратно описанный прикладной тест быстро попадает в нерв индустрии: команды уже устали платить за «самую умную модель», если рядом появляется вариант, который делает почти то же самое, но заметно дешевле.
Для русскоязычной IT-аудитории здесь особенно важен не сам факт победы одной модели над другой, а смещение критерия выбора. Если раньше многие разработчики и техлиды покупали себе внутреннее спокойствие формулой «берём Claude Opus, потому что он почти наверняка лучший», то теперь эта эвристика трещит. Вахтель прямо пишет, что использует Claude как основной инструмент и просто по инерции считала его лучшим вариантом. Тест заставил пересмотреть эту установку. Это довольно показательный момент: рынок AI-кодинга взрослеет, и слепая лояльность бренду начинает уступать место более скучной, но полезной бухгалтерии — сколько задач модель реально закрывает, за сколько минут и какой ценой на счёте.
Для бизнеса вывод ещё прозаичнее. Если у вас AI-ассистенты встроены в повседневную разработку, разница между 1 и 5 долларами на три задачи не выглядит космической. Но в масштабах команды, которая прогоняет сотни похожих циклов в неделю, это быстро превращается в заметную статью расходов. Особенно если речь не о стартапе на пять человек, а о продуктовой организации с несколькими командами, где агентные режимы включены постоянно. В такой ситуации «чуть лучше в документации» может оказаться недостаточным аргументом в пользу модели, которая потребляет в несколько раз больше токенов и времени.
При этом делать из одного теста окончательный рейтинг было бы слишком самоуверенно. Три задачи в одном репозитории — это ещё не универсальный вердикт для любого стека, команды и способа работы. Но сам факт, что Grok 4.5 уже на старте заставляет пересматривать привычную иерархию в AI-кодинге, важнее локального счёта в этом раунде. Если следующие независимые проверки подтвердят ту же пропорцию по качеству, скорости и стоимости, спор о «лучшем coding-ассистенте» быстро превратится в спор о том, кто умеет не только решать задачу, но и делать это без лишнего сжигания токенов. Подробности теста можно посмотреть в публикации .