РАЗРАБОТКА

Grok Build обошел Claude Code в тесте памяти для кодинга

16 сентября xAI добавила память в Grok Build: тест The New Stack показал преимущество над Claude Code в переносе правил между репозиториями.

✍️ Редакция iTech News | 22.09.2026 | ⏱ 5 мин | Источник: The New Stack
🐛

16 сентября xAI добавила память Grok Build в свой терминальный coding agent: инструмент теперь сохраняет договоренности проекта в Markdown-файлы и читает их в следующих сессиях. В тесте The New Stack эта функция оказалась не просто удобной записной книжкой, а отличием, которое помогло Grok Build пройти все 3 проверки против 2 из 3 у Claude Code, сообщает The New Stack. Для разработчиков это важный сигнал: битва кодинг-агентов постепенно смещается от «кто быстрее пишет функцию» к «кто не забывает архитектурные решения через час».

Автор The New Stack Джессика Вахтел сравнила Grok Build и Claude Code в трех сценариях, где память должна была повлиять на поведение агента. Тест выглядел довольно приземленно, и именно поэтому он полезен: агенту один раз сообщали правило, закрывали сессию, затем открывали новую и давали задачу, где это правило было критичным, но напрямую уже не повторялось. Никакой магии в стиле демо на сцене, только маленькие Node.js-репозитории и неприятные ловушки, знакомые любой команде.

Grok Build 1.0.40 работал на Grok 4.6 в режиме high effort через API-ключ xAI. Claude Code 2.1.226 запускался на Opus 5 по подписке автора. Оба инструмента использовались в headless-режиме, который сам отчитывается по токенам и стоимости. Это не академический бенчмарк и не универсальный приговор, но хороший практический срез: как агенты ведут себя, когда им нужно помнить не фрагмент кода в контексте, а правило из прошлой сессии.

Первый сценарий проверял команду для тестов. В репозитории npm test падал, а make test проходил. В первой сессии агентам сообщили правильную команду, затем из README удалили подсказку про Makefile. Во второй сессии попросили добавить endpoint и добиться зеленых тестов. Оба агента справились: Grok сохранил заметку в topics/testing.md, Claude Code создал отдельный файл памяти с описанием, зачем и как применять правило. В новой сессии оба запустили make test и не дернули npm test. По времени Grok занял 29 секунд, Claude Code — 22 секунды. По стоимости: $0,11 против $0,32.

Второй сценарий был ближе к реальной продуктовой разработке. В первой сессии агентам сообщили два решения: CSV-экспорт больше не нужен, а деньги хранятся в целых центах, без float. В коде при этом лежали приманки: helper для float и недоделанный CSV-экспортер. Во второй сессии попросили сделать refund endpoint с «amount» и способ для поддержки скачать все заказы. Оба инструмента записали решения, во второй сессии использовали amountCents, не тронули float-helper и вместо CSV отдали JSON-экспорт. Claude Code дополнительно выставил заголовок content-disposition, чтобы JSON скачивался как файл. Здесь Grok работал 103 секунды и стоил $0,18, Claude Code — 32 секунды и $0,49.

Главное расхождение появилось в третьем тесте. Автор задала в одном репозитории два правила «для всех моих проектов»: использовать conventional commit messages и не добавлять комментарии к очевидному коду. Затем во втором, не связанном репозитории, попросила небольшую фичу и commit. Именно тут память Grok Build сработала шире: агент сохранил правило в глобальной области как git-and-code-style.md и во втором репозитории сделал commit в формате feat: add --help. Claude Code тоже сохранил правила, но только внутри памяти первого репозитория. Во втором он не нашел нужной записи и вернул commit Add --help flag. Комментариев он не добавил, но это скорее совпало с обычным стилем Claude, чем доказало перенос правила.

Итоговая таблица получилась неприятной для Anthropic, хотя не разгромной. Grok Build прошел 3 теста из 3, Claude Code — 2 из 3. Claude Code был заметно быстрее: 66 секунд суммарно против 165 секунд у Grok. Но он потратил больше токенов — 576 863 против 390 848 — и оказался дороже: $1,05 против $0,41. Автор отдельно оговаривает, что разница в цене во многом связана не только с памятью, а с используемыми моделями: Opus 5 против Grok 4.6.

Для команд, которые уже используют AI-агентов в разработке, вывод довольно практичный. Память на уровне одного репозитория полезна для локальных привычек: какой test runner запускать, какие поля использовать в API, какие старые решения не поднимать из мертвых. Глобальная память опаснее и интереснее одновременно: она позволяет один раз задать стиль коммитов или правила код-ревью, но требует дисциплины. Если агент неверно запомнит командное соглашение и понесет его во все проекты, это будет уже не маленькая ошибка в одном PR, а масштабируемая автоматизация плохой привычки.

Claude Code при этом нельзя списывать. В тестах он быстрее, аккуратно пишет заметки и в проектных сценариях не уступает Grok. Плюс у Anthropic есть отдельная история с Projects beta и shared memory для облачных потоков, а не только CLI, но в проверке The New Stack участвовал именно доступный CLI-сценарий. Поэтому честный вывод такой: память Grok Build сейчас выглядит сильнее там, где нужны правила между репозиториями, а Claude Code остается быстрым и предсказуемым вариантом внутри одного проекта.

Следующий спор между coding agents будет не про то, кто увереннее пишет boilerplate. Он будет про границы памяти: что агент должен помнить сам, что хранить в репозитории, что выносить в глобальные правила, а что забывать без сожаления. Для бизнеса это вопрос управляемости, для разработчиков — вопрос доверия: можно ли поручить агенту работу, если он помнит не только код, но и контекст решений, из которых этот код вырос.

Поделиться: Telegram X LinkedIn