Grok 4.7 вышел с заявкой на главное больное место coding agents: модель учили не только писать код, но и держать многочасовую задачу без развала контекста. По данным The New Stack, результат заметно лучше прошлой версии, но сухие бенчмарки быстро охлаждают энтузиазм: на Terminal-Bench 4.0 модель решает 38,0% задач, то есть чаще всё ещё проигрывает, чем справляется.
Релиз состоялся 20 сентября 2026 года. Компания сделала акцент на более длинном цикле reinforcement learning и специально сдвинула обучение в сторону сложных задач, которые могут занимать «многие часы». Для разработчиков это звучит знакомо: агент открывает файлы, правит код, запускает тесты, ловит ошибку, пробует другой путь, снова запускает тесты. В такой цепочке один неверный вывод в начале легко превращается в аккуратно оформленный провал через два часа.
Именно поэтому в Grok 4.7 отдельно продвигают две способности: самопроверку и управление длинным контекстом. Первая нужна, чтобы агент не просто уверенно продолжал ошибочный план, а мог остановиться и проверить собственную гипотезу. Вторая — чтобы растущая история команд, логов, правок и ошибок не превращалась в кашу. Это не косметика для чат-бота, а базовая инфраструктура для задач, где AI сидит в репозитории дольше одного промпта.
Цифры показывают прогресс, но не дают повода увольнять дежурного разработчика. На Terminal-Bench 4.0 Grok 4.7 поднялся до 38,0% против 20,3% у Grok 4.6. На CursorBench 4.0, где проверяются более длинные сценарии разработки внутри редактора, результат вырос с 40,4% до 46,3%. В AA Briefcase v1.1, оценке многочасовой профессиональной работы, счёт увеличился с 1546 до 1657. Это хороший скачок между соседними версиями, но не гарантия автономной работы. Для сравнения, Claude Fable 5.1 набирает 57,9% на Terminal-Bench 4.0, то есть и лидерство в этом классе задач остаётся спорным.
Самый интересный сдвиг не в процентах, а в том, что модель обучали понимать собственную «обвязку» — Grok Bot harness. Такой harness отвечает за инструменты вокруг модели: как передавать команды терминала, как возвращать результаты выполнения, как форматировать ответы среды, как кормить всё это обратно в контекст. Если модель заранее знакома с этим форматом, ей меньше приходится осваивать правила игры через промпт на лету. Прагматично, но с побочным эффектом: чем глубже модель обучена под конкретную среду исполнения, тем сложнее команде потом заменить её на другую без потери качества.
Это важный сигнал для CTO, тимлидов и команд, которые уже тестируют AI-агентов на реальных репозиториях. Покупать нужно не только модель с красивым leaderboard, а весь контур: редактор, терминал, sandbox, тестовую среду, правила доступа, логи, rollback и человеческий контроль. Агент, который стоит $2 за миллион входных токенов и $6 за миллион выходных, может выглядеть недорогим на прайс-листе. Но если он гоняет CI впустую, путает предпосылки и оставляет после себя полурабочий pull request, экономия быстро становится бухгалтерской фантазией.
Для российских и русскоязычных команд вывод приземлённый: Grok 4.7 и похожие модели уже можно рассматривать как инструмент для длинных черновых прогонов, миграций, поиска причин падения тестов и подготовки патчей. Но запуск «на ночь без присмотра» пока требует страховки: ограниченного окружения, маленьких задач, обязательных тестов и ревью человеком. AI-агент становится выносливее, но выносливость — не то же самое, что инженерная ответственность.
Следующий этап гонки, похоже, будет не только про размер модели и цену токена. Победят системы, которые умеют доказывать собственную работу: показывать проверяемый ход решения, понимать, где они свернули не туда, и не превращать длинный контекст в архив самоуверенных ошибок. Grok 4.7 сделал шаг в эту сторону, но для продакшена главный вопрос остаётся прежним: когда агенту можно доверить не задачу, а последствия её выполнения?