Grok 4.7 вышел как новая флагманская модель xAI: 500 тысяч токенов контекста, запуск кода, function calling и ставка не на быстрый чат, а на многочасовую автономную работу. Для разработчиков и команд, которые уже пробуют AI-агентов в IDE и пайплайнах, Grok 4.7 интересен не красивой демкой, а обещанием дольше держать задачу, не терять нить и проверять собственный результат.
Модель уже доступна через API, Cursor и Grok Build, сообщает Habr / Новости. В Grok Build она стала моделью по умолчанию, в Cursor доступна на всех тарифах. Обычную версию также можно использовать через xAI API, OpenRouter, Vercel и Cloudflare. Отдельная версия Fast работает примерно вдвое быстрее и стоит вдвое дороже, но пока доступна только в Cursor и Grok Build, а не в публичном API xAI.
Главное техническое изменение — новая, более крупная базовая модель по сравнению с Grok 4.6. xAI также увеличила этап обучения с подкреплением и добавила в него больше сложных задач, которые выполняются не за один ответ, а в несколько шагов. Это важная деталь: модель учили не просто завершать фразу или писать функцию, а планировать работу, вызывать инструменты, запускать код и сверять результат с целью. Именно здесь сейчас проходит граница между «чат-бот помог с регуляркой» и «агент реально доехал до закрытого тикета».
Набор возможностей выглядит ожидаемо для флагманской модели конца 2026 года, но в сумме он делает Grok 4.7 заметным игроком для инженерных сценариев. Контекстное окно — 500 тысяч токенов. На вход можно подавать текст и изображения. Для рассуждений доступны уровни Low, Medium, High и xHigh. Есть function calling, поиск в интернете и X, запуск кода, а отсечка знаний заявлена на май 2026 года. Полмиллиона токенов не превращают модель в безошибочного архитектора, но дают ей шанс держать рядом крупный репозиторий, длинную спецификацию, историю обсуждений и набор логов без немедленного обрезания контекста.
Отдельно xAI говорит о встроенном понимании среды Grok Bot — системы постоянных AI-агентов, которые работают с приложениями, файлами и внешними сервисами. Для бизнеса это, пожалуй, самый практичный слой релиза. Если модель лучше понимает среду исполнения, ей проще не только написать патч, но и пройти соседние действия: найти нужный файл, вызвать инструмент, проверить вывод, поправить ошибку и продолжить. Рынок явно двигается в сторону моделей, которые продаются не как «самый умный ответ», а как рабочая смена внутри IDE, терминала или внутренней платформы.
В бенчмарках картина получилась без триумфального марша, и это даже полезно. На CursorBench 4.0 Grok 4.7 набрал 46,3% против 40,4% у Grok 4.6. В той же таблице GPT-5.6 Sol Max получил 41,7%, а Fable 5.1 Max остался впереди с 51,8%. На DeepSWE v1.1, который проверяет выполнение реальных задач разработки в репозиториях, результаты плотнее: GPT-5.6 Sol Max — 72,7%, Grok 4.7 — 71,0%, Fable 5.1 Max — 70,0%, Grok 4.6 — 65,2%. То есть новая модель заметно выросла относительно прошлой версии, но не забрала себе все первые места.
На Terminal-Bench 4.0 скачок сильнее: 38% у Grok 4.7 против 20,3% у Grok 4.6. При этом Fable 5.1 Max, по данным xAI, набрал 57,9%, а GPT-5.6 Sol Max — 37,3%. На EEBench, тесте для задач по электротехнике, Grok 4.7 показал 64% и обошёл модели из сравнения xAI. Но к этим цифрам лучше относиться как к стартовой карте, а не к приговору рынку: данные опубликованы самой xAI, режимы запуска различались, независимого подтверждения пока нет. Бенчмарки полезны, когда помогают выбрать инструмент под задачу, а не когда превращаются в спортивную таблицу для фан-клубов.
Цена у обычной версии осталась на уровне Grok 4.6: $2 за миллион входных токенов и $6 за миллион выходных. В сравнении xAI для GPT-5.6 Sol Max указаны $4 и $20, для Fable 5.1 Max — $10 и $50. Если эти условия сохранятся на практике, Grok 4.7 может оказаться привлекательным для команд, которые гоняют длинные контексты и агентные задачи пачками. В таких сценариях стоимость ошибки измеряется не только ценой токенов, но и временем инженера, который потом разбирает недоделанный патч.
Безопасность тоже обновили: xAI заявляет о переработанной системе ограничений. На LatchBio модель получила 62,4%, а в HackerBench v0.3, по утверждению разработчиков, пропустила 3,3% опасных запросов и при этом редко блокировала легитимную работу специалистов по безопасности. Независимой проверки этих результатов пока нет, поэтому для корпоративного внедрения вывод простой: тестировать на своих политиках, своих репозиториях и своих неприятных кейсах. Если тренд на многочасовых AI-агентов продолжится, главным вопросом станет не «какая модель умнее в среднем», а какая дешевле, устойчивее и предсказуемее доводит рабочую задачу до результата.