Google 30 сентября представила Gemini 4 Argon — новую флагманскую ИИ-модель для кодинга, кибербезопасности и длинных рабочих задач. Для разработчиков и IT-команд новость звучит заманчиво, но с типично корпоративной оговоркой: модель уже есть, пользоваться ей большинству пока нельзя.
Gemini 4 Argon стала долгожданным ответом Google на гонку frontier-моделей, сообщает The New Stack. Компания заявляет, что модель показывает лидерские результаты в инженерных задачах, аналитической работе и cyber defense, но запускает ее не массово, а через ограниченную программу для доверенных тестировщиков.
Главная интрига не в самом факте анонса, а в режиме доступа. Google открывает Argon сначала партнерам программы Fairwind, причем акцент сделан на защитные сценарии в кибербезопасности. Массового релиза в API, обычном Gemini или корпоративных подписках пока нет. Цены для API тоже не объявлены, так что считать экономику внедрения сейчас можно только на салфетке, а это редко заканчивается хорошей архитектурой бюджета.
По словам Google, модель уже используют внутри компании. Один из примеров — оптимизация инфраструктуры: Argon помогла сэкономить около 300 ТиБ памяти в дата-центрах Google за счет анализа телеметрии. Другой пример ближе к разработчикам: агенты на базе модели участвовали в миграции C/C++-кодовых баз на Rust, включая библиотеки re2 и libgav1, а также более 800 000 строк в Zircon, ядре Fuchsia OS. Это не демо с калькулятором на React, а вполне взрослая боль больших кодовых баз.
В бенчмарках Google тоже пришла не с пустыми руками. На DeepSWE v1.1, тесте для задач software engineering, Gemini 4 Argon набрала 77,9%. Компания сравнивает результат с конкурирующими frontier-моделями OpenAI, Anthropic и другими системами, утверждая, что Argon лидирует в ряде сценариев. Впрочем, любые вендорские таблицы стоит читать как пресс-релиз с графиками: полезно, но без независимых прогонов и реального API-доступа это еще не эксплуатационная правда.
Отдельный пункт — контекст и вывод. Google говорит о поддержке вывода до 1 млн токенов, тогда как у предыдущих Gemini-моделей лимит составлял 64 000 токенов. Для разработчиков это может быть важнее красивого места в рейтинге: длинный вывод открывает сценарии вроде многошаговой миграции проекта, генерации объемной документации, анализа большого набора логов или подготовки патчей без постоянного дробления задачи на куски. Но здесь снова упираемся в доступ: пока модель не попала к широкому кругу инженеров, проверить устойчивость на грязных репозиториях, странных зависимостях и легаси-сюрпризах нельзя.
Почему старт именно с кибербезопасности? Google объясняет это осторожным подходом к frontier-моделям: чем мощнее система, тем выше риск неправильного применения. Компания утверждает, что встроила механизмы мониторинга рассуждений модели и может останавливать ее, если поведение выходит за рамки. Звучит как ответ на растущую тревогу вокруг автономных агентов, которые уже умеют не только писать код, но и искать уязвимости, запускать инструменты и строить цепочки действий. Для CISO это одновременно подарок и повод налить себе крепкий кофе.
Один из ранних кейсов связан с Wiz: по данным Google, команда использовала Argon для поиска критической уязвимости, способной раскрывать персональные данные в системе, применяемой больницами по всему миру. Подробностей компания не раскрыла, а The New Stack справедливо обращает внимание, что такие заявления пока трудно независимо проверить. Особенно когда пример исходит от партнера, тесно связанного с экосистемой Google.
Для русскоязычной IT-аудитории практический вывод простой: Gemini 4 Argon пока не инструмент, который можно поставить в пайплайн завтра утром. Это скорее сигнал о направлении рынка. Большие модели двигаются от чат-ответов к долгим агентным задачам: миграции кода, security review, инфраструктурная оптимизация, юридический и финансовый анализ. Если Google действительно доведет эти сценарии до стабильного API, конкуренция для OpenAI, Anthropic и локальных корпоративных решений станет жестче.
Бизнесу пока рано переписывать AI-стратегию под новую модель, но уже пора задавать более приземленные вопросы: какие репозитории можно безопасно отдавать внешнему агенту, кто отвечает за результат его патча, как логировать действия модели и чем измерять пользу кроме «она умная». Следующий этап гонки будет не про самый громкий анонс, а про то, какая модель выдержит скучную, длинную и дорогую работу в продакшене.