AI И НЕЙРОСЕТИ

Gemini 3.5 Flash: Google делает ставку на быстрых ИИ-агентов

Gemini 3.5 Flash выдает 289 токенов в секунду и обходит конкурентов в агентских задачах. Google показал, куда теперь движется рынок ИИ.

✍️ Редакция iTech News | 20.05.2026 | ⏱ 5 мин | 👁 4 | Источник: Habr / Новости
🧬

Google показал Gemini 3.5 Flash и сразу задал рамку для обсуждения: модель выдает 289 токенов в секунду и, по данным компании, лучше всего чувствует себя в агентских сценариях и кодинге. Для разработчиков и IT-команд это важный сдвиг: гонка уже идет не только за «самый умный» ИИ, но и за модель, которую можно быстро и дешево ставить на реальную работу.

На это обратил внимание и Habr / Новости, разбирая анонс с конференции I/O 2026. Google представил новое семейство Gemini 3.5, и первой в нем вышла именно младшая версия Flash. Формулировка у компании амбициозная: это якобы ее сильнейшая модель для агентов и программирования. Заявление громкое, но дальше начинаются цифры, и они рисуют более интересную картину, чем обычный маркетинговый слоган.

Там, где Gemini 3.5 Flash действительно выглядит очень сильно, находятся задачи с инструментами, внешними вызовами и многошаговыми сценариями. На бенчмарке MCP Atlas модель набирает 83,6% и обходит Claude Opus 4.7 и GPT-5.5. На Finance Agent v2 результат составляет 57,9% против примерно 51% у обоих конкурентов и 43% у Gemini 3.1 Pro. Если убрать рекламную шелуху, посыл довольно прямой: Google пытается закрепить за Flash роль не «чат-бота на все случаи жизни», а производственного исполнителя, который умеет работать в агентной среде, пользоваться инструментами и не разваливаться на длинной цепочке действий.

Отдельно Google давит на мультимодальность. На MMMU-Pro модель получила 83,6%, на CharXiv — 84,2%, и в обоих случаях это лучший результат в таблице из источника. Для рынка это уже не декоративная функция, а вполне прикладная история: анализ документов, диаграмм, скриншотов, интерфейсов и смешанных форматов данных давно стал частью повседневной работы команд. Если модель действительно держит высокий уровень не только в текстовом окне, но и на задачах с визуальным контекстом, это повышает ее шансы попасть в корпоративные процессы, а не остаться демонстрацией со сцены.

С кодингом ситуация менее однозначная, но тоже показательная. На Terminal-Bench 2.1 у Gemini 3.5 Flash 76,2% против 70,3% у Gemini 3.1 Pro. То есть младшая новинка уже обгоняет прежний флагман Google в задаче, которая важна для разработчиков куда больше, чем красивые слова про «ассистентов нового поколения». Но абсолютным лидером по этому тесту модель не стала: GPT-5.5 набирает 78,2%. И это, пожалуй, самое честное прочтение анонса. Google не принес на рынок универсального чемпиона, который первым приходит в любой дисциплине. Компания, скорее, собрала очень быструю и достаточно сильную рабочую модель, способную закрывать большой пласт инженерных задач без претензии на интеллектуальную корону.

Это особенно заметно на тестах, где важнее сложное рассуждение, устойчивость на абстрактных задачах и длинный мыслительный горизонт. На Humanity's Last Exam у Gemini 3.5 Flash 40,2% — ниже, чем у Gemini 3.1 Pro с 44,4% и Claude Opus 4.7 с 46,9%. На ARC-AGI-2 модель получает 72,1% против 77,1% у 3.1 Pro. На GDPval-AA, где системы сравнивают по Elo-рейтингу на экономически ценной работе, у Flash 1656 пунктов. Это ниже, чем у Claude Sonnet 4.6 с 1676, Claude Opus 4.7 с 1753 и GPT-5.5 с 1769. И вот здесь расстановка сил становится предельно понятной: если вам нужен ИИ для глубоких рассуждений, стратегических задач или сложной аналитики, Flash не выглядит безоговорочным ответом. Если нужен быстрый исполнитель, который умеет много и не тормозит, позиция у него уже куда сильнее.

Главный козырь Google — скорость. По данным независимого сервиса Artificial Analysis, Gemini 3.5 Flash работает более чем в четыре раза быстрее Claude Opus 4.7 и GPT-5.5: 289 токенов в секунду против 67 и 71 соответственно. Даже собственный Gemini 3.1 Pro отстает более чем вдвое с показателем 135 токенов в секунду. При этом по сводному индексу интеллекта Artificial Analysis новая модель держится примерно на уровне 3.1 Pro и Claude Opus 4.7. Для бизнеса это, возможно, важнее красивых процентов в отдельных академических тестах. В реальном продукте цена задержки часто выше, чем разница между «очень хорошей» и «еще чуть более хорошей» логикой. Когда агент должен быстро разобрать поток задач, сделать серию вызовов, обновить данные и вернуть результат пользователю, лишние секунды превращаются в деньги, нагрузку на инфраструктуру и раздражение команды.

Именно поэтому Google вынес на сцену не абстрактные сравнения, а демонстрацию агентской платформы Antigravity. По версии компании, агенты на Antigravity 2.0 вместе с Gemini 3.5 Flash собрали работающую операционную систему с нуля за 12 часов. В процессе участвовали 93 параллельных субагента, было сделано более 15 тысяч обращений к модели, обработано 2,6 млрд токенов, а стоимость уложилась менее чем в $1000 API-кредитов. Здесь, конечно, стоит сохранять профессиональный скепсис: подобные демо почти всегда показывают идеальный сценарий, собранный в контролируемой среде. Но даже с этой поправкой сам акцент показателен. Google продает не просто модель, а тезис о том, что ИИ уже можно масштабировать как рабочую силу для инженерных задач.

Заодно компания расширила саму Antigravity. Появились консольная версия, SDK, нативная поддержка голоса через аудиомодели Gemini, десктопное приложение Antigravity 2.0 и интеграции с Google AI Studio, Android, Firebase и вебом. Это уже не выглядит как разовая витрина под конференцию. Скорее, Google собирает вокруг модели полноценный контур, чтобы разработчик не просто попробовал Flash в бенчмарке, а смог встроить его в пайплайн, приложение или внутренний инструмент. Для российского рынка, где команды часто смотрят на практичность интеграции не меньше, чем на саму модель, это важный момент: выигрывает не тот, кто громче всех сказал «мы умнее», а тот, кто быстрее встраивается в существующую инфраструктуру.

Gemini 3.5 Flash уже разворачивается для пользователей в приложении Gemini и в AI-режиме поиска Google, а для разработчиков доступна через Antigravity и Gemini API. Старшая Gemini 3.5 Pro, по данным источника, уже тестируется внутри Google и ожидается в течение месяца. Поэтому главный вопрос теперь не в том, может ли рынок показать еще один впечатляющий бенчмарк, а в том, закрепится ли модель класса Gemini 3.5 Flash как новый стандарт для ИИ-агентов: не самых философских, зато быстрых, дешевых и достаточно надежных, чтобы поручать им реальную работу, а не только демонстрации со сцены.

Поделиться: Telegram X LinkedIn