Gemini 3.5 Flash дебютировала на Google I/O 19 мая 2026 года с цифрами, которые для рынка выглядят неприятно убедительно: 76,2% в Terminal-bench 2.1 против 70,3% у Gemini 3.1 Pro и 83,6% в MCP Atlas против 78,2% у той же Pro-версии. Для разработчиков и команд, которые уже строят агентные сценарии, смысл простой: Google пытается доказать, что быстрый «рабочий» класс моделей больше не обязан быть компромиссом по качеству.
На это первым обратил внимание The New Stack: на I/O Google показала сразу две новинки, Gemini 3.5 Flash и Gemini Omni Flash. Но если Omni выглядит как витрина для мультимодального видео и генерации, то Flash — это история про куда более приземленный и денежный сегмент: код, инструменты, длинные цепочки действий и корпоративные workflow. Иными словами, не про «посмотрите, как красиво», а про «посмотрите, что уже можно встроить в продукт, IDE и внутренние процессы».
По официальным данным Google DeepMind, новая модель получила окно контекста до 1 млн токенов и максимум 64 тыс. токенов на вывод. Поддерживаются текст, изображения, аудио, видео и PDF на входе, а среди встроенных возможностей — function calling, структурированный вывод, поиск как инструмент и выполнение кода. Доступность тоже показательная: Google не прячет модель в лаборатории, а сразу выводит ее в Gemini App, Gemini API, Google AI Studio, Search AI Mode, Android Studio, Antigravity и корпоративные продукты. Это важный сигнал для рынка: компания не просто обновила линейку, а продвигает один и тот же стек сразу в пользовательские, девелоперские и enterprise-сценарии.
Самое интересное в этой истории — не абсолютные цифры, а то, где именно Gemini 3.5 Flash выигрывает. В тестах, связанных с агентной работой и кодом, модель действительно выглядит сильнее предшественника и часто лучше Gemini 3.1 Pro. В SWE-Bench Pro у нее 55,1% против 54,2% у 3.1 Pro; в OSWorld-Verified, где оценивается управление интерфейсами, 78,4% против 76,2%; в Finance Agent v2 — 57,9% против 43,0%. На мультимодальных задачах тоже есть рост: 84,2% в CharXiv Reasoning против 83,3% у Pro и 83,6% в MMMU-Pro против 80,5%. Да, на ряде более «лобовых» reasoning-бенчмарков Pro и особенно конкуренты все еще впереди: у Gemini 3.1 Pro выше результат в Humanity’s Last Exam, а GPT-5.5 и Claude Opus 4.7 выглядят сильнее в части сложного академического рассуждения и длинного контекста. Но Google здесь и не пытается продавать Flash как абсолютного чемпиона по всему списку. Аргумент другой: для реальных агентных задач, где модель должна не блеснуть на одном ответе, а пройти цепочку шагов, пользоваться инструментами и не сыпаться на коде, «быстрый» класс теперь стал заметно серьезнее.
Контекст у анонса тоже важный. Последние полтора года рынок ИИ жил по довольно понятной схеме: самые сильные модели — дорогие и тяжелые, а Flash-, mini- и lite-варианты нужны для массового трафика, чат-интерфейсов и экономии. Google, похоже, хочет сломать именно эту иерархию. Если раньше Pro был «мозгом», а Flash — «курьером», то теперь Flash все чаще претендует на роль основного исполнителя. Для команд, которые считают задержку, стоимость вызова и throughput, это, возможно, более важная новость, чем очередной абстрактный рекорд в тесте на олимпиадные задачи.
Показательно и то, как Google обрамляет релиз внешними отзывами. В материалах DeepMind компания Box заявляет, что Gemini 3.5 Flash превзошла Gemini 3 Flash на 19,6% во внутреннем наборе задач enterprise-класса, а в кейсах для life sciences дала прирост точности на 96,4%. JetBrains, со своей стороны, говорит о качестве кода и рассуждений, близком к Pro-классу, при сохранении профиля скорости и стоимости, который нужен для девелоперских сценариев в реальном времени. К таким цитатам всегда стоит относиться с профессиональной осторожностью: это не независимый аудит, а партнерские примеры. Но они хорошо показывают, куда Google целится коммерчески — в IDE, корпоративных агентов и отраслевые сценарии, где нужен не просто хороший ответ, а воспроизводимый результат в многошаговом процессе.
Для русскоязычной IT-аудитории здесь несколько практических выводов. Во-первых, растет давление на стек разработки: если модель умеет держать длинный контекст, вызывать инструменты и уверенно решать агентные coding-задачи, от команд будут ждать не «интеграцию с LLM вообще», а конкретные workflow с понятной метрикой пользы. Во-вторых, меняется критерий выбора модели. Сравнение только по IQ-бенчмаркам все меньше отражает реальность: бизнесу важнее, как модель ведет себя в IDE, браузере, CRM, документах и внутренних тулчейнах. В-третьих, это усиливает конкуренцию не только между Google, OpenAI и Anthropic, но и между самими классами моделей. Если Flash начинает подъедать территорию Pro, покупателям будет сложнее объяснить, за что именно они платят премию.
Отдельно стоит смотреть на связку с новым Gemini Omni Flash. Google явно разводит роли: Omni — для создания и редактирования видео, Flash — для агентных действий и кода. То есть компания строит не одну «универсальную чудо-модель», а набор специализированных слоев под разные виды работы. Для платформенной стратегии это логично. Для рынка — тоже: заказчики охотнее платят не за красивую абстракцию, а за модели, у которых есть внятная специализация и предсказуемое поведение в конкретной задаче.
Теперь главный вопрос не в том, смогла ли Google показать убедительный benchmark slide — смогла. Вопрос в другом: станет ли Gemini 3.5 Flash тем редким случаем, когда быстрая модель действительно закрепляется как стандарт для production-агентов, а не остается эффектной демкой с конференции. Если да, следующая гонка в ИИ пойдет уже не за самый умный одиночный ответ, а за лучший результат на длинной дистанции в реальном рабочем процессе.