Google представила Gemma 4 12B 3 июня 2026 года, и главный аргумент здесь не в самом релизе, а в конфигурации железа: новой модели, по заявлению компании, достаточно 16 ГБ VRAM или объединённой памяти, чтобы работать локально на обычном ноутбуке. Для русскоязычной IT-аудитории это важный сдвиг: мультимодальный ИИ постепенно перестаёт быть историей только про облако, дорогие GPU и счета за API.
О новинке сообщает The New Stack: Google позиционирует Gemma 4 12B как промежуточный вариант между компактной E4B и более тяжёлой 26B MoE-моделью. Формально это 11,95 млрд параметров, но акцент сделан не на сухой цифре, а на соотношении размера и производительности. По словам компании, модель по ряду стандартных бенчмарков приблизилась к Gemma 4 26B, занимая при этом меньше половины её общего объёма памяти. Для разработчика это переводится на понятный язык: не обязательно арендовать отдельную машину, чтобы получить внятный reasoning, агентные сценарии и мультимодальный ввод.
Самая интересная часть релиза не маркетинговая, а инженерная. Google сделала Gemma 4 12B «единой» мультимодальной моделью без отдельных энкодеров для картинки и аудио. В обычных мультимодальных системах изображение и звук сначала прогоняются через отдельные модули, а уже потом попадают в языковую модель. Здесь подход другой: визуальные и аудиоданные подаются почти напрямую в общий LLM-бэкбон. Для изображений используется облегчённый embedding-модуль, для аудио сырой сигнал проецируется в то же пространство, что и текстовые токены. Практический смысл у такого решения простой: меньше задержек, меньше накладных расходов по памяти и меньше «зоопарка» компонентов, которые потом нужно обслуживать в продакшене.
Отдельно Google подчёркивает, что это первая mid-size-модель в линейке с нативным аудиовводом. То есть речь уже не только о «локальном чатике на ноутбуке», а о более интересных сценариях: локальная транскрибация, голосовые команды, обработка медиафайлов, desktop-ассистенты без постоянной отправки данных наружу. В связке с Google AI Edge компания уже показала прикладной сценарий для macOS: Eloquent, локальный помощник для диктовки и редактирования текста. Там же заявлен прирост качества более чем на 60% по сравнению с прежними моделями в конкретном рабочем сценарии voice editing. Это не универсальная метрика «модель стала лучше на 60% вообще», и именно так к ней и стоит относиться, но для продуктовых команд сигнал понятный: Google продаёт не просто веса, а готовый narrative про on-device AI для рабочих задач.
Ещё один важный момент: Gemma 4 12B выходит по лицензии Apache 2.0. Для корпоративной разработки это часто важнее красивых слайдов про reasoning. Чем меньше юридических сюрпризов, тем легче тащить модель в пилоты, внутренние инструменты, RAG-сервисы, локальных copilot’ов и отраслевые ассистенты, где данные нельзя бездумно гонять через внешний API. Google явно продолжает играть в ту же стратегию, что и с предыдущими поколениями Gemma: не бороться лоб в лоб с закрытыми флагманами по абсолютному качеству, а занять территорию «достаточно умной» открытой модели, которая реально запускается на массовом железе.
В этом месте начинается более широкий рыночный контекст. За последние месяцы гонка в AI всё заметнее делится на два слоя. Первый слой — огромные облачные модели для тяжёлого reasoning, кода и корпоративных платформ. Второй — компактные или средние модели, которые можно держать ближе к устройству, данным и пользователю. Именно во втором слое сейчас идёт самая практичная драка: кто даст разработчику достаточно сильную модель, чтобы он не платил за каждый токен и не строил вокруг неё отдельную инфраструктурную церковь. У Google здесь понятная ставка: от Android-устройств и edge-сценариев до ноутбуков и рабочих станций, всё под одной экосистемой.
Для разработчиков релиз выглядит особенно прагматично ещё и потому, что модель не заперта в одном проприетарном контейнере. Google сразу перечисляет инструменты, через которые можно запускать и встраивать Gemma 4 12B: LM Studio, Ollama, Google AI Edge Gallery, LiteRT-LM CLI, Hugging Face Transformers, llama.cpp, MLX, SGLang, vLLM, Unsloth. Весы доступны через Hugging Face и Kaggle. Иначе говоря, речь не о демонстрации в духе «смотрите, как умеет наша лаборатория», а о вполне рабочем релизе для тех, кто хочет быстро проверить локальный inference, агентные пайплайны или мультимодальный прототип. Для российских команд, которые всё чаще считают стоимость владения ИИ-стеком, это может оказаться даже важнее, чем сами benchmark-таблицы.
Бизнесовый вывод тоже довольно прямой. Если модель такого класса действительно укладывается в 16 ГБ памяти и сохраняет близость к 26B в практических задачах, рынок получит ещё один аргумент в пользу локального ИИ: ниже задержка, меньше зависимость от канала, лучше контроль над данными и предсказуемее экономика. Не во всех случаях локальный запуск победит облако, особенно если нужен максимум качества или масштабирование на тысячи пользователей. Но для внутренних ассистентов, документооборота, аналитики, автоматизации саппорта и персональных рабочих инструментов компромисс уже выглядит не компромиссом, а вполне здравой архитектурой.
Теперь интрига не в том, сможет ли Gemma 4 12B запуститься на ноутбуке, а в том, сколько команд решат, что «достаточно хороший локальный ИИ» выгоднее, чем ещё один счёт от облачного провайдера. Если этот класс моделей продолжит подтягивать reasoning, аудио и агентные сценарии без резкого роста требований к железу, у on-device AI появится шанс выйти из статуса занятного эксперимента и стать нормой разработки. Подробнее об исходной публикации: .