Модель DiffusionGemma от Google DeepMind обещает ускорение генерации текста до 4 раз и при этом запускается локально с 18 ГБ DRAM или VRAM. Для разработчиков и команд, которые считают стоимость инференса не в презентациях, а в счетах за GPU и задержках на пользовательских устройствах, это важный сигнал: гонка идет уже не только за качеством ответа, но и за тем, как дешево и быстро этот ответ получить.
Google представила экспериментальную модель DiffusionGemma 11 июня 2026 года, сообщает The Register. Формально это очередное пополнение семейства open-weights-моделей Gemma, но по устройству она ближе не к классическим LLM, а к генераторам изображений вроде Stable Diffusion: текст здесь не собирается токен за токеном слева направо, а формируется сразу крупными блоками, которые затем последовательно уточняются.
Идея в том, что модель начинает не с первого слова, а с «холста» из случайных токенов и затем за несколько шагов убирает шум, пока не получает итоговый абзац. Для обычной авторегрессионной модели каждый новый токен требует снова и снова подтягивать активные параметры из памяти, поэтому узким местом становится пропускная способность памяти и объем VRAM. У диффузионного подхода профиль нагрузки другой: он в большей степени упирается в вычисления. А это уже интереснее для локального запуска, потому что у потребительских видеокарт вычислительной мощности часто больше, чем реально используется в типичном сценарии с одной пользовательской сессией.
На бумаге звучит почти как подарок для всех, кто запускает модели не в дата-центре, а на рабочей станции, ноутбуке или edge-устройстве. Google именно на это и делает акцент: модель DiffusionGemma рассчитана на локальное использование и, по заявлению компании, может работать с 18 ГБ DRAM или VRAM. Для рынка open-weights-моделей это важная деталь. Не потому, что 18 ГБ внезапно превратились в массовый стандарт, а потому, что разговор смещается от «у нас еще одна большая модель» к «у нас модель, которую вообще можно применить вне облака без экзотической инфраструктуры».
Впрочем, чудес не обещают даже сами авторы. The Register обращает внимание, что диффузионные языковые модели не новы: похожие подходы уже тестировались в проектах DREAM и Mercury 2. Их общий сюжет знаком любому, кто следит за AI не только по рекламным баннерам: скорость действительно растет, но по качеству такие системы обычно проигрывают классическим LLM сопоставимого размера. Судя по цифрам Google, DiffusionGemma идет по той же траектории. На бенчмарке GPQA-Diamond модель немного уступает Gemma 4 12B, а ее главное преимущество сводится именно к скорости генерации.
И даже здесь маркетингу пришлось бы немного сбавить громкость. Если сравнивать DiffusionGemma с Gemma 4 12B, у которой включен speculative decoding, речь идет примерно о 2,25-кратном ускорении, а не о космическом разрыве. Почти 4-кратный выигрыш Google показывает уже в сравнении с Gemma 4 26B-A4B на одной Nvidia H100. Это тоже сильный результат, но контекст важен: одно дело сравнение с 12B-моделью, другое — с 26-миллиардной конфигурацией на серверном ускорителе. Для инженеров, которые привыкли читать графики до подписей мелким шрифтом, разница принципиальная.
Зато по части доступности у релиза все выглядит здраво. Модель вышла под лицензией Apache 2.0, то есть без лишней юридической драмы для команд, которым важны коммерческое использование и встраивание в собственные продукты. Поддержка уже появилась в vLLM, MLX и Hugging Face Transformers, а для Llama.cpp, как сообщается, она должна выйти позже. Это хороший маркер зрелости экосистемы: новую архитектурную идею можно обсуждать сколько угодно, но пока она не доезжает до привычных inference-движков, для рынка ее как будто и нет.
Для русскоязычной IT-аудитории здесь сразу несколько практических выводов. Разработчикам локальных AI-приложений стоит следить не только за качеством на бенчмарках, но и за типом вычислительной нагрузки: если модель меньше зависит от memory bandwidth, она может неожиданно хорошо вести себя на железе, которое уже стоит в офисе или у пользователя дома. Продуктовым командам это дает пространство для более дешевых on-device или hybrid-сценариев, где часть генерации не нужно гонять через облако. А IT-директорам и фаундерам вся история напоминает простую вещь: оптимизация инференса становится такой же стратегической темой, как раньше выбор между своей инфраструктурой и SaaS.
Наконец, у Google здесь есть и собственный шкурный интерес. Локальный инференс долго считался хобби для энтузиастов, но крупные игроки все заметнее используют его как способ не сжигать лишние деньги в облаке. Из того же ряда — тихий запуск небольшого LLM прямо в браузере Chrome в мае. Если DiffusionGemma окажется не просто исследовательским экспериментом, а предвестником новой линейки быстрых моделей для потребительских устройств, то следующий этап конкуренции в генеративном AI будет идти не только за «самый умный ответ», но и за самый дешевый токен, который вообще перестанет быть токеном в привычном смысле. Подробности исходного материала можно посмотреть в .