AI И НЕЙРОСЕТИ

Google ускорила локальный ИИ: DiffusionGemma выдает текст в 4 раза быстрее

До 1000+ токенов в секунду на H100: Google выпустила DiffusionGemma, экспериментальную открытую модель для локального ИИ с 4-кратным приростом скорости.

✍️ Редакция iTech News | 11.06.2026 | ⏱ 5 мин | Источник: Ars Technica
🎓

Google DeepMind выпустила модель DiffusionGemma, которая, по заявлению компании, генерирует текст на локальном железе примерно в четыре раза быстрее сопоставимых моделей Gemma. Для разработчиков и команд, которые гоняют ИИ не в облаке, а на своих GPU, новость вполне практическая: речь идет не о новой витрине с красивым демо, а о способе заметно ускорить локальный ИИ без перехода на другой класс оборудования.

Главная интрига в том, что модель DiffusionGemma устроена не так, как большинство современных языковых моделей. Как пишет Ars Technica, вместо привычной автрорегрессионной схемы, где текст строится слева направо по одному токену за шаг, новинка использует диффузионный подход. Если совсем без академического тумана, модель начинает с «шумного» поля из токенов-заглушек, затем несколько раз переписывает весь блок целиком, уточняя вероятные варианты, и в конце выдает уже готовый фрагмент текста. Такой подход давно знаком по генерации изображений, но в текстовых моделях пока остается скорее экспериментальной веткой.

Сухие цифры здесь важнее маркетинга. DiffusionGemma построена как Mixture of Experts-модель: общий размер составляет 26 млрд параметров, но во время инференса активируются только 3,8 млрд. Это означает, что модель можно разместить в пределах 18 ГБ памяти, то есть на хорошем потребительском GPU она уже выглядит не как игрушка для лаборатории, а как вполне рабочий инструмент. В тестах Google на RTX 5090 модель выдает около 700 токенов в секунду, а на одном ускорителе Nvidia H100 поднимается выше 1000 токенов в секунду. Для сравнения, это примерно в четыре раза быстрее, чем у близких по размеру автрорегрессионных моделей Gemma. Для локального запуска разница не косметическая: там, где раньше ответ формировался с заметной паузой, теперь ИИ может работать почти в режиме «нажал и получил».

Причина ускорения связана не только с архитектурой, но и с тем, какой именно узкий ресурс ограничивает локальный инференс. Обычные LLM упираются в пропускную способность памяти: модель постоянно подгружает веса и последовательно считает следующий токен. Диффузионная схема смещает нагрузку в сторону вычислений и позволяет генерировать до 256 токенов параллельно. Для облака это не всегда выглядит выигрышно, потому что крупные сервисы и так умеют хорошо загружать железо пакетной обработкой запросов, а дорогая HBM-память в дата-центрах заметно снижает штраф за последовательную генерацию. На локальных машинах ситуация другая: вычислительные блоки нередко простаивают, а память становится именно тем тормозом, который портит весь пользовательский опыт. В таком контексте модель DiffusionGemma выглядит не альтернативой всему рынку LLM, а точечным ответом на конкретную инженерную боль.

При этом Google не делает вид, будто нашла серебряную пулю. У текстовой диффузии есть вполне приземленные недостатки. В изображениях ошибочный пиксель редко ломает картинку целиком, а в языке один неверный токен может сделать бессмысленным весь фрагмент, особенно если речь идет о коде, формулах или структурированном выводе. Кроме того, диффузионные модели не слишком эффективны, когда нужен очень короткий ответ. Если пользователь просит пять токенов, автрорегрессионная модель честно делает пять шагов и заканчивает. Диффузионной приходится прогонять более тяжелый параллельный процесс, чтобы в итоге все равно прийти к короткому результату. Отсюда и понятный ответ на вопрос, почему Google не спешит перестраивать под этот подход флагманские облачные Gemini: для больших сервисов важна не только скорость на одном запросе, но и предсказуемость качества, экономика инфраструктуры и устойчивость в разных сценариях.

Тем не менее у новой архитектуры уже видны ниши, где она может быть особенно полезна. Google отдельно указывает на нелинейные задачи: редактирование текста внутри готового блока, секвенирование молекул и построение математических графов. Логика простая: когда правильный токен зависит не только от прошлого, но и от будущего контекста, пошаговая генерация начинает мешать сама себе. В статье приводится и показательный пример с судоку, где обычным моделям тяжело из-за взаимозависимости клеток, а диффузионная схема может постепенно «самоисправлять» сразу большой массив токенов. Для разработчиков это интересный сигнал. Не факт, что завтра все побегут переводить чат-ботов на диффузию, но для IDE-помощников, систем пакетного редактирования текста, специализированных научных инструментов и некоторых задач в биоинформатике такая модель уже выглядит не экзотикой, а кандидатом на пилот.

Есть и еще один слой контекста. Google в последнее время активно ищет способы сделать открытые модели быстрее именно на пользовательском и корпоративном железе. Недавно компания начала внедрять MTP-drafters, то есть механизмы Multi-Token Prediction, которые используют иначе простаивающие вычислительные ресурсы для предсказания нескольких токенов вперед. Но, по данным компании, даже такие ускоренные версии Gemma уступают диффузионному варианту по скорости. Это важный разворот: гонка идет уже не только за качеством ответов и размером контекста, а за тем, чтобы LLM нормально жили вне облака. Для бизнеса это значит больше вариантов on-premise-развертывания, меньше зависимости от внешних API и более понятную стоимость эксплуатации. Для разработчиков - шанс собирать локальные продукты без вечного компромисса между приватностью и скоростью.

Google подчеркивает, что модель DiffusionGemma остается экспериментальной, хотя распространяется по той же лицензии Apache 2.0, что и остальные модели четвертого поколения Gemma. Веса уже доступны для скачивания, а компания отдельно отмечает совместную работу с Nvidia над оптимизацией под разные конфигурации: от квантизованных RTX-карт верхнего сегмента до H100 и платформы DGX Spark. Вопрос теперь не в том, заменит ли текстовая диффузия классические LLM целиком, а в другом: сколько локальных AI-сценариев внезапно окажутся удобнее именно на такой архитектуре, когда скорость перестанет быть главным оправданием облака. Подробности приводит Ars Technica.

Поделиться: Telegram X LinkedIn