Google заявила, что LiteRT-LM Gemma 4 теперь может выполнять локальный вывод до 2,2 раза быстрее за счет нативной поддержки Multi-Token Prediction. Для разработчиков это не косметическое обновление: речь о более дешевой и быстрой работе моделей прямо на устройстве, без обязательного похода в облако и без лишней боли с памятью, батареей и задержками.
Речь идет о рантайме LiteRT-LM, построенном поверх LiteRT, бывшего TensorFlow Lite. Как пишет InfoQ, Google добавила в него нативную поддержку MTP-drafters для Gemma 4, а заодно расширяет набор API: помимо Kotlin и C++ появляются Swift и JavaScript. Это важный сдвиг не только для Android-разработчиков, где Google традиционно чувствует себя уверенно, но и для iOS-команд и веб-разработчиков, которым нужен единый путь к локальному запуску LLM.
Технически ставка сделана на speculative decoding, но не в его наивной версии, когда выигрыш от параллельного предсказания токенов легко съедается накладными расходами. В LiteRT-LM легкий MTP-drafter и основная модель Gemma 4 исполняются на одном и том же hardware IP, например на GPU. Это нужно ради локальности памяти: общий KV cache и активации остаются в локальной памяти, без постоянной синхронизации между CPU и GPU и без лишних копирований данных. Дальше основная модель проверяет токены, которые предложил drafter, с помощью оптимизированных ядер, рассчитанных на максимальный параллелизм при верификации.
На бумаге цифры выглядят убедительно. По внутренним бенчмаркам Google, скорость MTP-декодинга выросла в 1,6 раза для Gemma 4 E2B и в 2,2 раза для Gemma 4 E4B. Компания также утверждает, что производительность и на стадии prefill, и на стадии decode в 1,8-3,7 раза выше по сравнению с рядом альтернативных фреймворков, включая llama.cpp, MLX, Cactus и ONNX. Такие сравнения всегда хочется перепроверять на собственных сценариях и железе, но сам вектор понятен: Google пытается превратить Gemma 4 в модель, которую удобно не только показывать на демо-слайдах, но и реально держать на пользовательских устройствах.
Отдельно Google делает акцент на том, что LiteRT-LM заточен именно под ограничения edge-среды: дефицит памяти, ограниченные вычислительные ресурсы и зоопарк аппаратных платформ. Для этого используются схемы квантования, ускоренные ядра XNNPACK и MLDrift, а на уровне оркестрации пайплайны сведены так, чтобы минимизировать дорогие переброски данных между CPU и GPU. На практике это значит, что разработчику не обязательно самому вручную выжимать последние проценты производительности из мобильного железа. Google, по сути, продает не просто библиотеку, а готовое мнение о том, как правильно запускать Gemma 4 on-device.
Не меньше внимания уделено управлению сессиями. LiteRT-LM умеет сохранять и восстанавливать состояние KV cache, чтобы длинные диалоги или многошаговые сценарии можно было продолжать без дорогого пересчета уже пройденного контекста. Для пользовательского опыта это звучит куда важнее, чем кажется на первый взгляд: если локальный ассистент после каждого прерывания начинает «думать заново», магия быстро заканчивается. Плюс это напрямую влияет на расход энергии и на то, насколько вообще реалистично строить поверх локальной модели агентные сценарии.
В ту же сторону работает и история с памятью. Google пишет, что рантайм уменьшает footprint, не держа в памяти per-layer embeddings и подгружая image- и audio-энкодеры только по необходимости. В качестве показательного примера приводится Gemma 4 E2B: модель весом около 2,58 ГБ занимает всего 607 МБ на мобильных CPU Apple. Для команд, которые пытаются уместить ИИ-функции в реальные ограничения смартфонов, это уже не абстрактная оптимизация, а разница между «можно встроить в продукт» и «оставим в роадмапе до лучших времен».
Еще одна важная деталь: LiteRT-LM продвигается не просто как рантайм для генерации текста, а как база для более «агентного» поведения моделей. Упомянуты нативная поддержка Gemma 4 Thinking Mode, constrained decoding для структурированных ответов и function calling. Иначе говоря, модель может не только печатать текст, но и останавливать выполнение, возвращать структурированный запрос к инструменту, а затем продолжать работу после ответа. Для мобильных приложений и встроенных AI-функций это вполне прикладной сценарий: локальная модель может оркестрировать действия, не отправляя каждый шаг в облако.
Для рынка это еще один сигнал, что конкуренция в on-device AI переходит из стадии «запустить хоть как-нибудь» в стадию инженерной оптимизации. Битва идет уже не только за качество модели, но и за то, кто лучше управляет памятью, кешем, квантованием и передачей данных между вычислительными блоками. Если Google удастся удержать заявленные цифры за пределами собственных бенчмарков, LiteRT-LM Gemma 4 может стать заметным аргументом в пользу локальных AI-функций в мобильных и кроссплатформенных продуктах. Первоисточник с деталями: .