Google запустил квантованные версии своей модели Gemma 4, что позволяет запускать искусственный интеллект на смартфонах, ноутбуках и периферийных устройствах. Это важный шаг, который значительно снизит требования к памяти и сделает ИИ более доступным для пользователей.
Фон технологии и ее влияние
Модели Gemma 4 ранее создавались сообществом, но теперь Google самостоятельно выпускает облегченные версии. Это стало возможным благодаря технологии QAT (Quantization-Aware Training), которая моделирует пониженную точность во время тренировки, что позволяет сокращать размер модели с минимальными потерями в качестве. Например, компактный вариант помещается в 1 ГБ памяти.
Детали новых моделей
Google представил пять различных размеров: E2B, E4B, 12B, 26B A4B и 31B. Пользователи имеют доступ к четырем вариантам: неквантованному Q4_0, готовому к запуску GGUF Q4_0, Compressed Tensors w4a16 и мобильному формату wNa8o8, что открывает возможности для различных приложений. Поддержка с первых дней будет обеспечена для множества платформ, включая llama.cpp, Ollama, LM Studio и других.
Google уверяет, что качество моделей, созданное с использованием QAT, сопоставимо с bfloat16. Однако на момент релиза отсутствуют независимые бенчмарки, подтверждающие эффективность именно Gemma 4 QAT.
Как это повлияет на пользователей
Для разработчиков и конечных пользователей квантованные модели станут отличным инструментом. Они смогут использовать ИИ для решения задач, таких как перевод текста в условиях дорогого роуминга или отсутствия доступа к интернету. Это существенно расширяет возможности использования ИИ, делая его доступным даже на мобильных устройствах.
В перспективах — дальнейшее развитие этой технологии и возможное появление новых версий моделей, что может привести к качественным изменениям на рынке ИИ.