AI И НЕЙРОСЕТИ

Google выпустила Gemma 4 12B для локальных ИИ-агентов на ноутбуке

Google 8 июня представила Gemma 4 12B: модель для локальных мультимодальных ИИ-агентов, которая должна работать на обычных ноутбуках.

✍️ Редакция iTech News | 09.06.2026 | ⏱ 5 мин | Источник: InfoQ
💡

Google представила Gemma 4 12B как модель, которая должна запускать мультимодальных ИИ-агентов прямо на ноутбуке, без обязательного похода в облако. Для разработчиков это не просто еще один релиз в переполненной ленте: Gemma 4 12B нацелена на локальную работу с кодом, изображениями и аудио на «обычных машинах», а значит разговор о приватности, задержках и стоимости экспериментов снова становится практическим, а не презентационным.

О новинке 8 июня сообщает InfoQ. По версии Google, модель можно связать с Google AI Edge и использовать для локальной сборки агентных сценариев: от автономной обработки данных до генерации визуализаций, создания веб-страниц и вызова инструментов. Идея для 2026 года вполне в духе рынка: бизнес хочет ИИ-помощников поближе к данным, разработчики хотят меньше сетевой магии и больше воспроизводимых пайплайнов, а ноутбук по-прежнему остается главным полигоном для проверки идей, пока закупка GPU-кластера еще не одобрена финансами.

Главная техническая ставка Google здесь не в самом слове «агентный», которое уже успели затереть до блеска, а в архитектуре. Gemma 4 12B использует унифицированный мультимодальный encoder-free подход: вместо отдельных многоступенчатых энкодеров для зрения и аудио данные подаются прямо в языковую модель. Это должно убрать две хронические проблемы классических мультимодальных систем среднего класса: лишнюю задержку на предварительной обработке и раздувание памяти из-за нескольких специализированных компонентов. В основе лежит decoder-only transformer с тем же продвинутым декодером, что и у Gemma 4 31B Dense. Для картинки Google использует vision embedder на 35 млн параметров, который заменяет 27-слойный vision transformer из других средних моделей семейства Gemma 4. Вместо отдельного тяжелого зрительного блока патчи изображения 48×48 пикселей напрямую проецируются в скрытое пространство LLM одной матричной операцией, а пространственные координаты добавляются через факторизованный X-Y lookup. Для аудио логика похожая: отдельный аудиоэнкодер убран, 16-килогерцевый сигнал режется на кадры по 40 мс, то есть по 640 семплов, и линейно проецируется в пространство входов модели.

На бумаге это выглядит как попытка убрать прослойки между модальностями и самим рассуждением модели. Для тех, кто дорабатывает open-source модели под свои задачи, это еще и вопрос обучения: Google отдельно подчеркивает, что общие веса для мультимодальных входов упрощают fine-tuning. Если использовать адаптеры вроде LoRA или идти в полную донастройку, обновлять можно весь мультимодальный цикл за один проход, без раздельного обслуживания зоопарка из визуального, аудио- и текстового стеков. Для команд, которым важны короткие итерации и предсказуемая инженерия, это может оказаться не менее ценным, чем любые красивые демо. Особенно если задача не «удивить инвестора на сцене», а встроить модель в продукт с нормальным CI, логированием и понятной себестоимостью.

Google уже показывает, куда именно хочет приземлить модель. Доступ заявлен через Google AI Edge Gallery, приложение Google AI Edge Eloquent для голосовой диктовки на устройстве и LiteRT-LM. Через AI Edge Gallery разработчикам обещают возможность «на лету» генерировать и выполнять скрипты по инструкциям на естественном языке. В качестве демонстрации Google показала, как модель создает Python-программу, которая рендерит PNG-график со сравнением десяти самых популярных женских имен при рождении в 2024 и 2025 годах. Это не тест на пределы программной инженерии, но хороший маркер позиционирования: речь не о чистом чат-боте, а о модели, которую подталкивают к роли локального исполнителя задач с кодом, файлами и визуальным выводом.

Еще один важный сигнал для экосистемы: Google не запирает модель в собственном интерфейсе. InfoQ пишет, что Gemma 4 12B можно использовать с существующими harness-инструментами вроде OpenCode, если поднять OpenAI-совместимый сервер через команду litert-lm serve, а также через llama.cpp. Дистрибуция тоже максимально широкая: модель доступна в Hugging Face, Ollama, LM Studio, Google Cloud и на других платформах. Для русскоязычной аудитории это, пожалуй, даже важнее архитектурных красивостей. Чем быстрее модель появляется в привычных каналах доставки и локального запуска, тем выше шанс, что ее реально попробуют в командах, а не просто обсудят в Telegram как «интересный анонс от Google».

Реакция ранних пользователей, впрочем, без фанатской истерики и без полного разгрома. В обсуждении на Reddit один из комментаторов назвал encoder-free подход едва ли не самым интересным, что он видел за последнее время, отдельно отметив нативную работу с аудио в 12B-модели. Другой пользователь объяснил практический плюс проще: изображения и аудио можно передавать без отдельного файла-надстройки, а датасет изначально учит модель работать с такими входами как с частью общей задачи. По кодингу отзывы более сдержанные. Один из участников обсуждения написал, что сумел с ее помощью собрать Python-приложение с серверной и клиентской частью и остался впечатлен качеством результата с первого захода. Но есть и более холодные оценки: модель, по мнению скептически настроенных комментаторов, годится для простых задач, объяснения конкретного кода или исправления логической ошибки, но не выглядит заменой более сильным специализированным coding-моделям в неоднозначных сценариях.

Для рынка это, пожалуй, и есть самый честный вывод. Google не обещает, что 12B-модель внезапно отменит облако, победит весь стек для разработки и станет универсальным senior-разработчиком в рюкзаке. Но сам вектор понятен: локальные мультимодальные агенты перестают быть игрушкой для энтузиастов, если модель умеет работать с кодом, графикой и аудио в едином контуре, запускается через знакомые инструменты и не требует отдельной инженерной жизни для каждого типа входа. Следующая развилка будет простой и жесткой: смогут ли такие модели удержать качество в реальных продуктовых сценариях, где нужен не эффектный one-shot на демо, а стабильная работа на длинной дистанции. Первоисточник с техническими деталями и примерами доступен в InfoQ.

Поделиться: Telegram X LinkedIn