Google выпустила EmbeddingGemma 2 — открытую модель на 740 млн параметров для поиска по тексту, коду, изображениям, видео и аудио. Главная интрига здесь не только в самой модели: на смартфоне или другом edge-устройстве векторный индекс с пользовательскими данными вполне может занять больше места, чем ИИ, который этот индекс обслуживает. Для российских команд это ещё один сигнал: локальный поиск постепенно становится инженерной задачей про данные и память, а не только про выбор LLM.
О релизе EmbeddingGemma 2 сообщает The New Stack. Модель предназначена не для генерации длинных ответов и не для роли чат-бота. Её задача проще и, в прикладных продуктах, часто полезнее: превратить разные типы контента в числовые представления — эмбеддинги, чтобы затем быстро находить близкие по смыслу объекты. Пользователь может искать не только документ по фразе, но и нужный фрагмент видео, картинку, аудиозапись или кусок кода.
Такой подход лежит в основе семантического поиска и RAG-систем: приложение сначала ищет релевантный контент в базе, а уже потом при необходимости передаёт его генеративной модели. Но на мобильном устройстве или встраиваемом железе эта схема быстро упирается в физику. Модель на сотни миллионов параметров можно оптимизировать, сжать и запускать локально. А вот коллекция эмбеддингов растёт вместе с архивом фотографий, переписками, файлами, видеороликами и корпоративными документами. Миллионы объектов — это уже не абстрактная «база знаний», а заметный расход накопителя и оперативной памяти.
Именно поэтому заголовок The New Stack звучит несколько провокационно, но по существу верно: модель поиска может оказаться компактнее самого индекса. Каждый элемент коллекции нужно не только представить вектором, но и сохранить вместе с данными для поиска: идентификатором, метаданными, ссылкой на исходный файл, иногда — несколькими векторами для разных фрагментов одного документа или ролика. Если приложение индексирует видео покадрово либо разбивает длинные тексты на части, число записей увеличивается особенно быстро.
Для разработчиков это меняет приоритеты. Выбрать небольшую открытую модель недостаточно: придётся заранее считать размер индекса, частоту его обновления и стоимость поиска. В локальном сценарии важны размерность векторов, методы сжатия, дедупликация, политика хранения и качество поиска после компромиссов с точностью. В облаке часть проблем можно закрыть масштабированием инфраструктуры. На устройстве лишние гигабайты не спрячешь за красивой диаграммой в презентации.
Мультимодальность добавляет и продуктовую ценность, и новый слой сложности. Поиск «найди созвон, где обсуждали макет», «покажи скриншот с этой ошибкой» или «отыщи похожий фрагмент кода» выглядит естественно для пользователя. Для команды за этим стоят единое представление разных форматов, пайплайн индексации, контроль доступа и понятные правила удаления данных. В корпоративном приложении особенно важно, чтобы удалённый файл исчезал не только из интерфейса, но и из поискового индекса.
Открытая модель на 740 млн параметров расширяет пространство для экспериментов у команд, которым нельзя или невыгодно отправлять контент пользователей во внешнее облако. Это относится к офлайн-приложениям, внутренним базам знаний, отраслевым сервисам с чувствительными данными и продуктам, где задержка запроса критична. При этом «локально» не означает автоматически «дёшево» и «приватно»: хранение индекса, шифрование, обновления модели и управление доступом остаются полноценной частью архитектуры.
Для бизнеса полезный вывод ещё прозаичнее. Векторный поиск перестаёт быть функцией, которую можно оценивать лишь по качеству ответов в демо. Его нужно планировать как слой данных: с лимитами, жизненным циклом, мониторингом размера и правилами, объясняющими пользователю, что именно индексируется. Иначе удачный поиск по медиатеке однажды превратится в уведомление о нехватке памяти — самый честный, но не самый приятный результат работы ИИ.
Следующий вопрос для рынка — смогут ли локальные мультимодальные системы удержать качество поиска, не раздувая индекс до размеров пользовательского архива. EmbeddingGemma 2 показывает, что сама модель уже может быть достаточно компактной; теперь конкурентное преимущество будет зависеть от того, кто аккуратнее упакует данные вокруг неё. Подробнее о релизе — в материале .