AI И НЕЙРОСЕТИ

Google показала, как доводит мобильный ИИ до продакшена

300 млн устройств и 70% роста визуального поиска: Google раскрыла, как проектирует мобильный ИИ с guardrails, low-latency и жестким UX-контролем.

✍️ Редакция iTech News | 22.07.2026 | ⏱ 5 мин | Источник: InfoQ

В 49-минутной презентации на InfoQ техлид Google Бхавук Джайн разобрал, как мобильный ИИ превращают из эффектной демки в продукт, который не стыдно выкатывать на сотни миллионов устройств. Для российской IT-аудитории здесь главное не магия моделей, а проза жизни: latency, стоимость инференса, guardrails и болезненный выбор между свободой пользователя и предсказуемостью результата.

Джайн, как пишет InfoQ, говорил о двух кейсах, над которыми работал сам: AI Wallpapers и Circle to Search. Первый показывает, как генеративную модель упаковывают в понятный мобильный UX, второй — как визуальный поиск встраивают прямо в ОС, чтобы пользователь не прыгал между приложениями. Заодно он описал базовую схему, без которой, по его версии, современные AI-фичи не долетают до продакшена: post-training, fine-tuning, grounding через внешние источники и затем inference с многоуровневыми guardrails.

Логика Google в этой схеме довольно приземленная. Базовая модель сама по себе слишком непредсказуема, поэтому ее сначала выравнивают под человеческие предпочтения и требования безопасности, затем специализируют под конкретный сценарий, а после этого привязывают к источникам фактов, чтобы она поменьше фантазировала. Джайн отдельно упомянул развилку между RLHF и DPO на этапе выравнивания, а на стадии дообучения — LoRA, QLoRA и другие PEFT-подходы как компромисс между качеством и ценой. Для инженерных команд это знакомая мысль: далеко не вся проблема решается новым обучением, иногда дешевле и надежнее добавить grounding, чем снова гнать модель через тренировочный конвейер.

Самый показательный кейс — AI Wallpapers. По словам Джайна, команда сознательно не пошла в лобовую логику «дайте пользователю пустое поле, пусть пишет что хочет». Вместо этого они выбрали управляемый сценарий: направляющие prompt chips, заранее продуманные категории, ограничения по стилям и двухслойную фильтрацию — сначала на уровне текстового запроса, потом на уровне уже сгенерированного изображения. Причина простая: свободный ввод красиво выглядит на слайдах, но в реальном продукте резко усложняет контроль качества, безопасность и стоимость ошибок. В докладе прозвучала еще одна неочевидная цифра: чтобы решить, какие слова и подсказки вообще попадут в интерфейс, команда сгенерировала и просмотрела более миллиона изображений. Не ради искусства, а чтобы понять, какие комбинации стабильно дают картинку, которую человек действительно захочет поставить на обои.

Отдельно Джайн рассказал о компромиссе, который обычно раздражает и продактов, и ML-инженеров: чем уже пространство вариантов, тем проще добиться предсказуемого UX и снизить риск токсичного или просто нелепого результата. В AI Wallpapers это дало и побочный технический бонус. Когда у вас повторяются шаблоны промптов, можно использовать prefix caching и другие оптимизации инференса, а значит, снижать задержку и цену запроса. Он прямо сказал, что ранние серверные модели были слишком дорогими, а сам проект занял около года — не три и не четыре месяца. Для тех, кто в 2026 году все еще обещает «прикрутим генеративку за квартал», это неприятное, но полезное напоминание.

Circle to Search устроен иначе, но урок похожий: победу приносит не только модель, а снятие трения в пользовательском сценарии. Google взяла уже существующую базу в виде Lens и встроила визуальный поиск глубже в Android. Вместо цепочки «сделать скриншот, открыть другое приложение, загрузить картинку, сформулировать запрос» пользователь получает системный жест и результат поверх текущего экрана. Внутри это выглядит как multimodal prompt: в пайплайн уходят не только пиксели, но и структурный layout экрана. Дальше подключаются fine-tuned мультимодальная модель, knowledge graph, web search, image search и слой синтеза ответа. Иными словами, мобильный ИИ здесь работает не как один всемогущий мозг, а как оркестр из retrieval, reasoning и фильтров безопасности.

В этой части доклада были и цифры, которые наверняка запомнятся менеджерам. По словам Джайна, Circle to Search уже запущен более чем на 300 млн устройств, а упрощенный доступ к визуальному поиску дал 70% годового роста таких запросов. Он отдельно отметил молодежную аудиторию, а среди рабочих сценариев — шопинг и перевод. Для бизнеса это хороший маркер: иногда рост дает не новая модель как таковая, а удачная точка входа в уже привычный пользовательский поток. Для разработчиков — еще одно подтверждение, что глубокая интеграция с ОС иногда важнее лишних пунктов в бенчмарке модели.

Что во всем этом важно для локального рынка и продуктовых команд? Во-первых, guardrails в докладе выглядят не как PR-надстройка, а как полноценная архитектурная подсистема: фильтрация данных, safety-tuned модели, рантайм-проверки входа и выхода, контроль вызова внешних инструментов, аудит и UX-механики на случай ошибки. Во-вторых, Google фактически защищает не самую модную, но рабочую идею: хороший AI-продукт часто строится на ограничениях, а не на максимальной свободе. В-третьих, мобильный ИИ упирается не только в качество ответа, но и в инфраструктурную математику: batching, caching, переиспользуемые endpoint'ы, наблюдаемость и стоимость каждой лишней миллисекунды.

Из доклада вытекает довольно жесткий вопрос для всей индустрии: кто в итоге выиграет гонку мобильного ИИ — тот, у кого сильнее базовая модель, или тот, кто лучше встроит ее в операционную систему, UX и cost envelope продукта. Пока аргументы Google выглядят в пользу второго варианта: пользователю редко интересно, какой именно стек скрывается под капотом, зато он мгновенно замечает, когда фича запускается без лишних шагов, не врет и не прожигает бюджет компании на каждом запросе. Мобильный ИИ, похоже, взрослеет именно в этой точке — там, где кончаются красивые презентации и начинается инженерия.

Поделиться: Telegram X LinkedIn