Google расширяет давний эксперимент с разговорным переводом и выкатывает Gemini 3.5 Live Translate — модель для мгновенного перевода речи в речь на более чем 70 языках. Для IT-аудитории новость важна не красивым демо, а тем, что перевод уходит из разряда сценических фокусов в API, Meet и мобильное приложение: это уже не игрушка для презентаций, а кандидат в рабочую функцию для звонков, саппорта, продаж и международных команд.
О запуске Gemini 3.5 Live Translate сообщает Ars Technica. По описанию Google, модель автоматически определяет язык, переводит почти в темпе обычного разговора и отстает от говорящего всего на несколько секунд. Главное отличие от старых голосовых переводчиков не в самой идее, а в подаче: система старается сохранить интонацию, темп и высоту голоса, чтобы на выходе звучал не безликий синтезатор, а версия вашей речи на другом языке. В демо это выглядит как попытка убрать самый раздражающий слой машинного перевода — ощущение, что между двумя людьми внезапно вклинился робот с офисным голосом.
Технически речь идет о новой модели в семействе Gemini 3.5, представленном на I/O. До этого Google успела выпустить только вариант Flash, а Pro-версию, если ориентироваться на слова компании, ждут в ближайшие недели. Новый speech-to-speech-модуль работает непрерывно, сам обрабатывает многоязычный вход и не заставляет разработчиков вручную выставлять параметры под каждую сессию. Плюс заявлена фильтрация фонового шума в загруженной среде — полезная деталь для реальных переговорок, выставок, колл-центров и любых сценариев, где люди разговаривают не в стерильной студии.
Самое практичное в анонсе — не маркетинг про «естественность», а каналы распространения. Разработчики уже могут тестировать публичную preview-версию через Gemini Live API и AI Studio. Для enterprise-клиентов Google с этого месяца открывает доступ к новой модели перевода в Google Meet, а позже обещает расширить rollout. Отдельно компания меняет интерфейс Meet, чтобы функция live translate не пряталась в глубине настроек. Это важный сигнал: когда платформа выносит функцию перевода на первый план, она явно рассчитывает, что пользователи будут включать ее не по праздникам, а регулярно.
Не менее показателен и мобильный сценарий. Google собирается в ближайшее время добавить новую модель в приложение Google Translate на Android и iOS. Еще в конце прошлого года компания начала тестировать живой перевод на базе Gemini с любыми наушниками, а не только с Pixel Buds в паре с Android-смартфоном. Теперь ограничения становятся еще мягче: наушники вообще не обязательны. Если их нет под рукой, можно просто приложить телефон к уху, как при звонке, и слушать перевод через разговорный динамик. Правда, режим такого прослушивания пока заявлен только для Android. Для массового рынка это, возможно, важнее любого AI-брендинга: чем меньше специального железа нужно пользователю, тем выше шанс, что функция реально войдет в привычку.
Для разработчиков здесь тоже есть вполне приземленный вывод. Google пытается упаковать сложный мультиязычный пайплайн в сервис, где не нужно отдельно думать о выборе языка, маршрутизации потоков и части аудиообработки. Это снижает порог для интеграции голосового перевода в продукты, где раньше команда бы просто не взялась за задачу из-за стоимости и сложности. Под удар попадают не только нишевые стартапы с «умным переводом», но и целый пласт корпоративного софта, который много лет жил с субтитрами, стенограммами и переводом текста после факта. Если перевод речи начинает работать достаточно быстро и звучит достаточно естественно, UX международного звонка меняется заметно сильнее, чем от очередного набора AI-саммари после встречи.
Есть, впрочем, и важная оговорка. Google подчеркивает, что аудиопотоки, созданные Gemini 3.5 Live Translate, не обязаны точно копировать голос пользователя, даже если должны звучать «живее» обычного синтеза. И компания явно понимает, какой здесь риск: все сгенерированные аудиофрагменты будут получать водяные знаки SynthID, встроенные прямо в данные звуковой волны. На текущем этапе, по словам Google, убрать их нельзя. Для рынка это почти не менее важная часть анонса, чем сам перевод. Когда AI начинает говорить от имени человека с похожей интонацией и темпом, без встроенной маркировки слишком быстро открывается дверь в серую зону между полезным инструментом и удобным средством для подделки речи.
В результате Google делает ставку сразу на два фронта: уменьшает задержку и повышает естественность, но параллельно вшивает механизм происхождения контента. Для бизнеса и продуктовых команд вопрос теперь не в том, возможен ли голосовой перевод почти в реальном времени, а в том, где пройдет граница доверия. Если модель действительно стабильно выдержит обычный темп разговора, сохранит интонацию и не развалится в шумной среде, следующая конкуренция пойдет уже не за сам факт перевода, а за то, кто лучше встроит его в рабочие процессы и кто убедительнее ответит на вопросы о безопасности. Первоисточник с деталями анонса — .