Google, похоже, готовит настройку голоса Gemini сразу по четырём параметрам: Speed, Energy, Formality и Warmth. Для русскоязычной IT-аудитории это не просто косметика: голосовой ИИ быстро превращается из демонстрации в рабочий интерфейс, а значит, тон, темп и манера речи начинают влиять на продукт не меньше, чем качество модели.
О находке в бета-версии Google app 17.41.12 сообщает 9to5Google. Речь не о публичном анонсе, а о традиционном для издания APK-разборе: журналисты изучили строки кода в свежей сборке приложения и нашли признаки будущей функции. Такие находки не гарантируют релиз, и сам Google пока ничего официально не подтверждал, но набор параметров выглядит достаточно конкретно, чтобы говорить не о случайных заготовках, а о проработанном направлении.
Если функция доберётся до пользователей, голос Gemini можно будет подкручивать по четырём шкалам. Для Energy, Formality и Warmth предусмотрены уровни low, medium и high, а для Speed — slow, normal и fast. То есть Google, судя по всему, хочет дать пользователю не выбор из нескольких готовых голосов, а более тонкую настройку характера озвучки. Это важное отличие: один и тот же голос можно сделать бодрее или спокойнее, более официальным или, наоборот, мягким, не меняя саму основу звучания.
По данным разборки, выбранные параметры должны применяться и в Gemini Live, и в обычном чате Gemini. Это уже серьёзнее, чем опция для одной узкой функции. Если настройки будут общими для разных сценариев, Google фактически строит единую голосовую идентичность ассистента внутри своей экосистемы. Для пользователя это означает предсказуемость опыта, а для продуктовых команд — ещё один слой персонализации, который можно воспринимать как часть UX, а не как декоративную надстройку.
Контекст здесь тоже показательный. После Google I/O компания уже добавила два новых голосовых варианта, а на самой конференции говорила о планах по поддержке региональных диалектов. Логика развития читается без особых усилий: сначала расширить базовый набор голосов, затем перейти к более детальной кастомизации, а дальше, вероятно, дойти до локальных речевых особенностей и более адресной адаптации под сценарий использования. Голосовой интерфейс в 2026 году уже нельзя продавать одной фразой «он умеет говорить». Теперь важно, как именно он говорит и уместен ли этот стиль в конкретном контексте.
На этом фоне любопытно совпадение с Apple. В материале упоминается, что в iOS 27 появляется возможность настраивать Siri AI по параметрам Pace и Expressivity, причём эти настройки распространяются и на другие системные приложения вроде Maps и Safari. Иными словами, и Google, и Apple движутся к одной точке: голосовой ИИ перестаёт быть единым голосом на всех и становится сервисом с регулируемой подачей. Разница пока в степени детализации. У Apple в публикации названы два параметра, у Google в коде уже просматриваются четыре. Даже если часть настроек не доедет до продакшена, сам вектор выглядит вполне очевидно.
Для разработчиков и продуктовых команд здесь есть практический вывод. Голосовой слой интерфейса начинает жить по тем же правилам, что и текстовый: tone of voice, формальность, эмоциональная окраска и скорость подачи становятся управляемыми переменными. Это может быть полезно в обучающих продуктах, клиентской поддержке, корпоративных ассистентах, навигации, wellness-сервисах и в любом месте, где пользователь слушает систему дольше пары секунд. Более официальный голос лучше подходит для рабочих сценариев и чувствительных запросов, более тёплый — для онбординга и помощников с регулярным взаимодействием, а управление скоростью критично для доступности и мультиязычного использования.
Для бизнеса это ещё и вопрос конверсии, удержания и бренда. Если пользователь может подстроить ассистента под себя, снижается раздражение от «не того» темпа или слишком театральной интонации. Если настройки закрепляются на уровне аккаунта и работают в нескольких режимах, вырастает ощущение персонального инструмента, а не обезличенной функции. Платформы давно умеют запоминать тему интерфейса, язык и размер шрифта; теперь к этому набору добавляется голосовая манера. На конкурентном рынке ассистентов такая мелочь быстро перестаёт быть мелочью.
Отдельный нюанс — локализация. В англоязычной среде параметры вроде Warmth или Formality воспринимаются относительно прямолинейно, но при выходе на другие языки всё усложняется. Формальность в русском, японском или немецком работает по-разному; «тёплая» подача тоже может звучать либо естественно, либо странно, если модель и TTS-слой плохо обучены на конкретной речевой норме. Поэтому сама по себе настройка голоса Gemini — лишь половина задачи. Вторая половина — добиться, чтобы эти ручки действительно меняли восприятие речи, а не просто переставляли ползунки в меню.
Пока это всё ещё функция из серии «может появиться, а может и нет», и к APK-разборкам всегда стоит относиться без лишней романтики. Но сам факт, что Google закладывает в Gemini четыре отдельных параметра голоса и собирается применять их сразу в Live и обычном чате, показывает зрелость новой конкуренции в ИИ-интерфейсах. Следующий раунд борьбы между платформами, похоже, пойдёт не только за размер контекстного окна и скорость ответа, но и за то, чей ассистент звучит уместнее, терпимее и просто приятнее в ежедневной работе.