AI И НЕЙРОСЕТИ

Google открыл разработчикам самодельные голоса в Gemini API

24 сентября Google выпустил Gemini 3.8 Flash TTS: разработчики могут создавать и клонировать голоса через API без звонка в отдел продаж.

✍️ Редакция iTech News | 25.09.2026 | ⏱ 5 мин | Источник: The New Stack
🔬

Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS вышли 24 сентября через Gemini API и Google AI Studio: Google дал разработчикам self-service-доступ к созданию и репликации голосов. Для русскоязычных команд это не просто еще одна модель озвучки, а сдвиг в архитектуре голосовых агентов, локализации продуктов и production-пайплайнов, где раньше кастомный голос часто упирался в ручные согласования и закрытые продажи.

О запуске сообщает The New Stack. Главная деталь: голос теперь можно не только выбрать из библиотеки, но и создать. Разработчик описывает тембр, роль, акцент и характер голосовой персоны текстом или загружает короткую запись существующего голоса. После этого Google возвращает идентификатор вида voice_..., который можно переиспользовать в приложении без повторной отправки исходного аудио или длинного промпта на каждый запрос.

Для репликации голоса Google добавил новый эндпоинт POST /v1beta/voices. Нужны две записи от одного и того же человека: чистый образец голоса длиной от 10 до 30 секунд и отдельная запись согласия, где спикер подтверждает, что голос принадлежит ему и что он разрешает создать синтетическую версию. Google сверяет, что согласие и эталонный образец принадлежат одному человеку. Это важная, пусть и не идеальная, защита от сценария, в котором чужой голос превращают в API-ресурс быстрее, чем юристы успевают открыть ноутбук.

Сохраненный голос живет в проекте год. Лимит — до 200 голосов на проект, их можно получать, просматривать списком и удалять через API. Есть и временный режим: если указать store=False, сервис вернет зашифрованный ключ voicekey_..., который действует семь дней. Такой вариант логичен для коротких кампаний, разовых генераций, тестов или внутренних процессов, где хранить профиль голоса долго не нужно.

Google отдельно маркирует аудио, созданное Gemini, через SynthID, а реплицированные голоса снабжает C2PA-метаданными происхождения. На фоне роста голосовых дипфейков это уже не косметика, а эксплуатационное требование: крупные клиенты будут спрашивать не только про качество синтеза, но и про трассируемость. При этом функция репликации доступна не везде: через AI Studio ее нет в Иллинойсе, Техасе, Европейской экономической зоне, Великобритании, Швейцарии и Индии.

Gemini 3.8 Flash TTS поддерживает голосовой дизайн на естественном языке, а Google заявляет работу более чем со 100 языками и диалектами. В документации для Flash TTS указаны 130 языков, для Flash-Lite — 101. Компания также говорит о библиотеке из более чем 2000 готовых голосов; отдельно упоминаются 30 студийных голосов и расширенная библиотека, которую можно фильтровать по языку, акценту, высоте тона и сценарию использования. Возможность ремиксовать библиотечные голоса промптами по тембру, скорости, высоте и акценту заявлена как будущая функция.

Важная техническая мелочь: Google рекомендует создать голос один раз и дальше использовать его ID. Если каждый раз заново отправлять длинное описание персоны, голос может дрейфовать. Для команд, которые делают озвучку курсов, подкастов, аудиоверсий статей или голосовых ассистентов, это означает более предсказуемый пайплайн: идентичность голоса хранится как ресурс, а не как хрупкая магия в промпте.

Есть и изменения, которые могут сломать старые интеграции. Gemini 3.8 трактует входной текст как дословный транскрипт. Если в preview-версии Gemini 3.1 разработчики прятали режиссерские указания прямо в тексте, теперь постоянные инструкции вроде шепота, сарказма или быстрого темпа надо передавать через аннотацию speech_metadata. Короткие звуки — например вздох, кашель или пауза — остаются inline в угловых скобках. Для двух спикеров поддержаны реакции слушателя, но есть ограничение: один запрос с двумя участниками работает с предустановленными голосами, а диалог между созданными или реплицированными голосами придется генерировать по репликам и склеивать из 24 кГц PCM.

Разделение между Flash и Flash-Lite ожидаемое. Flash TTS рассчитан на более сложную актерскую подачу: диалоги, вокальные теги, сложные произношения, региональные диалекты и длинную дикторскую речь. Flash-Lite TTS — более быстрый и дешевый вариант для массовой генерации, read-aloud-функций и каскадных голосовых агентов, где LLM отвечает текстом, а отдельный слой превращает его в речь. Обе модели используют одну схему API, так что переключение между ними сводится к смене параметра.

Сравнение с OpenAI здесь неизбежно. По данным источника, OpenAI тоже предлагает кастомные голоса, но через продажи: клиентам нужно обращаться к sales-команде, лимит составляет 20 голосов на организацию, а для создания требуются запись согласия и голосовой образец до 30 секунд. У OpenAI есть 13 встроенных голосов, которыми можно управлять по тону и скорости, но prompt-based voice design — создание нового голоса из текстового описания — в таком виде не предлагается.

Для разработчиков это меняет закупочную механику. Кастомный голос становится не enterprise-опцией с перепиской, а ресурсом, который можно прототипировать в API рядом с остальной логикой продукта. Для бизнеса это ускоряет эксперименты с голосовыми интерфейсами, но одновременно поднимает планку ответственности: согласия, хранение voice ID, политика удаления, маркировка синтетической речи и проверка региональных ограничений должны быть частью архитектуры, а не пунктом в конце презентации.

Если Gemini 3.8 Flash TTS приживется у платформ для голосовых агентов вроде LiveKit, Agora, Pipecat и Vercel AI Gateway, рынок быстро привыкнет к тому, что брендовый голос создается так же буднично, как API-ключ. Следующий спор будет уже не о том, кто умеет синтезировать речь, а о том, кто умеет управлять голосовой идентичностью безопасно, дешево и без ручного квеста через отдел продаж.

Поделиться: Telegram X LinkedIn