42 носителя русского языка прослушали записи нейросети, которую в СПбГУ дообучили на интонационной модели, и в среднем сочли речь естественной. Для продуктов, где важен синтез речи, это заметная новость: слабое место многих русскоязычных систем не словарь, а интонация, из-за которой вопрос легко превращается в сухую констатацию. Если такой подход дойдет до продакшена, выиграют голосовые ассистенты, образовательные сервисы и антропоморфные роботы.
Как пишет CNews, лингвисты Санкт-Петербургского государственного университета встроили в модель синтеза текста в речь собственную интонационную классификацию. Ее разработали доцент Нина Вольская и заведующий кафедрой фонетики и методики преподавания иностранных языков Павел Скрелин, а результаты исследования опубликованы в материалах International Conference on Speech and Computer. В качестве базы команда взяла Tacotron2, потому что эта архитектура позволяет тонко настраивать акустические признаки и работать с такими параметрами, как манера произношения, тембр и акцент.
С технической точки зрения исследование бьет в одну из самых упрямых проблем речевого ИИ. Нейросеть может правильно прочитать слова, выдержать паузы и даже аккуратно собрать тембр, но все равно звучать не по-человечески, если интонация разваливается на полпути. Пользователь обычно слышит это мгновенно: фраза вроде бы собрана верно, а смысл проседает, потому что акцент поставлен не туда, просьба звучит как приказ, а незавершенная мысль как законченный вывод. Для русской речи это особенно чувствительно, поскольку различия между вопросом, утверждением, обращением и акцентным выделением часто держатся именно на движении тона и темпе, а не на словах.
В СПбГУ решили не усреднять такие случаи, а подробно разметить их до обучения. В систему вошли параметры, которые обычно и создают ощущение живой реплики: мелодический диапазон, скорость произношения, тип высказывания, а также смысловая иерархия внутри фразы. Модель учится различать не только вопрос и повествование, но и приказ, просьбу, обращение, незавершенность. Для систем, где критичен синтез речи, это важный сдвиг: вместо одного безопасного шаблона нейросеть получает более богатую карту вариантов и может выбирать интонацию по контексту, а не по усредненному сценарию.
Проверяли результат на людях, а не только на метриках. В первом эксперименте 42 носителям русского языка дали прослушать синтезированные записи и попросили оценить их звучание. В среднем участники сочли аудио естественными, хотя в части примеров все же заметили артефакты. Во втором тесте испытуемые выбирали подходящий знак препинания для прозвучавшей фразы, и лучше всего система справилась с вопросительными конструкциями. Это не продуктовый A/B-тест и не заявка на полностью решенную задачу, но для академической работы такой результат важен: новая разметка не просто делает голос приятнее, а помогает слушателю точнее распознавать коммуникативный смысл.
Практический вывод для разработчиков и продуктовых команд здесь довольно прямой. Когда речь идет о голосовом помощнике, учебной платформе, сервисном боте или роботе с речевым интерфейсом, плоская просодия быстро съедает впечатление от всей остальной инженерии. Пользователь может простить слегка синтетический тембр, но хуже терпит реплики, в которых интонация спорит со смыслом. Работа СПбГУ показывает, что синтез речи можно заметно подтянуть не только заменой архитектуры, но и более дисциплинированной работой с данными: качественной интонационной разметкой и аккуратной настройкой модели. Для российского рынка это особенно полезный сигнал, потому что локальные речевые продукты часто упираются не в нехватку идей, а в нехватку хорошо описанного языкового материала.
Сами исследователи уже обозначили следующий рубеж: донастроить модель с учетом эмоциональных и стилистических вариантов интонации. И вот там начинается самое интересное для отрасли. Отличать вопрос от утверждения полезно, но реальная коммерческая ценность появится тогда, когда нейросеть сможет держать нужный тон не в одной короткой реплике, а в длинном диалоге, уроке или сервисном разговоре, без эффекта удачного демо и сбоев на живом пользователе.