OpenAI подвергла критике WebRTC, называя его неподходящим для приложений голосового AI. Основная проблема в том, что WebRTC активно снижает качество звука для уменьшения задержки, что — нежелательным для пользователей.
Проблемы совместимости и производительности
Ранее разработчики OpenAI использовали WebRTC для голосовых приложений, однако столкнулись с низкой производительностью и необходимостью ручной настройки. Основатель Voice AI отметил, что WebRTC предназначен для видеоконференций и, соответственно, требует быстрой передачи данных, что не подходит для сложных запросов голосовых AI, таких как взаимодействие с пользователем на базовом уровне.
Например, при использовании WebRTC для обработки запросов пользователи жалуются на резкие искажения звука. В отличие от обычных телефонных звонков или видеозвонков, где важна скорость, в условиях работы с AI пользователи готовы подождать дополнительные 200 мс, чтобы получить качественный ответ. Однако WebRTC не предоставляет такой возможности, так как активно удаляет пакеты звука во время плохого соединения.
Технические детали и решения
Как отмечается в исследовании, WebRTC состоит из примерно 45 RFC-документов, и его реализация требует существенных усилий, что увеличивает вероятность ошибок. В OpenAI даже рассматривали возможность настройки NACK (Negative Acknowledgment) для перепрослушивания пакетов, но практика показала, что WebRTC имеет слишком маленький jitter-буфер, что создает дополнительные проблемы.
Несмотря на признание проблемы WebRTC, разработчики пытаются улучшить ситуацию: аналитики допустили, что агенты голосового AI в будущем смогут сократить задержку до приемлемых значений, однако это потребует значительных усилий и, возможно, компромиссов в качестве звука.
Что это значит для разработчиков
Для российских разработчиков Voice AI ситуация ясна: использование WebRTC может привести к потере качества звука. Если ваша компания разрабатывает голосовые AI-системы, стоит рассмотреть альтернативные решения, которые позволят обеспечить лучшее качество звука без задержек. Например, стоит обратить внимание на возможности серверных решений с поддержкой совместимости и большими ресурсами обработки данных.
С учетом текущих проблем, имеет смысл отслеживать обновления от OpenAI и других исследовательских команд, которые могут предложить решения для улучшения работы голосовых AI в будущем.