OpenAI представила голосовой ChatGPT нового поколения, основанный на модели GPT-Live. Модель начала работать с 8 июля и позволяет вести разговоры, как с живым собеседником, с реакцией на паузы и комментарии.
Ключевые особенности
Главное новшество заключается в архитектуре full-duplex, которая позволяет модели одновременно слушать и говорить. Это означает, что ChatGPT может поддакивать собеседнику, ждать, если тот задумался, и при необходимости замолчать. В то время как предыдущие версии голосового ChatGPT сталкивались с проблемами скорости и нюансов, новый подход кардинально меняет ситуацию.
Теперь ChatGPT непрерывно обрабатывает звук во время генерации ответов, принимая решения о том, когда говорить, когда слушать и когда замолчать. Это значительное улучшение по сравнению с предыдущими модификациями, которым приходилось ждать завершения речи собеседника, прежде чем начать ответ.
Технологические улучшения и внедрение
GPT-Live также использует делегирование задач: если собеседник задает сложный вопрос, модель может передать его высокоуровневой фронтир-модели (GT-5.5), одновременно продолжая беседу. Пользователи могут настраивать уровень глубины рассуждений: Instant, Medium или High.
Кроме того, в процессе общения ChatGPT может показывать визуальные карточки с актуальной информацией, такой как погода или спортивные результаты. Развертывание нового режима идет на iOS, Android и веб-платформах, и теперь он стал стандартом для подписчиков Go, Plus и Pro, тогда как бесплатные пользователи могут получить упрощенную версию GPT-Live-1 mini.
Значение для пользователей и рынка
Среди преимуществ нового ChatGPT — заметное улучшение естественности взаимодействия. Как показывают первые сравнения, новая версия значительно превосходит предыдущую по качеству диалога. По данным OpenAI, голосовыми функциями ChatGPT ежедневно пользуются более 150 миллионов человек, и это число будет расти с развитием технологий.
Для разработчиков и компаний, использующих ИИ в своих процессах, запуск GPT-Live может означать необходимость адаптации бизнес-решений под новые возможности голосового взаимодействия, чтобы обеспечить более высокий уровень обслуживания клиентов и автоматизации.
В ближайшие месяцы мы можем ожидать появления новых возможностей, таких как поддержка видео и демонстрации экрана, а также расширение языковой поддержки, что позволит увеличить аудиторию пользователей.