Meta представила AI Muse Voice Transcribe — новую модель транскрипции речи, которая работает в реальном времени с возможностью определения 20 и более спикеров. Стоимость услуги составляет всего $0,18 за час обработанного аудио, что делает решение доступным для бизнеса.
Функциональность AI Muse Voice Transcribe
Muse обеспечивает одновременную транскрипцию, определение конца речи и распознавание нескольких спикеров без необходимости пост-обработки. Модель была обучена на более чем 70 языках и теперь поддерживает многоязычное переключение кода. Это особенно важно для международных компаний, где языковые барьеры могут затруднять коммуникацию.
Конкуренция на рынке транскрипции
Несмотря на то, что 20+ спикеров — это впечатляющая цифра, другие компании, такие как Speechmatics и Amazon Transcribe, уже предлагают решения, способные распознавать до 100 и 30 спикеров соответственно. Однако сочетание высокоскоростной транскрипции с недорогой ценой может оказаться более значительным для пользователей, чем просто максимальное количество спикеров.
Практическое значение для бизнеса
Для разработчиков, нацеленных на создание интерфейсов для видеозвонков, аналитики звонков или живых помощников, такая модель как Muse может изменить подход к audio-analytics. Компании, ориентирующиеся на улучшение коммуникации и автоматизацию процессов, должны рассмотреть возможность интеграции Muse в свои системы.