Meta 1 сентября 2026 года представила Muse Voice Transcribe — свою первую модель для распознавания речи в реальном времени. По ключевому стриминговому бенчмарку она показала 3,1% word error rate, обойдя GPT Live Transcribe от OpenAI с 3,9% и Gemini 3.5 Transcribe Live от Google с 4%. Для русскоязычной IT-аудитории это не просто еще один релиз «голосового ИИ»: рынок, где долго спорили о чат-ботах, быстро превращается в гонку за уши интерфейса.
О запуске сообщает The New Stack. Издание пишет, что модель разработала Meta Superintelligence Labs, а доступ к ней компания открыла сразу в трех каналах: через Meta Model API, в приложении Meta AI for Mac и в Muse Code. Ценник для API выглядит агрессивно: $3 за 1000 минут аудио, то есть около $0,18 в час. Для разработчиков это важная деталь: Meta продает не исследовательскую красивость, а вполне прикладной сервис, который можно встраивать в продукты без привычного набора «отдельный ASR, отдельный diarization, отдельный endpoint detector, а потом еще молимся за задержку».
Технически Muse Voice Transcribe умеет три вещи в одном потоке: потоковое преобразование речи в текст, разделение говорящих и определение момента, когда пользователь закончил фразу. Meta заявляет поддержку более 20 спикеров в одной записи, работу с разговорами длиннее часа и обучение на 70+ языках, из которых 25 языков в компании называют «extensively verified». Еще одна заявленная фича — code-switching, то есть переключение между языками прямо внутри реплики. Для глобальных продуктов это не декоративная опция: реальная речь давно выглядит не как аудиокнига, а как смесь английского, локального языка, имен собственных, брендов и слов из корпоративного жаргона.
Самое интересное в релизе — не только цифры на таблице, но и то, как Meta описывает механику модели. Под капотом это авторегрессионная мультимодальная система из семейства Muse Spark. Аудио подается кусками по 80 миллисекунд, и на каждом шаге модель решает, продолжать ли «слушать» следующий фрагмент или уже выдавать текстовый токен. Отсюда появляется режим adaptive delay: на простых словах модель может отвечать почти сразу, на сложных — подождать еще контекст. Идея не новая по духу, но в продакшене именно на таких компромиссах между скоростью и точностью все обычно и ломается. Слишком рано отдал текст — получил поток опечаток. Слишком поздно — пользователь уже успел понять, что «реальное время» у вас только в презентации.
По данным The New Stack, на бенчмарке Artificial Analysis AA-WER Streaming новая модель Meta заняла первое место по качеству финальной транскрипции в стриминговом режиме. В материале указаны конкретные цифры: 3,1% у Meta против 3,4% у Cartesia Ink-2, 3,6% у ElevenLabs Scribe v2 Real-time, 3,9% у GPT Live Transcribe и 4% у Gemini 3.5 Transcribe Live. В задаче разделения говорящих Meta тоже заявляет лидерство: 17,5% error rate на наборе публичных бенчмарков для diarization. Но здесь есть важная оговорка, без которой новость быстро превращается в маркетинг: сравнение по AA-WER Streaming относится к англоязычной речи. То есть говорить, что Meta уже «закрыла вопрос» для всего мира, рано. Для русского, смешанной речи СНГ-команд или доменных кейсов вроде медицины и финтеха нужны отдельные замеры.
Контекст у этой истории тоже показательный. The New Stack прямо пишет, что рынок real-time transcription за лето 2026 года стал одной из самых тесных зон в AI-индустрии: стриминговые модели почти одновременно выкатывали OpenAI, Google, xAI, Alibaba и специализированные игроки. Это уже не академическая дисциплина и не игрушка для заметок с созвонов. Речь идет о базовом слое для голосовых ассистентов, агентных интерфейсов, субтитров, операторских систем, meeting bots и инструментов разработки, где голос становится еще одним способом отдавать команды. Meta здесь особенно мотивирована: у нее есть Mac-приложение, есть Muse Code, есть амбиции вокруг персональных AI-ассистентов, и всем этим продуктам нужен надежный speech-to-text без неловких пауз и каши из спикеров.
Для бизнеса и команд разработки новость важна по трем причинам. Первая: Meta показывает, что связка «скорость плюс точность» уже стала предметом ценовой войны, а значит, интеграция голосовых сценариев будет дешеветь. Вторая: объединение ASR, diarization и endpointing в одной модели упрощает архитектуру и снижает количество точек отказа в pipeline. Третья: Meta, в отличие от части прежних своих AI-релизов, не собирается выкладывать open weights этой модели — представитель компании подтвердил это The New Stack. Для enterprise-клиентов это означает знакомый компромисс: быстрее старт через API, но меньше контроля над инференсом, кастомизацией и стоимостью владения в долгую. И если ваш продукт строится вокруг приватных переговоров, колл-центров или внутренних стенограмм, вопрос deployment-модели никуда не делся.
Теперь главный вопрос не в том, смогла ли Meta разово обойти OpenAI и Google на одном бенчмарке. Куда важнее, удержится ли это преимущество в сегменте, где разрыв между лидерами измеряется уже не пропастью, а несколькими десятыми процента WER и долями секунды задержки. Если да, Muse Voice Transcribe станет не просто удачным релизом, а еще одним сигналом, что следующая битва AI-платформ пройдет не в чат-окне, а в голосовом интерфейсе. Первоисточник с цифрами и деталями: .