AI И НЕЙРОСЕТИ

Модели Qwen3-ASR обогнали Whisper Large v3 по точности распознавания

Модели Qwen3-ASR демонстрируют лучшую точность распознавания по сравнению с Whisper Large v3. Что это значит для разработки ИИ?

✍️ Редакция iTech News | 21.03.2026 | ⏱ 2 мин | Источник: Reddit r/MachineLearning
🎯

Модели Qwen3-ASR показали превосходство над Whisper Large v3, достигнув уровня ошибок распознавания (WER) в 2,35% против 2,7% у Whisper. Это открывает новые горизонты для разработчиков технологий распознавания речи.

Контекст и сравнение с конкурентами

В рамках сравнительного теста на наборе данных LibriSpeech (2 620 высказываний) было зафиксировано, что Qwen3-ASR с 1,7 миллиарда параметров на 26% меньше по размеру по сравнению с Whisper, при этом обеспечивает на 13% более высокую точность. Модель с 600 миллионами параметров также продемонстрировала достойные результаты с WER в 2,80%. Для контекста: Whisper требует значительно больше ресурсов для аналогичных результатов.

Разработка моделей Qwen3 основана на концепции Large Audio-Language Model (LALM), что позволяет им учитывать контекст языка для устранения акустического двусмысленности. В отличие от Whisper, Qwen3 использует декодер LLM, что увеличивает точность обучения за счёт предварительного обучения на 40 миллионах часов данных — в 60 раз больше, чем у Whisper.

Технические детали и особенности моделей

Модель Parakeet TDT INT8 также была протестирована, показав WER в 2,74% при объёме всего в 634 МБ. Эта модель имеет бесавторегрессивный транскриптор, что исключает вероятность генеративных ошибок. Однако стоит отметить, что 4-битная квантизация оказывается неэффективной на языках, отличных от английского, например, на корейском языке уровень ошибок возрастает до 19,95% с 4-битной квантизацией.

Все результаты доступны для воспроизведения. Сценарий для тестирования можно найти на GitHub, что позволяет разработчикам быстро экспериментировать и интегрировать модели в свои приложения.

Практические выводы для разработчиков

Для российских компаний, работающих с технологиями распознавания речи, результаты Qwen3-ASR могут служить весомым аргументом в пользу адаптации новых решений. В условиях конкуренции с Whisper важно учитывать как минимизацию ресурсных затрат, так и максимизацию точности. Это может снизить затраты на вычисления и улучшить пользовательский опыт.

Следующий этап — более широкое внедрение Qwen3-ASR в коммерческих приложениях, что может значительно повысить их эффективность в распознавании речи.

Поделиться: Telegram X LinkedIn