AI И НЕЙРОСЕТИ

NVIDIA ускоряет оценку моделей ASR для медицины с помощью NeMo и Agent Skills

NVIDIA представила новые инструменты для быстрого создания и оценки синтетических аудиоданных в клиническом ASR.

✍️ Редакция iTech News | 15.11.2025 | ⏱ 2 мин | Источник: NVIDIA Developer Blog
NVIDIA улучшила оценку клинических ASR моделей

NVIDIA представила новый подход к оценке моделей автоматического распознавания речи (ASR) в медицинской сфере, используя синтетические аудиоданные и агентские навыки. Это ускоряет процесс создания тестовых наборов без необходимости в реальных данных пациентов, что критически важно для соблюдения конфиденциальности.

Контекст: вызовы клинического ASR

Работа с медицинскими терминами, часто редкими и специфичными, ставит серьезные задачи для стандартных систем распознавания речи. Например, лекарственные названия, такие как ацетаминофен или биктавр, не входят в обиходную лексику и требуют точного произношения в ASR-системах. По данным NVIDIA, использование синтетических данных возможно только при соблюдении их фонетической точности.

Сбор реальных аудиоданных сложно осуществим, так как это требует больших затрат времени и ресурсов на аннотацию, в то время как синтетические данные, не содержащие личной информации, избавляют от этих проблем. Это позволяет ИТ-командами быстро создавать и оценивать новые модели без задержек, связанных с соблюдением HIPAA.

Детали нового подхода

NVIDIA внедрила цикл итеративного улучшения, в котором первоначально определяются клинические профили, затем генерируются синтетические аудиофайлы с правильным произношением терминов. После этого выполняется оценка производительности ASR на уровне сущностей.

Как объясняет Джон Джафанипур из NVIDIA, такой подход дает возможность создать надежный набор данных для первичной оценки моделей ASR всего за несколько часов. Это значительно ускоряет процесс исследований и разработки в области медицинского ИИ.

С использованием NeMo Data Designer и NVIDIA Nemotron Speech система может также адаптироваться и расширяться с учетом выявленных ошибок, что делает её гибкой и эффективной в условиях быстро меняющихся клинических требований.

Практическое значение для разработчиков

Для разработчиков медицинского ПО этот подход открывает новые горизонты для обучения и тестирования алгоритмов распознавания речи. Возможность быстрой генерации аудиоданных позволяет снизить расходы на разработку, улучшить точность моделей и в итоге повлиять на закладку более качественных решений в области клинического ИИ.

В условиях растущей конкуренции на рынке медицинских технологий, способность быстро адаптироваться к потребностям различных специализированных областей является критически важной. Обратите внимание на новые инструменты от NVIDIA — это возможность для вашего бизнеса занять лидирующие позиции.

Следующий шаг для NVIDIA — расширить интеграцию этих инструментов с другими компонентами экосистемы ИИ для более комплексных решений внедрения в клинические практики.

Поделиться: Telegram X LinkedIn