Провинциальный аудит в Онтарио проверил 20 одобренных сервисов и выяснил неприятную вещь: AI-скрайбы для врачей не просто экономят время на бумажной работе, но и регулярно дописывают в карты пациентов то, чего не было. Среди ошибок — выдуманные направления на терапию и анализы, неверно записанные лекарства и пропущенные детали о психическом здоровье. Для IT-аудитории это очередное напоминание: если модель оформляет критичные данные, красивого интерфейса и бодрого питча про эффективность недостаточно.
Проблему описывает Ars Technica со ссылкой на доклад аудитора общего контроля Онтарио об использовании искусственного интеллекта в правительстве провинции. Проверка затронула 20 вендоров AI-скрайбов, которых власти заранее одобрили и включили в список поставщиков для медучреждений. Тест был не на краю науки: аудиторы прогнали через системы две смоделированные беседы врача с пациентом и посмотрели, насколько аккуратно сервисы превращают разговор в структурированную медицинскую запись. Итог вышел без особых сюрпризов для всех, кто хоть раз видел галлюцинации LLM в проде, но с куда более неприятной ценой ошибки: все 20 из 20 систем провалились по точности или полноте хотя бы в одном из тестов.
Цифры там такие, что формулировка «нуждается в доработке» выглядела бы издевательством. Девять сервисов добавляли в заметки информацию о пациенте, которой в разговоре не было вовсе. Двенадцать записывали данные с ошибками. Семнадцать упускали ключевые детали обсуждения психического состояния. В примерах из доклада фигурируют не косметические огрехи, а вещи, которые напрямую меняют дальнейшее лечение: несуществующие направления на анализ крови или психотерапию, неправильные названия выписанных препаратов, пропущенные важные обстоятельства по ментальному здоровью. Если перевести с бюрократического на человеческий, AI местами вел себя как очень уставший ассистент, который не расслышал половину разговора, а вторую половину уверенно додумал сам.
Особенно показательно, как эти продукты вообще прошли отбор. По внутренней шкале Supply Ontario средний балл проверенных решений за точность медицинских заметок составил лишь 12 из 20. Казалось бы, это и есть главный параметр для инструмента, который пишет в медкарту. Но в общей системе оценки этот критерий весил около 4% итогового результата. Для сравнения, отдельный показатель «присутствие компании в Онтарио» тянул на 30% общего балла. То есть поставщик мог получить ноль именно за точность записи и все равно остаться в зоне одобрения, если хорошо выглядел по другим пунктам. Такой дизайн закупки выглядит как классическая корпоративная трагикомедия: продукт можно брать для клиники, даже если он плохо справляется с единственной задачей, ради которой его, собственно, и покупают.
На этом фоне вывод аудитора звучит почти слишком мягко: AI-скрайбы «не были оценены должным образом». Еще один важный момент — власти Онтарио не заставляют государственные медорганизации использовать именно эти системы, и учреждения могут покупать решения у вендоров вне списка одобренных. Но сама рекомендация со стороны государства все равно работает как знак качества. Для части клиник это фактически сигнал: проверено, можно внедрять. Когда за этим знаком стоит настолько слабая проверка, проблема уже не только в моделях, но и в механике государственного отбора AI-продуктов.
История хорошо ложится в более широкий тренд. За последние годы медицинская отрасль стала одним из самых заметных покупателей генеративного AI не потому, что ей хочется футуризма, а потому что врачи перегружены документацией. Автоматический скрайб выглядит идеальным компромиссом: врач меньше печатает, система заполняет карту, пациент получает больше внимания, клиника — выше пропускную способность. На слайде для инвесторов это выглядит прекрасно. В реальности же такие инструменты живут на стыке распознавания речи, извлечения фактов, медицинской терминологии и контекстных нюансов. Ошибка здесь не равно «пользователь увидел странный текст в чате». Ошибка здесь — это неверная запись в клинической истории, на которую потом может опереться другой врач.
Для разработчиков и продуктовых команд в этой истории важен не только сам факт галлюцинаций — с этим никто уже не спорит, — а то, как именно система была внедрена в процесс. Доклад отдельно рекомендует обязать врачей подтверждать, что они просмотрели заметки, прежде чем те попадут в карту пациента. Иначе говоря, AI-скрайбы для врачей нельзя рассматривать как автономный слой автоматизации; это скорее черновик с высоким риском ошибки, который требует обязательного человеческого контроля. Если продукт продается как «снятие административной нагрузки», а по факту создает новый обязательный этап верификации, бизнесу придется честно пересчитать обещанную экономию времени. Не исключено, что часть эффекта съедается именно проверкой того, не придумала ли система лишнего.
Есть и еще один вывод, уже неприятный для закупщиков и IT-руководителей. Оценка AI-систем в чувствительных доменах не может строиться по логике обычного корпоративного тендера, где половина баллов уходит в локальное присутствие, документы и интеграционную вежливость поставщика. Если продукт принимает участие в создании медицинской записи, его надо проверять на реальных сценариях с измеримой клинической точностью, полнотой, устойчивостью к шуму и понятным режимом исправления ошибок. И делать это не один раз на входе, а регулярно, потому что модели, пайплайны и даже словари меняются. Иначе рынок получает знакомую схему: AI продают как инфраструктуру доверия, а тестируют как офисный софт.
На фоне бума генеративных помощников в медицине аудит Онтарио звучит не как локальный скандал, а как предупреждение всей отрасли. Автоматизация документации никуда не денется: у врачей слишком мало времени, а у поставщиков слишком большой соблазн монетизировать эту боль. Вопрос теперь в другом: кто первым навяжет рынку взрослый стандарт проверки таких систем — регуляторы, сами клиники или очередной инцидент, после которого ссылаться на «черновой режим» будет уже поздно. Подробности проверки изложены в материале .