AI И НЕЙРОСЕТИ

Аудит в Онтарио: AI Scribe путают лекарства и додумывают факты

12 из 20 систем AI Scribe в Онтарио путали лекарства в записях врачей, а 9 из 20 добавляли несуществующие детали лечения, показал аудит.

✍️ Редакция iTech News | 15.05.2026 | ⏱ 4 мин | 👁 9 | Источник: The Register
Аудит в Онтарио: AI Scribe путают лекарства и додумывают факты

В Онтарио проверили 20 систем AI Scribe, допущенных к работе в здравоохранении, и результаты вышли такими, после которых фраза «врач потом сам проверит» уже не звучит как надежная стратегия. В 12 случаях из 20 такие сервисы путали назначенные лекарства, а 9 из 20 добавляли в медицинские записи то, чего ни пациент, ни врач вообще не говорили. Для русскоязычной IT-аудитории это не очередная страшилка про нейросети, а очень предметный сигнал: если продукт генерирует критичный документ, ошибка в процентах и промах в приоритете метрик быстро превращаются в риск для бизнеса и репутации.

О выводах сообщил The Register со ссылкой на отчет Office of the Auditor General of Ontario. Речь идет о провинциальной программе AI Scribe, которую Министерство здравоохранения Онтарио запустило для врачей, практикующих медсестер и других специалистов. На этапе закупки решения проверяли на симулированных записях разговоров между врачом и пациентом: медицинские специалисты сравнивали исходные аудио с заметками, которые создавала система. Формально это выглядело как вполне вменяемый процесс оценки. На выходе оказалось, что даже при такой схеме часть одобренных продуктов проваливает базовую задачу: аккуратно пересказать разговор без самодеятельности.

Самые неприятные находки касались не стилистики и не кривых формулировок, а содержания. Аудиторы пишут, что 9 из 20 систем фабриковали информацию и даже предлагали изменения в плане лечения, хотя в исходной беседе этого не было. В примерах, которые приводятся в отчете, встречались записи о том, что у пациента не обнаружено новообразований, или о его тревожности, хотя такие темы вообще не обсуждались. Еще 12 систем подставляли неверную информацию о препаратах. Для медицинской записи это не «шероховатость модели», а уже ошибка класса «кто потом будет отвечать». Тем более что системы также пропускали важные детали разговора, в том числе связанные с психическим состоянием пациентов.

В этой истории особенно показательно не только качество самих моделей, но и логика их отбора. По данным аудита, 30% итоговой оценки в закупке зависели от того, есть ли у вендора присутствие в Онтарио. Точность медицинских заметок при этом давала лишь 4% общего балла. Контроль предвзятости весил 2%, оценка угроз, рисков и приватности тоже 2%, а соответствие SOC 2 Type 2 добавляло еще 4%. Иными словами, параметры, которые должны определять пригодность системы для работы с чувствительными медицинскими данными, в реальной модели оценки занимали подозрительно скромное место. Если перевести это с чиновничьего на инженерный, то procurement-команда фактически награждала вендоров за локальное присутствие заметно щедрее, чем за способность не путать лекарства в карте пациента.

Это важный момент не только для госзаказа и не только для медицины. За последние два года индустрия привыкла обсуждать генеративный ИИ в логике «да, он иногда галлюцинирует, зато ускоряет рутину». В low-risk сценариях такая сделка многим кажется приемлемой. Но с AI Scribe проблема в другом: продукт встроен в процесс, где запись становится частью клинической картины, а не просто черновиком для блога или письма. Поэтому аргумент «человек в контуре» сам по себе ничего не гарантирует. В отчете отдельно отмечается, что OntarioMD, участвовавшая в процессе внедрения, советовала врачам вручную проверять заметки на точность. При этом ни одна из одобренных систем не имела обязательной функции подтверждения, что врач действительно просмотрел и утвердил текст. Получается знакомая для многих продуктовых команд конструкция: контроль декларирован как организационная мера, но в интерфейсе и процессе он не зашит.

Министерство здравоохранения Онтарио, по данным CBC, заявило, что в программе участвуют более 5 тысяч врачей и известных случаев вреда пациентам из-за этой технологии пока нет. Это важная оговорка, но не индульгенция. Отсутствие зарегистрированного ущерба на момент комментария не означает, что система безопасна по умолчанию. Чаще это значит, что негативные эффекты еще не были формально зафиксированы, не дошли до аудита инцидентов или были погашены ручной перепроверкой. С точки зрения разработки и внедрения это как раз худший тип самоуспокоения: продукт работает потому, что люди вокруг него компенсируют его слабые места своим временем и вниманием.

Для команд, которые делают корпоративный ИИ, из этой истории следуют довольно приземленные выводы. Во-первых, нельзя оценивать такие системы по косвенным признакам удобства закупки, бренда или локального офиса, если точность результата остается второстепенным критерием. Во-вторых, «human in the loop» должен быть не лозунгом в презентации, а обязательным шагом в продукте: с подтверждением, логированием и понятной ответственностью. В-третьих, тестирование генеративных систем в чувствительных доменах надо строить не вокруг средней удовлетворенности пользователей, а вокруг конкретных классов ошибок: подмена препаратов, пропуск ключевого симптома, выдуманный диагноз, несанкционированная рекомендация по лечению. В противном случае рынок получает аккуратно упакованный copilot, который хорошо проходит демо, но плохо переносит встречу с реальными ставками.

История с AI Scribe в Онтарио неприятна именно своей будничностью: никто не поймал модель на экзотическом edge-case, аудиторы нашли сбои в самых базовых вещах. Это и есть главный вопрос для отрасли на ближайшее время: кто и по каким метрикам вообще решает, что генеративный ИИ уже можно пускать в процессы, где ошибка выглядит не как неловкий текст, а как неверная запись в документе, от которого зависит решение человека.

Поделиться: Telegram X LinkedIn