AI И НЕЙРОСЕТИ

Mallika Rao: долг в оценке ИИ ломает продукты тише, чем сбой

52-минутное выступление Mallika Rao объясняет, почему оценка ИИ-систем отстает от архитектуры и приводит к тихим, но опасным сбоям в проде.

✍️ Редакция iTech News | 30.05.2026 | ⏱ 5 мин | Источник: InfoQ
Mallika Rao: долг в оценке ИИ ломает продукты тише, чем сбой

Системы с ИИ могут обслуживать миллиарды запросов в день и при этом проваливаться не в мониторинге, а в смысле ответа. Именно об этом говорит оценка ИИ-систем в выступлении Mallika Rao: по ее версии, главный риск для продакшена не модель сама по себе, а накопленный «долг оценки», когда архитектура усложнилась, а проверка качества осталась где-то на уровне 2018 года. Для русскоязычных команд это довольно неприятная мысль: green dashboards больше не гарантируют, что продукт не теряет доверие пользователей.

Rao, бывший руководитель инженерных команд в Twitter, Walmart и Netflix, разбирает эту проблему в 52-минутной презентации на QCon AI, сообщает InfoQ. У спикера не академический, а вполне производственный бэкграунд: в Twitter она работала с поисковой инфраструктурой на триллионах документов и бюджетом задержки ниже 50 мс, в Walmart участвовала в системах денежных вознаграждений для 25 млн пользователей в месяц с требованиями комплаенса во всех 50 штатах США, в Netflix занималась контентными системами, где ежедневно принимаются миллиарды решений по персонализации.

Где ломается не железо, а смысл

Главная мысль Rao звучит просто и неприятно: современные AI-системы редко падают так, как падали классические распределенные сервисы. База данных упала, сервис не отвечает, latency улетела в космос — такое хотя бы видно сразу. С ИИ-сервисами проблема в другом: ответ может быть формально корректным, технически доставленным вовремя, даже пройти часть стандартных проверок, но оказаться бессмысленным или вредным для пользователя. Спикер называет это «тихими семантическими сбоями» — именно они и накапливают evaluation debt.

Под этим долгом она понимает разрыв между реальной сложностью системы и зрелостью ее проверки. Команда уже добавила LLM, эмбеддинги, vector store, многоступенчатый ranking, персонализацию, агентные workflow, а измеряет качество по-прежнему через precision/recall, статические тесты, графики latency, юнит-тесты и набор вручную проверенных примеров. Такая схема еще может выглядеть прилично в отчетах, но в продакшене постепенно начинает врать. Пользовательское доверие проседает не из-за одного громкого инцидента, а из-за серии мелких ошибок, которые никто не считал ошибками, потому что на уровне инфраструктуры все было «зелено».

Для инженерных руководителей здесь важен неприятный организационный вывод: оценка ИИ-систем — это не один score и не задача только ML-команды. Rao предлагает смотреть на нее как на стек из пяти слоев. В доступной расшифровке выступления подробно описаны как минимум четыре из них. Первый — корректность модели: привычные precision, recall, F1 и ответ на базовый вопрос, умеет ли модель предсказывать нужный результат на тестовом наборе. Второй — надежность инфраструктуры: P95, P99, поведение API, микросервисов, баз данных и кэшей под AI-нагрузкой. Третий — продуктовые guardrails: умеет ли система отсекать вредные, абсурдные или просто семантически нелепые ответы. Четвертый — человеческий опыт: понимает ли пользователь, почему он видит именно этот результат, вызывает ли интерфейс доверие, одинаково ли работает логика представления на разных платформах.

Это важный сдвиг в оптике. Во многих компаниях качество AI-фичи до сих пор обсуждают либо как задачу модели, либо как задачу SRE. Rao фактически говорит, что обе стороны могут быть правы и все равно проиграть: модель на офлайн-метриках хороша, инфраструктура держит SLA, а продукт в реальности портит пользовательский опыт. Для поиска, рекомендаций, выдачи контента, антифрода, rewards-систем и любых AI-надстроек над критичными пользовательскими сценариями это особенно болезненно. Ошибка в такой архитектуре часто не бинарна. Система не «сломалась» — она начала систематически давать людям не то, что обещала.

Почему это важно именно сейчас

Контекст у этого тезиса очевидный: за последние два года AI-стек в продакшене резко усложнился, а процессы верификации далеко не везде успели за ним. Компании добавляют retrieval, оркестрацию, персонализацию, гибридный поиск и агентные сценарии быстрее, чем выстраивают новые контуры наблюдаемости и контроля качества. И если у классического софта инцидент обычно можно локализовать по логам, то у AI-пайплайна сбой легко размазывается между данными, промптом, промежуточным ранжированием, guardrails и фронтендом. В результате команда спорит не о причине, а о том, где вообще кончается «модель» и начинается «продукт».

Rao ценна тем, что не продает очередную серебряную пулю. Наоборот, ее выступление довольно трезво приземляет AI-адопшен: если компания строит сложную интеллектуальную систему, но не инвестирует в диагностику зрелости оценки, она почти гарантированно покупает будущую аварию. Причем не обязательно публичную и громкую. Для бизнеса хуже другой сценарий: конверсия просела на доли процента, рекомендации стали менее уместными, пользователи реже доверяют подсказкам, ручных эскалаций у саппорта больше, а ни один стандартный график прямо не показывает причину. Для продуктовых и инженерных команд это означает, что метрики надо проектировать не только вокруг точности и скорости, но и вокруг понятности, правдоподобия и устойчивости результата в конкретном пользовательском контексте.

Для российской IT-аудитории здесь практический вывод довольно прямой. Если ваша команда внедряет ИИ в поиск, каталог, саппорт, аналитику, CRM или внутренние инструменты, вопрос уже не в том, «насколько хороша модель». Вопрос в том, есть ли у вас общая схема, которая связывает модельные метрики, инфраструктурные ограничения, продуктовые ограничения и реальный пользовательский опыт. Без этого оценка ИИ-систем быстро превращается в ритуал: цифры есть, уверенности нет. А когда AI-функция попадает в критичный бизнес-процесс, такой ритуал становится слишком дорогим удовольствием.

Самый неудобный вопрос после выступления Rao звучит так: сколько команд уже живут с накопленным долгом оценки и даже не считают его техническим долгом. Пока компании соревнуются в скорости внедрения AI-функций, выиграют, похоже, не те, кто быстрее прикрутил LLM, а те, кто раньше остальных научился ловить семантические сбои до того, как их заметит пользователь.

Поделиться: Telegram X LinkedIn