AI И НЕЙРОСЕТИ

Почему AI в продакшене ломается там, где пилот выглядел блестяще

Capital One признала: главная проблема не в запуске пилотов, а в переводе AI в продакшен — с метриками, рисками и реальными данными.

✍️ Редакция iTech News | 12.06.2026 | ⏱ 5 мин | Источник: VentureBeat
🧬

Пока рынок обсуждает новые модели и агентные сценарии, крупные компании упираются в более приземленную проблему: AI в продакшене сыплется там, где на демо все выглядело убедительно. Именно об этом в колонке для VentureBeat пишет Лиз Боши, вице-президент AI Foundations в Capital One: экспериментировать с ИИ бизнес уже научился, а вот доводить прототипы до стабильной работы в реальных процессах — все еще нет.

Для русскоязычной IT-аудитории тезис болезненно знакомый. Внутри компаний хватает аккуратных proof of concept, презентаций с красивыми скриншотами и пилотов, которые нравятся руководству ровно до встречи с latency, грязными данными, требованиями безопасности и регуляторикой. Боши формулирует это без лишней романтики: вопрос не в том, что теоретически умеет модель, а в том, что реально работает для конкретного пользователя, процесса или решения при текущих технических и организационных ограничениях, сообщает VentureBeat.

Ключевая мысль Capital One проста: между фундаментальными исследованиями и прикладной разработкой не должно быть декоративной стены. Если исследовательская команда живет в своем мире, где метрики считаются на чистых офлайн-наборах, а продуктовая и инженерная — в своем, где есть SLA, легаси и боевые инциденты, то провал почти запрограммирован. Модель может показать достойный результат в лаборатории и тут же просесть в проде из-за задержек, особенностей live-данных или просто потому, что она не вписывается в реальный пользовательский сценарий. В Capital One говорят, что их AI-команды намеренно устроены так, чтобы соединять фундаментальные исследования и прикладные задачи под одной крышей. Логика прагматичная: чем раньше ограничения продакшена попадут в контур R&D, тем меньше шансов потратить месяцы на тупиковую ветку.

В качестве примера компания приводит собственные задачи в финансовом секторе: борьбу с мошенничеством, улучшение цифрового клиентского опыта и развитие клиентских AI-решений. Отдельно Боши упоминает исследование multi-agent-архитектур, где речь идет не просто о рассуждениях одной LLM, а о координации нескольких специализированных агентов под разные задачи. Один агент, условно, собирает контекст клиента, другой готовит документацию, третий помогает выстроить следующий шаг. По словам Capital One, эта работа поддержала запуск Chat Concierge — сервиса для покупки автомобиля, который должен не только отвечать на вопросы, но и действовать от имени клиента по его запросу. Здесь важен не маркетинговый лоск названия, а сам паттерн: исследование считается полезным не тогда, когда его можно показать на внутреннем семинаре, а когда из него вырастает рабочий продукт.

Вторая важная часть материала — довольно жесткий разбор того, как компании должны проверять идеи по дороге в AI в продакшене. Capital One предлагает смотреть на цепочку proof of concept, pilot и production не как на формальность, а как на серию реальных фильтров. Proof of concept, по версии Боши, обязан быть работающей машиной, а не слайдом о том, что когда-нибудь можно было бы сделать. Даже на ранней стадии нужен измеримый сигнал: система действительно выполняет задачу или нет, есть ли смысл двигаться дальше или команда просто влюбилась в идею. Для многих корпораций это неприятный тезис, потому что значительная часть AI-инициатив до сих пор существует в жанре «вот что мы могли бы автоматизировать», а не «вот конкретная операция, которую система уже делает с понятным качеством».

Не менее показательно ее отношение к пилотам. Негативный результат пилота, говорит Боши, — это не провал. Провал начинается в тот момент, когда любой пилот по определению объявляется успешным, потому что иначе кому-то придется признать, что гипотеза не взлетела. В такой логике пилот перестает быть точкой принятия решения и превращается в медленное, но почти неизбежное проталкивание в прод. Для инженеров, продактов и руководителей это, пожалуй, главный вывод материала: пилот должен расширять масштаб и реализм, а не служить церемонией перед релизом. Если на этом этапе система не помогает человеку выполнять реальную работу лучше, быстрее или надежнее, ее надо останавливать, сужать или переделывать. И это дешевле, чем потом героически тушить проблемы в боевой среде.

Третья мысль звучит банально только на первый взгляд: продакшен — командный вид спорта. В колонке прямо сказано, что решить модельную или алгоритмическую задачу — лишь часть работы. Дальше включаются software engineering, science, product, design, technical program management, operations и другие функции уровня предприятия. Для российского и вообще постсоветского рынка это особенно актуально: AI-проекты часто буксуют не из-за слабой модели, а из-за того, что ответственность размазана между R&D, платформенной командой, безопасностью, владельцем продукта и эксплуатацией. В результате никто не спорит, что идея перспективная, но никто не может провести ее через инфраструктуру, процессы согласования и реальную нагрузку. Capital One по сути говорит вслух то, что многие в индустрии предпочитают не формулировать: технический прорыв — это еще не половина успеха, а лишь допуск к следующему кругу проблем.

Отсюда и упор на измерения. Боши перечисляет базовые показатели вроде accuracy и latency и напоминает, что без внятных метрик улучшать систему невозможно. Формула «если вы не можете понять, стало ли лучше, значит, лучше не станет» звучит жестко, но по делу. Для бизнеса это означает отказ от оптики в пользу диагностики: меньше восторга от демо, больше внимания к качеству ответа, задержкам, стабильности и тому, как система ведет себя на реальных данных. Для разработчиков — еще один аргумент в пользу нормальной observability, контрольных наборов, регулярной переоценки и честного сравнения версий. Для HR и IT-руководителей — напоминание, что искать «одного сильного промпт-инженера» бесполезно, если вокруг нет процесса, который умеет валидировать и безопасно масштабировать результат.

Наконец, Capital One делает ставку не только на технологию, но и на культуру. Исследование, по словам Боши, неизбежно связано с неопределенностью, а значит, компании должны поощрять не показной оптимизм, а способность команды признать: «это не работает». Если такая фраза воспринимается как карьерная катастрофа, люди начинают не исправлять проблемы, а прятать их до последнего. Если же пилоты действительно могут закончиться остановкой, переосмыслением или сужением задачи, организация двигается быстрее и безопаснее одновременно. На практике это довольно редкая зрелость: большинству компаний комфортнее говорить о масштабировании AI, чем честно выбирать, какие идеи не заслуживают продакшена.

Из этой колонки вытекает неудобный, но полезный вывод: следующая гонка в enterprise AI, похоже, будет не за самой громкой моделью, а за дисциплиной внедрения. У кого лучше выстроена связка между исследованием, продуктом, инженерией и измерением результата, тот и получит рабочий AI в продакшене — не на сцене конференции, а в системах, где ошибка стоит денег, репутации и доверия пользователя.

Поделиться: Telegram X LinkedIn