Пока индустрия спорит о качестве моделей, инфраструктура production AI уже трещит под более приземленной нагрузкой. На 63-минутной панели InfoQ эксперты из Forge, Cockroach Labs, Doubleword и MESA сформулировали неприятный, но полезный вывод: собрать AI-сервис стало проще, чем удержать его в продакшене без каскадных сбоев, перерасхода бюджета и удушья по данным.
Панель под названием The Infrastructure Challenge Behind Production AI, как пишет InfoQ, модерировал редактор и cloud-эксперт Ренато Лозио. В разговоре участвовали основатель-инженер Forge Симерус Махеш, senior systems engineer Cockroach Labs Алекс Инфанзон, сооснователь и CTO Doubleword Мерьем Арик и CTIO компании MESA Лука Бьянки. Исходная точка дискуссии была предельно практичной: AI в компаниях перестал быть пилотом для пары энтузиастов и все чаще работает как постоянный слой над бизнес-операциями. А это значит, что вопрос уже не в том, можно ли собрать модельный пайплайн, а в том, выдержит ли его остальная система.
Самая жесткая мысль прозвучала от Мерьем Арик. По ее словам, команда Doubleword еще четыре года назад делала ставку на две вещи: открытые модели будут усиливать позиции из-за стоимости, производительности и приватности, а расходы на токены станут для компаний отдельной проблемой. Ошиблись они, по сути, только в масштабе. Если ожидался рост совокупных затрат на токены примерно в 10 раз в год, то в реальности, по наблюдению Арик, для многих организаций он скорее идет по траектории 100x. Это уже не просто неприятная строка в бюджете. Это сценарий, в котором приложение, спроектированное под текущую нагрузку, через год внезапно оказывается маленьким, дорогим и нервным. И да, знаменитый парадокс Джевонса, который все любят вспоминать на конференциях, в этом случае работает без скидок: чем дешевле и доступнее становятся вычисления, тем охотнее бизнес их потребляет.
Алекс Инфанзон добавил к этому другой слой проблем. На поверхности все привыкли говорить о дефиците GPU, но, по его словам, в реальных разговорах с AI-native-компаниями и платформенными командами всплывают менее гламурные ограничения. Во-первых, электричество и сама физика дата-центров: если строить или серьезно расширять мощности, планировать приходится на годы вперед, с оглядкой на доступность энергии. Во-вторых, внезапно дорожает и усложняется слой данных. Традиционные базы, заточенные под более предсказуемые транзакционные профили, не всегда подходят под высокую скорость, постоянные обращения, трассировку агентных систем и хранение операционных следов AI-приложений. Речь не только о логах ради любопытства. Эти данные нужны, чтобы понимать поведение агентов, считать расход токенов, отслеживать память и разбирать сбои не по гаданию, а по фактам.
Лука Бьянки сформулировал то, что многим разработчикам и архитекторам уже знакомо интуитивно: AI меняет сам профиль нагрузки. Если раньше система жила в логике «у нас в основном базы данных», то теперь, как он выразился, нагрузка стала «про токены». Это не косметическая замена терминов. Меняется ритм вызовов, зависимость от внешних провайдеров, характер пиков, требования к задержкам и устойчивости. В регулируемых секторах, где работает MESA, такая перестройка особенно болезненна: там нельзя просто сказать пользователю «попробуйте еще раз позже». И здесь первый дефицитный ресурс, по мысли участников, не всегда GPU и не обязательно сеть. Очень часто раньше заканчивается надежность внешней системы, от которой зависит ваш сервис: облачный провайдер, inference API, база, оркестрация, любая точка, где чужой SLA внезапно становится вашей ночной аварией.
Для инженерных руководителей главный вывод звучит без сантиментов: прототип и production AI живут в разных мирах. Пока команда радуется тому, что агент «в принципе работает», под капотом уже копится технический долг в области хранения данных, наблюдаемости, capacity planning и отказоустойчивости. Инфанзон прямо сказал, что самые интересные разговоры с заказчиками у него теперь не о моделях, а об инфраструктуре под ними. Это важный сдвиг для рынка. Еще недавно конкурентным преимуществом считалось быстрее всех прикрутить LLM к продукту. Теперь преимущество у тех, кто умеет держать под контролем стоимость токенов, не терять состояние приложений, видеть деградацию заранее и проектировать систему так, чтобы рост нагрузки не превращался в катастрофический отказ. С инженерной точки зрения это возвращает в центр внимания довольно старые, но недооцененные дисциплины: работу с распределенными данными, очередями, кэшированием, ретраями, лимитами, деградационными сценариями и экономикой запросов.
Для русскоязычной IT-аудитории здесь нет экзотики, только полезное напоминание. Если компания строит AI-функции поверх существующего продукта, ей придется переучивать не только ML-инженеров, но и backend, platform, SRE и FinOps-команды. Если стартап с рождения AI-native, то соблазн решать все новой моделью тоже быстро заканчивается: в проде выигрывает не самая эффектная демка, а та, которая не сжигает бюджет на токены и не падает при первом же серьезном росте спроса. Инфраструктура production AI перестает быть внутренним делом платформенной команды и становится прямым фактором юнит-экономики, сроков вывода продукта и доверия со стороны клиентов.
Открытый вопрос теперь не в том, смогут ли компании встроить AI в свои процессы, а в том, кто успеет перестроить архитектуру раньше, чем рост нагрузки и зависимости от внешних систем начнут диктовать продуктовую стратегию. Судя по разговору на InfoQ, ближайшие победители в этой гонке будут отличаться не количеством моделей в стеке, а тем, насколько трезво они проектируют инфраструктуру production AI еще до первого большого сбоя.