Coinbase, по данным The New Stack, уже держит в работе 1200 AI-агентов и при этом смогла сократить свои расходы на ИИ примерно вдвое относительно пиковых значений. Для русскоязычной IT-аудитории здесь важна не сама цифра, а архитектурный вывод: мультимодельная AI-инфраструктура быстро становится не красивой схемой для конференций, а способом не сжечь бюджет, когда агентные сценарии выходят в прод.
В центре истории две компании с очень разным профилем. Vercel строит платформу для разработки и доставки веб-приложений, Coinbase управляет одной из крупнейших криптобирж. Но ставка у них одна: не привязываться к одному поставщику моделей и не считать, что самый дорогой frontier-LLM должен решать вообще все задачи. Такой подход еще год назад выглядел как инженерская перестраховка. Теперь это скорее базовая гигиена для компаний, где AI начинает работать на постоянной основе, а не в режиме демонстрации для инвесторов.
Coinbase в этой логике выглядит особенно показательно. Компания уже использует крупный парк агентов, и это автоматически превращает AI из инструмента для отдельных команд в инфраструктурный слой с обычными для инфраструктуры вопросами: стоимость, маршрутизация, наблюдаемость, выбор моделей под разные классы задач. По сути, когда у тебя не один ассистент в IDE, а сотни и тысячи автономных или полуавтономных процессов, экономика запросов начинает интересовать не меньше, чем качество ответов. Именно поэтому история про «сократили счет почти вдвое» звучит для CTO куда важнее, чем привычные рассказы о том, как AI ускорил написание черновиков.
Судя по описанию кейса, Coinbase не просто урезала расходы, а изменила сам принцип потребления моделей. Вместо идеи «берем лучшую модель и льем в нее весь трафик» компания делает ставку на маршрутизацию запросов и подбор модели под конкретную задачу. Это хорошо ложится на публичные комментарии CEO Coinbase Брайана Армстронга летом 2026 года: он уже говорил о model routing, о более дешевых моделях по умолчанию для части сценариев, о кэшировании и о том, что дорогие флагманские модели не нужны для каждой операции. Такой сдвиг выглядит довольно трезво. Планирование, сложное рассуждение и оркестрация агентов можно отдавать более сильным моделям, а рутинные шаги, исполнение или промежуточные операции — дешевым альтернативам, включая open-weight-модели.
Для рынка это важный сигнал еще и потому, что его озвучивают не лаборатории и не вендоры GPU, а пользователи с реальной нагрузкой. Глава Vercel Гильермо Раух и глава Coinbase Брайан Армстронг приходят к одной и той же схеме с разных концов: один со стороны платформы и developer experience, другой со стороны бизнеса, где цена ошибки и цена инфраструктуры быстро становятся очень материальными. Когда такие компании сходятся в архитектурной ставке, это обычно означает, что рынок выходит из подростковой фазы «давайте просто подключим самый модный API» и входит в фазу нормальной инженерии с выбором по latency, quality, cost и reliability.
Для разработчиков и продуктовых команд из этого следует довольно приземленный вывод. Мультимодельная AI-инфраструктура требует не только gateway для LLM, но и набора дисциплин вокруг него. Нужны правила маршрутизации, профили задач, метрики по стоимости на пользовательский сценарий, кэширование, контроль контекста, а главное — понимание, где сильная модель действительно приносит дополнительную ценность, а где она просто дороже. Иначе агентная система быстро превращается в черный ящик, который выглядит впечатляюще на демо, но в конце месяца присылает неприятный счет. Для бизнеса это, в свою очередь, меняет способ оценки AI-проектов: уже недостаточно сказать, что команда «ускорилась с помощью ИИ». Придется показывать, какой стек это ускорение обеспечивает и как он масштабируется без пропорционального роста затрат.
Отдельно интересно, что разговор смещается с моделей как таковых на слой оркестрации. Побеждает не тот, кто просто подключил OpenAI, Anthropic или Gemini, а тот, кто умеет собрать из разных моделей рабочую систему, где дорогой интеллект включается точечно. В этом смысле AI начинает все сильнее напоминать облачную инфраструктуру десятилетней давности: сначала рынок мечтал о единственном поставщике, потом пришли multi-cloud, FinOps и прагматика. Теперь ту же школу, похоже, проходит генеративный стек.
Главный вопрос на ближайший год звучит уже не так: «какая модель лучшая?», а так: «какая архитектура позволит держать тысячи агентов в проде без взрыва расходов и деградации качества?». Если кейс Coinbase не исключение, а ранний маркер тренда, то следующая конкурентная гонка развернется не вокруг громкости релизов, а вокруг умения собрать дешевую, управляемую и устойчивую агентную платформу.