У Microsoft в каталоге Azure AI Foundry уже 11 тысяч моделей, а новый роутер, по данным компании, может снизить расходы на инференс до 50% и ускорить ответы на 40%. Для рынка это важный сигнал: маршрутизация AI-моделей из экзотики для продвинутых команд превращается в базовую архитектурную практику, и русскоязычным разработчикам, продактам и IT-руководителям стоит смотреть не на «лучшую модель вообще», а на связку цена-латентность-качество под конкретный сценарий.
Как пишет The New Stack, свежие анонсы Microsoft показывают довольно болезненное признание: ставка на один-единственный «главный» foundation model для enterprise-задач перестает работать. В Azure AI Foundry компания вывела в общий контур model router, который автоматически выбирает модель под каждый запрос. Идея простая, но для крупных внедрений почти неизбежная: простые задачи не надо гонять через дорогой reasoning-стек, а сложные не стоит отправлять на слишком компактные модели только ради экономии.
На практике Microsoft упаковывает это в платформенный сервис. По данным ITPro, функция model router уже доступна в общем доступе в Microsoft Foundry и умеет переключать запросы между несколькими семействами моделей, исходя из сложности промпта, стоимости и задержки. На старте речь шла, в частности, о DeepSeek-v3.1, семействе GPT-4.1, семействе GPT-5, GPT-oss-120b, Grok-4, Grok-4-fast и нескольких вариантах Llama. Это уже не история про «мы поддерживаем OpenAI и на всякий случай что-то еще». Это история про полноценную маршрутизацию AI-моделей, где поставщик облака сам говорит клиенту: не фиксируйтесь на одном вендоре и одном классе моделей.
Показательна и формулировка самого Microsoft. Корпоративный вице-президент AI Platform Эрик Бойд объяснил, что несколько лет назад у клиентов было «две-три модели, которые имели значение», а теперь в каталоге Foundry уже 11 тысяч позиций, и одиночному разработчику или даже отдельной команде физически трудно осмысленно выбирать между ними. Это, пожалуй, главный сдвиг 2025-2026 годов: проблема enterprise AI теперь не только в том, как подключить LLM к данным и бизнес-процессу, но и в том, как не утонуть в собственном зоопарке моделей, тарифов, лимитов и SLA.
Контекст здесь тоже важен. Последние полтора года крупные компании пытались стандартизироваться на одном «любимом» поставщике: где-то это был OpenAI, где-то Anthropic, где-то Gemini, а где-то внутренняя ставка на open-weight-модели. Логика была понятной: единый стек проще закупать, сертифицировать, подключать к guardrails и объяснять безопасникам. Но реальная эксплуатация быстро показала неприятную вещь: один и тот же LLM плохо подходит одновременно для саппорта, генерации кода, внутреннего поиска, агентных workflow и обработки документов. Где-то критична цена, где-то задержка, где-то качество reasoning, а где-то важнее контролируемость и возможность донастройки. Именно поэтому маршрутизация AI-моделей становится не маркетинговой фичей, а способом навести экономический порядок.
Эту смену логики подтверждает и Сатья Наделла. В интервью Business Insider, опубликованном 27 июня 2026 года, глава Microsoft прямо сказал, что в мире должно быть «столько моделей, сколько компаний», потому что бизнес нельзя сводить к аренде чужого интеллекта без собственной настройки под данные, контекст и процессы. Наделла отдельно подчеркнул, что не хочет быть запертым в одной модели и предпочитает возможность использовать open-weight или fine-tuned-подход там, где это эффективнее по цене. Для Microsoft это почти идеологический разворот: компания остается ключевым партнером OpenAI, но одновременно строит платформу, в которой ценность создает не одна звездная модель, а оркестрация множества вариантов.
Для разработчиков и продуктовых команд отсюда следует довольно приземленный вывод. Архитектура AI-продукта теперь все чаще будет состоять из нескольких слоев: policy engine, который решает, куда отправить запрос; набора моделей под разные классы задач; observability и cost monitoring; плюс корпоративного слоя данных и безопасности. То есть выбирать придется уже не «GPT или Claude», а проектировать систему маршрутизации: когда эскалировать запрос на более дорогую модель, где хватит компактной open-weight-альтернативы, как учитывать токен-экономику, как логировать качество ответа и как не потерять контроль над агентами, которых в компании внезапно стало не три, а триста.
Для бизнеса новость тоже неприятно отрезвляющая. Покупка доступа к одной сильной модели больше не гарантирует ни предсказуемых затрат, ни нормальной производительности на масштабе. Если верить данным Microsoft по early access-клиентам, выигрыш от автоматического роутинга уже измеряется десятками процентов по стоимости и скорости. А это означает, что следующий раунд конкуренции на рынке enterprise AI пойдет не только между моделями, но и между платформами, которые умеют дешево и прозрачно распределять нагрузку между ними. Вопрос теперь не в том, какая модель победит. Вопрос в том, какая компания первой научится превращать модельное многообразие в управляемую инфраструктуру, а не в дорогой хаос.