Nvidia все активнее продвигает не спор между облаком и локальным запуском, а их совместную работу. Для рынка это важный сдвиг: локальные модели ИИ компания уже предлагает запускать на рабочей станции за $4699, а тяжелые задачи по-прежнему отдавать frontier-моделям в облаке. Для разработчиков и IT-команд сигнал простой: архитектура с одним-единственным «умным API на все случаи» быстро устаревает.
Об этом, как пишет The New Stack, рассказал Джоуи Конуэй, старший директор Nvidia по ПО для генеративного ИИ. Его тезис звучит без лишней поэзии: задачи слишком разные, чтобы их всегда решала одна модель. Простые запросы выгоднее и быстрее отправлять в локальные модели, сложные — в более мощные frontier-системы, а между ними нужен роутер, который выбирает лучший вариант по цене, задержке и типу задачи. Иными словами, индустрия уходит от идеи «одна большая модель на все» к схеме, где под капотом работает целая бригада узких специалистов.
В Nvidia этот подход называют чем-то вроде системы моделей. Конуэй приводит понятный пример: ранние reasoning-модели могли тратить ресурсы на примитивные действия, буквально «размышляя» над тем, сколько будет два плюс два. Если такой запрос можно закрыть быстро и дешево, нет смысла гонять его через дорогую модель с длинной цепочкой рассуждений. Логика здесь не философская, а вполне бухгалтерская: меньше стоимость инференса, ниже задержка, выше предсказуемость. Для продакшена это важнее красивых демо.
При этом Nvidia аккуратно показывает, где именно хочет зарабатывать в этой схеме. Пока компания ставит акцент не столько на сам верхний слой с роутерами, сколько на инфраструктуру под ним. В качестве примера Конуэй упоминает открытый inference-сервер Dynamo: он направляет запрос на тот GPU, который уже обрабатывал этот контекст, чтобы не терять эффективность на переносах и переинициализации. Какой именно модели поручить задачу, решают уже внешние или прикладные роутеры. Но оговорка у Nvidia показательная: компания не исключает, что со временем будет строить и больше логики маршрутизации сама. То есть играть только роль поставщика «лопат» она явно не собирается.
Самый конкретный аргумент в пользу такого гибридного подхода Nvidia подкрепляет цифрами. В материале упоминается совместная работа с LangChain: их Deep Agents harness запускался на открытой модели Nemotron 3 Ultra с 550 млрд параметров и, по словам Конуэя, показывал сопоставимый результат с ведущими закрытыми моделями в бизнес-задачах при стоимости до 10 раз ниже. Важная деталь: прирост обеспечила не переобученная модель, а настройка обвязки вокруг нее — промптов, описаний инструментов и middleware. Для команд, которые привыкли искать спасение только в следующем релизе модели, это неприятный, но полезный вывод: иногда экономику проекта ломает не сам LLM, а посредственная инженерия вокруг него.
Локальный сценарий Nvidia продает не только через экономию, но и через контроль. Конуэй прямо говорит: компаниям важно держать данные и особенно интеллектуальную собственность внутри своего контура. Отсюда формула «переместите ИИ туда, где живут данные, или туда, где находятся сотрудники». В этой логике локальные модели ИИ становятся не игрушкой для энтузиастов, а способом встроить модель в корпоративную среду без постоянной отправки чувствительных данных внешнему поставщику. Для банков, промышленности, телекомов и крупных аутсорсеров это уже не идеология open source, а вопрос комплаенса, суверенности и предсказуемых рисков.
Под такую стратегию Nvidia подводит и железо. В статье упомянут DGX Spark — машина на Grace Blackwell с 128 ГБ объединенной памяти и ценой $4699, рассчитанная на запуск моделей примерно до 200 млрд параметров без вывода данных за пределы рабочего места. Для более крупных сценариев есть DGX Station с 748 ГБ RAM. Понятно, что «настольный ИИ» в таком исполнении все еще не про массовый ноутбук разработчика, а скорее про дорогую профессиональную рабочую станцию. Но сам факт, что вендор уже обсуждает локальный запуск сотнемиллиардных моделей как практическую конфигурацию, а не футуристическую зарисовку, хорошо показывает, как быстро сдвигается планка.
Отдельный слой — безопасность агентных систем. Nvidia здесь предлагает NemoClaw, референсный стек, который объединяет открытый agent harness OpenClaw, песочницу OpenShell, политики контроля и локальный инференс Nemotron. Смысл понятен: если вы хотите запускать агентов рядом с корпоративными данными, одной модели мало, нужен еще и каркас, который ограничивает ее доступ, действия и окружение. Для бизнеса это, пожалуй, даже важнее самой дискуссии о локальных и облачных моделях. Агент без guardrails быстро превращается из ассистента в дорогой источник инцидентов.
Для рынка в целом позиция Nvidia выглядит прагматично и немного хитро. Если клиент запускает модель у себя, он все равно покупает ускорители и системное ПО Nvidia. Если уходит в облако за frontier-моделью, велика вероятность, что под капотом снова работает Nvidia. Поэтому компания может совершенно искренне любить мир, где сосуществуют оба подхода. Для разработчиков и IT-руководителей из этого следует более приземленный вывод: проектировать ИИ-сервисы теперь разумно как систему из нескольких уровней — с локальным слоем для приватности, дешевых и быстрых задач и с внешним слоем для пикового интеллекта. Вопрос уже не в том, победят ли локальные модели ИИ облако. Вопрос в том, насколько быстро команды научатся собирать из этого нормальную архитектуру, а не очередной аттракцион из дорогих токенов и плохо прирученных агентов.