vCluster опубликовал практическую схему, в которой несколько команд получают собственные Kubernetes-кластеры поверх одной GPU-инфраструктуры, а Nvidia KAI Scheduler распределяет ускорители по квотам и очередям. Для платформенных команд это способ не разворачивать отдельный Kubernetes на каждый проект для ИИ и не держать дорогие GPU полупустыми.
Отдельный кластер на каждую команду слишком дорог
Обычный компромисс знаком любой платформе машинного обучения: либо выдавать каждой команде свой кластер и мириться с низкой загрузкой GPU, либо сажать всех в один Kubernetes и ловить конфликты CRD, RBAC и версий операторов. В документации vCluster решение описано как виртуальная плоскость управления: у каждой команды свой API-сервер, свои CRD и свои правила доступа, а физические узлы и GPU остаются общими.
Nvidia здесь отвечает не за всю архитектуру, а за планировщик. KAI Scheduler компания открыла 1 апреля 2025 года под лицензией Apache 2.0 как часть технологий Run:ai. Планировщик умеет иерархические очереди, честное распределение ресурсов, учет топологии и дробное выделение GPU.
Как связка KAI Scheduler и vCluster работает на практике
В этой схеме vCluster виртуализирует плоскость управления Kubernetes, а KAI Scheduler планирует реальные задачи на базовом кластере. Для интеграции нужен один нетривиальный шаг: vCluster рекомендует отключить owner references через experimental.syncSettings.setOwner: false, иначе pod-grouper KAI упирается в права на объекты Service.
После этого команды могут запускать задания с schedulerName: kai-scheduler. В примерах vCluster есть и обычный запрос на nvidia.com/gpu: 1, и дробный режим gpu-fraction: 0.5. Перевод на русский простой: один GPU можно делить между несколькими менее прожорливыми задачами, а не бронировать целиком «на всякий случай».
Значение для рынка
Для российских и СНГ-команд, которые чаще собирают GPU-инфраструктуру в собственной серверной или частном облаке, это полезно в двух сценариях: внутренние платформы для ИИ и безопасные стенды для тестирования новых планировщиков. Но чудес не будет: сам KAI не изолирует видеопамять при дробном использовании GPU. Поэтому для внешних клиентов, недоверенных арендаторов и строгих требований по безопасности по-прежнему надежнее отдельные узлы или полноценные приватные кластеры.
Оригиналы: , и .
Следующий логичный шаг — проверить, останется ли эта схема удобным испытательным контуром или начнет массово переходить в боевые платформы для ИИ.