AI И НЕЙРОСЕТИ

Red Hat AI 3.5 взялся за очереди к GPU в корпоративном AI

9 сентября Red Hat выпустила AI 3.5 с multi-tenancy, приоритетами для GPU, EvalHub и наблюдаемостью для корпоративных AI-сервисов.

✍️ Редакция iTech News | 11.09.2026 | ⏱ 4 мин | Источник: The New Stack
💡

Red Hat AI 3.5 вышел 9 сентября и целится в очень земную проблему корпоративного AI: кто первым получает дорогой GPU, когда пилот внезапно становится сервисом для бизнеса. Для русскоязычных команд это не абстрактная история про платформы, а знакомый конфликт между экспериментами, SLA и бюджетом на ускорители.

Новая версия Red Hat AI добавляет приоритетное планирование GPU, изоляцию арендаторов и проверки безопасности до выката, сообщает The New Stack. Идея проста: AI-нагрузки должны жить не как набор хрупких демо в соседнем кластере, а как обычная критичная инфраструктура — с правами доступа, метриками, лимитами, очередями и понятной ответственностью.

Главный акцент релиза — multi-tenancy для AI-платформ. Red Hat говорит о сценариях, где нескольким командам или клиентам нужно делить одну GPU-инфраструктуру, но не смешивать данные, модели и права доступа. Для более жесткой изоляции компания заявила поддержку hosted control planes на Red Hat OpenShift Virtualization: у каждого арендатора может быть свой control plane, при этом физическая инфраструктура консолидируется. AI-нагрузки также можно запускать в виртуальных машинах OpenShift Virtualization, чтобы получить VM-уровень изоляции поверх общих серверов с GPU.

Вторая важная часть — priority-aware serving. В обычном пилоте все выглядят равными: один разработчик тестирует RAG, другой гоняет пакетную задачу, третья команда показывает внутреннего агента директору. В продакшене такая демократия быстро заканчивается. Red Hat AI 3.5 добавляет admission control, политики справедливого распределения и защиту от starvation, чтобы критичные запросы не простаивали за фоновыми задачами. Если клиентский агент должен отвечать с предсказуемой задержкой, он получает приоритет; пакетная обработка документов подождет. Никакой магии, просто наконец-то взрослая диспетчеризация.

Отдельный блок релиза связан с безопасностью и проверкой моделей. EvalHub стал общедоступным инструментом для оценки моделей, RAG-сценариев и агентов до развертывания. В каталоге Red Hat появились более 20 валидированных моделей, включая модели от Google, NVIDIA и Alibaba Cloud; для них заявлены benchmark-данные, а также оценки рисков через Garak, включая безопасность, утечки персональных данных и токсичность. Это не заменяет внутренний аудит, но дает платформенной команде стартовую доказательную базу, а не очередной Excel с колонкой «вроде норм».

Наблюдаемость тоже подтянули ближе к реальности эксплуатации. В Red Hat AI 3.5 появились панели для inference health, загрузки GPU, производительности моделей и потребления токенов. Важная деталь для больших организаций — showback по пользователям: можно смотреть, кто и сколько потребляет, даже если биллинг внутри компании пока не превращен в полноценный chargeback. Для IT-директора это способ перестать обсуждать AI-бюджет в стиле «куда-то ушли деньги на облако» и начать говорить предметно: какая команда, какая модель, какой workload, какая польза.

Red Hat также двигает релиз в сторону agentic AI. В AI Hub появились шаблоны агентов и starter kits для типовых корпоративных сценариев: code review, обработка документов, исследовательские workflow. AutoRAG связывает корпоративные репозитории данных с агентскими приложениями, добавляя поддержку многоязычных документов, conversational testing и настройку retrieval-пайплайнов через визуальный интерфейс. Для разработчиков это может сократить путь от «у нас есть база знаний и модель» до проверяемого RAG-сервиса, хотя всю тяжелую работу с качеством данных за них платформа, конечно, не сделает.

Есть и инфраструктурные улучшения для вывода моделей в продакшен. Controlled deployments позволяют катить новую версию модели через canary-подход: часть трафика идет на обновление, текущие запросы завершаются без обрыва, а при плохом результате можно откатиться без простоя. CPU offloading стал общедоступным, а NVMe storage offload для KV cache находится в developer preview; оба механизма нужны для длинных диалогов и больших документов, когда память GPU становится узким местом. Distributed inference с llm-d расширили за пределы OpenShift: CoreWeave CKS и Microsoft Azure AKS получили статус general availability, Amazon EKS пока идет как technology preview.

Для рынка это сигнал, что вендоры инфраструктуры перестают продавать AI как отдельный блестящий остров и начинают упаковывать его в привычные механики платформенной инженерии. Kubernetes, RBAC, virtualized isolation, observability, rollout-политики, распределение очередей — все это звучит скучнее, чем «агенты сами напишут вам квартальный план», зато именно на таких скучных вещах AI-пилоты либо взрослеют, либо остаются презентацией на внутреннем митапе.

Для российских и русскоязычных команд практический вывод довольно прямой: если AI уже вышел за пределы лаборатории, вопрос не только в выборе модели. Нужны правила доступа к GPU, изоляция данных, метрики потребления, проверка рисков и понятный путь обновления моделей. Red Hat AI 3.5 не закрывает всю эту головную боль одним релизом, но хорошо показывает, куда движется корпоративный AI: меньше романтики пилотов, больше дисциплины платформы.

Поделиться: Telegram X LinkedIn