AI И НЕЙРОСЕТИ

CUDA на AMD в Windows: энтузиаст связал ZLUDA и ROCm

13 278 SPS показал тест CUDA-нагрузки на Radeon RX 9060 XT через ZLUDA и ROCm в Windows. Но до замены NVIDIA далеко.

✍️ Редакция iTech News | 15.09.2026 | ⏱ 4 мин | Источник: Tom's Hardware
🎓

CUDA на AMD в Windows снова перестала звучать как форумная магия: одиночный разработчик запустил часть CUDA-зависимых библиотек на Radeon RX 9060 XT без виртуалки, WSL2 и двойной загрузки. Для разработчиков, которые регулярно упираются в репозитории с жёстким требованием NVIDIA, это не готовая замена CUDA-стеку, но уже рабочий обходной путь для экспериментов.

Проект Speedstu под названием CUDA-for-AMD-Windows связывает ZLUDA, слой трансляции CUDA-вызовов, с HIP/ROCm SDK для Windows, сообщает Tom's Hardware. Это не новый рантайм и не драйвер уровня производителя, а набор PowerShell-скриптов, который автоматизирует настройку: определяет архитектуру GPU, подтягивает закреплённую версию ZLUDA v6-preview.69 и пытается сопоставить CUDA-библиотеки с доступными аналогами в ROCm.

В демонстрации автору удалось перехватить и перенаправить CUDA Driver API, а также завести cuBLAS, cuSPARSE и cuFFT поверх AMD-эквивалентов. Для проверки он обучил PPO-модель reinforcement learning на 2,2 млн параметров с неизменёнными CUDA-библиотеками на Radeon RX 9060 XT. Пока это единственная официально поддержанная видеокарта в проекте, так что владельцам других Radeon лучше держать под рукой не только энтузиазм, но и план отката.

Контекст здесь важнее самого трюка. AMD в последних обновлениях ROCm наконец дала Windows-пользователям более внятную официальную поддержку PyTorch и HIP SDK для потребительских GPU Radeon RX 7000 и RX 9000. Для нативных фреймворков это большой шаг: локальная разработка под AI на Windows-машине с Radeon уже не выглядит наказанием за экономию на видеокарте. Но реальная жизнь устроена грубее документации: старые GitHub-репозитории, проприетарные инструменты и экспериментальные AI-пайплайны часто проверяют наличие CUDA в лоб и на этом разговор заканчивают.

Именно в эту щель попадает CUDA-for-AMD-Windows. Проект работает как адаптер для софта, который не знает или не хочет знать про HIP. Разработчику не нужно ждать, пока автор заброшенного репозитория сделает порт под AMD, и не нужно собирать отдельную Linux-среду ради одного эксперимента. Для домашней рабочей станции или лабораторного стенда это может сэкономить вечер, а иногда и несколько дней борьбы с зависимостями.

В бенчмарках проекта есть цифры, но читать их надо без фанфар. На workload с PPO-моделью 2,2 млн параметров публичный путь на официальной ZLUDA и штатном AMD HIP SDK 6.4 показал медиану 13 278,46 steps per second. Альтернативный recovered custom overlay на восстановленных старых бинарниках ZLUDA оказался медленнее: 12 875,80 SPS, примерно минус 3%. По отдельным метрикам разрыв тоже не драматичный, но заметный: collection SPS ниже на 6,23%, inference time выше на 7,33%, PPO learn time выше на 2,75%.

Главное ограничение: крупные куски CUDA-мира пока не взлетели. cuDNN, TensorRT и NCCL в проекте не resolve-ятся, а значит многие ML-задачи, особенно связанные с нейросетевым обучением и инференсом через распространённые фреймворки, просто упадут. Если ваш инструмент глубоко завязан на cuDNN, этот мост закончится прямо посреди реки. Сам ZLUDA тоже не живёт жизнью корпоративного продукта: после потери коммерческого финансирования проект поддерживается как хобби-разработка.

Для бизнеса вывод довольно прозаичный. Ставить такой стек в production, строить на нём SLA и обещать отделу закупок независимость от NVIDIA рано. Зато для R&D, проверки гипотез, локальных экспериментов и запуска капризных CUDA-only тулов на Windows-машинах с Radeon это интересный сигнал. Барьер здесь всё больше похож не на железобетонную стену, а на набор несовместимых ABI, библиотек и ожиданий, которые можно частично обойти инженерной настойчивостью.

CUDA на AMD пока не превращает Radeon в drop-in замену GeForce или RTX для любого AI-сценария. Но сам факт, что одиночный open source-разработчик смог связать ZLUDA, ROCm и часть CUDA-библиотек в воспроизводимый Windows-пайплайн, меняет тон разговора: вопрос уже не в том, возможно ли это вообще, а в том, сколько библиотек сообщество сможет дотащить до рабочего состояния. Подробности и исходный инфоповод доступны у Tom's Hardware.

Поделиться: Telegram X LinkedIn