КИБЕРБЕЗОПАСНОСТЬ

GPUThor обходит ECC на NVIDIA GPU и ведет к root-доступу

GPUThor за 1,1 минуты находит пригодный bit flip на NVIDIA Ampere и обходит ECC, открывая путь к DoS и повышению привилегий до root.

✍️ Редакция iTech News | 27.08.2026 | ⏱ 5 мин | Источник: BleepingComputer

Атака GPUThor показала неприятную для рынка вещь: ECC-защита на профессиональных GPU NVIDIA не гарантирует, что Rowhammer останется только академической страшилкой. Исследователи добились DoS и продемонстрировали сценарий повышения привилегий до root на хост-системе, а для команд, которые делят GPU между несколькими задачами, это уже не лабораторная экзотика, а вполне прикладной риск.

О новой технике сообщает BleepingComputer со ссылкой на работу исследователей из Университета Торонто. Речь идет о развитии класса атак Rowhammer, где злоумышленник многократно обращается к строкам памяти, чтобы спровоцировать битовые сбои в соседних областях. На CPU этот сюжет давно известен, но в GPU-мире его долго сдерживали как практические ограничения, так и внедрение ECC. Теперь выяснилось, что на части ускорителей NVIDIA этот барьер можно обойти.

Что именно сломали

GPUThor протестировали на рабочих видеокартах NVIDIA поколения Ampere с памятью GDDR6: RTX A4000, RTX A4500, RTX A5000 и RTX A6000. Это не маргинальные модели из дальнего угла рынка, а вполне обычные карты для AI-задач, визуализации и облачной инфраструктуры. Авторы работы пишут, что их новая схема заметно практичнее прошлых концептов вроде GPUHammer и GPUBreach, которые фактически потеряли остроту после появления ECC.

Ключевой трюк в том, что исследователи не просто «били» по памяти чаще, а подобрали неравномерный шаблон hammering-доступов, который помогает обходить механизм Target Row Refresh в GDDR6. Для этого они опирались на два плохо документированных поведения GPU: как объединяются повторяющиеся запросы к памяти и как часто вообще срабатывает TRR. В результате, по их данным, удалось получить в 6,6 раза больше активаций строк-агрессоров, чем у прошлых вариантов атаки, а интенсивность bit flip выросла до диапазона от 72 тысяч до 377 тысяч переворотов на гигабайт на тестовых GPU без включенной ECC.

На бумаге это выглядит как «еще один коэффициент», но practically именно здесь начинается проблема. По сравнению с GPUHammer новая схема оказалась сильнее в 4548-23597 раз, а время на поиск потенциально пригодного для эксплуатации переворота сократилось примерно с 21,9 часа до 1,1 минуты. Для атакующего это разница между редкой удачей и повторяемым сценарием. Для инженеров эксплуатации и SecOps это уже не тема из разряда «когда-нибудь в следующих поколениях железа», а повод посмотреть на конфигурацию существующих серверов и рабочих станций.

Почему ECC не спасает

NVIDIA использует схему SECDED ECC: одиночные ошибки она исправляет, двойные обнаруживает. Проблема в том, что обнаружить не значит нейтрализовать. В ходе экспериментов с включенной ECC исследователи получили 387 двойных ошибок, которые механизм заметил, но не смог исправить, и еще две тройные ошибки, которые были исправлены некорректно, что уже привело к повреждению данных. Для среды, где на GPU крутятся длительные вычисления, обучение моделей или общие сервисы нескольких команд, такой класс сбоев неприятен сразу в двух измерениях: он и бьет по доступности, и открывает дорогу к более опасным сценариям.

Первый сценарий относительно прямолинейный: DoS. На ECC-включенной RTX A6000 исследователи вызвали состояние, при котором GPU сбрасывался примерно раз в два часа, обрывая все текущие задачи. При повторении атаки на той же карте устройство в итоге могло пометить себя как требующее замены. Для облачного провайдера или внутреннего кластера это уже не просто «ошибка вычислений», а риск ложной аппаратной деградации, простоя задач и лишних расходов на диагностику и замену железа.

Второй сценарий интереснее и тревожнее: повышение привилегий. По данным авторов, через повреждение таблиц страниц GPU можно дать непривилегированной CUDA-программе произвольный доступ к памяти, а дальше дотянуться и до root-shell на хосте. Важная оговорка: это демонстрация исследовательской эксплуатации, а не сообщение о массовых атаках в дикой природе. Но сам факт, что цепочка выходит за пределы «падает GPU-задача» и упирается в контроль над системой, резко меняет разговор о multi-tenant средах и о том, кому вообще можно доверять запуск CUDA-кода.

Отдельно неприятно, что вопрос не ограничивается только четырьмя подтвержденными моделями. Исследователи считают, что серверные Ampere-ускорители вроде A100, несмотря на большую устойчивость к DoS, все еще уязвимы к повышению привилегий, потому что опираются на тот же уровень ECC-защиты SECDED. В некоторых Blackwell GPU функция RAS Repair делает атаку более долгой, но не закрывает ее полностью. Авторы также допускают, что даже GPU с HBM3/e и GDDR7 с on-die ECC могут оказаться уязвимыми, если удается вызвать многобитные перевороты. Иными словами, проблема выглядит не как баг одной линейки, а как более глубокий архитектурный вопрос о том, что считать достаточной защитой памяти в эпоху повсеместного GPU-шеринга.

NVIDIA получила уведомление от исследователей 29 апреля 2026 года, а 21 августа опубликовала advisory с рекомендациями. Компания советует включать одновременно SYS-ECC и IOMMU/DMA isolation, следить за телеметрией ошибок GPU и ограничивать совместное использование ускорителей либо запуск недоверенных нагрузок. При этом NVIDIA отдельно отмечает, что риск зависит от конкретного DRAM-устройства, типа памяти, дизайна платформы и системной конфигурации; на протестированных GDDR6X- и HBM2e-GPU при тех же шаблонах атаки перевороты битов не наблюдались. Исследователи, со своей стороны, рекомендуют по возможности избегать cross-tenant шеринга GPU, мониторить счетчики ECC-ошибок и жестче фильтровать недоверенные CUDA-нагрузки.

Для рынка AI-инфраструктуры это плохая, но полезная новость. Несколько лет индустрия привыкала думать о GPU как о дорогом, дефицитном и потому максимально уплотняемом ресурсе: больше арендаторов, выше утилизация, меньше простаивающих ускорителей. Атака GPUThor бьет именно по этой логике. Чем активнее компании делят один и тот же GPU между разными пользователями и задачами, тем выше цена ошибки в модели доверия. Похоже, следующий этап гонки за эффективностью AI-кластеров будет не только про FLOPS и память, но и про то, сколько аппаратной изоляции рынок готов купить вместо красивых цифр утилизации. Подробности исследования пересказывает BleepingComputer.

Поделиться: Telegram X LinkedIn