AI И НЕЙРОСЕТИ

NVIDIA сократила время восстановления LLM после сбоев до 7,3 секунды

NVIDIA представила новый механизм восстановления LLM, который сокращает время отклика после сбоев с 283 секунд до 7,3 секунд.

✍️ Редакция iTech News | 01.09.2025 | ⏱ 2 мин | Источник: NVIDIA Developer Blog
NVIDIA улучшила LLM восстановление до 7,3 секунды

NVIDIA внедрила технологию Shadow Engine Recovery, сократившую время восстановления LLM после сбоев с 283 секунд до всего 7,3 секунд. Это значительное улучшение повышает стабильность и скорость работы AI-систем для разработчиков и конечных пользователей.

Контекст разработки и фон

Современные LLM (Large Language Models) часто сталкиваются с различными сбоями, что приводит к длительному времени восстановления. Стандартные методы, как правило, требуют полного перезапуска процесса, что негативно сказывается на доступности и качестве предоставляемых услуг. NVIDIA стремится минимизировать эти потери, особенно в свете роста популярности AI-приложений.

NVIDIA представила решение как часть платформы Dynamo для отказоустойчивого запуска LLM. В опубликованном материале компания сравнивает новую схему не с решениями Google или Microsoft, а с обычным холодным перезапуском.

Подробности о технологии и данных

Shadow Engine Recovery работает за счёт поддержки полностью инициализированного резервного двигателя на том же GPU. Технология использует GPU Memory Service (GMS), который сохраняет состояние весов, что позволяет нескольким двигателям использовать одни и те же веса без дублирования. При сбое активного процесса резервный двигатель может сразу же вступить в работу, что значительно ускоряет процесс восстановления.

В тестах на модели GLM-5.2 с использованием узлов NVIDIA B200 было установлено, что время восстановления с резервным двигателем снижается практически в 39 раз. В результате этого пользователи получают более высокую скорость обработки данных и лучшую стабильность в работе.

Выводы для разработчиков

Для IT-команд, работающих с LLM, эта технология обозначает высокую степень надежности и уменьшение времени простоя. С переходом на Shadow Engine Recovery компании могут обеспечить более высокий уровень обслуживания и уменьшить нагрузку на оставшиеся рабочие процессы во время сбоев. Это позволяет не только улучшить качество обслуживания, но и повысить уровень доверия клиентов.

Пока Shadow Engine Recovery доступна в режиме preview в NVIDIA Dynamo; компания отдельно отмечает, что поддержка KV-кэша через GMS ещё находится в разработке.

Поделиться: Telegram X LinkedIn