NVIDIA представила Model Optimizer для постобучающей квантизации, что улучшает производительность AI-моделей на устройствах, таких как GPU GeForce RTX. Эта технология снижает требования к памяти и вычислениям, сохраняя качество моделей и позволяя им работать эффективнее в условиях ограниченных ресурсов.
Что такое Model Optimizer?
NVIDIA Model Optimizer (ModelOpt) — это библиотека, которая включает современные методы оптимизации для сжатия и ускорения моделей AI. Среди таких методов — квантизация, дистилляция и обрезка. ModelOpt поддерживает модели форматов Hugging Face, PyTorch и ONNX. С помощью Python APIs пользователи могут комбинировать различные методы оптимизации для создания эффективных контрольных точек.
Квантизация моделей CLIP
Модель CLIP (Contrastive Language-Image Pretraining), представленная OpenAI в 2021 году, позволяет создавать связи между изображениями и текстом, что делает её важной частью современных мультимодальных систем. Для повышения производительности при использовании ModelOpt NVIDIA предлагает постобучающую квантизацию, поддерживающую форматы FP4, FP8 и INT8.
В руководстве рассматривается, как провести постобучающую квантизацию для модели CLIP в формате FP8. Процесс включает подготовку базовой модели CLIP и использование набора данных для калибровки, что позволяет оценивать точность модели по таким задачам, как нулевая классификация и извлечение данных.
Практическое значение
Для разработчиков и исследователей в России и СНГ использование квантизации моделей позволит снизить потребление ресурсов и увеличить скорость работы AI-приложений. Это актуально на фоне дефицита вычислительных мощностей и высоких цен на современные GPU. Если ваша команда использует ресурсы GPU, то внедрение такой оптимизации может снизить затраты на 20-30% в ближайший год.
Следующий шаг для NVIDIA — увеличение функционала Model Optimizer и дальнейшая интеграция с существующими решениями, что позволит ещё более эффективно использовать мощности на различных устройствах.