Cloudflare разработала систему Unweight, позволяющую сократить размер весов LLM на 15-22% без потери качества. Это оптимизация важна для разработчиков, которым необходимо проводить инференс быстро и эффективно, особенно на ресурсно-ограниченных устройствах.
Оптимизация весов моделей
Система Unweight позволяет достигать значительного уменьшения объёма весов моделей, которые традиционно создают узкие места в работе. На примере использования GPU NVIDIA H100 стало ясно, что пропускная способность памяти, а не вычислительные мощности, оказывается главным ограничением. Например, процесс обработки этих на GPU происходит до 600 раз быстрее, чем может передать память.
Технические детали Unweight
Unweight использует метод сжатия, который делает без потерь, что позволяет экономить до 3 ГБ видеопамяти на одной модели. Первые тесты с Llama-3.1-8B показали, что можно добиться 30% сжатия весов в многослойных перцептронах (MLP). Это стало возможным благодаря быстрой декомпрессии весов в оперативной памяти, что устраняет задержки, возникающие при обращении к основной памяти.
Разработка Cloudflare также включает возможность автоматической настройки процесса выполнения, что делает систему более гибкой для различных нагрузок и освободит больше ресурсов на GPU.
Влияние на разработчиков
Для разработчиков это значит, что теперь можно запускать больше моделей на менее мощных GPU, что делает их работу более экономичной. Сокращение объёма моделей может привести к снижению затрат на инфраструктуру, что особенно актуально для стартапов и компаний с ограниченными ресурсами.
Cloudflare намерена продолжать работу над системой, включая публикацию технической документации и открытие GPU-ядр, чтобы упростить внедрение решения в другие проекты.