Weka представила новое решение, которое позволяет сократить потребление памяти GPU до 90% за счет кеширования токенов, используемых в AI-моделях. Для разработчиков это означает значительную экономию ресурсов и возможность быстро развертывать новые AI нагрузки.
Проблемы текущего подхода к GPU
В условиях увеличивающегося спроса на мощности для AI, разработчики сталкиваются с проблемой нехватки памяти GPU. Длительные контексты и многопользовательские разговоры заставляют модели перерасчитывать уже обработанную информацию. Это не только увеличивает нагрузку на GPU, но и замедляет обработку запросов, ограничивая количество пользователей, которые могут получать ответы одновременно.
Что предлагает Weka
Платформа NeuralMesh 6 от Weka использует инновационный подход, сочетая NAND-флэш-накопители для кеширования токенов, что позволяет работать как с GPU-памятью, но по значительно более низкой стоимости. Кроме того, новое оборудование Wekapod 3 оптимизирует этот процесс, обеспечивая более быструю и эффективную работу с данными.
CEO Weka Лиран Цвибель отметил: «Клиенты стремятся получить доступ к вычислительным ресурсам и хотят сразу использовать новые возможности, как только они становятся доступны». Это позволяет более эффективно использовать существующие инвестиции в GPU и снижать затраты на вывод новых AI-проектов на рынок.
Что это значит для бизнеса и разработчиков
Для бизнеса, который уже использует AI на больших масштабах, новое решение Weka станет важным шагом к снижению затрат и увеличению производительности. Особенно это актуально для компаний, разрабатывающих виртуальных помощников или системы обработки запросов. Отметим, что интеграция этой технологии позволит существенно сократить время развертывания новых AI-моделей — теперь это можно сделать за считанные часы, а не недели.
Следующим шагом для Weka станет расширение возможностей своей платформы на новые рынки, а также углубленная интеграция с другими облачными решениями.