NVIDIA улучшила производительность TensorRT Edge-LLM, демонстрируя скорость обработки на уровне 52,33 токена в секунду — это на 6,4 раза быстрее, чем предыдущий эталон. Перформанс был достигнут с использованием NVIDIA Jetson AGX Thor, что открывает новые горизонты для интеграции AI в устройства на краю сети.
Как осуществляется замер производительности
В процессе тестирования MLPerf Inference v6.1 Edge Agentic использовалась модель Qwen3.6-27B, которая успешно справилась со 1007 запросами за 24 минуты и 36 секунд. Для достижения таких результатов команда применила несколько технологий: NVFP4-квантование, многошаговое предсказание токенов и кэширование, обеспечив 96% обработки токенов из уже загруженного кэша. Это позволяет сокращать временные затраты на повторные вычисления, что особенно важно для длинных сессий взаимодействия.
Почему это важно для разработчиков AI
С увеличением скорости обработки на 6,4 раза, TensorRT Edge-LLM позволяет разработчикам создавать более сложные AI-агенты, которые могут использовать ресурсы устройства гораздо эффективнее. Это означает, что пользователи смогут реализовывать более сложные сценарии, требующие длительной обработки диалогов с учетом предыдущих сообщений.
Для компаний в России, занимающихся разработкой AI-решений, это открывает новые возможности для создания интерактивных систем и телекоммуникационных приложений, которые будут работать на маломощных устройствах — от гигабайтных серверов до компактных модулей.
Следующий этап — выпуск обновлений для TensorRT Edge-LLM с учетом новых возможностей и рекомендаций по интеграции. Разработчики уже могут загружать готовые модели и настраивать свои приложения для оптимальной работы с новыми решениями от NVIDIA.