AI И НЕЙРОСЕТИ

NVIDIA оптимизировала модели для Jetson — скорость декодирования увеличена в 6,28 раз

NVIDIA представила новые модели для Jetson с рекордной оптимизацией. Скорость декодирования увеличена в 6,28 раза.

✍️ Редакция iTech News | 22.08.2025 | ⏱ 2 мин | Источник: NVIDIA Developer Blog
NVIDIA оптимизировала модели для Jetson: скорость декодирования возросла

NVIDIA представила новые AI-модели для платформы Jetson, которые способны к многошаговому рассуждению и теперь могут выполнять задачи, ранее доступные только крупным дата-центрам. Это важно для разработчиков, так как локальная обработка данных снижает задержки и затраты.

Исторический контекст развития Edge AI

До недавнего времени AI-модели, обладающие возможностью глубокого рассуждения, были слишком громоздкими для работы на устройствах Edge. В условиях зависимости от дата-центров разработчики сталкивались с увеличением затрат и задержек. Однако в 2026 году ситуация изменилась благодаря ряду компактных открытых моделей, которые теперь могут эффективно работать на NVIDIA Jetson.

Новые модели, такие как Nemotron 3.5 Lightning и Qwen3.8-27B, демонстрируют важные изменения в подходе к разработке AI на Edge-устройствах. Обе модели позволяют выполнять сложные задачи, такие как обнаружение аномалий в реальном времени и управление роботами в суровых условиях.

Технические детали: что нового в моделях

Модель Nemotron 3.5 Lightning использует архитектуру с 30 миллиардами параметров, однако активирует только 3 миллиарда на токен, в то время как Qwen3.8-27B обращается ко всем 27 миллиардам. Благодаря технологии NVFP4 и спекулятивному декодированию производительность увеличилась в 6,28 раз по сравнению с обычными моделями на Jetson.

Разработчикам следует учитывать, что оптимизация моделей зависит от их архитектуры. Например, Nemotron 3.5 Lightning лучше работает с DSpark, а Qwen3.8-27B — с DFlash2. Четкое понимание этих нюансов позволяет значительно увеличить эффективность работы с оборудованием.

Практическое значение для разработчиков

Для русскоязычной аудитории это означает, что теперь более доступна разработка приложений на базе AI, которые могут работать автономно без постоянного доступа к облаку. Это особенно актуально в условиях ограниченного интернета или в отдалённых регионах, где такая технология может значительно упростить рабочие процессы.

Рекомендуем ознакомиться с официальными руководствами по развертыванию моделей и тестированию их в условиях реальных задач. Жалобы разработчиков о высоких затратах на инфраструктуру теперь могут стать меньше благодаря возможностям, которые предлагают новые компактные модели.

Следующий шаг — дальнейшее оптимизация моделей и их применение в различных отраслях, что может открыть новые горизонты для разработки.

Поделиться: Telegram X LinkedIn