NVIDIA представила модель Nemotron 3 Nano с 30 миллиардами параметров, которая активирует до 3 миллиардов параметров за токен. По данным компании, модель обеспечивает до 4 раз более высокую пропускную способность по сравнению с Nemotron 2 Nano и рассчитана на задачи автономных агентов.
Преимущества новой модели
Nemotron 3 Nano оптимизирована для выполнения задач в режиме реального времени, что особенно важно для высоконагруженных сценариев, таких как верификация результатов и делегирование подзадач. Благодаря архитектуре Mixture-of-Experts (MoE) данный релиз позволяет эффективно запускать только часть параметров модели, что снизило вычислительные затраты. Теперь разработчики могут рассчитывать на максимально быструю обработку данных на локальных машинах и в облачных дата-центрах.
Технологические улучшения
Модель использует гибридную архитектуру Mamba-Transformer MoE и поддерживает контекст до 1 миллиона токенов. По данным NVIDIA, это помогает удерживать высокую скорость на длинных запросах и делает модель более подходящей для агентных сценариев, где важны низкие задержки и экономичный вывод.
Что это значит для разработчиков и бизнеса
Для российских команд, занимающихся разработкой AI-приложений, появление Nemotron 3 Nano дает возможность использовать более компактную модель для высокопроизводительных агентных систем. В качестве альтернативы более тяжелым решениям новинка делает ставку на скорость и более низкие требования к инфраструктуре.
Следующий шаг для NVIDIA — развитие линейки Nemotron и связанных инструментов для агентных систем, что откроет дополнительные возможности для пользователей и разработчиков в СНГ и других регионах.