Alibaba представила Qwen3.8-Flash-Next, мощную модель генеративного AI, оснащенную 125 млрд параметров. Новинка позволяет обрабатывать контексты до 1 миллиона токенов, что открывает новые горизонты для разработчиков в области агентного программирования.
Что такое Qwen3.8-Flash-Next
Модель Qwen3.8-Flash-Next включает в себя 125 миллиардов параметров, из которых 6 миллиардов активируются на токен. Контекстное окно модели достигает 262 144 токенов, с возможностью расширения до 1 миллиона токенов благодаря технологии YaRN. В её архитектуре используются Gated DeltaNet (GDN) и Qwen Sparse Attention (QSA). Это позволяет оптимизировать обработку и эффективность работы с историческим контекстом.
Эффективность и производительность
Согласно результатам тестов Alibaba, QSA повышает эффективность для работы с 1 миллион токенов, обеспечивая до 7,6-кратного ускорения при предварительной загрузке и до 4,9-кратного ускорения во время декодирования по сравнению с полным вниманием. Модель Qwen3.8-Flash-Next достигает скорости обработки более 16 000 токенов в секунду на GPU NVIDIA GB300 NVL72. Это открывает путь к высокопроизводительным приложениями в области агентного программирования.
Применение для разработчиков
Разработчикам доступны инструменты для настройки модели с помощью NVIDIA NeMo AutoModel и возможности применения методов обучения с подкреплением. Это позволит адаптировать Qwen3.8-Flash-Next для узкоспециализированных задач и доменных приложений. Также доступны открытые рецепты развертывания через SGLang, vLLM и другие движки.
Значение для рынка AI
Запуск Qwen3.8-Flash-Next является важным шагом для разработчиков в сфере AI, предоставляя им доступ к передовым технологиям и высокой производительности. Учитывая текущую зависимость от многоуровневых AI-систем, это может значительно изменить подход к разработке программных решений в России и СНГ. Если ваша компания работает в AI, стоит рассмотреть адаптацию этой технологии в своих проектах, чтобы оставаться конкурентоспособными.
Следующий шаг — внедрение новой архитектуры Qwen4, что обещает ещё больше возможностей для разработчиков и специалистов в области AI.