AI И НЕЙРОСЕТИ

Alibaba представила Qwen3.8-Flash-Next — 176 млрд параметров для AI

Alibaba выпустила Qwen3.8-Flash-Next с 176 миллиардами параметров и архитектурой для высоких объемов данных.

✍️ Редакция iTech News | 31.08.2025 | ⏱ 2 мин | Источник: NVIDIA Developer Blog
Qwen3.8-Flash-Next: Новый прогресс от Alibaba в AI

Alibaba представила Qwen3.8-Flash-Next — многоцелевую AI-модель с 176 миллиардами параметров. Эта модель нацелена на упрощение обработки больших объемов данных и сокращение вычислительных затрат в приложениях с длинным контекстом. Для разработчиков это открывает новые горизонты в области генеративного AI и кодирования.

Что представляет собой новая модель

Qwen3.8-Flash-Next обладает контекстным окном в 262 144 токена, которое можно расширить до 1 миллиона токенов с помощью YaRN. Эта модель включает в себя комбинацию Gated DeltaNet (GDN) и Qwen Sparse Attention (QSA), что позволяет значительно сократить потребление вычислительных ресурсов. В бенчмарках зафиксированы приросты производительности: скорость предзагрузки увеличилась до 7.6 раз, а декодирования — до 4.9 раз по сравнению с полным вниманием.

На архитектуре NVIDIA GB300 NVL72, которая оснащена 72 GPU, модель демонстрирует скорость обработки более 16 000 токенов в секунду на каждом графическом процессоре. Это позволяет масштабировать решение от локальной аппаратуры до развертываний в дата-центрах. Поддержка со стороны NVIDIA включает весь спектр инструментов, таких как SGLang и TensorRT-LLM для дообучения и вывода.

Контекст и конкурентная среда

Конкуренция на рынке AI-инструментов с каждым годом становится всё более острой. Аналогичные модели, такие как GPT-4 от OpenAI и LLaMA от Meta, предлагают интересные возможности, но Qwen3.8-Flash-Next выделяется своим объёмом и адаптивностью к различным задачам. Модель создана для использования в контекстах, где особенно высока необходимость в обработке длинных последовательностей токенов и данных.

Практическое значение для бизнеса

Разработчики и компании, работающие с большими объемами данных, смогут значительно упростить процессы и повысить эффективность. Учитывая прирост производительности и возможность обработки длинных контекстов, внедрение Qwen3.8-Flash-Next может снизить вычислительные затраты при выполнении тяжёлых задач за счёт более экономной работы с длинным контекстом. Это особенно важно для финтеха, медицины и других отраслей, интенсивно использующих AI.

Alibaba заявила, что продолжит развивать эту архитектуру в направлении Qwen4, но точных сроков следующего релиза не назвала.

Поделиться: Telegram X LinkedIn