AI И НЕЙРОСЕТИ

Alibaba открыла веса Qwen3.8-Flash-Next, раннего превью Qwen4

Alibaba открыла веса Qwen3.8-Flash: у модели 125 млрд параметров, 6 млрд активны на токен и до 1 млн токенов контекста в прод-версии.

✍️ Редакция iTech News | 29.08.2026 | ⏱ 5 мин | Источник: The New Stack

Alibaba выпустила Qwen3.8-Flash-Next и сразу задала понятный месседж: это не просто очередная модель в линейке, а ранний показ того, как будет устроен Qwen4. Для тех, кто следит за рынком ИИ-моделей не из спортивного интереса, а ради продакшена, новость важна по двум причинам: веса открыты, а заявка сделана на более дешевую и быструю архитектуру при длинном контексте и мультимодальности.

Как пишет The New Stack, Alibaba представила open-weight-модель Qwen3.8-Flash-Next, а ее облачная прод-версия доступна как Qwen3.8-Flash. По официальным данным команды Qwen, у модели 125 млрд параметров в основном блоке, еще 51 млрд приходится на N-gram embedding, но на каждый токен активируется только 6 млрд параметров. Для рынка это уже привычный трюк класса MoE: на бумаге модель огромная, в работе пытается быть ощутимо экономнее, чем плотные аналоги. В случае Qwen команда прямо продает не только интеллект, но и экономику инференса.

Главный тезис релиза звучит без экивоков: Qwen3.8-Flash-Next — это раннее превью архитектуры Qwen4. Alibaba уже делала похожий ход раньше, когда Qwen3-Next показала идеи, позже разошедшиеся по семейству Qwen3.5, Qwen3.6, Qwen3.7 и Qwen3.8. Теперь компания повторяет схему: сначала выкатывает архитектурный эксперимент в открытые веса, потом, если сообщество не разнесет его на куски бенчмарками и практикой, масштабирует в следующее поколение. Для разработчиков это удобный формат: можно смотреть не презентацию о прекрасном будущем, а живую модель, которую уже дают запускать и сравнивать.

Сама архитектурная часть выглядит как попытка выжать больше пользы из каждого доллара на обучение и инференс. В Qwen3.8-Flash-Next Alibaba обновила сразу четыре блока: attention, residual, embedding и optimization. Вместо прежней связки с Gated Attention используется гибрид Gated DeltaNet и Qwen Sparse Attention. Последняя работает не по отдельным токенам, а по micro-block, что должно снижать цену длинного контекста. Residual-поток расширили до четырех веток с динамическими gate-механизмами. В embedding-слой добавили N-gram подход, который позволяет наращивать емкость модели без пропорционального роста вычислений. Наконец, в оптимизации используется Muon в комбинации с AdamW. Если перевести этот набор с исследовательского на инженерный, посыл простой: Alibaba ищет способ масштабировать модель так, чтобы рост качества не выглядел как бесконечный счет за GPU.

Цифры тоже подобраны не для красоты. Нативно модель поддерживает 262 144 токена контекста и, по данным Qwen, расширяется до 1 000 000 токенов с YaRN. Для облачной версии Qwen3.8-Flash миллион токенов уже заявлен как дефолт. Это важный сигнал для рынка агентных систем и корпоративных сценариев, где модель должна не просто ответить на вопрос, а держать в голове длинную переписку, спецификации, документы, куски кода, результаты tool calling и историю собственных шагов. Короткий контекст для таких задач все чаще становится не технической деталью, а налогом на нестабильность.

Отдельно Alibaba давит на тему производительности в coding- и office-сценариях. По собственным бенчмаркам компании, Qwen3.8-Flash-Next превосходит Claude Opus 4.6 в ряде задач: например, на SWE-bench Pro у модели 62,5 против 53,4, на CoWorkBench — 73,9 против 68,2, на JobBench — 55,7 против 36,6. Есть и более общий маркетинговый удар: обучение модели, как утверждает Qwen, обошлось менее чем в одну девятую стоимости Qwen3.7-Plus. К таким цифрам рынок давно привык относиться с нужной дозой подозрительности: методики сравнения у вендоров свои, выбор бенчмарков тоже. Но сама рамка показательная. Конкуренция между крупными лабораториями все меньше строится вокруг абстрактного «наш ИИ умнее», и все больше — вокруг вопроса, сколько стоит полезный токен в реальной работе.

Для русскоязычной IT-аудитории здесь есть вполне прикладной вывод. Во-первых, Qwen3.8-Flash-Next усиливает тренд на открытые модели, которые уже не выглядят компромиссом для «бедных, но независимых». Если несколько лет назад open-weight-модель часто значила «поиграться в песочнице», то теперь речь идет о длинном контексте, мультимодальности, tool use и агентных сценариях. Во-вторых, Alibaba все агрессивнее играет в сегменте, где до недавнего времени внимание почти целиком забирали OpenAI, Anthropic, Google и отчасти Meta. В-третьих, сам подход «сначала архитектурный preview, потом полноценное семейство» выгоден командам, которые строят внутренние платформы и хотят заранее оценить совместимость с vLLM, SGLang, Transformers и собственными агентными пайплайнами.

Но здесь же скрыта и практическая оговорка. Открытые веса не равны дешевому внедрению. Даже если модель выглядит очень привлекательно на бумаге, большой размер, мультимодальность и длинный контекст быстро превращают self-hosting в разговор не про энтузиазм, а про бюджет, инфраструктуру и дисциплину оптимизации. Поэтому для части компаний Qwen3.8-Flash-Next станет не кандидатом на локальный запуск, а рычагом давления на поставщиков API и аргументом в переговорах о цене. И это тоже нормальный эффект от open-weight-релиза: даже если вы не поднимаете модель сами, сам факт ее существования меняет рынок.

Интереснее всего теперь не то, смогла ли Alibaba выпустить еще одну сильную модель, а то, закрепится ли ее архитектурный курс как новый стандарт для больших агентных систем. Если ставка на более экономный длинный контекст и мультимодальный MoE сработает в продакшене так же хорошо, как в презентации, Qwen4 может оказаться не догоняющим релизом, а моделью, на которую начнут оглядываться конкуренты. Подробности первого анонса собрал The New Stack.

Поделиться: Telegram X LinkedIn