26 августа 2026 года команда Qwen компании Alibaba открыла веса модели Qwen3.8-Flash-Next — мультимодальной MoE-архитектуры с 125 млрд параметров основной модели и дополнительными 51 млрд в N-gram embedding слое, при этом на каждый токен активируется всего 6 млрд параметров. Это ранний превью архитектуры Qwen4, предназначенный для того, чтобы сообщество могло адаптировать инфраструктуру и инструменты до полного релиза семейства Qwen4.
Архитектура модели вводит четыре ключевых инноваций: гибридное внимание, объединяющее Gated DeltaNet (GDN) с Qwen Sparse Attention (QSA), gated residual connections, N-gram embedding и оптимизатор Muon. По сравнению с Qwen3.7-Plus (397 млрд параметров, 17 млрд активных) обучение обошлось примерно в девять раз дешевле, при этом производительность в задачах кодирования и офисных сценариях заметно выросла. Это явилось результатом не просто инкрементального масштабирования, а радикальной переработки механизмов активации и оптимизации.
Официальные бенчмарки показывают превосходство над предыдущими версиями Qwen и конкурентным результатам: 62,5 на SWE-bench Pro (по сравнению с данными Claude Opus 4.6), 73,9 на CoWorkBench, 58,7 на DeepSWE 1.1 и 84,5 на AndroidWorld. Нативный контекст 262 тыс. токенов расширяется до 1 млн через YaRN. При условии 90% попадания в prefill кэш, Qwen3.8-Flash-Next достигает 8,6-кратного увеличения пропускной способности prefill по сравнению с Qwen3.7-Plus, а при 1 млн токенов QSA обеспечивает ускорение внимания в 7,6 раза на prefill и 4,9 раза на decode.
Важно отметить, что методология оценки опирается преимущественно на внутренние тесты Qwen, включая agentic coding и офисные бенчмарки. На момент релиза отсутствуют независимые сторонние верификации, а публикуемые сравнения проводятся выборочно — в основном по задачам, где выигрывает разреженная активация. Это типичная ситуация для лабораторий из Азии, где полные детали обучения и данных остаются закрытыми, однако Alibaba выбрал путь открытия весов для ранней обратной связи сообщества.
В ландшафте MoE-моделей Qwen3.8-Flash-Next отличается от DeepSeek-V4-Flash (284 млрд / 13 млрд активных) меньшим числом активных параметров при сопоставимой или лучшей производительности на agentic-задачах. Эта разница в архитектурных выборах отражает более широкий сдвиг в подходах: в то время как американские лаборатории продолжают инвестировать в масштабирование плотных моделей, китайские команды всё чаще делают ставку на разреженность, гибридное внимание и специализированные embedding-слои (как N-gram) для снижения стоимости обучения и инференса.
Выпуск открытых весов Qwen3.8-Flash-Next позволяет разработчикам тестировать архитектуру до полноценного Qwen4. vLLM и SGLang уже обеспечивают day-0 поддержку на GPU NVIDIA и AMD, а это ускоряет практическую интеграцию: инженеры смогут проверить, насколько гибридное внимание QSA и Muon-оптимизатор масштабируются на реальных workloads и в каких сценариях разреженная активация даёт максимальный выигрыш.
Остаётся неясным, насколько устойчивы заявленные преимущества при независимом воспроизведении и на более широком спектре задач, включая сложные мультимодальные сценарии, выходящие за рамки кодирования. Следующие исследовательские работы, вероятно, сосредоточатся на абляциях отдельных архитектурных компонентов и сравнении QSA с другими гибридными и разреженными подходами.
Главный итог релиза — демонстрация того, что на фронтире AI дальнейший прогресс в эффективности достигается не только за счёт увеличения параметров, но и через радикальную переработку механизмов активации, гибридного внимания и оптимизации. В экосистеме открытых весов это создаёт реальную конкуренцию закрытым фронтиер-моделям на основании стоимости и инженерной эффективности.
