Qwen3.8-Flash-Next: Alibaba сократила активные параметры до 6B и опередила Claude Opus 4.6 по эффективности

Отредактировано: Alex Khohlov

26 августа 2026 года команда Qwen компании Alibaba открыла веса модели Qwen3.8-Flash-Next — мультимодальной MoE-архитектуры с 125 млрд параметров основной модели и дополнительными 51 млрд в N-gram embedding слое, при этом на каждый токен активируется всего 6 млрд параметров. Это ранний превью архитектуры Qwen4, предназначенный для того, чтобы сообщество могло адаптировать инфраструктуру и инструменты до полного релиза семейства Qwen4.

Архитектура модели вводит четыре ключевых инноваций: гибридное внимание, объединяющее Gated DeltaNet (GDN) с Qwen Sparse Attention (QSA), gated residual connections, N-gram embedding и оптимизатор Muon. По сравнению с Qwen3.7-Plus (397 млрд параметров, 17 млрд активных) обучение обошлось примерно в девять раз дешевле, при этом производительность в задачах кодирования и офисных сценариях заметно выросла. Это явилось результатом не просто инкрементального масштабирования, а радикальной переработки механизмов активации и оптимизации.

Официальные бенчмарки показывают превосходство над предыдущими версиями Qwen и конкурентным результатам: 62,5 на SWE-bench Pro (по сравнению с данными Claude Opus 4.6), 73,9 на CoWorkBench, 58,7 на DeepSWE 1.1 и 84,5 на AndroidWorld. Нативный контекст 262 тыс. токенов расширяется до 1 млн через YaRN. При условии 90% попадания в prefill кэш, Qwen3.8-Flash-Next достигает 8,6-кратного увеличения пропускной способности prefill по сравнению с Qwen3.7-Plus, а при 1 млн токенов QSA обеспечивает ускорение внимания в 7,6 раза на prefill и 4,9 раза на decode.

Важно отметить, что методология оценки опирается преимущественно на внутренние тесты Qwen, включая agentic coding и офисные бенчмарки. На момент релиза отсутствуют независимые сторонние верификации, а публикуемые сравнения проводятся выборочно — в основном по задачам, где выигрывает разреженная активация. Это типичная ситуация для лабораторий из Азии, где полные детали обучения и данных остаются закрытыми, однако Alibaba выбрал путь открытия весов для ранней обратной связи сообщества.

В ландшафте MoE-моделей Qwen3.8-Flash-Next отличается от DeepSeek-V4-Flash (284 млрд / 13 млрд активных) меньшим числом активных параметров при сопоставимой или лучшей производительности на agentic-задачах. Эта разница в архитектурных выборах отражает более широкий сдвиг в подходах: в то время как американские лаборатории продолжают инвестировать в масштабирование плотных моделей, китайские команды всё чаще делают ставку на разреженность, гибридное внимание и специализированные embedding-слои (как N-gram) для снижения стоимости обучения и инференса.

Выпуск открытых весов Qwen3.8-Flash-Next позволяет разработчикам тестировать архитектуру до полноценного Qwen4. vLLM и SGLang уже обеспечивают day-0 поддержку на GPU NVIDIA и AMD, а это ускоряет практическую интеграцию: инженеры смогут проверить, насколько гибридное внимание QSA и Muon-оптимизатор масштабируются на реальных workloads и в каких сценариях разреженная активация даёт максимальный выигрыш.

Остаётся неясным, насколько устойчивы заявленные преимущества при независимом воспроизведении и на более широком спектре задач, включая сложные мультимодальные сценарии, выходящие за рамки кодирования. Следующие исследовательские работы, вероятно, сосредоточатся на абляциях отдельных архитектурных компонентов и сравнении QSA с другими гибридными и разреженными подходами.

Главный итог релиза — демонстрация того, что на фронтире AI дальнейший прогресс в эффективности достигается не только за счёт увеличения параметров, но и через радикальную переработку механизмов активации, гибридного внимания и оптимизации. В экосистеме открытых весов это создаёт реальную конкуренцию закрытым фронтиер-моделям на основании стоимости и инженерной эффективности.

7 Просмотров

Источники

  • AI资讯 | 实时追踪人工智能行业最新动态与热点快讯 - AIHub

  • Alibaba's Qwen to open-source Qwen3.8-Flash-Next, previewing Qwen4 architecture · TechNode

  • Alibaba's Qwen team releases Qwen3.8-Flash-Next: A 125B Multimodal MoE With 6B Active Parameters Previewing the Qwen4 Architecture - MarkTechPost

  • Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency - Qwen Blog

  • Qwen on X - Official benchmarks announcement

  • Experiment with Qwen3.8-Flash-Next on NVIDIA GB300 NVL72 for Agentic Coding | NVIDIA Technical Blog

  • DeepSeek V4 Flash: 284B MoE, 1M Context, Benchmarks, Pricing (2026)

  • vLLM on X - Day-0 support announcement

  • Qwen/Qwen3.8-Flash-Next — 176B / 6B active · MOE · 256K ctx

  • Alibaba's Qwen launches Qwen3.8-Flash AI model with lower training costs - Yahoo News

  • Alibaba Releases Smaller Qwen AI Model to Compete With Anthropic, DeepSeek - Bloomberg

  • DeepSeek-V4-Flash · Hugging Face

Читайте больше статей по этой теме:

Вы нашли ошибку или неточность?Мы учтем ваши комментарии как можно скорее.