Qwen3.8-Flash-Next:阿里巴巴将激活参数缩减至6B,效率超越Claude Opus 4.6

编辑者: Alex Khohlov

26月2026日,阿里巴巴Qwen团队开源了Qwen3.8-Flash-Next模型的权重——这是一种多模态MoE架构,主模型拥有125亿参数,并在N-gram嵌入层额外增加了51亿参数,而每个令牌仅激活6亿参数。这是Qwen4架构的早期预览,旨在让社区在Qwen4系列全面发布前能够适配基础设施和工具。

该模型架构引入了四项关键创新:混合注意力(结合Gated DeltaNet(GDN)与Qwen稀疏注意力(QSA))、门控残差连接、N-gram嵌入以及Muon优化器。与Qwen3.7-Plus(397亿参数,17亿激活)相比,训练成本约为其九分之一,同时在编码任务和办公场景中的性能显著提升。这不仅是增量扩展的结果,更是对激活机制和优化进行彻底重构的成果。

官方基准测试显示,该模型优于之前的Qwen版本和竞品结果:SWE-bench Pro上为62,5(相比之下Claude Opus 4.6),CoWorkBench上为73,9,DeepSWE 1.1上为58,7,AndroidWorld上为84,5。原生上下文262千令牌可通过YaRN扩展至1百万。在90%的prefill缓存命中率下,Qwen3.8-Flash-Next的prefill吞吐量相比Qwen3.7-Plus提升了8,6倍,而在1百万令牌时,QSA在prefill阶段实现了7,6倍的注意力加速,在decode阶段实现了4,9倍加速。

值得注意的是,评估方法主要依赖Qwen的内部测试,包括agentic编码和办公基准。发布时缺乏独立的第三方验证,公开的比较是选择性的——主要集中在稀疏激活占优的任务上。这是亚洲实验室的典型情况,训练和数据的完整细节保持不公开,但阿里巴巴选择了开源权重以获取社区的早期反馈。

在MoE模型格局中,Qwen3.8-Flash-Next与DeepSeek-V4-Flash(284亿/13亿激活)相比,激活参数更少,但在agentic任务上性能相当或更优。这种架构选择的差异反映了更广泛的方法转变:美国实验室继续投资于密集模型的扩展,而中国团队越来越倾向于稀疏性、混合注意力和专用嵌入层(如N-gram)以降低训练和推理成本。

Qwen3.8-Flash-Next开放权重的发布使开发者能够在Qwen4全面推出前测试该架构。vLLM和SGLang已提供在NVIDIA和AMD GPU上的day-0支持,这加速了实际集成:工程师可以验证QSA混合注意力和Muon优化器在真实工作负载上的扩展性,以及稀疏激活在哪些场景中带来最大收益。

尚不清楚在独立复现和更广泛的任务(包括超出编码范围的复杂多模态场景)中,所声称的优势有多稳固。后续研究可能会聚焦于各架构组件的消融实验,以及QSA与其他混合和稀疏方法的比较。

本次发布的主要结论是,在AI前沿,效率的进一步进步不仅通过增加参数实现,还通过对激活机制、混合注意力和优化的彻底重构来实现。在开放权重生态系统中,这基于成本和工程效率对封闭前沿模型构成了真正的竞争。

7 查看

来源

  • AI资讯 | 实时追踪人工智能行业最新动态与热点快讯 - AIHub

  • Alibaba's Qwen to open-source Qwen3.8-Flash-Next, previewing Qwen4 architecture · TechNode

  • Alibaba's Qwen team releases Qwen3.8-Flash-Next: A 125B Multimodal MoE With 6B Active Parameters Previewing the Qwen4 Architecture - MarkTechPost

  • Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency - Qwen Blog

  • Qwen on X - Official benchmarks announcement

  • Experiment with Qwen3.8-Flash-Next on NVIDIA GB300 NVL72 for Agentic Coding | NVIDIA Technical Blog

  • DeepSeek V4 Flash: 284B MoE, 1M Context, Benchmarks, Pricing (2026)

  • vLLM on X - Day-0 support announcement

  • Qwen/Qwen3.8-Flash-Next — 176B / 6B active · MOE · 256K ctx

  • Alibaba's Qwen launches Qwen3.8-Flash AI model with lower training costs - Yahoo News

  • Alibaba Releases Smaller Qwen AI Model to Compete With Anthropic, DeepSeek - Bloomberg

  • DeepSeek-V4-Flash · Hugging Face

阅读更多关于此主题的文章:

你发现了错误或不准确的地方吗?我们会尽快考虑您的意见。