26月2026日,阿里巴巴Qwen团队开源了Qwen3.8-Flash-Next模型的权重——这是一种多模态MoE架构,主模型拥有125亿参数,并在N-gram嵌入层额外增加了51亿参数,而每个令牌仅激活6亿参数。这是Qwen4架构的早期预览,旨在让社区在Qwen4系列全面发布前能够适配基础设施和工具。
该模型架构引入了四项关键创新:混合注意力(结合Gated DeltaNet(GDN)与Qwen稀疏注意力(QSA))、门控残差连接、N-gram嵌入以及Muon优化器。与Qwen3.7-Plus(397亿参数,17亿激活)相比,训练成本约为其九分之一,同时在编码任务和办公场景中的性能显著提升。这不仅是增量扩展的结果,更是对激活机制和优化进行彻底重构的成果。
官方基准测试显示,该模型优于之前的Qwen版本和竞品结果:SWE-bench Pro上为62,5(相比之下Claude Opus 4.6),CoWorkBench上为73,9,DeepSWE 1.1上为58,7,AndroidWorld上为84,5。原生上下文262千令牌可通过YaRN扩展至1百万。在90%的prefill缓存命中率下,Qwen3.8-Flash-Next的prefill吞吐量相比Qwen3.7-Plus提升了8,6倍,而在1百万令牌时,QSA在prefill阶段实现了7,6倍的注意力加速,在decode阶段实现了4,9倍加速。
值得注意的是,评估方法主要依赖Qwen的内部测试,包括agentic编码和办公基准。发布时缺乏独立的第三方验证,公开的比较是选择性的——主要集中在稀疏激活占优的任务上。这是亚洲实验室的典型情况,训练和数据的完整细节保持不公开,但阿里巴巴选择了开源权重以获取社区的早期反馈。
在MoE模型格局中,Qwen3.8-Flash-Next与DeepSeek-V4-Flash(284亿/13亿激活)相比,激活参数更少,但在agentic任务上性能相当或更优。这种架构选择的差异反映了更广泛的方法转变:美国实验室继续投资于密集模型的扩展,而中国团队越来越倾向于稀疏性、混合注意力和专用嵌入层(如N-gram)以降低训练和推理成本。
Qwen3.8-Flash-Next开放权重的发布使开发者能够在Qwen4全面推出前测试该架构。vLLM和SGLang已提供在NVIDIA和AMD GPU上的day-0支持,这加速了实际集成:工程师可以验证QSA混合注意力和Muon优化器在真实工作负载上的扩展性,以及稀疏激活在哪些场景中带来最大收益。
尚不清楚在独立复现和更广泛的任务(包括超出编码范围的复杂多模态场景)中,所声称的优势有多稳固。后续研究可能会聚焦于各架构组件的消融实验,以及QSA与其他混合和稀疏方法的比较。
本次发布的主要结论是,在AI前沿,效率的进一步进步不仅通过增加参数实现,还通过对激活机制、混合注意力和优化的彻底重构来实现。在开放权重生态系统中,这基于成本和工程效率对封闭前沿模型构成了真正的竞争。
