Qwen3.8-Flash-Next:阿里巴巴將主動參數縮減至6B,效率超越Claude Opus 4.6

编辑者: Alex Khohlov

26月2026日,阿里巴巴的Qwen團隊開放了Qwen3.8-Flash-Next的模型權重——這是一個多模態MoE架構,主模型有125億參數,另外在N-gram嵌入層有51億參數,而每個token僅啟動6億參數。這是Qwen4架構的早期預覽,旨在讓社群在Qwen4系列完整發布前,能提前調整基礎設施與工具。

模型架構引入了四項關鍵創新:混合注意力(結合Gated DeltaNet(GDN)與Qwen Sparse Attention(QSA))、閘控殘差連接、N-gram嵌入,以及Muon優化器。與Qwen3.7-Plus(397億參數,17億活躍)相比,訓練成本約降低九倍,同時在編碼與辦公場景的效能顯著提升。這並非單純的增量擴展,而是對激活機制與優化方式的徹底革新。

官方基準測試顯示,其表現優於先前的Qwen版本及競爭對手:SWE-bench Pro上為62,5(對比Claude Opus 4.6的數據),CoWorkBench上為73,9,DeepSWE 1.1上為58,7,AndroidWorld上為84,5。原生上下文262千個token,可透過YaRN擴展至1百萬。在prefill快取命中率為90%的條件下,Qwen3.8-Flash-Next的prefill吞吐量相較Qwen3.7-Plus提升8,6倍;而在1百萬token時,QSA在prefill階段加速注意力7,6倍,在decode階段加速4,9倍。

值得注意的是,評估方法主要依賴Qwen的內部測試,包括agentic coding與辦公基準。發布時尚無獨立的第三方驗證,公開的比較也是選擇性的——主要集中在稀疏激活佔優勢的任務上。這是亞洲實驗室的典型情況,訓練與數據的完整細節保持不公開,但阿里巴巴選擇開放權重以獲取社群的早期回饋。

在MoE模型格局中,Qwen3.8-Flash-Next與DeepSeek-V4-Flash(284億/13億活躍)相比,活躍參數更少,但在agentic任務上表現相當或更佳。這種架構選擇的差異反映了更廣泛的方法轉變:美國實驗室持續投資於密集模型的規模化,而中國團隊則越來越傾向於稀疏性、混合注意力與專門的嵌入層(如N-gram),以降低訓練與推論成本。

Qwen3.8-Flash-Next開放權重的發布,讓開發者能在Qwen4完整推出前測試架構。vLLM與SGLang已提供NVIDIA與AMD GPU上的day-0支援,這加速了實際整合:工程師將能驗證QSA混合注意力與Muon優化器在真實工作負載上的擴展性,以及稀疏激活在哪些場景中能帶來最大效益。

目前仍不清楚,在獨立重現以及更廣泛的任務(包括超出編碼範圍的複雜多模態場景)中,這些宣稱的優勢能維持多少。接下來的研究可能會聚焦於各架構組件的消融實驗,以及QSA與其他混合或稀疏方法的比較。

這次發布的主要結論是:在AI前沿,效率的進一步提升不僅來自參數的增加,更來自對激活機制、混合注意力與優化的徹底革新。在開放權重生態系中,這在成本與工程效率上對封閉前沿模型構成了實質競爭。

7 浏览量

來源

  • AI资讯 | 实时追踪人工智能行业最新动态与热点快讯 - AIHub

  • Alibaba's Qwen to open-source Qwen3.8-Flash-Next, previewing Qwen4 architecture · TechNode

  • Alibaba's Qwen team releases Qwen3.8-Flash-Next: A 125B Multimodal MoE With 6B Active Parameters Previewing the Qwen4 Architecture - MarkTechPost

  • Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency - Qwen Blog

  • Qwen on X - Official benchmarks announcement

  • Experiment with Qwen3.8-Flash-Next on NVIDIA GB300 NVL72 for Agentic Coding | NVIDIA Technical Blog

  • DeepSeek V4 Flash: 284B MoE, 1M Context, Benchmarks, Pricing (2026)

  • vLLM on X - Day-0 support announcement

  • Qwen/Qwen3.8-Flash-Next — 176B / 6B active · MOE · 256K ctx

  • Alibaba's Qwen launches Qwen3.8-Flash AI model with lower training costs - Yahoo News

  • Alibaba Releases Smaller Qwen AI Model to Compete With Anthropic, DeepSeek - Bloomberg

  • DeepSeek-V4-Flash · Hugging Face

阅读更多关于此主题的文章:

发现错误或不准确的地方吗?我们会尽快处理您的评论。