26月2026日,阿里巴巴的Qwen團隊開放了Qwen3.8-Flash-Next的模型權重——這是一個多模態MoE架構,主模型有125億參數,另外在N-gram嵌入層有51億參數,而每個token僅啟動6億參數。這是Qwen4架構的早期預覽,旨在讓社群在Qwen4系列完整發布前,能提前調整基礎設施與工具。
模型架構引入了四項關鍵創新:混合注意力(結合Gated DeltaNet(GDN)與Qwen Sparse Attention(QSA))、閘控殘差連接、N-gram嵌入,以及Muon優化器。與Qwen3.7-Plus(397億參數,17億活躍)相比,訓練成本約降低九倍,同時在編碼與辦公場景的效能顯著提升。這並非單純的增量擴展,而是對激活機制與優化方式的徹底革新。
官方基準測試顯示,其表現優於先前的Qwen版本及競爭對手:SWE-bench Pro上為62,5(對比Claude Opus 4.6的數據),CoWorkBench上為73,9,DeepSWE 1.1上為58,7,AndroidWorld上為84,5。原生上下文262千個token,可透過YaRN擴展至1百萬。在prefill快取命中率為90%的條件下,Qwen3.8-Flash-Next的prefill吞吐量相較Qwen3.7-Plus提升8,6倍;而在1百萬token時,QSA在prefill階段加速注意力7,6倍,在decode階段加速4,9倍。
值得注意的是,評估方法主要依賴Qwen的內部測試,包括agentic coding與辦公基準。發布時尚無獨立的第三方驗證,公開的比較也是選擇性的——主要集中在稀疏激活佔優勢的任務上。這是亞洲實驗室的典型情況,訓練與數據的完整細節保持不公開,但阿里巴巴選擇開放權重以獲取社群的早期回饋。
在MoE模型格局中,Qwen3.8-Flash-Next與DeepSeek-V4-Flash(284億/13億活躍)相比,活躍參數更少,但在agentic任務上表現相當或更佳。這種架構選擇的差異反映了更廣泛的方法轉變:美國實驗室持續投資於密集模型的規模化,而中國團隊則越來越傾向於稀疏性、混合注意力與專門的嵌入層(如N-gram),以降低訓練與推論成本。
Qwen3.8-Flash-Next開放權重的發布,讓開發者能在Qwen4完整推出前測試架構。vLLM與SGLang已提供NVIDIA與AMD GPU上的day-0支援,這加速了實際整合:工程師將能驗證QSA混合注意力與Muon優化器在真實工作負載上的擴展性,以及稀疏激活在哪些場景中能帶來最大效益。
目前仍不清楚,在獨立重現以及更廣泛的任務(包括超出編碼範圍的複雜多模態場景)中,這些宣稱的優勢能維持多少。接下來的研究可能會聚焦於各架構組件的消融實驗,以及QSA與其他混合或稀疏方法的比較。
這次發布的主要結論是:在AI前沿,效率的進一步提升不僅來自參數的增加,更來自對激活機制、混合注意力與優化的徹底革新。在開放權重生態系中,這在成本與工程效率上對封閉前沿模型構成了實質競爭。
