26月2026日、AlibabaのQwenチームは、Qwen3.8-Flash-Nextのウェイトを公開しました。これは、メインモデルが125億パラメータ、N-gram埋め込み層に追加の51億パラメータを持つマルチモーダルMoEアーキテクチャであり、各トークンに対してわずか6億パラメータがアクティブになります。これはQwen4アーキテクチャの初期プレビューであり、コミュニティがQwen4ファミリーの完全リリース前にインフラストラクチャとツールを適応できるようにすることを目的としています。
モデルのアーキテクチャは、Gated DeltaNet(GDN)とQwen Sparse Attention(QSA)を組み合わせたハイブリッドアテンション、ゲート付き残差接続、N-gram埋め込み、Muonオプティマイザという4つの主要な革新を導入しています。Qwen3.7-Plus(397億パラメータ、17億アクティブ)と比較して、トレーニングコストは約9分の1に抑えられ、コーディングタスクやオフィスシナリオでのパフォーマンスは大幅に向上しました。これは単なる段階的なスケーリングではなく、アクティベーションと最適化のメカニズムの根本的な再設計の結果です。
公式ベンチマークでは、以前のQwenバージョンや競合他社の結果を上回っています:SWE-bench Proで62,5(Claude Opus 4.6のデータと比較)、CoWorkBenchで73,9、DeepSWE 1.1で58,7、AndroidWorldで84,5。ネイティブコンテキストは262千トークンで、YaRNを通じて1百万に拡張されます。prefillキャッシュヒット率90%の場合、Qwen3.8-Flash-NextはQwen3.7-Plusと比較してprefillスループットが8,6倍向上し、1百万トークンではQSAによりprefillで7,6倍、decodeで4,9倍のアテンション高速化を実現します。
重要なのは、評価方法論が主にQwenの内部テスト(エージェント型コーディングやオフィスベンチマークを含む)に依存していることです。リリース時点では独立した第三者による検証はなく、公開されている比較は選択的であり、主にスパースアクティベーションが有利なタスクに焦点を当てています。これは、トレーニングとデータの詳細が非公開のままであるアジアの研究所では典型的な状況ですが、Alibabaはコミュニティからの早期フィードバックを得るためにウェイトを公開する道を選びました。
MoEモデルの状況において、Qwen3.8-Flash-NextはDeepSeek-V4-Flash(284億/13億アクティブ)とは異なり、エージェント型タスクで同等以上のパフォーマンスを維持しながら、アクティブパラメータ数が少なくなっています。このアーキテクチャ選択の違いは、アプローチのより広いシフトを反映しています:アメリカの研究所が高密度モデルのスケーリングに投資し続ける一方で、中国のチームはトレーニングと推論のコストを削減するために、スパース性、ハイブリッドアテンション、特殊な埋め込み層(N-gramなど)にますます重点を置いています。
Qwen3.8-Flash-Nextのオープンウェイトのリリースにより、開発者は完全なQwen4の前にアーキテクチャをテストできます。vLLMとSGLangはすでにNVIDIAおよびAMD GPUでのday-0サポートを提供しており、実践的な統合を加速します:エンジニアは、QSAハイブリッドアテンションとMuonオプティマイザが実際のワークロードでどのようにスケールするか、またスパースアクティベーションが最大の利益をもたらすシナリオを確認できます。
独立した再現や、コーディングを超えた複雑なマルチモーダルシナリオを含むより広範なタスクにおいて、主張された利点がどの程度持続可能であるかは不明のままです。今後の研究は、個々のアーキテクチャコンポーネントのアブレーション研究や、QSAと他のハイブリッドおよびスパースアプローチとの比較に焦点を当てる可能性が高いです。
このリリースの主な成果は、AIの最前線において、効率性のさらなる進歩がパラメータの増加だけでなく、アクティベーションメカニズム、ハイブリッドアテンション、最適化の根本的な再設計によって達成されることを示したことです。オープンウェイトのエコシステムにおいて、これはコストとエンジニアリング効率の点でクローズドなフロンティアモデルとの真の競争を生み出します。
