Qwen3.8-Flash-Next: Alibaba reduziert aktive Parameter auf 6B und übertrifft Claude Opus 4.6 an Effizienz

Bearbeitet von: Alex Khohlov

Am 26. August 2026 hat das Qwen-Team von Alibaba die Gewichte des Modells Qwen3.8-Flash-Next veröffentlicht – einer multimodalen MoE-Architektur mit 125 Milliarden Parametern im Hauptmodell und zusätzlichen 51 Milliarden in der N-gram-Embedding-Schicht, wobei pro Token nur 6 Milliarden Parameter aktiviert werden. Dies ist eine frühe Vorschau auf die Qwen4-Architektur, die der Community ermöglichen soll, Infrastruktur und Werkzeuge vor der vollständigen Veröffentlichung der Qwen4-Familie anzupassen.

Die Architektur des Modells führt vier zentrale Innovationen ein: hybride Aufmerksamkeit, die Gated DeltaNet (GDN) mit Qwen Sparse Attention (QSA) verbindet, gated residual connections, N-gram-Embedding und den Optimierer Muon. Im Vergleich zu Qwen3.7-Plus (397 Milliarden Parameter, 17 Milliarden aktiv) war das Training etwa neunmal günstiger, während die Leistung bei Programmieraufgaben und Büroszenarien deutlich gestiegen ist. Dies war das Ergebnis nicht nur einer inkrementellen Skalierung, sondern einer radikalen Überarbeitung der Aktivierungs- und Optimierungsmechanismen.

Offizielle Benchmarks zeigen eine Überlegenheit gegenüber früheren Qwen-Versionen und konkurrierenden Ergebnissen: 62,5 bei SWE-bench Pro (im Vergleich zu den Daten von Claude Opus 4.6), 73,9 bei CoWorkBench, 58,7 bei DeepSWE 1.1 und 84,5 bei AndroidWorld. Der native Kontext von 262 Tausend Token wird über YaRN auf 1 Millionen erweitert. Unter der Bedingung eines 90%-Treffers im Prefill-Cache erreicht Qwen3.8-Flash-Next eine 8,6-fache Steigerung des Prefill-Durchsatzes im Vergleich zu Qwen3.7-Plus, und bei 1 Millionen Token beschleunigt QSA die Aufmerksamkeit um das 7,6-fache beim Prefill und 4,9-fache beim Decode.

Wichtig zu erwähnen ist, dass die Bewertungsmethodik hauptsächlich auf internen Qwen-Tests basiert, einschließlich agentischer Programmier- und Büro-Benchmarks. Zum Zeitpunkt der Veröffentlichung gibt es keine unabhängigen externen Verifizierungen, und die veröffentlichten Vergleiche werden selektiv durchgeführt – hauptsächlich bei Aufgaben, bei denen die sparse Aktivierung gewinnt. Dies ist eine typische Situation für Labore in Asien, wo die vollständigen Details zu Training und Daten vertraulich bleiben, aber Alibaba hat den Weg der Veröffentlichung der Gewichte für frühes Community-Feedback gewählt.

In der Landschaft der MoE-Modelle unterscheidet sich Qwen3.8-Flash-Next von DeepSeek-V4-Flash (284 Milliarden / 13 Milliarden aktiv) durch eine geringere Anzahl aktiver Parameter bei vergleichbarer oder besserer Leistung bei agentischen Aufgaben. Dieser Unterschied in den architektonischen Entscheidungen spiegelt eine breitere Verschiebung in den Ansätzen wider: Während amerikanische Labore weiterhin in die Skalierung dichter Modelle investieren, setzen chinesische Teams zunehmend auf Sparsity, hybride Aufmerksamkeit und spezialisierte Embedding-Schichten (wie N-gram), um die Kosten für Training und Inferenz zu senken.

Die Veröffentlichung der offenen Gewichte von Qwen3.8-Flash-Next ermöglicht es Entwicklern, die Architektur vor dem vollwertigen Qwen4 zu testen. vLLM und SGLang bieten bereits Day-0-Unterstützung auf NVIDIA- und AMD-GPUs, was die praktische Integration beschleunigt: Ingenieure können überprüfen, wie gut die hybride Aufmerksamkeit QSA und der Muon-Optimierer auf realen Workloads skalieren und in welchen Szenarien die sparse Aktivierung den größten Gewinn bringt.

Es bleibt unklar, wie stabil die behaupteten Vorteile bei unabhängiger Reproduktion und bei einem breiteren Spektrum von Aufgaben sind, einschließlich komplexer multimodaler Szenarien, die über das Programmieren hinausgehen. Zukünftige Forschungsarbeiten werden sich wahrscheinlich auf Ablationen einzelner architektonischer Komponenten und den Vergleich von QSA mit anderen hybriden und sparsen Ansätzen konzentrieren.

Das Hauptergebnis der Veröffentlichung ist die Demonstration, dass an der Spitze der KI weitere Fortschritte in der Effizienz nicht nur durch die Erhöhung der Parameter erreicht werden, sondern auch durch eine radikale Überarbeitung der Aktivierungsmechanismen, der hybriden Aufmerksamkeit und der Optimierung. Im Ökosystem der offenen Gewichte schafft dies einen echten Wettbewerb für geschlossene Frontier-Modelle auf der Grundlage von Kosten und technischer Effizienz.

7 Ansichten

Quellen

  • AI资讯 | 实时追踪人工智能行业最新动态与热点快讯 - AIHub

  • Alibaba's Qwen to open-source Qwen3.8-Flash-Next, previewing Qwen4 architecture · TechNode

  • Alibaba's Qwen team releases Qwen3.8-Flash-Next: A 125B Multimodal MoE With 6B Active Parameters Previewing the Qwen4 Architecture - MarkTechPost

  • Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency - Qwen Blog

  • Qwen on X - Official benchmarks announcement

  • Experiment with Qwen3.8-Flash-Next on NVIDIA GB300 NVL72 for Agentic Coding | NVIDIA Technical Blog

  • DeepSeek V4 Flash: 284B MoE, 1M Context, Benchmarks, Pricing (2026)

  • vLLM on X - Day-0 support announcement

  • Qwen/Qwen3.8-Flash-Next — 176B / 6B active · MOE · 256K ctx

  • Alibaba's Qwen launches Qwen3.8-Flash AI model with lower training costs - Yahoo News

  • Alibaba Releases Smaller Qwen AI Model to Compete With Anthropic, DeepSeek - Bloomberg

  • DeepSeek-V4-Flash · Hugging Face

Lesen Sie mehr Artikel zu diesem Thema:

Haben Sie einen Fehler oder eine Ungenauigkeit festgestellt?Wir werden Ihre Kommentare so schnell wie möglich berücksichtigen.