Qwen3.8-Flash-Next : Alibaba réduit les paramètres actifs à 6B et surpasse Claude Opus 4.6 en efficacité

Édité par : Alex Khohlov

Le 26 août 2026, l'équipe Qwen d'Alibaba a ouvert les poids du modèle Qwen3.8-Flash-Next — une architecture MoE multimodale avec 125 milliards de paramètres pour le modèle principal et 51 milliards supplémentaires dans la couche d'embedding N-gram, avec seulement 6 milliards de paramètres activés par jeton. Il s'agit d'un aperçu précoce de l'architecture Qwen4, destiné à permettre à la communauté d'adapter l'infrastructure et les outils avant la sortie complète de la famille Qwen4.

L'architecture du modèle introduit quatre innovations clés : l'attention hybride combinant Gated DeltaNet (GDN) avec Qwen Sparse Attention (QSA), les connexions résiduelles avec portes, l'embedding N-gram et l'optimiseur Muon. Par rapport à Qwen3.7-Plus (397 milliards de paramètres, 17 milliards actifs), l'entraînement a coûté environ neuf fois moins cher, tout en améliorant nettement les performances dans les tâches de codage et les scénarios bureautiques. Cela résulte non pas d'une simple mise à l'échelle incrémentale, mais d'une refonte radicale des mécanismes d'activation et d'optimisation.

Les benchmarks officiels montrent une supériorité sur les versions précédentes de Qwen et des résultats compétitifs : 62,5 sur SWE-bench Pro (par rapport aux données de Claude Opus 4.6), 73,9 sur CoWorkBench, 58,7 sur DeepSWE 1.1 et 84,5 sur AndroidWorld. Le contexte natif de 262 mille jetons est étendu à 1 millions via YaRN. Avec un taux de hit de 90% dans le cache de prefill, Qwen3.8-Flash-Next atteint une augmentation de 8,6 fois du débit de prefill par rapport à Qwen3.7-Plus, et avec 1 millions de jetons, QSA accélère l'attention de 7,6 fois en prefill et de 4,9 fois en décodage.

Il est important de noter que la méthodologie d'évaluation repose principalement sur des tests internes de Qwen, y compris des benchmarks de codage agentique et bureautique. Au moment de la sortie, il n'existe pas de vérifications indépendantes par des tiers, et les comparaisons publiées sont sélectives — principalement sur des tâches où l'activation éparse est avantageuse. C'est une situation typique pour les laboratoires asiatiques, où les détails complets de l'entraînement et des données restent confidentiels, mais Alibaba a choisi d'ouvrir les poids pour obtenir un retour précoce de la communauté.

Dans le paysage des modèles MoE, Qwen3.8-Flash-Next se distingue de DeepSeek-V4-Flash (284 milliards / 13 milliards actifs) par un nombre plus faible de paramètres actifs tout en offrant des performances comparables ou supérieures sur les tâches agentiques. Cette différence dans les choix architecturaux reflète un changement plus large dans les approches : alors que les laboratoires américains continuent d'investir dans la mise à l'échelle de modèles denses, les équipes chinoises misent de plus en plus sur la parcimonie, l'attention hybride et des couches d'embedding spécialisées (comme N-gram) pour réduire les coûts d'entraînement et d'inférence.

La publication des poids ouverts de Qwen3.8-Flash-Next permet aux développeurs de tester l'architecture avant la sortie complète de Qwen4. vLLM et SGLang offrent déjà un support day-0 sur les GPU NVIDIA et AMD, ce qui accélère l'intégration pratique : les ingénieurs pourront vérifier comment l'attention hybride QSA et l'optimiseur Muon se comportent sur des charges de travail réelles et dans quels scénarios l'activation éparse offre le meilleur gain.

Il reste à déterminer dans quelle mesure les avantages annoncés sont durables lors d'une reproduction indépendante et sur un éventail plus large de tâches, y compris des scénarios multimodaux complexes au-delà du codage. Les prochains travaux de recherche se concentreront probablement sur des ablations des composants architecturaux individuels et sur la comparaison de QSA avec d'autres approches hybrides et éparses.

Le principal enseignement de cette sortie est la démonstration qu'à la frontière de l'IA, les progrès en efficacité ne proviennent pas seulement de l'augmentation des paramètres, mais aussi d'une refonte radicale des mécanismes d'activation, de l'attention hybride et de l'optimisation. Dans l'écosystème des poids ouverts, cela crée une réelle concurrence aux modèles de pointe fermés sur la base du coût et de l'efficacité technique.

7 Vues

Sources

  • AI资讯 | 实时追踪人工智能行业最新动态与热点快讯 - AIHub

  • Alibaba's Qwen to open-source Qwen3.8-Flash-Next, previewing Qwen4 architecture · TechNode

  • Alibaba's Qwen team releases Qwen3.8-Flash-Next: A 125B Multimodal MoE With 6B Active Parameters Previewing the Qwen4 Architecture - MarkTechPost

  • Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency - Qwen Blog

  • Qwen on X - Official benchmarks announcement

  • Experiment with Qwen3.8-Flash-Next on NVIDIA GB300 NVL72 for Agentic Coding | NVIDIA Technical Blog

  • DeepSeek V4 Flash: 284B MoE, 1M Context, Benchmarks, Pricing (2026)

  • vLLM on X - Day-0 support announcement

  • Qwen/Qwen3.8-Flash-Next — 176B / 6B active · MOE · 256K ctx

  • Alibaba's Qwen launches Qwen3.8-Flash AI model with lower training costs - Yahoo News

  • Alibaba Releases Smaller Qwen AI Model to Compete With Anthropic, DeepSeek - Bloomberg

  • DeepSeek-V4-Flash · Hugging Face

Lire plus d'articles sur ce sujet :

Avez-vous trouvé une erreur ou une inexactitude ?Nous étudierons vos commentaires dans les plus brefs délais.