Le 26 août 2026, l'équipe Qwen d'Alibaba a ouvert les poids du modèle Qwen3.8-Flash-Next — une architecture MoE multimodale avec 125 milliards de paramètres pour le modèle principal et 51 milliards supplémentaires dans la couche d'embedding N-gram, avec seulement 6 milliards de paramètres activés par jeton. Il s'agit d'un aperçu précoce de l'architecture Qwen4, destiné à permettre à la communauté d'adapter l'infrastructure et les outils avant la sortie complète de la famille Qwen4.
L'architecture du modèle introduit quatre innovations clés : l'attention hybride combinant Gated DeltaNet (GDN) avec Qwen Sparse Attention (QSA), les connexions résiduelles avec portes, l'embedding N-gram et l'optimiseur Muon. Par rapport à Qwen3.7-Plus (397 milliards de paramètres, 17 milliards actifs), l'entraînement a coûté environ neuf fois moins cher, tout en améliorant nettement les performances dans les tâches de codage et les scénarios bureautiques. Cela résulte non pas d'une simple mise à l'échelle incrémentale, mais d'une refonte radicale des mécanismes d'activation et d'optimisation.
Les benchmarks officiels montrent une supériorité sur les versions précédentes de Qwen et des résultats compétitifs : 62,5 sur SWE-bench Pro (par rapport aux données de Claude Opus 4.6), 73,9 sur CoWorkBench, 58,7 sur DeepSWE 1.1 et 84,5 sur AndroidWorld. Le contexte natif de 262 mille jetons est étendu à 1 millions via YaRN. Avec un taux de hit de 90% dans le cache de prefill, Qwen3.8-Flash-Next atteint une augmentation de 8,6 fois du débit de prefill par rapport à Qwen3.7-Plus, et avec 1 millions de jetons, QSA accélère l'attention de 7,6 fois en prefill et de 4,9 fois en décodage.
Il est important de noter que la méthodologie d'évaluation repose principalement sur des tests internes de Qwen, y compris des benchmarks de codage agentique et bureautique. Au moment de la sortie, il n'existe pas de vérifications indépendantes par des tiers, et les comparaisons publiées sont sélectives — principalement sur des tâches où l'activation éparse est avantageuse. C'est une situation typique pour les laboratoires asiatiques, où les détails complets de l'entraînement et des données restent confidentiels, mais Alibaba a choisi d'ouvrir les poids pour obtenir un retour précoce de la communauté.
Dans le paysage des modèles MoE, Qwen3.8-Flash-Next se distingue de DeepSeek-V4-Flash (284 milliards / 13 milliards actifs) par un nombre plus faible de paramètres actifs tout en offrant des performances comparables ou supérieures sur les tâches agentiques. Cette différence dans les choix architecturaux reflète un changement plus large dans les approches : alors que les laboratoires américains continuent d'investir dans la mise à l'échelle de modèles denses, les équipes chinoises misent de plus en plus sur la parcimonie, l'attention hybride et des couches d'embedding spécialisées (comme N-gram) pour réduire les coûts d'entraînement et d'inférence.
La publication des poids ouverts de Qwen3.8-Flash-Next permet aux développeurs de tester l'architecture avant la sortie complète de Qwen4. vLLM et SGLang offrent déjà un support day-0 sur les GPU NVIDIA et AMD, ce qui accélère l'intégration pratique : les ingénieurs pourront vérifier comment l'attention hybride QSA et l'optimiseur Muon se comportent sur des charges de travail réelles et dans quels scénarios l'activation éparse offre le meilleur gain.
Il reste à déterminer dans quelle mesure les avantages annoncés sont durables lors d'une reproduction indépendante et sur un éventail plus large de tâches, y compris des scénarios multimodaux complexes au-delà du codage. Les prochains travaux de recherche se concentreront probablement sur des ablations des composants architecturaux individuels et sur la comparaison de QSA avec d'autres approches hybrides et éparses.
Le principal enseignement de cette sortie est la démonstration qu'à la frontière de l'IA, les progrès en efficacité ne proviennent pas seulement de l'augmentation des paramètres, mais aussi d'une refonte radicale des mécanismes d'activation, de l'attention hybride et de l'optimisation. Dans l'écosystème des poids ouverts, cela crée une réelle concurrence aux modèles de pointe fermés sur la base du coût et de l'efficacité technique.
