26 अगस्त 2026 को Alibaba की Qwen टीम ने Qwen3.8-Flash-Next मॉडल के वज़न जारी किए — यह एक मल्टीमॉडल MoE आर्किटेक्चर है जिसमें मुख्य मॉडल के 125 अरब पैरामीटर और N-gram एम्बेडिंग परत में अतिरिक्त 51 अरब पैरामीटर हैं, जबकि प्रत्येक टोकन के लिए केवल 6 अरब पैरामीटर सक्रिय होते हैं। यह Qwen4 आर्किटेक्चर का एक प्रारंभिक पूर्वावलोकन है, जिसका उद्देश्य समुदाय को Qwen4 परिवार के पूर्ण रिलीज़ से पहले बुनियादी ढांचे और उपकरणों को अनुकूलित करने में सक्षम बनाना है।
मॉडल आर्किटेक्चर चार प्रमुख नवाचार पेश करता है: हाइब्रिड अटेंशन जो Gated DeltaNet (GDN) को Qwen Sparse Attention (QSA) के साथ जोड़ता है, गेटेड रेज़िड्यूअल कनेक्शन, N-gram एम्बेडिंग और Muon ऑप्टिमाइज़र। Qwen3.7-Plus (397 अरब पैरामीटर, 17 अरब सक्रिय) की तुलना में, प्रशिक्षण लगभग नौ गुना सस्ता रहा, जबकि कोडिंग और कार्यालय परिदृश्यों में प्रदर्शन में उल्लेखनीय सुधार हुआ। यह केवल वृद्धिशील स्केलिंग का परिणाम नहीं था, बल्कि सक्रियण तंत्र और अनुकूलन के आमूल-चूल पुनर्गठन का परिणाम था।
आधिकारिक बेंचमार्क पिछले Qwen संस्करणों और प्रतिस्पर्धी परिणामों पर श्रेष्ठता दिखाते हैं: SWE-bench Pro पर 62,5 (Claude Opus 4.6 के डेटा की तुलना में), CoWorkBench पर 73,9, DeepSWE 1.1 पर 58,7 और AndroidWorld पर 84,5। मूल संदर्भ 262 हज़ार टोकन YaRN के माध्यम से 1 मिलियन तक विस्तारित होता है। 90% प्रीफिल कैश हिट की स्थिति में, Qwen3.8-Flash-Next Qwen3.7-Plus की तुलना में प्रीफिल थ्रूपुट में 8,6 गुना वृद्धि प्राप्त करता है, और 1 मिलियन टोकन पर QSA प्रीफिल में 7,6 गुना और डिकोड में 4,9 गुना अटेंशन त्वरण प्रदान करता है।
यह ध्यान रखना महत्वपूर्ण है कि मूल्यांकन पद्धति मुख्य रूप से Qwen के आंतरिक परीक्षणों पर निर्भर करती है, जिसमें एजेंटिक कोडिंग और कार्यालय बेंचमार्क शामिल हैं। रिलीज़ के समय कोई स्वतंत्र तृतीय-पक्ष सत्यापन नहीं है, और प्रकाशित तुलनाएँ चुनिंदा रूप से की जाती हैं — मुख्य रूप से उन कार्यों पर जहाँ स्पार्स सक्रियण जीतता है। यह एशियाई प्रयोगशालाओं के लिए एक विशिष्ट स्थिति है, जहाँ प्रशिक्षण और डेटा के पूर्ण विवरण गोपनीय रहते हैं, हालाँकि Alibaba ने समुदाय से शीघ्र प्रतिक्रिया के लिए वज़न खोलने का मार्ग चुना है।
MoE मॉडल के परिदृश्य में, Qwen3.8-Flash-Next DeepSeek-V4-Flash (284 अरब / 13 अरब सक्रिय) से कम सक्रिय पैरामीटर रखता है, जबकि एजेंटिक कार्यों पर तुलनीय या बेहतर प्रदर्शन करता है। आर्किटेक्चरल विकल्पों में यह अंतर दृष्टिकोणों में व्यापक बदलाव को दर्शाता है: जहाँ अमेरिकी प्रयोगशालाएँ घने मॉडलों के स्केलिंग में निवेश करना जारी रखती हैं, वहीं चीनी टीमें तेजी से स्पार्सिटी, हाइब्रिड अटेंशन और विशेष एम्बेडिंग परतों (जैसे N-gram) पर दांव लगा रही हैं ताकि प्रशिक्षण और इन्फ्रेंस लागत कम हो सके।
Qwen3.8-Flash-Next के खुले वज़न का रिलीज़ डेवलपर्स को पूर्ण Qwen4 से पहले आर्किटेक्चर का परीक्षण करने की अनुमति देता है। vLLM और SGLang पहले से ही NVIDIA और AMD GPU पर day-0 समर्थन प्रदान करते हैं, और यह व्यावहारिक एकीकरण को गति देता है: इंजीनियर यह जाँच सकते हैं कि QSA हाइब्रिड अटेंशन और Muon ऑप्टिमाइज़र वास्तविक वर्कलोड पर कैसे स्केल करते हैं और किन परिदृश्यों में स्पार्स सक्रियण अधिकतम लाभ देता है।
यह स्पष्ट नहीं है कि स्वतंत्र पुनरुत्पादन और कोडिंग से परे जटिल मल्टीमॉडल परिदृश्यों सहित व्यापक कार्यों पर दावा किए गए लाभ कितने टिकाऊ हैं। अगले शोध कार्य संभवतः व्यक्तिगत आर्किटेक्चरल घटकों के एब्लेशन और QSA की अन्य हाइब्रिड और स्पार्स दृष्टिकोणों से तुलना पर केंद्रित होंगे।
रिलीज़ का मुख्य निष्कर्ष यह प्रदर्शित करना है कि AI की अग्रिम पंक्ति में, दक्षता में आगे की प्रगति केवल पैरामीटर बढ़ाने से नहीं, बल्कि सक्रियण तंत्र, हाइब्रिड अटेंशन और अनुकूलन के आमूल-चूल पुनर्गठन के माध्यम से प्राप्त होती है। खुले वज़न के पारिस्थितिकी तंत्र में, यह लागत और इंजीनियरिंग दक्षता के आधार पर बंद फ्रंटियर मॉडलों के लिए वास्तविक प्रतिस्पर्धा पैदा करता है।
