Qwen3.8-Flash-Next: Alibaba ने सक्रिय पैरामीटर घटाकर 6B किए और दक्षता में Claude Opus 4.6 से आगे निकल गया

द्वारा संपादित: Alex Khohlov

26 अगस्त 2026 को Alibaba की Qwen टीम ने Qwen3.8-Flash-Next मॉडल के वज़न जारी किए — यह एक मल्टीमॉडल MoE आर्किटेक्चर है जिसमें मुख्य मॉडल के 125 अरब पैरामीटर और N-gram एम्बेडिंग परत में अतिरिक्त 51 अरब पैरामीटर हैं, जबकि प्रत्येक टोकन के लिए केवल 6 अरब पैरामीटर सक्रिय होते हैं। यह Qwen4 आर्किटेक्चर का एक प्रारंभिक पूर्वावलोकन है, जिसका उद्देश्य समुदाय को Qwen4 परिवार के पूर्ण रिलीज़ से पहले बुनियादी ढांचे और उपकरणों को अनुकूलित करने में सक्षम बनाना है।

मॉडल आर्किटेक्चर चार प्रमुख नवाचार पेश करता है: हाइब्रिड अटेंशन जो Gated DeltaNet (GDN) को Qwen Sparse Attention (QSA) के साथ जोड़ता है, गेटेड रेज़िड्यूअल कनेक्शन, N-gram एम्बेडिंग और Muon ऑप्टिमाइज़र। Qwen3.7-Plus (397 अरब पैरामीटर, 17 अरब सक्रिय) की तुलना में, प्रशिक्षण लगभग नौ गुना सस्ता रहा, जबकि कोडिंग और कार्यालय परिदृश्यों में प्रदर्शन में उल्लेखनीय सुधार हुआ। यह केवल वृद्धिशील स्केलिंग का परिणाम नहीं था, बल्कि सक्रियण तंत्र और अनुकूलन के आमूल-चूल पुनर्गठन का परिणाम था।

आधिकारिक बेंचमार्क पिछले Qwen संस्करणों और प्रतिस्पर्धी परिणामों पर श्रेष्ठता दिखाते हैं: SWE-bench Pro पर 62,5 (Claude Opus 4.6 के डेटा की तुलना में), CoWorkBench पर 73,9, DeepSWE 1.1 पर 58,7 और AndroidWorld पर 84,5। मूल संदर्भ 262 हज़ार टोकन YaRN के माध्यम से 1 मिलियन तक विस्तारित होता है। 90% प्रीफिल कैश हिट की स्थिति में, Qwen3.8-Flash-Next Qwen3.7-Plus की तुलना में प्रीफिल थ्रूपुट में 8,6 गुना वृद्धि प्राप्त करता है, और 1 मिलियन टोकन पर QSA प्रीफिल में 7,6 गुना और डिकोड में 4,9 गुना अटेंशन त्वरण प्रदान करता है।

यह ध्यान रखना महत्वपूर्ण है कि मूल्यांकन पद्धति मुख्य रूप से Qwen के आंतरिक परीक्षणों पर निर्भर करती है, जिसमें एजेंटिक कोडिंग और कार्यालय बेंचमार्क शामिल हैं। रिलीज़ के समय कोई स्वतंत्र तृतीय-पक्ष सत्यापन नहीं है, और प्रकाशित तुलनाएँ चुनिंदा रूप से की जाती हैं — मुख्य रूप से उन कार्यों पर जहाँ स्पार्स सक्रियण जीतता है। यह एशियाई प्रयोगशालाओं के लिए एक विशिष्ट स्थिति है, जहाँ प्रशिक्षण और डेटा के पूर्ण विवरण गोपनीय रहते हैं, हालाँकि Alibaba ने समुदाय से शीघ्र प्रतिक्रिया के लिए वज़न खोलने का मार्ग चुना है।

MoE मॉडल के परिदृश्य में, Qwen3.8-Flash-Next DeepSeek-V4-Flash (284 अरब / 13 अरब सक्रिय) से कम सक्रिय पैरामीटर रखता है, जबकि एजेंटिक कार्यों पर तुलनीय या बेहतर प्रदर्शन करता है। आर्किटेक्चरल विकल्पों में यह अंतर दृष्टिकोणों में व्यापक बदलाव को दर्शाता है: जहाँ अमेरिकी प्रयोगशालाएँ घने मॉडलों के स्केलिंग में निवेश करना जारी रखती हैं, वहीं चीनी टीमें तेजी से स्पार्सिटी, हाइब्रिड अटेंशन और विशेष एम्बेडिंग परतों (जैसे N-gram) पर दांव लगा रही हैं ताकि प्रशिक्षण और इन्फ्रेंस लागत कम हो सके।

Qwen3.8-Flash-Next के खुले वज़न का रिलीज़ डेवलपर्स को पूर्ण Qwen4 से पहले आर्किटेक्चर का परीक्षण करने की अनुमति देता है। vLLM और SGLang पहले से ही NVIDIA और AMD GPU पर day-0 समर्थन प्रदान करते हैं, और यह व्यावहारिक एकीकरण को गति देता है: इंजीनियर यह जाँच सकते हैं कि QSA हाइब्रिड अटेंशन और Muon ऑप्टिमाइज़र वास्तविक वर्कलोड पर कैसे स्केल करते हैं और किन परिदृश्यों में स्पार्स सक्रियण अधिकतम लाभ देता है।

यह स्पष्ट नहीं है कि स्वतंत्र पुनरुत्पादन और कोडिंग से परे जटिल मल्टीमॉडल परिदृश्यों सहित व्यापक कार्यों पर दावा किए गए लाभ कितने टिकाऊ हैं। अगले शोध कार्य संभवतः व्यक्तिगत आर्किटेक्चरल घटकों के एब्लेशन और QSA की अन्य हाइब्रिड और स्पार्स दृष्टिकोणों से तुलना पर केंद्रित होंगे।

रिलीज़ का मुख्य निष्कर्ष यह प्रदर्शित करना है कि AI की अग्रिम पंक्ति में, दक्षता में आगे की प्रगति केवल पैरामीटर बढ़ाने से नहीं, बल्कि सक्रियण तंत्र, हाइब्रिड अटेंशन और अनुकूलन के आमूल-चूल पुनर्गठन के माध्यम से प्राप्त होती है। खुले वज़न के पारिस्थितिकी तंत्र में, यह लागत और इंजीनियरिंग दक्षता के आधार पर बंद फ्रंटियर मॉडलों के लिए वास्तविक प्रतिस्पर्धा पैदा करता है।

7 दृश्य

स्रोतों

  • AI资讯 | 实时追踪人工智能行业最新动态与热点快讯 - AIHub

  • Alibaba's Qwen to open-source Qwen3.8-Flash-Next, previewing Qwen4 architecture · TechNode

  • Alibaba's Qwen team releases Qwen3.8-Flash-Next: A 125B Multimodal MoE With 6B Active Parameters Previewing the Qwen4 Architecture - MarkTechPost

  • Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency - Qwen Blog

  • Qwen on X - Official benchmarks announcement

  • Experiment with Qwen3.8-Flash-Next on NVIDIA GB300 NVL72 for Agentic Coding | NVIDIA Technical Blog

  • DeepSeek V4 Flash: 284B MoE, 1M Context, Benchmarks, Pricing (2026)

  • vLLM on X - Day-0 support announcement

  • Qwen/Qwen3.8-Flash-Next — 176B / 6B active · MOE · 256K ctx

  • Alibaba's Qwen launches Qwen3.8-Flash AI model with lower training costs - Yahoo News

  • Alibaba Releases Smaller Qwen AI Model to Compete With Anthropic, DeepSeek - Bloomberg

  • DeepSeek-V4-Flash · Hugging Face

इस विषय पर अधिक लेख पढ़ें:

क्या आपने कोई गलती या अशुद्धि पाई?हम जल्द ही आपकी टिप्पणियों पर विचार करेंगे।