26 আগস্ট 2026 সালে Alibaba-এর Qwen টিম Qwen3.8-Flash-Next মডেলের ওজন প্রকাশ করেছে — এটি একটি মাল্টিমোডাল MoE আর্কিটেকচার যার মূল মডেলে 125 বিলিয়ন প্যারামিটার এবং N-gram এমবেডিং স্তরে অতিরিক্ত 51 বিলিয়ন প্যারামিটার রয়েছে, তবে প্রতি টোকেনে মাত্র 6 বিলিয়ন প্যারামিটার সক্রিয় হয়। এটি Qwen4 আর্কিটেকচারের একটি প্রাথমিক প্রিভিউ, যা সম্প্রদায়কে Qwen4 পরিবারের সম্পূর্ণ রিলিজের আগে অবকাঠামো এবং সরঞ্জামগুলিকে মানিয়ে নেওয়ার সুযোগ দেয়।
মডেল আর্কিটেকচারটি চারটি মূল উদ্ভাবন প্রবর্তন করে: হাইব্রিড অ্যাটেনশন যা Gated DeltaNet (GDN) এবং Qwen Sparse Attention (QSA) একত্রিত করে, গেটেড রেসিডুয়াল কানেকশন, N-gram এমবেডিং এবং Muon অপ্টিমাইজার। Qwen3.7-Plus (397 বিলিয়ন প্যারামিটার, 17 বিলিয়ন সক্রিয়) এর তুলনায় প্রশিক্ষণ প্রায় নয় গুণ সস্তা হয়েছে, অন্যদিকে কোডিং এবং অফিসিয়াল কাজের ক্ষেত্রে কর্মক্ষমতা উল্লেখযোগ্যভাবে উন্নত হয়েছে। এটি কেবল ক্রমবর্ধমান স্কেলিংয়ের ফল নয়, বরং অ্যাক্টিভেশন মেকানিজম এবং অপ্টিমাইজেশনের আমূল পুনর্নির্মাণের ফল।
অফিসিয়াল বেঞ্চমার্কগুলি পূর্ববর্তী Qwen সংস্করণ এবং প্রতিযোগিতামূলক ফলাফলের উপর শ্রেষ্ঠত্ব দেখায়: SWE-bench Pro-তে 62,5 (Claude Opus 4.6 ডেটার তুলনায়), CoWorkBench-এ 73,9, DeepSWE 1.1-এ 58,7 এবং AndroidWorld-এ 84,5। নেটিভ কনটেক্সট 262 হাজার টোকেন YaRN-এর মাধ্যমে 1 মিলিয়নে প্রসারিত হয়। 90% প্রিফিল ক্যাশে হিটের শর্তে, Qwen3.8-Flash-Next Qwen3.7-Plus-এর তুলনায় প্রিফিল থ্রুপুটে 8,6-গুণ বৃদ্ধি অর্জন করে, এবং 1 মিলিয়ন টোকেনে QSA প্রিফিলে 7,6 গুণ এবং ডিকোডে 4,9 গুণ অ্যাটেনশন ত্বরণ প্রদান করে।
এটি লক্ষণীয় যে মূল্যায়ন পদ্ধতি প্রধানত Qwen-এর অভ্যন্তরীণ পরীক্ষার উপর নির্ভর করে, যার মধ্যে এজেন্টিক কোডিং এবং অফিসিয়াল বেঞ্চমার্ক অন্তর্ভুক্ত। প্রকাশের সময় স্বাধীন তৃতীয় পক্ষের যাচাইকরণ নেই, এবং প্রকাশিত তুলনাগুলি নির্বাচনী — মূলত সেই কাজগুলিতে যেখানে স্পার্স অ্যাক্টিভেশন জয়ী হয়। এটি এশিয়ার ল্যাবরেটরিগুলির জন্য একটি সাধারণ পরিস্থিতি, যেখানে প্রশিক্ষণ এবং ডেটার সম্পূর্ণ বিবরণ গোপন থাকে, তবে Alibaba সম্প্রদায়ের প্রাথমিক প্রতিক্রিয়ার জন্য ওজন প্রকাশের পথ বেছে নিয়েছে।
MoE মডেলের ল্যান্ডস্কেপে, Qwen3.8-Flash-Next DeepSeek-V4-Flash (284 বিলিয়ন / 13 বিলিয়ন সক্রিয়) থেকে কম সক্রিয় প্যারামিটার দ্বারা আলাদা, এজেন্টিক কাজগুলিতে তুলনামূলক বা ভাল কর্মক্ষমতা সহ। আর্কিটেকচারাল পছন্দের এই পার্থক্য পদ্ধতির বিস্তৃত পরিবর্তনকে প্রতিফলিত করে: যেখানে আমেরিকান ল্যাবরেটরিগুলি ঘন মডেল স্কেলিংয়ে বিনিয়োগ চালিয়ে যাচ্ছে, চীনা দলগুলি ক্রমবর্ধমানভাবে স্পার্সিটি, হাইব্রিড অ্যাটেনশন এবং বিশেষায়িত এমবেডিং স্তর (যেমন N-gram) এর উপর জোর দিচ্ছে প্রশিক্ষণ এবং ইনফারেন্স খরচ কমাতে।
Qwen3.8-Flash-Next-এর ওপেন ওয়েট প্রকাশ ডেভেলপারদের সম্পূর্ণ Qwen4-এর আগে আর্কিটেকচার পরীক্ষা করার অনুমতি দেয়। vLLM এবং SGLang ইতিমধ্যে NVIDIA এবং AMD GPU-তে day-0 সমর্থন প্রদান করে, যা ব্যবহারিক একীকরণকে ত্বরান্বিত করে: প্রকৌশলীরা যাচাই করতে পারবেন যে QSA হাইব্রিড অ্যাটেনশন এবং Muon অপ্টিমাইজার বাস্তব workloads-এ কতটা স্কেল করে এবং কোন পরিস্থিতিতে স্পার্স অ্যাক্টিভেশন সর্বাধিক সুবিধা দেয়।
স্বাধীন পুনরুত্পাদন এবং কোডিংয়ের বাইরে জটিল মাল্টিমোডাল পরিস্থিতি সহ বিস্তৃত কাজের ক্ষেত্রে দাবিকৃত সুবিধাগুলি কতটা টেকসই তা অস্পষ্ট রয়ে গেছে। পরবর্তী গবেষণা কাজগুলি সম্ভবত পৃথক আর্কিটেকচারাল উপাদানগুলির অ্যাবলেশন এবং অন্যান্য হাইব্রিড ও স্পার্স পদ্ধতির সাথে QSA-এর তুলনার উপর ফোকাস করবে।
রিলিজের প্রধান ফলাফল হল প্রদর্শন যে AI-এর সীমান্তে দক্ষতায় আরও অগ্রগতি কেবল প্যারামিটার বৃদ্ধির মাধ্যমে নয়, বরং অ্যাক্টিভেশন মেকানিজম, হাইব্রিড অ্যাটেনশন এবং অপ্টিমাইজেশনের আমূল পুনর্নির্মাণের মাধ্যমে অর্জিত হয়। ওপেন ওয়েট ইকোসিস্টেমে, এটি খরচ এবং প্রকৌশল দক্ষতার ভিত্তিতে বন্ধ ফ্রন্টিয়ার মডেলগুলির সাথে প্রকৃত প্রতিযোগিতা তৈরি করে।
