في 26 أغسطس 2026، أطلق فريق Qwen التابع لشركة Alibaba أوزان نموذج Qwen3.8-Flash-Next، وهو عبارة عن بنية MoE متعددة الوسائط تضم 125 مليار معلم في النموذج الأساسي و51 مليار معلم إضافي في طبقة N-gram embedding، مع تنشيط 6 مليارات معلم فقط لكل توكن. يعد هذا عرضًا مسبقًا مبكرًا لبنية Qwen4، ويهدف إلى تمكين المجتمع من تكييف البنية التحتية والأدوات قبل الإصدار الكامل لعائلة Qwen4.
تقدم بنية النموذج أربعة ابتكارات رئيسية: الانتباه الهجين الذي يجمع بين Gated DeltaNet (GDN) وQwen Sparse Attention (QSA)، وgated residual connections، وN-gram embedding، ومحسن Muon. ومقارنةً بنموذج Qwen3.7-Plus (397 مليار معلم، و17 مليار معلم نشط)، كانت تكلفة التدريب أقل بتسع مرات تقريبًا، مع تحسن ملحوظ في الأداء في مهام البرمجة والسيناريوهات المكتبية. ولم يكن هذا نتيجة لمجرد توسع تدريجي، بل لإعادة صياغة جذرية لآليات التنشيط والتحسين.
تُظهر المعايير الرسمية تفوقًا على الإصدارات السابقة من Qwen ونتائج تنافسية: 62.5 على SWE-bench Pro (مقارنةً ببيانات Claude Opus 4.6)، و73.9 على CoWorkBench، و58.7 على DeepSWE 1.1، و84.5 على AndroidWorld. السياق الأصلي 262 ألف رمز يتوسع إلى 1 مليون عبر YaRN. بشرط 90% إصابة في ذاكرة التخزين المؤقت prefill، يحقق Qwen3.8-Flash-Next زيادة 8.6 أضعاف في إنتاجية prefill مقارنةً بـ Qwen3.7-Plus، وعند 1 مليون رمز، يوفر QSA تسريعًا للانتباه بمقدار 7.6 مرة على prefill و4.9 مرة على decode.
من المهم ملاحظة أن منهجية التقييم تعتمد بشكل أساسي على الاختبارات الداخلية لـ Qwen، بما في ذلك معايير البرمجة الوكيلة والمهام المكتبية. في وقت الإصدار، لا توجد تحققات مستقلة من جهات خارجية، والمقارنات المنشورة تتم بشكل انتقائي — بشكل أساسي على المهام التي تفوز فيها التفعيلات المتفرقة. هذا وضع نموذجي للمختبرات في آسيا، حيث تظل تفاصيل التدريب والبيانات الكاملة مغلقة، لكن Alibaba اختارت مسار فتح الأوزان للحصول على ملاحظات مبكرة من المجتمع.
في مشهد نماذج MoE، يختلف Qwen3.8-Flash-Next عن DeepSeek-V4-Flash (284 مليار / 13 مليار نشط) بعدد أقل من المعلمات النشطة مع أداء مماثل أو أفضل في المهام الوكيلة. يعكس هذا الاختلاف في الخيارات المعمارية تحولًا أوسع في المناهج: بينما تواصل المختبرات الأمريكية الاستثمار في توسيع النماذج الكثيفة، تراهن الفرق الصينية بشكل متزايد على التشتت، والانتباه الهجين، وطبقات التضمين المتخصصة (مثل N-gram) لتقليل تكلفة التدريب والاستدلال.
إصدار الأوزان المفتوحة لـ Qwen3.8-Flash-Next يسمح للمطورين باختبار البنية قبل Qwen4 الكامل. توفر vLLM وSGLang بالفعل دعمًا من اليوم 0 على وحدات معالجة الرسوميات NVIDIA وAMD، وهذا يسرع التكامل العملي: سيتمكن المهندسون من التحقق من مدى قابلية توسيع الانتباه الهجين QSA ومحسن Muon على أعباء العمل الحقيقية وفي أي السيناريوهات يحقق التنشيط المتفرق أقصى ربح.
يبقى غير واضح مدى استدامة المزايا المعلنة عند إعادة الإنتاج المستقلة وعلى نطاق أوسع من المهام، بما في ذلك السيناريوهات متعددة الوسائط المعقدة التي تتجاوز نطاق البرمجة. من المحتمل أن تركز الأبحاث التالية على عمليات الإزالة للمكونات المعمارية الفردية ومقارنة QSA مع المناهج الهجينة والمتفرقة الأخرى.
الخلاصة الرئيسية للإصدار هي إظهار أن التقدم الإضافي في الكفاءة على حدود الذكاء الاصطناعي لا يتحقق فقط من خلال زيادة المعلمات، ولكن أيضًا من خلال إعادة صياغة جذرية لآليات التنشيط والانتباه الهجين والتحسين. في نظام الأوزان المفتوحة، يخلق هذا منافسة حقيقية للنماذج الحدودية المغلقة على أساس التكلفة والكفاءة الهندسية.
