26 Ağustos 2026 tarihinde Alibaba'nın Qwen ekibi, Qwen3.8-Flash-Next modelinin ağırlıklarını açıkladı — 125 milyar parametreli ana model ve ek 51 milyar N-gram embedding katmanına sahip çok modlu bir MoE mimarisi; her token için yalnızca 6 milyar parametre etkinleştiriliyor. Bu, Qwen4 mimarisinin erken bir önizlemesi olup, topluluğun Qwen4 ailesinin tam sürümünden önce altyapıyı ve araçları uyarlayabilmesi için tasarlanmıştır.
Model mimarisi dört temel yenilik sunar: Gated DeltaNet (GDN) ile Qwen Sparse Attention (QSA) birleştiren hibrit dikkat, kapılı artık bağlantılar, N-gram embedding ve Muon optimizasyonu. Qwen3.7-Plus (397 milyar parametre, 17 milyar aktif) ile karşılaştırıldığında, eğitim yaklaşık dokuz kat daha ucuzken, kodlama ve ofis senaryolarındaki performans belirgin şekilde arttı. Bu, yalnızca kademeli ölçeklendirmenin değil, aktivasyon ve optimizasyon mekanizmalarının radikal bir şekilde yeniden işlenmesinin sonucuydu.
Resmi kıyaslamalar, önceki Qwen sürümlerine ve rekabetçi sonuçlara göre üstünlük gösteriyor: SWE-bench Pro'da 62,5 (Claude Opus 4.6 verileriyle karşılaştırıldığında), CoWorkBench'te 73,9, DeepSWE 1.1'te 58,7 ve AndroidWorld'de 84,5. Yerel bağlam 262 bin token, YaRN aracılığıyla 1 milyona genişletiliyor. 90% prefill önbellek isabeti koşuluyla, Qwen3.8-Flash-Next, Qwen3.7-Plus'a kıyasla prefill verimliliğinde 8,6 kat artış sağlıyor ve 1 milyon token'da QSA, prefill'de dikkati 7,6 kat, decode'ta ise 4,9 kat hızlandırıyor.
Değerlendirme metodolojisinin öncelikle Qwen'in dahili testlerine dayandığını, agentic kodlama ve ofis kıyaslamalarını içerdiğini belirtmek önemlidir. Sürüm anında bağımsız üçüncü taraf doğrulamaları yoktur ve yayınlanan karşılaştırmalar seçicidir — çoğunlukla seyrek aktivasyonun kazandığı görevlerde. Bu, eğitim ve veri ayrıntılarının gizli kaldığı Asya'daki laboratuvarlar için tipik bir durumdur; ancak Alibaba, topluluktan erken geri bildirim almak için ağırlıkları açma yolunu seçti.
MoE model manzarasında Qwen3.8-Flash-Next, DeepSeek-V4-Flash'ten (284 milyar / 13 milyar aktif) daha az aktif parametreye sahipken, agentic görevlerde karşılaştırılabilir veya daha iyi performans gösteriyor. Mimari seçimlerdeki bu fark, yaklaşımlardaki daha geniş bir değişimi yansıtıyor: Amerikan laboratuvarları yoğun modelleri ölçeklendirmeye yatırım yapmaya devam ederken, Çinli ekipler giderek seyrekliğe, hibrit dikkate ve eğitim ile çıkarım maliyetini düşürmek için özel embedding katmanlarına (N-gram gibi) odaklanıyor.
Qwen3.8-Flash-Next'in açık ağırlıklarının yayınlanması, geliştiricilerin tam Qwen4'ten önce mimariyi test etmesine olanak tanıyor. vLLM ve SGLang, NVIDIA ve AMD GPU'larda gün-0 desteği sağlıyor ve bu da pratik entegrasyonu hızlandırıyor: mühendisler, QSA hibrit dikkatinin ve Muon optimizasyonunun gerçek iş yüklerinde ne kadar ölçeklendiğini ve seyrek aktivasyonun hangi senaryolarda maksimum kazanç sağladığını doğrulayabilecek.
Bağımsız yeniden üretimde ve kodlamanın ötesine geçen karmaşık çok modlu senaryolar da dahil olmak üzere daha geniş bir görev yelpazesinde iddia edilen avantajların ne kadar sürdürülebilir olduğu belirsizliğini koruyor. Sonraki araştırma çalışmaları muhtemelen bireysel mimari bileşenlerin ablasyonlarına ve QSA'nın diğer hibrit ve seyrek yaklaşımlarla karşılaştırılmasına odaklanacaktır.
Sürümün ana sonucu, AI sınırında verimlilikteki ilerlemenin yalnızca parametreleri artırarak değil, aynı zamanda aktivasyon mekanizmalarının, hibrit dikkatin ve optimizasyonun radikal bir şekilde yeniden işlenmesiyle elde edildiğini göstermesidir. Açık ağırlık ekosisteminde bu, maliyet ve mühendislik verimliliği temelinde kapalı sınır modellerine karşı gerçek bir rekabet yaratıyor.
