Qwen3.8-Flash-Next: Alibaba mengurangi parameter aktif menjadi 6B dan melampaui Claude Opus 4.6 dalam efisiensi

Diedit oleh: Alex Khohlov

Pada 26 Agustus 2026, tim Qwen dari Alibaba merilis bobot model Qwen3.8-Flash-Next — arsitektur MoE multimodal dengan 125 miliar parameter model utama dan tambahan 51 miliar di lapisan embedding N-gram, dengan hanya 6 miliar parameter yang diaktifkan per token. Ini adalah pratinjau awal arsitektur Qwen4, yang dimaksudkan agar komunitas dapat mengadaptasi infrastruktur dan alat sebelum rilis penuh keluarga Qwen4.

Arsitektur model memperkenalkan empat inovasi kunci: perhatian hibrida yang menggabungkan Gated DeltaNet (GDN) dengan Qwen Sparse Attention (QSA), koneksi residual bergerbang, embedding N-gram, dan pengoptimal Muon. Dibandingkan dengan Qwen3.7-Plus (397 miliar parameter, 17 miliar aktif), pelatihan sekitar sembilan kali lebih murah, sementara kinerja dalam tugas pengkodean dan skenario kantor meningkat secara signifikan. Ini adalah hasil dari bukan sekadar penskalaan inkremental, tetapi perombakan radikal pada mekanisme aktivasi dan optimasi.

Tolok ukur resmi menunjukkan keunggulan atas versi Qwen sebelumnya dan hasil yang kompetitif: 62,5 pada SWE-bench Pro (dibandingkan dengan data Claude Opus 4.6), 73,9 pada CoWorkBench, 58,7 pada DeepSWE 1.1, dan 84,5 pada AndroidWorld. Konteks asli 262 ribu token diperluas menjadi 1 juta melalui YaRN. Dengan kondisi 90% cache prefill yang cocok, Qwen3.8-Flash-Next mencapai peningkatan throughput prefill 8,6 kali lipat dibandingkan dengan Qwen3.7-Plus, dan dengan 1 juta token, QSA memberikan percepatan perhatian 7,6 kali pada prefill dan 4,9 kali pada decode.

Penting untuk dicatat bahwa metodologi evaluasi terutama bergantung pada pengujian internal Qwen, termasuk pengkodean agen dan tolok ukur kantor. Pada saat rilis, tidak ada verifikasi pihak ketiga independen, dan perbandingan yang dipublikasikan dilakukan secara selektif — terutama pada tugas-tugas di mana aktivasi jarang menang. Ini adalah situasi umum untuk laboratorium di Asia, di mana detail lengkap pelatihan dan data tetap tertutup, namun Alibaba memilih untuk membuka bobot untuk umpan balik awal dari komunitas.

Dalam lanskap model MoE, Qwen3.8-Flash-Next berbeda dari DeepSeek-V4-Flash (284 miliar / 13 miliar aktif) dengan jumlah parameter aktif yang lebih sedikit namun kinerja yang sebanding atau lebih baik pada tugas agen. Perbedaan dalam pilihan arsitektur ini mencerminkan pergeseran yang lebih luas dalam pendekatan: sementara laboratorium Amerika terus berinvestasi dalam penskalaan model padat, tim Tiongkok semakin mengandalkan sparsity, perhatian hibrida, dan lapisan embedding khusus (seperti N-gram) untuk mengurangi biaya pelatihan dan inferensi.

Rilis bobot terbuka Qwen3.8-Flash-Next memungkinkan pengembang untuk menguji arsitektur sebelum Qwen4 penuh. vLLM dan SGLang sudah menyediakan dukungan day-0 pada GPU NVIDIA dan AMD, dan ini mempercepat integrasi praktis: para insinyur akan dapat memverifikasi seberapa baik perhatian hibrida QSA dan pengoptimal Muon menskalakan pada beban kerja nyata dan dalam skenario apa aktivasi jarang memberikan keuntungan maksimal.

Masih belum jelas seberapa stabil keunggulan yang diklaim ketika direproduksi secara independen dan pada spektrum tugas yang lebih luas, termasuk skenario multimodal kompleks di luar pengkodean. Pekerjaan penelitian berikutnya kemungkinan akan fokus pada ablasi komponen arsitektur individual dan perbandingan QSA dengan pendekatan hibrida dan jarang lainnya.

Kesimpulan utama dari rilis ini adalah demonstrasi bahwa di garis depan AI, kemajuan lebih lanjut dalam efisiensi dicapai tidak hanya melalui peningkatan parameter, tetapi juga melalui perombakan radikal pada mekanisme aktivasi, perhatian hibrida, dan optimasi. Dalam ekosistem bobot terbuka, ini menciptakan persaingan nyata dengan model frontier tertutup berdasarkan biaya dan efisiensi rekayasa.

7 Tampilan

Sumber-sumber

  • AI资讯 | 实时追踪人工智能行业最新动态与热点快讯 - AIHub

  • Alibaba's Qwen to open-source Qwen3.8-Flash-Next, previewing Qwen4 architecture · TechNode

  • Alibaba's Qwen team releases Qwen3.8-Flash-Next: A 125B Multimodal MoE With 6B Active Parameters Previewing the Qwen4 Architecture - MarkTechPost

  • Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency - Qwen Blog

  • Qwen on X - Official benchmarks announcement

  • Experiment with Qwen3.8-Flash-Next on NVIDIA GB300 NVL72 for Agentic Coding | NVIDIA Technical Blog

  • DeepSeek V4 Flash: 284B MoE, 1M Context, Benchmarks, Pricing (2026)

  • vLLM on X - Day-0 support announcement

  • Qwen/Qwen3.8-Flash-Next — 176B / 6B active · MOE · 256K ctx

  • Alibaba's Qwen launches Qwen3.8-Flash AI model with lower training costs - Yahoo News

  • Alibaba Releases Smaller Qwen AI Model to Compete With Anthropic, DeepSeek - Bloomberg

  • DeepSeek-V4-Flash · Hugging Face

Baca lebih banyak artikel tentang topik ini:

Apakah Anda menemukan kesalahan atau ketidakakuratan?Kami akan mempertimbangkan komentar Anda sesegera mungkin.