Vào ngày 26 tháng 8 năm 2026, đội ngũ Qwen của Alibaba đã công bố trọng số của mô hình Qwen3.8-Flash-Next — một kiến trúc MoE đa phương thức với 125 tỷ tham số trong mô hình chính và thêm 51 tỷ tham số trong lớp N-gram embedding, trong khi chỉ có 6 tỷ tham số được kích hoạt cho mỗi token. Đây là bản xem trước sớm của kiến trúc Qwen4, nhằm mục đích giúp cộng đồng có thể thích ứng cơ sở hạ tầng và các công cụ trước khi phát hành đầy đủ dòng Qwen4.
Kiến trúc của mô hình giới thiệu bốn cải tiến then chốt: cơ chế chú ý hỗn hợp kết hợp Gated DeltaNet (GDN) với Qwen Sparse Attention (QSA), gated residual connections, N-gram embedding và bộ tối ưu hóa Muon. So với Qwen3.7-Plus (397 tỷ tham số, 17 tỷ tham số kích hoạt), chi phí huấn luyện rẻ hơn khoảng chín lần, trong khi hiệu suất trong các tác vụ lập trình và kịch bản văn phòng tăng lên đáng kể. Đây không chỉ là kết quả của việc mở rộng quy mô dần dần, mà là sự tái cấu trúc triệt để các cơ chế kích hoạt và tối ưu hóa.
Các bài kiểm tra hiệu năng chính thức cho thấy sự vượt trội so với các phiên bản Qwen trước đó và các kết quả cạnh tranh: 62,5 trên SWE-bench Pro (so với dữ liệu của Claude Opus 4.6), 73,9 trên CoWorkBench, 58,7 trên DeepSWE 1.1 và 84,5 trên AndroidWorld. Cửa sổ ngữ cảnh gốc 262 nghìn token có thể mở rộng lên đến 1 triệu thông qua YaRN. Với điều kiện tỷ lệ khớp bộ nhớ đệm prefill đạt 90%, Qwen3.8-Flash-Next đạt được mức tăng thông lượng prefill gấp 8,6 lần so với Qwen3.7-Plus, và với 1 triệu token, QSA giúp tăng tốc cơ chế chú ý lên 7,6 lần ở giai đoạn prefill và 4,9 lần ở giai đoạn decode.
Cần lưu ý rằng phương pháp đánh giá chủ yếu dựa trên các bài kiểm tra nội bộ của Qwen, bao gồm agentic coding và các bài kiểm tra văn phòng. Tại thời điểm phát hành, vẫn chưa có sự xác minh độc lập từ bên thứ ba, và các so sánh được công bố mang tính chọn lọc — chủ yếu tập trung vào các tác vụ mà cơ chế kích hoạt thưa thớt chiếm ưu thế. Đây là tình trạng điển hình đối với các phòng thí nghiệm từ châu Á, nơi các chi tiết đầy đủ về huấn luyện và dữ liệu vẫn được giữ kín, tuy nhiên Alibaba đã chọn con đường công bố trọng số để nhận phản hồi sớm từ cộng đồng.
Trong bối cảnh các mô hình MoE, Qwen3.8-Flash-Next khác biệt với DeepSeek-V4-Flash (284 tỷ / 13 tỷ tham số kích hoạt) bởi số lượng tham số kích hoạt ít hơn trong khi hiệu suất tương đương hoặc tốt hơn trong các tác vụ agentic. Sự khác biệt trong các lựa chọn kiến trúc này phản ánh một sự chuyển dịch rộng lớn hơn trong các phương pháp tiếp cận: trong khi các phòng thí nghiệm của Mỹ tiếp tục đầu tư vào việc mở rộng quy mô các mô hình dày đặc, các đội ngũ Trung Quốc ngày càng đặt cược vào tính thưa thớt, cơ chế chú ý hỗn hợp và các lớp embedding chuyên dụng (như N-gram) để giảm chi phí huấn luyện và suy luận.
Việc phát hành trọng số mở của Qwen3.8-Flash-Next cho phép các nhà phát triển thử nghiệm kiến trúc trước khi Qwen4 ra mắt đầy đủ. vLLM và SGLang đã cung cấp hỗ trợ day-0 trên GPU NVIDIA và AMD, điều này giúp đẩy nhanh quá trình tích hợp thực tế: các kỹ sư có thể kiểm tra xem cơ chế chú ý hỗn hợp QSA và bộ tối ưu hóa Muon mở rộng quy mô như thế nào trên các khối lượng công việc thực tế và trong những kịch bản nào thì cơ chế kích hoạt thưa thớt mang lại lợi ích tối đa.
Vẫn chưa rõ các ưu điểm được tuyên bố sẽ ổn định đến mức nào khi được tái lập độc lập và trên một phạm vi rộng hơn các tác vụ, bao gồm cả các kịch bản đa phương thức phức tạp nằm ngoài phạm vi lập trình. Các công trình nghiên cứu tiếp theo có khả năng sẽ tập trung vào việc phân tích từng thành phần kiến trúc riêng lẻ và so sánh QSA với các phương pháp hỗn hợp và thưa thớt khác.
Kết quả chính của đợt phát hành này là minh chứng cho việc trên ranh giới AI, những tiến bộ tiếp theo về hiệu quả không chỉ đạt được bằng cách tăng số lượng tham số, mà còn thông qua việc tái cấu trúc triệt để các cơ chế kích hoạt, chú ý hỗn hợp và tối ưu hóa. Trong hệ sinh thái trọng số mở, điều này tạo ra sự cạnh tranh thực sự với các mô hình ranh giới đóng dựa trên chi phí và hiệu quả kỹ thuật.
