26 sierpnia 2026 roku zespół Qwen firmy Alibaba udostępnił wagi modelu Qwen3.8-Flash-Next — multimodalnej architektury MoE z 125 mld parametrów modelu głównego i dodatkowymi 51 mld w warstwie N-gram embedding, przy czym na każdy token aktywowanych jest tylko 6 mld parametrów. To wczesne podgląd architektury Qwen4, mające na celu umożliwienie społeczności adaptacji infrastruktury i narzędzi przed pełną premierą rodziny Qwen4.
Architektura modelu wprowadza cztery kluczowe innowacje: hybrydową uwagę łączącą Gated DeltaNet (GDN) z Qwen Sparse Attention (QSA), bramkowane połączenia rezydualne, N-gram embedding oraz optymalizator Muon. W porównaniu z Qwen3.7-Plus (397 mld parametrów, 17 mld aktywnych) trening kosztował około dziewięć razy mniej, a wydajność w zadaniach kodowania i scenariuszach biurowych wyraźnie wzrosła. Był to wynik nie tylko inkrementalnego skalowania, ale radykalnego przeprojektowania mechanizmów aktywacji i optymalizacji.
Oficjalne benchmarki pokazują przewagę nad poprzednimi wersjami Qwen i konkurencyjnymi wynikami: 62,5 na SWE-bench Pro (w porównaniu z danymi Claude Opus 4.6), 73,9 na CoWorkBench, 58,7 na DeepSWE 1.1 i 84,5 na AndroidWorld. Natywny kontekst 262 tys. tokenów rozszerza się do 1 mln przez YaRN. Przy warunku 90% trafienia w prefill cache, Qwen3.8-Flash-Next osiąga 8,6-krotny wzrost przepustowości prefill w porównaniu z Qwen3.7-Plus, a przy 1 mln tokenów QSA zapewnia przyspieszenie uwagi o 7,6 razy na prefill i 4,9 razy na decode.
Ważne jest, aby zauważyć, że metodologia oceny opiera się głównie na wewnętrznych testach Qwen, w tym agentic coding i benchmarkach biurowych. W momencie premiery brakuje niezależnych weryfikacji stron trzecich, a publikowane porównania są przeprowadzane wybiórczo — głównie w zadaniach, w których wygrywa rzadka aktywacja. To typowa sytuacja dla laboratoriów z Azji, gdzie pełne szczegóły treningu i danych pozostają zamknięte, jednak Alibaba wybrał ścieżkę otwarcia wag dla wczesnej informacji zwrotnej społeczności.
W krajobrazie modeli MoE Qwen3.8-Flash-Next różni się od DeepSeek-V4-Flash (284 mld / 13 mld aktywnych) mniejszą liczbą aktywnych parametrów przy porównywalnej lub lepszej wydajności w zadaniach agentic. Ta różnica w wyborach architektonicznych odzwierciedla szerszą zmianę w podejściach: podczas gdy amerykańskie laboratoria nadal inwestują w skalowanie gęstych modeli, chińskie zespoły coraz częściej stawiają na rzadkość, hybrydową uwagę i specjalistyczne warstwy embedding (jak N-gram) w celu obniżenia kosztów treningu i inferencji.
Wydanie otwartych wag Qwen3.8-Flash-Next pozwala programistom testować architekturę przed pełnym Qwen4. vLLM i SGLang już zapewniają wsparcie day-0 na GPU NVIDIA i AMD, co przyspiesza praktyczną integrację: inżynierowie będą mogli sprawdzić, jak hybrydowa uwaga QSA i optymalizator Muon skalują się na rzeczywistych obciążeniach i w jakich scenariuszach rzadka aktywacja daje maksymalne korzyści.
Pozostaje niejasne, na ile trwałe są deklarowane przewagi przy niezależnym odtworzeniu i na szerszym spektrum zadań, w tym złożonych scenariuszach multimodalnych wykraczających poza kodowanie. Kolejne prace badawcze prawdopodobnie skupią się na ablacjach poszczególnych komponentów architektonicznych i porównaniu QSA z innymi podejściami hybrydowymi i rzadkimi.
Główny wniosek z premiery — demonstracja, że na granicy AI dalszy postęp w wydajności osiąga się nie tylko poprzez zwiększanie parametrów, ale także przez radykalne przeprojektowanie mechanizmów aktywacji, hybrydowej uwagi i optymalizacji. W ekosystemie otwartych wag tworzy to realną konkurencję dla zamkniętych modeli granicznych pod względem kosztów i wydajności inżynieryjnej.
