26 серпня 2026 року команда Qwen компанії Alibaba відкрила ваги моделі Qwen3.8-Flash-Next — мультимодальної MoE-архітектури з 125 млрд параметрів основної моделі та додатковими 51 млрд у N-gram embedding шарі, при цьому на кожен токен активується лише 6 млрд параметрів. Це раннє прев'ю архітектури Qwen4, призначене для того, щоб спільнота могла адаптувати інфраструктуру та інструменти до повного релізу сімейства Qwen4.
Архітектура моделі впроваджує чотири ключові інновації: гібридну увагу, що поєднує Gated DeltaNet (GDN) з Qwen Sparse Attention (QSA), gated residual connections, N-gram embedding та оптимізатор Muon. Порівняно з Qwen3.7-Plus (397 млрд параметрів, 17 млрд активних) навчання обійшлося приблизно в дев'ять разів дешевше, при цьому продуктивність у задачах кодування та офісних сценаріях помітно зросла. Це стало результатом не просто інкрементального масштабування, а радикальної переробки механізмів активації та оптимізації.
Офіційні бенчмарки показують перевагу над попередніми версіями Qwen та конкурентними результатами: 62,5 на SWE-bench Pro (порівняно з даними Claude Opus 4.6), 73,9 на CoWorkBench, 58,7 на DeepSWE 1.1 та 84,5 на AndroidWorld. Нативний контекст 262 тис. токенів розширюється до 1 млн через YaRN. За умови 90% попадання в prefill кеш, Qwen3.8-Flash-Next досягає 8,6-кратного збільшення пропускної здатності prefill порівняно з Qwen3.7-Plus, а при 1 млн токенів QSA забезпечує прискорення уваги в 7,6 рази на prefill та 4,9 рази на decode.
Важливо зазначити, що методологія оцінки спирається переважно на внутрішні тести Qwen, включаючи agentic coding та офісні бенчмарки. На момент релізу відсутні незалежні сторонні верифікації, а публіковані порівняння проводяться вибірково — в основному за задачами, де виграє розріджена активація. Це типова ситуація для лабораторій з Азії, де повні деталі навчання та даних залишаються закритими, однак Alibaba обрав шлях відкриття ваг для раннього зворотного зв'язку спільноти.
У ландшафті MoE-моделей Qwen3.8-Flash-Next відрізняється від DeepSeek-V4-Flash (284 млрд / 13 млрд активних) меншою кількістю активних параметрів при порівнянній або кращій продуктивності на agentic-задачах. Ця різниця в архітектурних виборах відображає ширший зсув у підходах: у той час як американські лабораторії продовжують інвестувати в масштабування щільних моделей, китайські команди все частіше роблять ставку на розрідженість, гібридну увагу та спеціалізовані embedding-шари (як N-gram) для зниження вартості навчання та інференсу.
Випуск відкритих ваг Qwen3.8-Flash-Next дозволяє розробникам тестувати архітектуру до повноцінного Qwen4. vLLM та SGLang вже забезпечують day-0 підтримку на GPU NVIDIA та AMD, а це прискорює практичну інтеграцію: інженери зможуть перевірити, наскільки гібридна увага QSA та Muon-оптимізатор масштабуються на реальних workloads і в яких сценаріях розріджена активація дає максимальний виграш.
Залишається незрозумілим, наскільки стійкі заявлені переваги при незалежному відтворенні та на ширшому спектрі задач, включаючи складні мультимодальні сценарії, що виходять за межі кодування. Наступні дослідницькі роботи, ймовірно, зосередяться на абляціях окремих архітектурних компонентів та порівнянні QSA з іншими гібридними та розрідженими підходами.
Головний підсумок релізу — демонстрація того, що на фронтирі AI подальший прогрес в ефективності досягається не лише за рахунок збільшення параметрів, але й через радикальну переробку механізмів активації, гібридної уваги та оптимізації. В екосистемі відкритих ваг це створює реальну конкуренцію закритим фронтир-моделям на основі вартості та інженерної ефективності.
