Qwen3.8-Flash-Next: Alibaba скоротила активні параметри до 6B і випередила Claude Opus 4.6 за ефективністю

Відредаговано: Alex Khohlov

26 серпня 2026 року команда Qwen компанії Alibaba відкрила ваги моделі Qwen3.8-Flash-Next — мультимодальної MoE-архітектури з 125 млрд параметрів основної моделі та додатковими 51 млрд у N-gram embedding шарі, при цьому на кожен токен активується лише 6 млрд параметрів. Це раннє прев'ю архітектури Qwen4, призначене для того, щоб спільнота могла адаптувати інфраструктуру та інструменти до повного релізу сімейства Qwen4.

Архітектура моделі впроваджує чотири ключові інновації: гібридну увагу, що поєднує Gated DeltaNet (GDN) з Qwen Sparse Attention (QSA), gated residual connections, N-gram embedding та оптимізатор Muon. Порівняно з Qwen3.7-Plus (397 млрд параметрів, 17 млрд активних) навчання обійшлося приблизно в дев'ять разів дешевше, при цьому продуктивність у задачах кодування та офісних сценаріях помітно зросла. Це стало результатом не просто інкрементального масштабування, а радикальної переробки механізмів активації та оптимізації.

Офіційні бенчмарки показують перевагу над попередніми версіями Qwen та конкурентними результатами: 62,5 на SWE-bench Pro (порівняно з даними Claude Opus 4.6), 73,9 на CoWorkBench, 58,7 на DeepSWE 1.1 та 84,5 на AndroidWorld. Нативний контекст 262 тис. токенів розширюється до 1 млн через YaRN. За умови 90% попадання в prefill кеш, Qwen3.8-Flash-Next досягає 8,6-кратного збільшення пропускної здатності prefill порівняно з Qwen3.7-Plus, а при 1 млн токенів QSA забезпечує прискорення уваги в 7,6 рази на prefill та 4,9 рази на decode.

Важливо зазначити, що методологія оцінки спирається переважно на внутрішні тести Qwen, включаючи agentic coding та офісні бенчмарки. На момент релізу відсутні незалежні сторонні верифікації, а публіковані порівняння проводяться вибірково — в основному за задачами, де виграє розріджена активація. Це типова ситуація для лабораторій з Азії, де повні деталі навчання та даних залишаються закритими, однак Alibaba обрав шлях відкриття ваг для раннього зворотного зв'язку спільноти.

У ландшафті MoE-моделей Qwen3.8-Flash-Next відрізняється від DeepSeek-V4-Flash (284 млрд / 13 млрд активних) меншою кількістю активних параметрів при порівнянній або кращій продуктивності на agentic-задачах. Ця різниця в архітектурних виборах відображає ширший зсув у підходах: у той час як американські лабораторії продовжують інвестувати в масштабування щільних моделей, китайські команди все частіше роблять ставку на розрідженість, гібридну увагу та спеціалізовані embedding-шари (як N-gram) для зниження вартості навчання та інференсу.

Випуск відкритих ваг Qwen3.8-Flash-Next дозволяє розробникам тестувати архітектуру до повноцінного Qwen4. vLLM та SGLang вже забезпечують day-0 підтримку на GPU NVIDIA та AMD, а це прискорює практичну інтеграцію: інженери зможуть перевірити, наскільки гібридна увага QSA та Muon-оптимізатор масштабуються на реальних workloads і в яких сценаріях розріджена активація дає максимальний виграш.

Залишається незрозумілим, наскільки стійкі заявлені переваги при незалежному відтворенні та на ширшому спектрі задач, включаючи складні мультимодальні сценарії, що виходять за межі кодування. Наступні дослідницькі роботи, ймовірно, зосередяться на абляціях окремих архітектурних компонентів та порівнянні QSA з іншими гібридними та розрідженими підходами.

Головний підсумок релізу — демонстрація того, що на фронтирі AI подальший прогрес в ефективності досягається не лише за рахунок збільшення параметрів, але й через радикальну переробку механізмів активації, гібридної уваги та оптимізації. В екосистемі відкритих ваг це створює реальну конкуренцію закритим фронтир-моделям на основі вартості та інженерної ефективності.

7 Перегляди

Джерела

  • AI资讯 | 实时追踪人工智能行业最新动态与热点快讯 - AIHub

  • Alibaba's Qwen to open-source Qwen3.8-Flash-Next, previewing Qwen4 architecture · TechNode

  • Alibaba's Qwen team releases Qwen3.8-Flash-Next: A 125B Multimodal MoE With 6B Active Parameters Previewing the Qwen4 Architecture - MarkTechPost

  • Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency - Qwen Blog

  • Qwen on X - Official benchmarks announcement

  • Experiment with Qwen3.8-Flash-Next on NVIDIA GB300 NVL72 for Agentic Coding | NVIDIA Technical Blog

  • DeepSeek V4 Flash: 284B MoE, 1M Context, Benchmarks, Pricing (2026)

  • vLLM on X - Day-0 support announcement

  • Qwen/Qwen3.8-Flash-Next — 176B / 6B active · MOE · 256K ctx

  • Alibaba's Qwen launches Qwen3.8-Flash AI model with lower training costs - Yahoo News

  • Alibaba Releases Smaller Qwen AI Model to Compete With Anthropic, DeepSeek - Bloomberg

  • DeepSeek-V4-Flash · Hugging Face

Читайте більше статей на цю тему:

Знайшли помилку чи неточність?Ми розглянемо ваші коментарі якомога швидше.