Qwen3.8-Flash-Next: Alibaba reduziu os parâmetros ativos para 6B e superou Claude Opus 4.6 em eficiência

Editado por: Alex Khohlov

Em 26 de agosto de 2026, a equipe Qwen da Alibaba abriu os pesos do modelo Qwen3.8-Flash-Next — uma arquitetura MoE multimodal com 125 bilhões de parâmetros no modelo principal e 51 bilhões adicionais na camada de embedding N-gram, com apenas 6 bilhões de parâmetros ativados por token. Esta é uma prévia inicial da arquitetura Qwen4, destinada a permitir que a comunidade adapte a infraestrutura e as ferramentas antes do lançamento completo da família Qwen4.

A arquitetura do modelo introduz quatro inovações principais: atenção híbrida, combinando Gated DeltaNet (GDN) com Qwen Sparse Attention (QSA), conexões residuais com portão, embedding N-gram e o otimizador Muon. Em comparação com Qwen3.7-Plus (397 bilhões de parâmetros, 17 bilhões ativos), o treinamento custou cerca de nove vezes menos, enquanto o desempenho em tarefas de codificação e cenários de escritório aumentou notavelmente. Isso resultou não apenas de um escalonamento incremental, mas de uma reformulação radical dos mecanismos de ativação e otimização.

Os benchmarks oficiais mostram superioridade sobre versões anteriores do Qwen e resultados competitivos: 62,5 no SWE-bench Pro (em comparação com os dados do Claude Opus 4.6), 73,9 no CoWorkBench, 58,7 no DeepSWE 1.1 e 84,5 no AndroidWorld. O contexto nativo de 262 mil tokens é expandido para 1 milhões via YaRN. Com 90% de acerto no cache de prefill, Qwen3.8-Flash-Next alcança um aumento de 8,6 vezes na taxa de transferência de prefill em comparação com Qwen3.7-Plus, e com 1 milhões de tokens, QSA acelera a atenção em 7,6 vezes no prefill e 4,9 vezes no decode.

É importante notar que a metodologia de avaliação se baseia principalmente em testes internos da Qwen, incluindo benchmarks de codificação agêntica e de escritório. No momento do lançamento, não há verificações independentes de terceiros, e as comparações publicadas são seletivas — principalmente em tarefas onde a ativação esparsa vence. Esta é uma situação típica para laboratórios na Ásia, onde os detalhes completos de treinamento e dados permanecem fechados, mas a Alibaba escolheu abrir os pesos para feedback antecipado da comunidade.

No cenário de modelos MoE, Qwen3.8-Flash-Next difere do DeepSeek-V4-Flash (284 bilhões / 13 bilhões ativos) por ter menos parâmetros ativos com desempenho comparável ou melhor em tarefas agênticas. Essa diferença nas escolhas arquitetônicas reflete uma mudança mais ampla nas abordagens: enquanto os laboratórios americanos continuam investindo no escalonamento de modelos densos, as equipes chinesas cada vez mais apostam em esparsidade, atenção híbrida e camadas de embedding especializadas (como N-gram) para reduzir o custo de treinamento e inferência.

O lançamento dos pesos abertos do Qwen3.8-Flash-Next permite que os desenvolvedores testem a arquitetura antes do Qwen4 completo. vLLM e SGLang já oferecem suporte no dia 0 em GPUs NVIDIA e AMD, o que acelera a integração prática: os engenheiros poderão verificar como a atenção híbrida QSA e o otimizador Muon escalam em cargas de trabalho reais e em quais cenários a ativação esparsa oferece o maior ganho.

Ainda não está claro quão sustentáveis são as vantagens declaradas quando reproduzidas de forma independente e em um espectro mais amplo de tarefas, incluindo cenários multimodais complexos além da codificação. As próximas pesquisas provavelmente se concentrarão em ablações dos componentes arquitetônicos individuais e na comparação do QSA com outras abordagens híbridas e esparsas.

A principal conclusão do lançamento é a demonstração de que, na fronteira da IA, o progresso adicional em eficiência é alcançado não apenas aumentando os parâmetros, mas também por meio de uma reformulação radical dos mecanismos de ativação, atenção híbrida e otimização. No ecossistema de pesos abertos, isso cria uma concorrência real com os modelos fechados de fronteira com base em custo e eficiência de engenharia.

7 Visualizações

Fontes

  • AI资讯 | 实时追踪人工智能行业最新动态与热点快讯 - AIHub

  • Alibaba's Qwen to open-source Qwen3.8-Flash-Next, previewing Qwen4 architecture · TechNode

  • Alibaba's Qwen team releases Qwen3.8-Flash-Next: A 125B Multimodal MoE With 6B Active Parameters Previewing the Qwen4 Architecture - MarkTechPost

  • Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency - Qwen Blog

  • Qwen on X - Official benchmarks announcement

  • Experiment with Qwen3.8-Flash-Next on NVIDIA GB300 NVL72 for Agentic Coding | NVIDIA Technical Blog

  • DeepSeek V4 Flash: 284B MoE, 1M Context, Benchmarks, Pricing (2026)

  • vLLM on X - Day-0 support announcement

  • Qwen/Qwen3.8-Flash-Next — 176B / 6B active · MOE · 256K ctx

  • Alibaba's Qwen launches Qwen3.8-Flash AI model with lower training costs - Yahoo News

  • Alibaba Releases Smaller Qwen AI Model to Compete With Anthropic, DeepSeek - Bloomberg

  • DeepSeek-V4-Flash · Hugging Face

Leia mais artigos sobre este tema:

Encontrou um erro ou imprecisão?Vamos considerar seus comentários assim que possível.