Qwen3.8-Flash-Next: Alibaba redujo los parámetros activos a 6B y superó a Claude Opus 4.6 en eficiencia

Editado por: Alex Khohlov

El 26 de agosto de 2026, el equipo Qwen de Alibaba abrió los pesos del modelo Qwen3.8-Flash-Next, una arquitectura MoE multimodal con 125 mil millones de parámetros en el modelo principal y 51 mil millones adicionales en la capa de embedding N-gram, activando solo 6 mil millones de parámetros por token. Esta es una vista previa temprana de la arquitectura Qwen4, diseñada para que la comunidad pueda adaptar la infraestructura y las herramientas antes del lanzamiento completo de la familia Qwen4.

La arquitectura del modelo introduce cuatro innovaciones clave: atención híbrida que combina Gated DeltaNet (GDN) con Qwen Sparse Attention (QSA), conexiones residuales con puerta, embedding N-gram y el optimizador Muon. En comparación con Qwen3.7-Plus (397 mil millones de parámetros, 17 mil millones activos), el entrenamiento costó aproximadamente nueve veces menos, mientras que el rendimiento en tareas de codificación y escenarios de oficina aumentó notablemente. Esto fue el resultado no solo de un escalado incremental, sino de una revisión radical de los mecanismos de activación y optimización.

Los puntos de referencia oficiales muestran superioridad sobre versiones anteriores de Qwen y resultados competitivos: 62,5 en SWE-bench Pro (en comparación con los datos de Claude Opus 4.6), 73,9 en CoWorkBench, 58,7 en DeepSWE 1.1 y 84,5 en AndroidWorld. El contexto nativo de 262 mil tokens se expande a 1 millones a través de YaRN. Con una tasa de acierto del 90% en el caché de prefill, Qwen3.8-Flash-Next logra un aumento de 8,6 veces en el rendimiento de prefill en comparación con Qwen3.7-Plus, y con 1 millones de tokens, QSA acelera la atención 7,6 veces en prefill y 4,9 veces en decode.

Es importante señalar que la metodología de evaluación se basa principalmente en pruebas internas de Qwen, incluyendo codificación agéntica y puntos de referencia de oficina. En el momento del lanzamiento, no hay verificaciones independientes de terceros, y las comparaciones publicadas se realizan de manera selectiva, principalmente en tareas donde la activación dispersa gana. Esta es una situación típica para laboratorios en Asia, donde los detalles completos del entrenamiento y los datos permanecen cerrados, pero Alibaba eligió el camino de abrir los pesos para recibir comentarios tempranos de la comunidad.

En el panorama de modelos MoE, Qwen3.8-Flash-Next se diferencia de DeepSeek-V4-Flash (284 mil millones / 13 mil millones activos) por tener menos parámetros activos con un rendimiento comparable o mejor en tareas agénticas. Esta diferencia en las elecciones arquitectónicas refleja un cambio más amplio en los enfoques: mientras que los laboratorios estadounidenses continúan invirtiendo en escalar modelos densos, los equipos chinos apuestan cada vez más por la dispersión, la atención híbrida y capas de embedding especializadas (como N-gram) para reducir los costos de entrenamiento e inferencia.

El lanzamiento de los pesos abiertos de Qwen3.8-Flash-Next permite a los desarrolladores probar la arquitectura antes del Qwen4 completo. vLLM y SGLang ya ofrecen soporte desde el día 0 en GPU NVIDIA y AMD, lo que acelera la integración práctica: los ingenieros podrán verificar cómo la atención híbrida QSA y el optimizador Muon escalan en cargas de trabajo reales y en qué escenarios la activación dispersa ofrece la máxima ventaja.

Queda sin aclarar cuán sostenibles son las ventajas declaradas en la reproducción independiente y en un espectro más amplio de tareas, incluidos escenarios multimodales complejos que van más allá de la codificación. Los próximos trabajos de investigación probablemente se centrarán en ablaciones de componentes arquitectónicos individuales y en la comparación de QSA con otros enfoques híbridos y dispersos.

El resultado principal del lanzamiento es la demostración de que en la frontera de la IA, un mayor progreso en eficiencia se logra no solo aumentando los parámetros, sino también mediante una revisión radical de los mecanismos de activación, atención híbrida y optimización. En el ecosistema de pesos abiertos, esto crea una competencia real con los modelos de frontera cerrados en términos de costo y eficiencia de ingeniería.

7 Vues

Fuentes

  • AI资讯 | 实时追踪人工智能行业最新动态与热点快讯 - AIHub

  • Alibaba's Qwen to open-source Qwen3.8-Flash-Next, previewing Qwen4 architecture · TechNode

  • Alibaba's Qwen team releases Qwen3.8-Flash-Next: A 125B Multimodal MoE With 6B Active Parameters Previewing the Qwen4 Architecture - MarkTechPost

  • Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency - Qwen Blog

  • Qwen on X - Official benchmarks announcement

  • Experiment with Qwen3.8-Flash-Next on NVIDIA GB300 NVL72 for Agentic Coding | NVIDIA Technical Blog

  • DeepSeek V4 Flash: 284B MoE, 1M Context, Benchmarks, Pricing (2026)

  • vLLM on X - Day-0 support announcement

  • Qwen/Qwen3.8-Flash-Next — 176B / 6B active · MOE · 256K ctx

  • Alibaba's Qwen launches Qwen3.8-Flash AI model with lower training costs - Yahoo News

  • Alibaba Releases Smaller Qwen AI Model to Compete With Anthropic, DeepSeek - Bloomberg

  • DeepSeek-V4-Flash · Hugging Face

Lea más artículos sobre este tema:

¿Encontró un error o inexactitud?Consideraremos sus comentarios lo antes posible.