Qwen3.8-Flash-Next: אליבאבא צמצמה את הפרמטרים הפעילים ל-6B והקדימה את Claude Opus 4.6 ביעילות

נערך על ידי: Alex Khohlov

ב-26 באוגוסט 2026, צוות Qwen של אליבאבא פרסם את משקלי המודל Qwen3.8-Flash-Next — ארכיטקטורת MoE מולטי-מודאלית עם 125 מיליארד פרמטרים במודל הראשי ועוד 51 מיליארד בשכבת N-gram embedding, כאשר על כל טוקן מופעלים רק 6 מיליארד פרמטרים. זוהי תצוגה מקדימה מוקדמת של ארכיטקטורת Qwen4, שנועדה לאפשר לקהילה להתאים תשתיות וכלים לפני השחרור המלא של משפחת Qwen4.

ארכיטקטורת המודל מציגה ארבעה חידושים מרכזיים: קשב היברידי המשלב Gated DeltaNet (GDN) עם Qwen Sparse Attention (QSA), חיבורים שיוריים עם שער, N-gram embedding ואופטימיזר Muon. בהשוואה ל-Qwen3.7-Plus (397 מיליארד פרמטרים, 17 מיליארד פעילים), האימון עלה בערך פי תשע פחות, ובכל זאת הביצועים במשימות קידוד ותרחישי משרד עלו באופן ניכר. זו הייתה תוצאה לא של הגדלה מצטברת, אלא של עיצוב מחדש רדיקלי של מנגנוני ההפעלה והאופטימיזציה.

בנצ'מרקים רשמיים נראה יתרון על פני גרסאות קודמות של Qwen ותוצאות תחרותיות: 62.5 ב-SWE-bench Pro (לעומת נתוני Claude Opus 4.6), 73.9 ב-CoWorkBench, 58.7 ב-DeepSWE 1.1 ו-84.5 ב-AndroidWorld. הקונטקסט הטבעי של 262 אלף טוקנים מורחב ל-1 מיליון באמצעות YaRN. בתנאי של 90% פגיעה ב-prefill cache, Qwen3.8-Flash-Next משיגה הגדלה של פי 8.6 בתפוקת ה-prefill בהשוואה ל-Qwen3.7-Plus, ועם 1 מיליון טוקנים QSA מספקת האצה של פי 7.6 ב-prefill ופי 4.9 ב-decode.

חשוב לציין שמתודולוגיית ההערכה מסתמכת בעיקר על בדיקות פנימיות של Qwen, כולל agentic coding ובנצ'מרקים משרדיים. בזמן השחרור אין אימות חיצוני בלתי תלוי, וההשוואות שפורסמו נעשות באופן סלקטיבי — בעיקר במשימות שבהן הפעלה דלילה מנצחת. זהו מצב אופייני למעבדות באסיה, שבהן פרטים מלאים על אימון ונתונים נשארים סגורים, אך אליבאבא בחרה בדרך של פתיחת משקלים כדי לקבל משוב מוקדם מהקהילה.

בנוף מודלי ה-MoE, Qwen3.8-Flash-Next שונה מ-DeepSeek-V4-Flash (284 מיליארד / 13 מיליארד פעילים) במספר קטן יותר של פרמטרים פעילים עם ביצועים דומים או טובים יותר במשימות agentic. הבדל זה בבחירות ארכיטקטוניות משקף שינוי רחב יותר בגישות: בעוד מעבדות אמריקאיות ממשיכות להשקיע בהגדלת מודלים צפופים, צוותים סיניים מסתמכים יותר ויותר על דלילות, קשב היברידי ושכבות embedding ייעודיות (כמו N-gram) כדי להפחית את עלות האימון וההסקה.

שחרור המשקלים הפתוחים של Qwen3.8-Flash-Next מאפשר למפתחים לבדוק את הארכיטקטורה לפני Qwen4 המלא. vLLM ו-SGLang כבר מספקות תמיכה מיום 0 על GPUs של NVIDIA ו-AMD, וזה מאיץ את האינטגרציה המעשית: מהנדסים יוכלו לבדוק עד כמה קשב היברידי QSA ואופטימיזר Muon מתאימים לעומסי עבודה אמיתיים, ובאילו תרחישים הפעלה דלילה נותנת רווח מקסימלי.

עדיין לא ברור עד כמה היתרונות המוצהרים יציבים בשחזור בלתי תלוי ובמגוון רחב יותר של משימות, כולל תרחישים מולטי-מודאליים מורכבים החורגים מקידוד. עבודות מחקר עתידיות יתמקדו כנראה באבלציות של רכיבים ארכיטקטוניים בודדים ובהשוואת QSA לגישות היברידיות ודלילות אחרות.

המסקנה העיקרית מהשחרור היא הדגמה שבחזית ה-AI, התקדמות נוספת ביעילות מושגת לא רק על ידי הגדלת פרמטרים, אלא גם דרך עיצוב מחדש רדיקלי של מנגנוני הפעלה, קשב היברידי ואופטימיזציה. במערכת האקולוגית של משקלים פתוחים, זה יוצר תחרות אמיתית למודלים סגורים על בסיס עלות ויעילות הנדסית.

7 צפיות

מקורות

  • AI资讯 | 实时追踪人工智能行业最新动态与热点快讯 - AIHub

  • Alibaba's Qwen to open-source Qwen3.8-Flash-Next, previewing Qwen4 architecture · TechNode

  • Alibaba's Qwen team releases Qwen3.8-Flash-Next: A 125B Multimodal MoE With 6B Active Parameters Previewing the Qwen4 Architecture - MarkTechPost

  • Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency - Qwen Blog

  • Qwen on X - Official benchmarks announcement

  • Experiment with Qwen3.8-Flash-Next on NVIDIA GB300 NVL72 for Agentic Coding | NVIDIA Technical Blog

  • DeepSeek V4 Flash: 284B MoE, 1M Context, Benchmarks, Pricing (2026)

  • vLLM on X - Day-0 support announcement

  • Qwen/Qwen3.8-Flash-Next — 176B / 6B active · MOE · 256K ctx

  • Alibaba's Qwen launches Qwen3.8-Flash AI model with lower training costs - Yahoo News

  • Alibaba Releases Smaller Qwen AI Model to Compete With Anthropic, DeepSeek - Bloomberg

  • DeepSeek-V4-Flash · Hugging Face

קראו כתבות נוספות בנושא זה:

מצאתם טעות או אי-דיוק?הערותיכם ייבחנו בהקדם האפשרי.