ב-26 באוגוסט 2026, צוות Qwen של אליבאבא פרסם את משקלי המודל Qwen3.8-Flash-Next — ארכיטקטורת MoE מולטי-מודאלית עם 125 מיליארד פרמטרים במודל הראשי ועוד 51 מיליארד בשכבת N-gram embedding, כאשר על כל טוקן מופעלים רק 6 מיליארד פרמטרים. זוהי תצוגה מקדימה מוקדמת של ארכיטקטורת Qwen4, שנועדה לאפשר לקהילה להתאים תשתיות וכלים לפני השחרור המלא של משפחת Qwen4.
ארכיטקטורת המודל מציגה ארבעה חידושים מרכזיים: קשב היברידי המשלב Gated DeltaNet (GDN) עם Qwen Sparse Attention (QSA), חיבורים שיוריים עם שער, N-gram embedding ואופטימיזר Muon. בהשוואה ל-Qwen3.7-Plus (397 מיליארד פרמטרים, 17 מיליארד פעילים), האימון עלה בערך פי תשע פחות, ובכל זאת הביצועים במשימות קידוד ותרחישי משרד עלו באופן ניכר. זו הייתה תוצאה לא של הגדלה מצטברת, אלא של עיצוב מחדש רדיקלי של מנגנוני ההפעלה והאופטימיזציה.
בנצ'מרקים רשמיים נראה יתרון על פני גרסאות קודמות של Qwen ותוצאות תחרותיות: 62.5 ב-SWE-bench Pro (לעומת נתוני Claude Opus 4.6), 73.9 ב-CoWorkBench, 58.7 ב-DeepSWE 1.1 ו-84.5 ב-AndroidWorld. הקונטקסט הטבעי של 262 אלף טוקנים מורחב ל-1 מיליון באמצעות YaRN. בתנאי של 90% פגיעה ב-prefill cache, Qwen3.8-Flash-Next משיגה הגדלה של פי 8.6 בתפוקת ה-prefill בהשוואה ל-Qwen3.7-Plus, ועם 1 מיליון טוקנים QSA מספקת האצה של פי 7.6 ב-prefill ופי 4.9 ב-decode.
חשוב לציין שמתודולוגיית ההערכה מסתמכת בעיקר על בדיקות פנימיות של Qwen, כולל agentic coding ובנצ'מרקים משרדיים. בזמן השחרור אין אימות חיצוני בלתי תלוי, וההשוואות שפורסמו נעשות באופן סלקטיבי — בעיקר במשימות שבהן הפעלה דלילה מנצחת. זהו מצב אופייני למעבדות באסיה, שבהן פרטים מלאים על אימון ונתונים נשארים סגורים, אך אליבאבא בחרה בדרך של פתיחת משקלים כדי לקבל משוב מוקדם מהקהילה.
בנוף מודלי ה-MoE, Qwen3.8-Flash-Next שונה מ-DeepSeek-V4-Flash (284 מיליארד / 13 מיליארד פעילים) במספר קטן יותר של פרמטרים פעילים עם ביצועים דומים או טובים יותר במשימות agentic. הבדל זה בבחירות ארכיטקטוניות משקף שינוי רחב יותר בגישות: בעוד מעבדות אמריקאיות ממשיכות להשקיע בהגדלת מודלים צפופים, צוותים סיניים מסתמכים יותר ויותר על דלילות, קשב היברידי ושכבות embedding ייעודיות (כמו N-gram) כדי להפחית את עלות האימון וההסקה.
שחרור המשקלים הפתוחים של Qwen3.8-Flash-Next מאפשר למפתחים לבדוק את הארכיטקטורה לפני Qwen4 המלא. vLLM ו-SGLang כבר מספקות תמיכה מיום 0 על GPUs של NVIDIA ו-AMD, וזה מאיץ את האינטגרציה המעשית: מהנדסים יוכלו לבדוק עד כמה קשב היברידי QSA ואופטימיזר Muon מתאימים לעומסי עבודה אמיתיים, ובאילו תרחישים הפעלה דלילה נותנת רווח מקסימלי.
עדיין לא ברור עד כמה היתרונות המוצהרים יציבים בשחזור בלתי תלוי ובמגוון רחב יותר של משימות, כולל תרחישים מולטי-מודאליים מורכבים החורגים מקידוד. עבודות מחקר עתידיות יתמקדו כנראה באבלציות של רכיבים ארכיטקטוניים בודדים ובהשוואת QSA לגישות היברידיות ודלילות אחרות.
המסקנה העיקרית מהשחרור היא הדגמה שבחזית ה-AI, התקדמות נוספת ביעילות מושגת לא רק על ידי הגדלת פרמטרים, אלא גם דרך עיצוב מחדש רדיקלי של מנגנוני הפעלה, קשב היברידי ואופטימיזציה. במערכת האקולוגית של משקלים פתוחים, זה יוצר תחרות אמיתית למודלים סגורים על בסיס עלות ויעילות הנדסית.
