מעבדת Tongyi Lab (חטיבה של Alibaba) השיקה את Qwen Robot Suite — סדרת המודלים הייעודיים הראשונה שנוצרה במיוחד לעבודה בעולם הפיזי. אין מדובר בעוד שיפור של מודלים מולטי-מודאליים, אלא במעבר מערכתי מצ'אט-בוטים שמבינים את העולם, ל סוכנים פיזיים, המסוגלים לתפוס את הסביבה, לתכנן פעולות ולבצע אותן בזמן אמת.
ההשקה כוללת שלושה מודלים בסיסיים:
- Qwen-RobotNav — ניווט והתניידות במרחב הפיזי;
- Qwen-RobotManip — מניפולציה של אובייקטים ואינטראקציה עם הסביבה;
- Qwen-RobotWorld — חיזוי דינמיקה של סצנות ומצב העולם בעתיד.
כל המודלים בנויים על בסיס משפחת Qwen (בראש ובראשונה מודלי הראייה-שפה Qwen3-VL ו-Qwen3.5), אומנו אך ורק על נתונים פתוחים וכבר עוברים הטמעות פיילוט אצל לקוחות Alibaba Cloud.
מדוע זה חשוב: הפער בין הבנה לפעולה
מודלי Qwen כבר מזמן מבינים היטב את העולם הפיזי: מזהים אובייקטים, יחסים מרחביים, הוראות וקשרים סיבתיים. עם זאת, בין ההבנה לבין פעולה ממשית נותר פער עקרוני — חוסר התאמה בין ייצוגים לשוניים-חזותיים לבין פקודות שליטה ברובוט.
Qwen Robot Suite פותר בדיוק את הבעיה הזו, על ידי יצירת "גשרים" ייעודיים בין תפיסה לפעולה בשלושה תחומים מרכזיים: ניידות, מניפולציה וחיזוי העולם.
Qwen-RobotNav — ניווט וניידות
המודל מאחד חמש משימות ניווט למסגרת עבודה אחת:
- ביצוע הוראות בשפה טבעית;
- ניווט לנקודה או לאובייקט מוגדרים מראש;
- מעקב אחר מטרות נעות;
- נהיגה אוטונומית;
- מענה על שאלות בסביבה פיזית (Embodied Question Answering).
היא משתמשת בקידוד מונחה של תצפיות ובממשק כלים מיוחד, המאפשר למתכנן ברמה גבוהה יותר (למשל, Qwen3.7) להחליף באופן דינמי בין מצבי עבודה ולנהל את ההקשר.
תוצאות: 76.5% שיעורי הצלחה במעבר ב-VLN-CE RxR, 75.6% ב-HM3Dv2 (ניווט לאובייקט, תמונות RGB בלבד), 91.4 PDMS ב-NAVSIM (לולאה סגורה של נהיגה אוטונומית). המודל כבר נבדק בהצלחה על רובוט מרובע רגליים אמיתי מסוג Unitree Go2 עם מצלמה אחת בעלת רזולוציה נמוכה.
Qwen-RobotManip — מניפולציה ואינטראקציה
זהו המודל הבוגר והחזק ביותר בכל הערכה. הוא בנוי על בסיס Qwen3.5-4B עם ראש פעולות המבוסס על flow-matching DiT ומציג מרחב מצבים ופעולות מאוחד 80-ממדי עם מיקומי דלתא במערכת הקואורדינטות של המצלמה. גישה זו מאפשרת למידה יעילה מנתונים של סוגי רובוטים שונים (בעלי זרוע אחת, שתי זרועות, ידיים בעלות מיומנות גבוהה, פלטפורמות ניידות) ללא התנגשויות בנתונים.
נקודת מפתח — היקף ואיכות הלמידה: למעלה מ-38 100 שעות של נתונים פתוחים, כולל הקלטות אמיתיות של עבודת רובוטים, וידאו אגוצנטרי של בני אדם ונתונים סינתטיים שנוצרו באמצעות צינור עיבוד (pipeline) של המרה "אדם-רובוט".
תוצאות במבחני ביצועים (benchmarks):
- 91.4% ב-LIBERO-Plus (גבוה ב-7 נקודות אחוז מהתוצאה הטובה ביותר הקודמת);
- מקום 1 בדירוג הכללי של RoboChallenge Table30 v1 (45% ביצועים מוצלחים, מקדים את המקום השלישי ב-20%);
- מדדים חזקים ב-RoboTwin, RoboCasa, EBench ובמבחנים אחרים, במיוחד בתרחישים מחוץ להתפלגות הלמידה (out-of-distribution) ובהעברת מיומנויות בין סוגי רובוטים שונים ללא למידה נוספת.
המודל מפגין תכונות מתהוות (emergent properties): עמידות בפני הפרעות חיצוניות, התאוששות משגיאות, ביצוע הוראות פתוחות והעברת מיומנויות בין רובוטים שונים.
Qwen-RobotWorld — מודל עולם וחיזוי העתיד
זהו מודל עולם וידאו מונחה-שפה, אשר על סמך תצפית נוכחית והוראה טקסטואלית מייצר מצב עתידי של הסצנה שנראה אמין מבחינה פיזיקלית. המודל אומן על 8.6 מיליון זוגות של "וידאו-טקסט" (למעלה מ-200 מיליון פריימים) ומבין היטב פיזיקה (חוקי תנועה, שימור מסה, התנהגות נוזלים וכו').
הוא תופס את המקומות הראשונים ב-EWMBench, DreamGen Bench, WorldModelBench (בין מודלים פתוחים) וב-PBBench. בעלת ערך מיוחד היא היכולת לשליטה לשונית מדויקת ויצירה עקבית מנקודות מבט שונות.
Qwen-RobotClaw — שכבת אינטגרציה
רכיב נוסף וחשוב — Qwen-RobotClaw, ערכת כלים פנימית עבור סוכנים רובוטיים. היא מאפשרת לסוכני שפה-חזותיים רגילים של Qwen לקרוא למודלים של Robot Suite ככלים של העולם הפיזי, תוך ניהול ההקשר והזיכרון בעת ביצוע משימות ארוכות טווח.
שכבה זו היא שהופכת את שלושת המודלים הבסיסיים למערכת שלמה עבור סוכנים הפועלים בעולם הפיזי.
המודלים כבר נמצאים בשימוש פיילוט אצל לקוחות ארגוניים נבחרים של Alibaba Cloud במגזר הרובוטיקה.
פורסמו מאגרים ב-GitHub (QwenLM/Qwen-RobotNav, Qwen-RobotManip ואחרים) ודוחות טכניים. המודלים זמינים דרך האקו-סיסטם של Qwen, כולל פלטפורמת Hugging Face. משקולות מלאות והוראות אינטגרציה מפורטות צפויות בעתיד הקרוב.


