Alibaba تقدم Qwen Robot Suite: السلسلة الأولى من النماذج الأساسية للذكاء الاصطناعي المتجسد والروبوتات الحقيقية

الكاتب: lee author

Alibaba تقدم Qwen Robot Suite: السلسلة الأولى من النماذج الأساسية للذكاء الاصطناعي المتجسد والروبوتات الحقيقية-1
تقدّم شركة علي بابا مجموعة Qwen للروبوتات: الجزء الأول من النماذج الأساسية للذكاء الاصطناعي المجسد والروبوتات الواقعية

أطلق مختبر Tongyi Lab (التابع لشركة Alibaba) Qwen Robot Suite ، وهي السلسلة الأولى من النماذج المتخصصة المصممة خصيصًا للعمل في العالم المادي. لا يعد هذا مجرد تحسين آخر للنماذج متعددة الوسائط، بل هو انتقال منهجي من روبوتات الدردشة التي تفهم العالم إلى وكلاء ماديينقادرين على إدراك البيئة المحيطة، وتخطيط الإجراءات، وتنفيذها في الوقت الفعلي.

يتضمن الإصدار ثلاثة نماذج أساسية:

  • Qwen-RobotNav ؛ للملاحة والتنقل في الفضاء المادي؛
  • Qwen-RobotManip ؛ للتعامل مع الأشياء والتفاعل مع البيئة المحيطة؛
  • Qwen-RobotWorld ؛ للتنبؤ بديناميكيات المشاهد والحالة المستقبلية للعالم.

بُنيت جميع النماذج على أساس عائلة Qwen (وبشكل أساسي النماذج البصرية اللغوية Qwen3-VL وQwen3.5)، وقد دُرّبت حصريًا على بيانات مفتوحة، وتخضع حاليًا لعمليات تنفيذ تجريبية لدى عملاء Alibaba Cloud.

لماذا يعد هذا مهمًا: الفجوة بين الفهم والفعل

لطالما كانت نماذج Qwen تفهم العالم المادي جيدًا، فهي تميز الأشياء، والعلاقات المكانية، والتعليمات، وعلاقات السبب والنتيجة. ومع ذلك، ظلت هناك فجوة جوهرية بين الفهم والفعل الحقيقي، وهي عدم التطابق بين التمثيلات اللغوية البصرية وأوامر التحكم في الروبوت.

يعالج Qwen Robot Suite هذه المشكلة تحديدًا، من خلال إنشاء «جسور» متخصصة بين الإدراك والفعل في ثلاثة مجالات رئيسية: التنقل، والتعامل مع الأشياء، والتنبؤ بالعالم.

Qwen-RobotNav؛ الملاحة والتنقل

يجمع النموذج بين خمس مهام ملاحية في آن واحد ضمن إطار عمل موحد:

  • اتباع تعليمات اللغة الطبيعية؛
  • الملاحة إلى نقطة أو جسم محدد؛
  • تتبع الأهداف المتحركة؛
  • القيادة الذاتية؛
  • الإجابة عن الأسئلة في البيئة المادية (Embodied Question Answering).

تستخدم ترميزاً موجهاً للملاحظات وواجهة أدوات خاصة تسمح للمخطط الأعلى (على سبيل المثال، Qwen3.7) بالتبديل الديناميكي بين أوضاع العمل وإدارة السياق.

النتائج: معدل نجاح مسارات بنسبة 76.5% في VLN-CE RxR، و75.6% في HM3Dv2 (الملاحة إلى جسم، صور RGB فقط)، و91.4 PDMS في NAVSIM (القيادة الذاتية بنظام الحلقة المغلقة). وقد اختُبر النموذج بنجاح بالفعل على روبوت رباعي الأرجل حقيقي من طراز Unitree Go2 مزود بكاميرا واحدة منخفضة الدقة.

Qwen-RobotManip — التعامل والتفاعل

يعد هذا النموذج الأكثر نضجاً وقوة في المجموعة بأكملها. وقد بُني على أساس Qwen3.5-4B مع رأس إجراءات يعتمد على flow-matching DiT، ويقدم فضاء حالات وإجراءات موحداً 80-الأبعاد مع إحداثيات دلتا في نظام إحداثيات الكاميرا. يتيح هذا النهج التعلم الفعال من بيانات أنواع مختلفة من الروبوتات (أحادية الذراع، وثنائية الأذرع، والأذرع ذات المهارة العالية، والمنصات المتنقلة) دون تضارب في البيانات.

النقطة الجوهرية هي حجم وجودة التدريب: أكثر من 38 100 ساعة من البيانات المفتوحة، بما في ذلك تسجيلات حقيقية لعمل الروبوتات، وفيديوهات من منظور الشخص الأول للبشر، وبيانات اصطناعية تم إنشاؤها عبر مسار تحويل «من إنسان إلى روبوت».

النتائج في اختبارات الأداء (benchmarks):

  • 91.4% في LIBERO-Plus (أعلى بمقدار 7 نقطة مئوية عن أفضل نتيجة سابقة)؛
  • المركز 1 في الترتيب العام لـ RoboChallenge Table30 v1 (بواقع 45% عملية تنفيذ ناجحة، متفوقاً على المركز الثالث بمقدار 20%)؛
  • أداء قوي في RoboTwin وRoboCasa وEBench واختبارات أخرى، لا سيما في سيناريوهات خارج نطاق بيانات التدريب وعند نقل المهارات بين أنواع مختلفة من الروبوتات دون تدريب إضافي.

يُظهر النموذج خصائص ناشئة: مثل مقاومة الاضطرابات الخارجية، والتعافي من الأخطاء، وتنفيذ التعليمات المفتوحة، ونقل المهارات بين روبوتات مختلفة.

Qwen-RobotWorld — نموذج العالم والتنبؤ بالمستقبل

هذا نموذج عالم للفيديو مشروط باللغة، يقوم بناءً على الملاحظة الحالية والتعليمات النصية بتوليد حالة مستقبلية للمشهد تكون واقعية من الناحية الفيزيائية. دُرّب النموذج على 8.6 مليون زوج من «الفيديو والنص» (أكثر من 200 مليون إطار) وهو يفهم الفيزياء جيداً (قوانين الحركة، وقانون حفظ الكتلة، وسلوك السوائل، وما إلى ذلك).

يحتل النموذج المراكز الأولى في EWMBench وDreamGen Bench وWorldModelBench (بين النماذج المفتوحة) وPBBench. وتبرز أهمية إمكانية التحكم اللغوي الدقيق والتوليد المتسق من زوايا رؤية مختلفة.

Qwen-RobotClaw — طبقة التكامل

مكون إضافي مهم هو — Qwen-RobotClaw، وهو مجموعة أدوات داخلية للوكلاء الروبوتيين. فهو يتيح لوكلاء Qwen المرئيين-اللغويين العاديين استدعاء نماذج Robot Suite كأدوات للعالم المادي، مع إدارة السياق والذاكرة عند تنفيذ المهام طويلة الأمد.

هذه الطبقة تحديداً هي التي تحول النماذج الأساسية الثلاثة إلى نظام متكامل للوكلاء الذين يعملون في العالم المادي.

النماذج قيد الاستخدام التجريبي بالفعل لدى عملاء مؤسسيين مختارين لشركة Alibaba Cloud في قطاع الروبوتات.

تم نشر المستودعات على GitHub (QwenLM/Qwen-RobotNav وQwen-RobotManip وغيرها) والتقارير التقنية. النماذج متاحة عبر نظام Qwen البيئي، بما في ذلك منصة Hugging Face. ومن المتوقع توفير الأوزان الكاملة وتعليمات التكامل التفصيلية في القريب العاجل.

53 مشاهدات

المصادر

  • qwen.ai

التعليقات

اقرأ المزيد من المقالات حول هذا الموضوع:

هل وجدت خطأً أو عدم دقة؟سننظر في ملاحظاتك في أقرب وقت ممكن.