الفهم الوكيل للفيديو في Gemini Flash: من العينات الثابتة إلى الاستكشاف النشط للمحتوى

تم التعديل بواسطة: Svitlana Velhush

في 1 سبتمبر 2026، كشفت Google DeepMind عن الفهم الوكيل للفيديو في نماذج Gemini 3.7 Flash و3.6 Flash و3.5 Flash-Lite. بدلاً من أخذ عينات ثابتة بمعدل إطار واحد في الثانية، يقرر النموذج الآن بشكل مستقل أي أجزاء من الفيديو أو الصوت أو النص المكتوب يجب تحميلها وبأي دقة. تشير المدونة الرسمية للشركة إلى انخفاض استهلاك الرموز بنسبة تصل إلى 88%، وانخفاض التكلفة بنسبة تصل إلى 66%، وزيادة الدقة بنسبة تصل إلى 7% على مقاطع الفيديو الطويلة.

تعمل الآلية على النحو التالي: يتلقى النموذج رابط الفيديو واستعلام المستخدم، ثم يخطط لتسلسل الإجراءات - استخراج النص المكتوب، أو زيادة معدل الإطارات في فترة مشبوهة، أو التبديل إلى الصوت. كل خطوة مصحوبة بتفكير داخلي، ويتم تشكيل السياق النهائي فقط من الأجزاء ذات الصلة. ونتيجة لذلك، فإن محاضرة مدتها ساعة، والتي كانت تتطلب في الوضع الثابت أكثر من مليون رمز، تتم معالجتها الآن باستخدام حوالي 100 ألف.

تم التقييم على معايير 1H-VideoQA وLVBench. في الوضع الوكيل، انخفض استخدام الرموز بنسبة 88%، وزادت دقة الإجابات بعدة نقاط مئوية. ومع ذلك، لا تنشر Google دراسات إزالة تفصيلية تظهر أي مكون - اختيار الوسائط، أو معدل الإطارات التكيفي، أو التخطيط الداخلي - يساهم بشكل رئيسي في تحسين الجودة.

في السابق، اعتمدت معظم النماذج متعددة الوسائط، بما في ذلك الإصدارات السابقة من Gemini وحلول من مختبرات أخرى، على المعالجة الثابتة: معدل إطارات ثابت وتحميل كامل للسياق. يضمن هذا النهج قابلية التكرار، لكنه سرعان ما أصبح غير فعال على مقاطع الفيديو الطويلة. تشبه طريقة Google الوكيلة الأساليب المستخدمة بالفعل في الوكلاء النصيين مع الأدوات، لكنها تنقلها إلى الفيديو مع الحفاظ على تعدد الوسائط.

تُظهر المقارنة مع الأعمال الموازية أن Google تراهن على الكفاءة للمحتوى الطويل تحديدًا، بينما تواصل بعض المختبرات الأخرى تحسين الأساليب الثابتة بدقة إطارات أعلى. الفرق في الفلسفة واضح: جانب يقلل من حجم السياق، والآخر يزيد من كثافته.

بالنسبة للمطورين، هذا يعني القدرة على بناء وكلاء فيديو يحللون تسجيلات متعددة الساعات دون تكاليف باهظة. تظهر سيناريوهات جديدة - البحث التلقائي عن اللحظات الرئيسية في المحاضرات، والتحرير الدقيق للفيديو حسب الوصف، ومراقبة الحالات الشاذة في التسجيلات الصناعية. ومع ذلك، لا يزال من غير الواضح مدى استقرار النموذج في التعامل مع الاستعلامات الغامضة عندما يتم توزيع الأجزاء ذات الصلة عبر الفيديو بأكمله.

التحقق المستقل محدود حاليًا بالتقارير الأولى من المطورين. من المحتمل أن يختبر المجتمع السلوك على الحالات الحافة: مقاطع فيديو مع تغييرات سريعة في المشاهد، أو صوت منخفض الجودة، أو نصوص مكتوبة متناقضة. ستكرس الأعمال المثيرة التالية لتحمل التخطيط الوكيل وتأثيره على التعميم.

النتيجة الرئيسية للتطوير هي أن تحليل الفيديو يصبح ليس شاملاً بل مستهدفًا، وهذا يغير اقتصاد التطبيقات التي تتعامل مع المحتوى المتعدد الوسائط الطويل.

15 مشاهدات

المصادر

  • AI NEWS WAS NONSTOP TODAY

اقرأ المزيد من المقالات حول هذا الموضوع:

هل وجدت خطأً أو عدم دقة؟سننظر في ملاحظاتك في أقرب وقت ممكن.