ב-1 בספטמבר 2026, Google DeepMind הציג הבנת וידאו סוכנתית במודלים Gemini 3.7 Flash, 3.6 Flash ו-3.5 Flash-Lite. במקום דגימה קבועה של פריימים בתדירות של אחד לשנייה, המודל כעת מחליט בעצמו אילו קטעי וידאו, אודיו או תמליל כדאי לטעון ובאיזו רזולוציה. הבלוג הרשמי של החברה מדווח על הפחתה של עד 88% בצריכת טוקנים, ירידה של עד 66% בעלות ועלייה של עד 7% בדיוק על סרטונים ארוכים.
המנגנון פועל כך: המודל מקבל קישור לסרטון ושאילתת משתמש, ולאחר מכן מתכנן רצף פעולות - לחלץ תמליל, להגדיל את תדירות הפריימים במרווח חשוד או לעבור לאודיו. כל שלב מלווה בחשיבה פנימית, וההקשר הסופי נוצר רק מקטעים רלוונטיים. כתוצאה מכך, הרצאה של שעה, שבמצב סטטי דרשה יותר ממיליון טוקנים, מעובדת כעת עם כ-100 אלף.
ההערכה בוצעה על מדדים 1H-VideoQA ו-LVBench. במצב סוכן, נצרכו 88% פחות טוקנים, ודיוק התשובות עלה בכמה אחוזים. עם זאת, Google לא מפרסמת מחקרי ניתוח מפורטים המראים איזה רכיב בדיוק - בחירת מודאליות, תדירות פריימים אדפטיבית או תכנון פנימי - תורם עיקרי לשיפור האיכות.
בעבר, רוב המודלים הרב-מודאליים, כולל גרסאות קודמות של Gemini ופתרונות של מעבדות אחרות, הסתמכו על עיבוד סטטי: תדירות פריימים קבועה וטעינה מלאה של ההקשר. גישה זו הבטיחה שחזוריות, אך הפכה במהירות לבלתי יעילה על סרטונים ארוכים. השיטה הסוכנתית של Google מזכירה גישות שכבר יושמו בסוכני טקסט עם כלים, אך מעבירה אותן לוידאו תוך שמירה על רב-מודאליות.
השוואה לעבודות מקבילות מראה ש-Google שמה דגש על יעילות דווקא לתוכן ארוך, בעוד שחלק מהמעבדות האחרות ממשיכות לשפר שיטות סטטיות עם רזולוציית פריימים גבוהה יותר. ההבדל בפילוסופיה ברור: צד אחד ממזער את נפח ההקשר, השני ממקסם את הצפיפות שלו.
למפתחים, משמעות הדבר היא אפשרות לבנות סוכני וידאו המנתחים הקלטות של שעות רבות ללא עלויות מופרזות. צצים תרחישים חדשים - חיפוש אוטומטי של רגעי מפתח בהרצאות, עריכת וידאו מדויקת לפי תיאור, ניטור חריגות בהקלטות תעשייתיות. עם זאת, עדיין לא ברור עד כמה המודל מתמודד ביציבות עם שאילתות מעורפלות, כאשר קטעים רלוונטיים מפוזרים על פני כל הסרטון.
אימות בלתי תלוי מוגבל כרגע לדיווחים ראשוניים של מפתחים. הקהילה כנראה תבדוק את ההתנהגות במקרי קיצון: סרטונים עם מעברי סצנה מהירים, אודיו באיכות נמוכה או תמלילים סותרים. העבודות המעניינות הבאות יתמקדו דווקא בעמידות התכנון הסוכני והשפעתו על הכללה.
התוצאה העיקרית של הפיתוח - ניתוח וידאו הופך לא ממצה אלא ממוקד מטרה, וזה משנה את הכלכלה של יישומים העובדים עם תוכן מולטימדיה ארוך.

