1 Eylül 2026'de Google DeepMind, Gemini 3.7 Flash, 3.6 Flash ve 3.5 Flash-Lite modellerinde ajan tabanlı video anlayışını tanıttı. Saniyede bir karelik sabit örnekleme yerine, model artık videonun, sesin veya transkriptin hangi bölümlerini ve hangi çözünürlükte yükleyeceğine kendisi karar veriyor. Şirketin resmi blogu, token tüketiminde 88 %'e varan azalma, maliyette 66 %'e varan düşüş ve uzun videolarda doğrulukta 7 %'e varan artış bildiriyor.
Mekanizma şu şekilde çalışıyor: model, videonun bağlantısını ve kullanıcının isteğini alır, ardından bir dizi eylem planlar — transkripti çıkarmak, şüpheli bir aralıkta kare hızını artırmak veya sese geçmek. Her adıma içsel bir muhakeme eşlik eder ve nihai bağlam yalnızca ilgili parçalardan oluşturulur. Sonuç olarak, statik modda bir milyondan fazla token gerektiren bir saatlik bir ders artık yaklaşık 100 bin token ile işleniyor.
Değerlendirme, 1H-VideoQA ve LVBench kıyaslamalarında yapıldı. Ajan modunda token kullanımı 88 % daha azdı ve yanıt doğruluğu birkaç puan arttı. Ancak Google, kalite artışına ana katkıyı hangi bileşenin — modalite seçimi, uyarlanabilir kare hızı veya içsel planlama — sağladığını gösteren ayrıntılı ablasyon çalışmalarını yayınlamıyor.
Daha önce, önceki Gemini sürümleri ve diğer laboratuvarların çözümleri dahil olmak üzere çoğu çok modlu model, statik işlemeye dayanıyordu: sabit kare hızı ve tam bağlam yükleme. Bu yaklaşım tekrarlanabilirliği garanti ediyordu ancak uzun videolarda hızla verimsiz hale geliyordu. Google'ın ajan yöntemi, araçlarla metin ajanlarında zaten kullanılan yaklaşımları anımsatıyor, ancak bunları çok modluluğu koruyarak videoya taşıyor.
Paralel çalışmalarla karşılaştırma, Google'ın özellikle uzun içerik için verimliliğe odaklandığını, bazı diğer laboratuvarların ise daha yüksek kare çözünürlüğüyle statik yöntemleri geliştirmeye devam ettiğini gösteriyor. Felsefedeki fark açıktır: bir taraf bağlam hacmini en aza indirirken, diğer taraf yoğunluğunu en üst düzeye çıkarıyor.
Geliştiriciler için bu, çok saatlik kayıtları engelleyici maliyetler olmadan analiz eden video ajanları oluşturma olanağı anlamına geliyor. Yeni senaryolar ortaya çıkıyor — derslerde otomatik anahtar an arama, açıklamaya göre hassas video düzenleme, endüstriyel kayıtlarda anomali izleme. Ancak, ilgili parçalar videonun her yerine dağıldığında modelin belirsiz sorgularla ne kadar istikrarlı başa çıktığı belirsizliğini koruyor.
Bağımsız doğrulama şu anda ilk geliştirici raporlarıyla sınırlı. Topluluk muhtemelen davranışı uç durumlarda test edecek: hızlı sahne değişimleri, düşük kaliteli ses veya çelişkili transkriptler içeren videolar. Sonraki ilginç çalışmalar, ajan planlamasının hataya dayanıklılığına ve genelleme üzerindeki etkisine odaklanacak.
Geliştirmenin ana sonucu — video analizi artık kapsamlı değil, hedefli hale geliyor ve bu, uzun multimedya içeriğiyle çalışan uygulamaların ekonomisini değiştiriyor.

