2026 年 9 月 1 日,Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 與 3.5 Flash-Lite 模型中推出了代理式影片理解功能。模型不再採用每秒一幀的固定頻率採樣,而是自行決定應載入哪些影片、音訊或逐字稿片段,以及採用何種解析度。該公司的官方部落格指出,在長影片處理上,token 消耗量減少了高達 88 %,成本降低了 66 %,且準確度提升了 7 %。
運作機制如下:模型接收影片連結與使用者指令後,會規劃一系列行動——擷取逐字稿、在可疑區間增加幀率,或切換至音訊。每一步都伴隨著內部推理,而最終的上下文僅由相關片段組成。結果顯示,一段在靜態模式下需要超過一百萬個 token 的一小時講座,現在僅需約 100 千個即可處理。
評估是在 1H-VideoQA 和 LVBench 基準測試上進行的。在代理模式下,token 消耗減少了 88 %,而回答準確度提升了幾個百分點。與此同時,Google 並未發布詳細的消融研究,以說明究竟是哪個組件——模態選擇、自適應幀率還是內部規劃——對品質提升做出了主要貢獻。
此前,包括早期版本的 Gemini 及其他實驗室的解決方案在內,大多數多模態模型都依賴靜態處理:固定的幀率和完整的上下文載入。這種方法雖能保證可重現性,但在處理長影片時會迅速變得效率低下。Google 的代理方法類似於已應用於具備工具調用能力的文字代理技術,但將其轉移到了影片領域,並保留了多模態特性。
與同期研究的對比顯示,Google 致力於提升長內容的處理效率,而其他一些實驗室則繼續完善高解析度幀的靜態方法。兩者的哲學差異顯而易見:一方致力於最小化上下文體積,另一方則致力於最大化其密度。
對開發者而言,這意味著可以構建影片代理,在無需支付過高成本的情況下分析長達數小時的錄影。新的應用場景隨之出現——自動搜尋講座中的關鍵時刻、根據描述進行精確影片編輯、監控工業錄影中的異常情況。然而,當相關片段分散在整個影片中時,模型處理模糊指令的穩定性仍有待觀察。
獨立驗證目前僅限於開發者的初步報告。社群可能會針對邊緣案例測試其表現:場景快速切換、低品質音訊或存在矛盾的逐字稿影片。接下來值得關注的研究將集中在代理規劃的容錯能力及其對泛化能力的影響。
該研發成果的核心結論是——影片分析正從面面俱到轉向目標導向,這改變了處理長多媒體內容的應用程式經濟模式。

