1年2026月、Google DeepMindはGemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteモデルにエージェント型動画理解を導入しました。毎秒1フレームの固定サンプリングの代わりに、モデルは動画、音声、文字起こしのどの部分をどの解像度で読み込むかを自律的に決定します。同社の公式ブログによると、トークン消費は88%削減、コストは66%削減、長い動画での精度は7%向上しました。
このメカニズムは次のように機能します。モデルは動画へのリンクとユーザーのクエリを受け取り、文字起こしの抽出、不審な区間でのフレームレートの増加、音声への切り替えなど、一連のアクションを計画します。各ステップには内部推論が伴い、最終的なコンテキストは関連する断片のみから構築されます。その結果、静的なモードでは100万トークン以上を必要とした1時間の講義が、現在では約100千トークンで処理されます。
評価は1H-VideoQAとLVBenchのベンチマークで実施されました。エージェントモードではトークン使用量が88%減少し、回答精度は数パーセント向上しました。ただし、Googleは、モダリティの選択、適応的フレームレート、内部計画のうち、どのコンポーネントが品質向上に主に寄与しているかを示す詳細なアブレーション研究を公開していません。
これまで、Geminiの以前のバージョンや他の研究所のソリューションを含むほとんどのマルチモーダルモデルは、固定フレームレートと完全なコンテキスト読み込みという静的処理に依存していました。このアプローチは再現性を保証しましたが、長い動画ではすぐに非効率になりました。Googleのエージェント手法は、ツールを使用したテキストエージェントで既に適用されていたアプローチに似ていますが、マルチモダリティを維持しながら動画に移行しています。
並行研究との比較から、Googleは長いコンテンツの効率性に重点を置いている一方、他のいくつかの研究所はより高いフレーム解像度で静的メソッドを改良し続けていることがわかります。哲学の違いは明らかです。一方はコンテキストの量を最小化し、もう一方はその密度を最大化します。
開発者にとって、これは法外なコストなしに数時間の録画を分析する動画エージェントを構築できることを意味します。講義のキーポイントの自動検索、説明に基づく正確な動画編集、産業用録画の異常監視など、新しいシナリオが出現します。ただし、関連する断片が動画全体に分散している場合に、モデルが曖昧なクエリにどれだけ安定して対処できるかは不明のままです。
独立した検証は現在、開発者からの初期レポートに限られています。コミュニティはおそらく、シーンの急激な変化、低品質の音声、矛盾する文字起こしを含む動画などのエッジケースでの動作をテストするでしょう。次の興味深い研究は、エージェント計画の堅牢性と一般化への影響に焦点を当てるでしょう。
この開発の主な成果は、動画分析が網羅的ではなく目的指向になり、長いマルチメディアコンテンツを扱うアプリケーションの経済性を変えることです。

