Gemini Flash中的智能视频理解:从静态采样到主动内容探索

编辑者: Svitlana Velhush

1年2026月,Google DeepMind在Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite模型中引入了智能视频理解。模型不再以每秒一帧的固定频率采样,而是自主决定加载哪些视频、音频或转录片段,以及以何种分辨率加载。公司官方博客称,长视频的令牌消耗减少了88%,成本降低了66%,准确率提升了7%。

该机制的工作原理如下:模型收到视频链接和用户请求后,规划一系列操作——提取转录、在可疑区间提高帧率或切换到音频。每一步都伴随内部推理,最终上下文仅由相关片段构成。因此,在静态模式下需要超过一百万个令牌的一小时讲座,现在只需大约100千个令牌即可处理。

评估在1H-VideoQA和LVBench基准上进行。在智能模式下,令牌使用减少了88%,答案准确率提升了几个百分点。然而,Google并未公布详细的消融研究,以显示哪个具体组件——模态选择、自适应帧率还是内部规划——对质量提升贡献最大。

此前,大多数多模态模型,包括Gemini的早期版本和其他实验室的解决方案,都依赖静态处理:固定帧率和完整上下文加载。这种方法保证了可复现性,但在长视频上很快变得低效。Google的智能方法类似于文本代理中已使用的工具调用方法,但将其扩展到视频,同时保持多模态特性。

与并行工作的比较表明,Google押注于长内容的效率,而其他一些实验室则继续完善具有更高帧分辨率的静态方法。设计理念的差异显而易见:一方最小化上下文体积,另一方最大化其密度。

对于开发者来说,这意味着能够构建视频代理,分析数小时的录像而无需高昂的成本。新的场景应运而生——自动搜索讲座中的关键时刻、根据描述精确编辑视频、监控工业录像中的异常。然而,当相关片段分散在整个视频中时,模型能否稳定处理模糊请求仍不清楚。

独立验证目前仅限于开发者的初步报告。社区可能会在边缘案例上测试其行为:快速场景切换的视频、低质量音频或相互矛盾的转录。接下来的有趣工作将专门针对智能体规划的容错性及其对泛化的影响。

这项开发的主要成果是视频分析变得有针对性而非穷尽式,这改变了处理长多媒体内容的应用的成本效益。

15 查看

来源

  • AI NEWS WAS NONSTOP TODAY

阅读更多关于此主题的文章:

你发现了错误或不准确的地方吗?我们会尽快考虑您的意见。