Google为Gemini加入代理式视频理解

Google DeepMind News··作者 Rohan Doshi

关键信息

Google 表示,这种代理式方案在标准视频基准上可将分析成本降低最多 66%,将 token 消耗降低最多 88%,同时将准确率提升最多 7%。它不再依赖固定帧率处理,而是让 Gemini 动态查看画面、音频和字幕,其中 Gemini 3.7 Flash 被描述为兼具最佳整体质量和最优的准确率-成本权衡。

资讯摘要

Google 正在其最新的 Gemini Flash 模型中推出代理式视频理解,包括 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite。公司表示,这项新能力可以在显著降低视频分析 token 用量和成本的同时提升准确率。该功能现已可用于视频上传和 YouTube 视频,并可通过 Google AI Studio 和 Gemini Enterprise Agent Platform 中的 Gemini API 调用。Google 将其与 agentic vision 进行类比,后者把代码执行与 Gemini 原生图像理解结合起来;这一次,视频处理则借助 Gemini 原生的视频工具来增强能力。官方提到的新增能力包括亚秒级片段检索、更准确的异常检测以及精确计数。

其关键技术变化在于,Gemini 不再像传统静态处理那样按固定帧率读取视频,例如默认的 1 FPS。相反,它可以动态搜索、扫描并检查最相关的片段,同时综合画面、音频和字幕信息。Google 表示,在标准视频基准上,这种方法可将分析成本降低最多 66%,将 token 消耗降低最多 88%,并将准确率提升最多 7%。公司还强调,长视频场景是最大受益者,因为静态处理往往会让开发者在高成本和遗漏关键信息之间做选择。

Google为Gemini加入代理式视频理解

资讯正文

使用 Gemini 引入具备代理能力的视频理解

今天,我们正在最新模型中推出具备代理能力的视频理解:Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite。这项新能力在大幅降低视频分析所需的 token 用量和成本的同时,提高了准确率。与具备代理能力的视觉理解类似,后者将代码执行与 Gemini 模型原生的图像理解能力结合在一起,具备代理能力的视频理解则使用 Gemini 原生的视频工具来提升性能,并解锁视频处理的新能力,例如亚秒级时刻检索、更准确的异常检测、精确计数等。

该功能现已通过 Google AI Studio 和 Gemini Enterprise Agent Platform 中的 Gemini API 面向视频上传和 YouTube 视频开放。

基准测试

不同于当前的“静态”处理方式——模型以固定的每秒帧数摄取视频(默认 1 FPS,可通过 API 调整)——具备代理能力的视频理解让模型的核心推理能力与原生视频工具配合,动态搜索、扫描并检查目标视频片段,覆盖视觉帧、音频和转录文本。在标准视频分析基准测试中,具备代理能力的视频理解的 Gemini 模型将分析成本最高降低 66%,token 消耗最高降低 88%,同时准确率最高提升 7%。

这些效率提升在长视频内容上尤为明显(从 10 分钟的操作指南到 90 分钟的讲座以及数小时的录制内容),因为静态处理迫使开发者在高 token 成本与会丢失关键细节的技术之间作出选择。

在启用具备代理能力的视频理解后,Gemini 3.7 Flash 的 token 消耗最高可降低 88%,准确率最高可提升 7%。

尽管这些提升覆盖了全部三款受支持的模型,但配备具备代理能力理解的 Gemini 3.7 Flash 在整体质量上提供了最佳可能表现,并兼具最佳的质量与成本效率,在所测试的视频理解模型中处于准确率与成本的帕累托前沿。

使用具备代理能力的视频理解后,Gemini 3.7 Flash 在视频分析的准确率与成本之间处于帕累托前沿。

工作原理

不同于模型以固定帧率摄取媒体流的静态处理方式,具备代理能力的视频理解使 Gemini 能够主动、以目标为导向地决定要观看什么、以什么速度观看,以及通过哪种模态(帧、音频或转录文本)来查看,仅抓取所需的片段和信号。虽然开发者此前也可以手动实现这一点,但借助具备代理能力的视频理解,Gemini 可以通过一个代理循环来完成这一过程,调用内部工具加载视频文件中的相关部分,从而显著降低开发开销。

能力与使用场景

具备代理能力的视频理解正在改变开发者处理长视频内容的方式,并可应用于多种高要求场景。

- 亚秒级时刻检索:精确定位转瞬即逝的状态变化和紧密的剪辑边界,这些内容在 1 FPS 下很容易被遗漏,从而实现精确的自动化视频编辑。

- 长视频中的“大海捞针”式搜索:在数小时的视频中回答复杂查询,而无需消耗数百万个 token。

- 异常检测:以更高的 FPS 对感兴趣的时间窗口重新采样,以检查快速运动和细微的视觉伪影。

- 动作与物体计数:准确跟踪重复的身体动作和随时间变化的不同物体。

实际效果

我们的许多早期访问合作伙伴在测试 agentic video understanding 时都看到了强劲表现。以下是他们的反馈:

开始使用

要启用它,只需在 API 配置中将 processing 设为“agentic”。阅读我们的开发者指南,了解更多功能信息以及如何开始使用。

from google import genai

client = genai.Client()

interaction = client.interactions.create(

model="gemini-3.7-flash",

input=[

{

"type": "video",

"uri": "https://youtu.be/7Z5Vy9JBANs",

"processing": "agentic"

},

"type": "text",

"text": "What are the 3 most important announcements in this keynote?",

print(interaction.output_text)我们也在将 agentic video understanding 的效率和质量提升带给 Google 产品中的数十亿用户。该功能很快将面向 Gemini 应用中的所有用户推出,覆盖 Flash 和 Flash-Lite 模型。并且在未来几个月里,agentic video understanding 还将为 YouTube 视频观看页上的“YouTube 问问”功能提供支持,借助 Gemini 基于画面内容提供更高质量的答案。

感谢以下人员对这项工作的贡献:Sergi Caelles、Filip Pavetić、Ahmet Iscen、Suhas Yogin,以及 Agentic Vision 团队。

来源与参考

  1. 原始链接
  2. Introducing agentic video understanding with Gemini

收录于 2026-09-02