Gemini加入代理式视频分析
The Decoder··作者 Jonathan Kemper
关键信息
该功能现已通过 Gemini API 面向视频上传和 YouTube 视频开放,除标准 API token 计费外不收取额外费用。谷歌表示,模型可以识别低于 1 秒的事件,对可疑片段提高采样帧率,并按需使用画面、音频或转录文本。
资讯摘要
谷歌正在为多个 Gemini Flash 模型推出代理式视频分析,包括 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite。与此前默认按每秒 1 帧固定速率分析视频的方式不同,新系统允许模型自己决定查看哪些片段,以及使用哪种模态。谷歌表示,这样模型就能更智能地搜索长视频,而不是把 token 花在无关帧上。根据 LongVideoBench 等基准测试,谷歌称启用代理式分析的 Gemini 3.7 Flash 在质量、准确率和成本效率之间取得了最佳平衡。
公司还表示,该系统能够捕捉每秒 1 帧采样可能错过的短暂状态变化或剪辑点,因此更适合剪辑和场景检索任务。它还可以通过对可疑时间窗口提高帧率重新采样来识别异常,并更准确地统计重复动作或随时间变化的物体数量。开发者现在已可在 Google AI Studio 和 Gemini Enterprise Agent Platform 中使用这一功能,只需将处理模式设置为“agentic”。谷歌计划稍后把同样的能力带到 Gemini 应用和 YouTube 中,包括为播放页上的“Ask YouTube”提供更贴近视频实际画面的回答。

资讯正文
Google Gemini 全新的基于智能体的视频分析可将 token 用量最多降低 88%
要点
- Google 正在为其 Gemini Flash 模型加入基于智能体的视频分析功能,该功能会动态搜索视频片段,而不是按固定模式逐帧扫描。
- 这些模型会自主决定分析视频的哪些部分以及如何分析。Google 表示,这可节省最多 88% 的 token、将成本降低 66%,并提升准确率。
- 该功能现已通过 Gemini API 提供,用于在长视频中查找特定场景;与 Gemini 应用和 YouTube 的集成则计划稍后推出。
Google 正在为多款 Gemini 模型加入基于智能体的视频分析功能。与按固定帧率逐帧扫描视频不同,模型会自行寻找相关片段,Google 表示,这样可以大幅减少 token 用量并降低成本。
最新的 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 模型,能够捕捉短于一秒的瞬间,包括在每秒一帧的处理方式下可能被遗漏的状态变化或剪切。Google 表示,这使得自动化视频编辑的精度大幅提升。
该系统还可以在数小时的视频中定位单个场景,而不会消耗数百万个 token。它会通过以更高帧率重新采样可疑时间窗口来发现异常,并能准确统计随时间重复出现的动作和单个物体。
在此之前,Gemini 依赖静态处理,默认按每秒一帧的固定帧率对视频进行采样,且可通过 API 调整。自 2025 年原生视频分析推出以来,Gemini 一直在转录音轨,并按每秒为单位分析画面。
Google 表示,基于智能体的版本把模型的推理直接与原生视频工具绑定在一起。模型会自行决定查看哪些片段、以多快的速度查看,以及通过哪种模态查看——无论是画面、音频还是转录文本。对于某项任务,它只会提取真正需要的瞬间和信号。
Gemini 现在只加载视频中有用的部分
Gemini 现在会使用一个内部工具,只抓取视频文件中相关的部分。开发者过去可以手动构建这种选择性处理方式,但现在由模型自行完成。
这一方法建立在 Google 于 1 月为 Gemini 3 Flash 推出的“agentic vision”之上。该功能允许模型编写并运行 Python 代码来放大、裁剪和标注图像,并在回复前通过“思考-行动-观察”循环检查每个结果。该功能在发布时并不能自动适用于所有情况,但基础已经打下。Google 在去年 12 月发布 Gemini 3 Flash 时,就曾将视频的视觉与空间推理标记为即将推出的能力。
效率提升在长视频上最为明显,从 10 分钟的教程到 90 分钟的讲座,以及持续数小时的录制内容都包括在内。在静态处理方式下,开发者不得不在高昂的 token 成本和会丢失重要细节的方法之间做选择。根据 Google 自己的基准测试,包括 LongVideoBench 在内,采用基于 agent 的分析的 Gemini 3.7 Flash 在整体质量上得分最高,并且在准确性与成本效率之间提供了最佳组合。
通过 API 不额外收费
该功能现已可通过 Google AI Studio 中的 Gemini API 以及 Gemini Enterprise Agent Platform 用于视频上传和 YouTube 视频。开发者只需在 API 配置中将处理模式设为“agentic”,并按标准 Gemini API token 费率付费,无需支付额外费用。更多细节见 Developer Guide。
Google 也计划将这些改进带到自家产品中。该功能应很快向所有 Gemini 应用用户推出,适用于 Flash 和 Flash Lite 设备。在接下来的几个月里,基于 agent 的视频分析还将为播放页面上的“Ask YouTube”功能提供支持,使回答与视频中实际可见内容的关联更加紧密。
来源与参考