Google 推出 Gemini Agentic Video:视频理解最高降 88% Token,成本降 66%

行业动态

Google 推出 Gemini Agentic Video:视频理解最高降 88% Token,成本降 66%

栏目:行业动态

摘要

Google 推出 Gemini Agentic Video Understanding,让模型按任务主动搜索和重看视频片段。官方称其最高可减少 88% Token、降低 66% 成本,并提升最多 7% 准确率,现已向 Gemini API 开放。

本文目录

Google在9月1日发布了 Gemini的 Agentic Video Understanding(智能体视频理解)能力,并率先覆盖 Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite。它解决的不是“让模型多看几帧”这么简单,而是把视频分析从固定帧率、一次性吞入素材的方式,改成由模型主动决定看哪里、看多快、该读画面、音频还是转写文本。对长视频分析来说,这一变化直接指向两个长期问题:Token消耗太高,以及固定采样容易漏掉关键瞬间。

Google给出的测试结果相当直接:在标准视频分析基准上,启用 Agentic Video Understanding后,Token消耗最高可减少88%,分析成本最高降低66%,准确率最高提升7%。其中,Gemini 3.7 Flash在 Google的测试中表现出最佳的质量与成本平衡。

从“固定采样”变成主动寻找答案

传统视频理解通常按照固定 FPS读取视频。Gemini API默认可按1 FPS处理,开发者也可以手动调整,但这意味着系统要么读取大量冗余画面,要么为了省成本降低采样率,从而错过短暂动作、快速切换或异常细节。

Agentic Video Understanding的思路是让模型根据问题动态选择观察策略。它会在推理过程中调用内部视频工具,按需搜索、扫描和重新检查特定时间片段,同时结合视频帧、音频和字幕,只取回答问题真正需要的信号。开发者过去也能自己搭建类似流程,但现在这部分决策被整合进模型的智能体循环,减少了额外的工程编排。

Gemini Agentic Video Understanding 的 Token 效率与准确率基准图

Google 官方基准:启用 Agentic Video Understanding 后,Token 消耗和成本显著下降。

从成本角度看,这个机制对长视频尤其重要。10分钟教程、90分钟课程乃至数小时录像,如果仍采用固定采样,很容易迅速堆高上下文与 Token使用量。Agentic Video的价值就在于避免“为了找到几十秒有效内容,先完整处理几小时视频”的浪费。

四类能力最值得关注

Google重点展示了四类场景。第一是亚秒级片段检索,可以定位1 FPS采样容易错过的瞬时变化和剪辑边界;第二是长视频“needle-in-a-haystack”搜索,用更少 Token在数小时内容中寻找特定事件;第三是异常检测,模型可以对可疑时间窗口提高采样频率重新检查;第四是动作和物体计数,通过多次扫描不同时间段,减少快速运动中的漏数和误数。

这些能力的共同点是:模型不再平均地“看完整段视频”,而是围绕问题去寻找证据。这对自动剪辑、体育动作分析、监控与质检、课程检索、会议总结、媒体资产管理等任务都更实用,尤其适合信息密度分布不均的长视频。

Gemini Agentic Video Understanding 从查询到输出的智能体处理流程图

Google 官方示意图:模型会按任务动态搜索、扫描并检查视频片段。

开发者现在就能使用

这项能力已经通过 Gemini API在 Google AI Studio和 Gemini Enterprise Agent Platform中提供,支持视频上传和 YouTube视频。当前覆盖 Gemini 3.7 Flash、3.6 Flash与3.5 Flash-Lite,仍按标准 Gemini API Token价格计费,没有额外的功能费用。

启用方式也比较直接,在视频输入配置中把 `processing` 设为 `agentic` 即可。Google官方示例使用 Gemini 3.7 Flash:

python
from google import genai

client = genai.Client()
json
interaction = client.interactions.create(
model="gemini-3.7-flash",
input=[
{
"type": "video",
"uri": "https://youtu.be/7Z5Vy9JBANs",
"processing": "agentic"
},
{
"type": "text",
"text": "What are the 3 most important announcements in this keynote?",
},
],
)
text
print(interaction.output_text)

这次更新的意义

Agentic Video最值得关注的并不是单一基准分数,而是视频多模态处理方式的变化。过去很多视频 AI应用需要开发者自己做切片、采样、检索和二次分析,现在 Google正在把这些步骤下沉到模型内部,让模型根据任务目标主动控制“看什么”和“怎么看”。

这也意味着视频理解的竞争正在从单纯追求模型是否能看懂画面,转向更实际的工程指标:能否在长视频里快速找到关键证据、能否减少上下文浪费、能否在成本下降的同时保持甚至提高准确率。对于需要大规模处理课程、直播回放、会议录像、媒体库和监控视频的团队,这种能力可能比一次模型参数升级更有实际价值。

Google还确认,这项能力接下来会进入 Gemini应用的 Flash和 Flash-Lite模型,并计划在未来几个月用于 YouTube播放页上的 Ask YouTube功能。也就是说,Agentic Video不只是面向 API开发者的实验能力,而是正在被纳入 Google更大范围的视频理解产品体系。

© 2026 DGNEWLIVE 保留所有权利.