让模型自己决定「看哪几帧」:Gemini Agentic 视频理解把感知变成工具调用
来源说明(热点来源):Google DeepMind Blog -《Introducing agentic video understanding in Gemini》(https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/)
视频是 token 大户。按固定帧率把整段视频塞给模型,一条 90 分钟的讲座轻松烧掉几百万 token;开发者只能在高成本和丢细节之间二选一。9 月初 Google DeepMind 给 Gemini Flash 系模型上线了 agentic video understanding(智能体式视频理解):让模型自己决定看哪几帧、以什么速度看、用画面还是音频还是转录文本,把「看视频」这件原本要开发者手写逻辑的事,变成模型在一个智能体循环里自己按需调用内部工具。官方口径是 token 消耗最多降 88%、成本最多降 66%、准确率最多还能提升 7%。这篇文章从热点解读的角度拆开:旧做法卡在哪、新机制怎么运作、效果数字是什么语境、怎么调用,以及它给做 Agent 的人什么启发。
一、旧做法的成本困境
- 静态处理默认按固定帧率(1 FPS)摄取整个视频流,开发者只能调 FPS 高低;
- 调高 FPS 保细节但 token 爆炸,调低省 token 但丢细节,长视频「大海捞针」式提问(跨几小时视频找一个片段)动辄要喂几百万 token;
- 降采样这类处理是盲目的:不管问题是什么,整段视频一视同仁地抽帧,大量与问题无关的帧也进了上下文。
二、新机制:感知决策交给模型的 agentic loop
- 模型通过 agentic loop(智能体循环)发挥主动、目标导向的作用:根据当前查询决定下一步看视频的哪一段、用什么速度看、用哪种模态(画面帧、音频、转录文本);
- 实现上是模型在循环里调用一个内部工具,按需加载视频文件的对应部分,形成「查询 → 工具调用 → 分析 → 再查询」的循环;
- 动态 FPS 重采样:遇到快速动作的片段会以更高 FPS 重新采样细看,静态内容直接跳过;
- 对开发者最大的变化:以前要自己写「先看开头、找关键段、再放大看」这类代码,现在这段动态选择逻辑被模型接管,开发成本降下来,也更容易针对特定查询动态调整分析粒度。
三、效果数字与适用语境
官方数字(跨标准视频分析基准,自家评测口径):
- token 消耗最多降低 88%;
- 成本最多降低 66%;
- 准确率最多提升 7%;
- 以上峰值来自 Gemini 3.7 Flash 开启该功能后;效率增益在长视频上最明显,覆盖 10 分钟教程、90 分钟讲座到多小时录像;
- 在 LongVideoBench 长视频理解基准上,Gemini 3.7 Flash 开启后同样展示大量 token 削减与准确率提升(原文以配图呈现);
- 综合来看,Gemini 3.7 Flash + agentic 理解在三个模型中提供最佳整体质量,也处于准确率-成本帕累托前沿(accuracy-to-cost Pareto frontier)。
四、四个典型场景
- 亚秒级时刻检索:定位 1 FPS 下容易错过的瞬间状态变化和紧密剪辑边界,用于自动剪辑;
- 长视频大海捞针:回答跨多小时视频的复杂问题,不用消耗几百万 token;
- 异常检测:对感兴趣的时间窗口用更高 FPS 重采样,检查快速运动和细微视觉伪影;
- 动作与物体计数:准确跟踪反复出现的物理动作与不同物体。
五、怎么用:一行参数开关
官方示例代码(来自 DeepMind 原文):
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.7-flash",
input=[
{
"type": "video",
"uri": "https://youtu.be/7Z5Vy9JBANs",
"processing": "agentic" # 关键开关:agentic 视频理解
},
{
"type": "text",
"text": "What are the 3 most important announcements in this keynote?",
},
],
)
print(interaction.output_text)
说明:模型名 gemini-3.7-flash 换成 3.6 Flash、3.5 Flash-Lite 同样可用;input 里视频与文本成对传入,视频块多一个 processing: "agentic" 参数就是开启开关;interaction.output_text 拿最终回答。该能力通过 Gemini API(Google AI Studio 与 Gemini Enterprise Agent Platform)提供,支持视频上传与 YouTube 链接分析,无需额外功能费,按标准 token 价格计费。SDK 与各模型版本未验证最新,接口细节以官方文档(ai.dev/learn/agentic-video-understanding-with-gemini)为准。
六、对 Agent 开发者的四点启示
- 昂贵的感知可以做成按需工具:这个功能本质是把「看视频」变成循环里的工具调用——和你给 Agent 挂一个搜索工具是同一套思想;凡是「全量处理完再过滤」的步骤,都值得问一句能不能改成「先定位、再细看」,把昂贵操作从预执行改成按查询触发;
- 动态粒度是省 token 的第一杠杆:固定采样是对问题无知的平均用力,目标驱动的重采样才能把预算花在刀刃上,多模态 Agent 每多看一帧都是成本,粒度决策值得交给模型而不是写死;
- 用帕累托前沿选配置:官方给出的「准确率 × 成本」双轴对比(3.7 Flash 处在成本-准确率前沿上)是 Agent 选型的好模板——不要只看准确率,画一张成本-质量散点,选前沿上的点;
- 闭环里的抽象可以复用:查询 → 工具调用 → 分析 → 再查询这个循环与文本 Agent 的 ReAct 一致,多模态只是把「工具结果」从文本换成了视频片段,理解了这层抽象,视频 Agent 就没有新概念。
七、注意事项
- 数字是官方自家评测口径,未做独立复现,引用时以官方数据为准;
- 目前仅 Flash 系模型(3.7/3.6 Flash、3.5 Flash-Lite)支持,不是全系能力;
- 决策由模型自治:内部工具何时触发、每轮延迟多少,官方未公开细节,生产使用前建议在自家长视频上实测 token 收益与准确率的变化;
- 模态切换(画面/音频/转录)意味着结果质量依赖视频本身有没有干净音轨或字幕,纯无声画面场景要单独验证。
八、总结
Agentic 视频理解把「感知策略」从开发者手里移交给了模型:看什么、看多细、用什么模态,全部在智能体循环里按查询动态决定,换来最高 88% 的 token 削减和 7% 的准确率提升。对做 Agent 的人,它的价值不只是省 token,而是给出一个可迁移的设计模式——把昂贵的感知、检索、计算都做成循环里按需调用的工具,用目标驱动代替全量平均用力。下一个你要写的多模态 Agent,值得先问一句:它真的需要看完每一帧,还是只需要知道自己要看哪几帧?
更多推荐



所有评论(0)