来源说明(热点来源):Google DeepMind Blog -《Introducing agentic video understanding in Gemini》(https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/)

视频是 token 大户。按固定帧率把整段视频塞给模型,一条 90 分钟的讲座轻松烧掉几百万 token;开发者只能在高成本和丢细节之间二选一。9 月初 Google DeepMind 给 Gemini Flash 系模型上线了 agentic video understanding(智能体式视频理解):让模型自己决定看哪几帧、以什么速度看、用画面还是音频还是转录文本,把「看视频」这件原本要开发者手写逻辑的事,变成模型在一个智能体循环里自己按需调用内部工具。官方口径是 token 消耗最多降 88%、成本最多降 66%、准确率最多还能提升 7%。这篇文章从热点解读的角度拆开:旧做法卡在哪、新机制怎么运作、效果数字是什么语境、怎么调用,以及它给做 Agent 的人什么启发。

一、旧做法的成本困境

  • 静态处理默认按固定帧率(1 FPS)摄取整个视频流,开发者只能调 FPS 高低;
  • 调高 FPS 保细节但 token 爆炸,调低省 token 但丢细节,长视频「大海捞针」式提问(跨几小时视频找一个片段)动辄要喂几百万 token;
  • 降采样这类处理是盲目的:不管问题是什么,整段视频一视同仁地抽帧,大量与问题无关的帧也进了上下文。

二、新机制:感知决策交给模型的 agentic loop

  • 模型通过 agentic loop(智能体循环)发挥主动、目标导向的作用:根据当前查询决定下一步看视频的哪一段、用什么速度看、用哪种模态(画面帧、音频、转录文本);
  • 实现上是模型在循环里调用一个内部工具,按需加载视频文件的对应部分,形成「查询 → 工具调用 → 分析 → 再查询」的循环;
  • 动态 FPS 重采样:遇到快速动作的片段会以更高 FPS 重新采样细看,静态内容直接跳过;
  • 对开发者最大的变化:以前要自己写「先看开头、找关键段、再放大看」这类代码,现在这段动态选择逻辑被模型接管,开发成本降下来,也更容易针对特定查询动态调整分析粒度。

三、效果数字与适用语境

官方数字(跨标准视频分析基准,自家评测口径):

  • token 消耗最多降低 88%;
  • 成本最多降低 66%;
  • 准确率最多提升 7%;
  • 以上峰值来自 Gemini 3.7 Flash 开启该功能后;效率增益在长视频上最明显,覆盖 10 分钟教程、90 分钟讲座到多小时录像;
  • 在 LongVideoBench 长视频理解基准上,Gemini 3.7 Flash 开启后同样展示大量 token 削减与准确率提升(原文以配图呈现);
  • 综合来看,Gemini 3.7 Flash + agentic 理解在三个模型中提供最佳整体质量,也处于准确率-成本帕累托前沿(accuracy-to-cost Pareto frontier)。

四、四个典型场景

  • 亚秒级时刻检索:定位 1 FPS 下容易错过的瞬间状态变化和紧密剪辑边界,用于自动剪辑;
  • 长视频大海捞针:回答跨多小时视频的复杂问题,不用消耗几百万 token;
  • 异常检测:对感兴趣的时间窗口用更高 FPS 重采样,检查快速运动和细微视觉伪影;
  • 动作与物体计数:准确跟踪反复出现的物理动作与不同物体。

五、怎么用:一行参数开关

官方示例代码(来自 DeepMind 原文):

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-3.7-flash",
    input=[
        {
            "type": "video",
            "uri": "https://youtu.be/7Z5Vy9JBANs",
            "processing": "agentic"   # 关键开关:agentic 视频理解
        },
        {
            "type": "text",
            "text": "What are the 3 most important announcements in this keynote?",
        },
    ],
)

print(interaction.output_text)

说明:模型名 gemini-3.7-flash 换成 3.6 Flash、3.5 Flash-Lite 同样可用;input 里视频与文本成对传入,视频块多一个 processing: "agentic" 参数就是开启开关;interaction.output_text 拿最终回答。该能力通过 Gemini API(Google AI Studio 与 Gemini Enterprise Agent Platform)提供,支持视频上传与 YouTube 链接分析,无需额外功能费,按标准 token 价格计费。SDK 与各模型版本未验证最新,接口细节以官方文档(ai.dev/learn/agentic-video-understanding-with-gemini)为准。

六、对 Agent 开发者的四点启示

  1. 昂贵的感知可以做成按需工具:这个功能本质是把「看视频」变成循环里的工具调用——和你给 Agent 挂一个搜索工具是同一套思想;凡是「全量处理完再过滤」的步骤,都值得问一句能不能改成「先定位、再细看」,把昂贵操作从预执行改成按查询触发;
  2. 动态粒度是省 token 的第一杠杆:固定采样是对问题无知的平均用力,目标驱动的重采样才能把预算花在刀刃上,多模态 Agent 每多看一帧都是成本,粒度决策值得交给模型而不是写死;
  3. 用帕累托前沿选配置:官方给出的「准确率 × 成本」双轴对比(3.7 Flash 处在成本-准确率前沿上)是 Agent 选型的好模板——不要只看准确率,画一张成本-质量散点,选前沿上的点;
  4. 闭环里的抽象可以复用:查询 → 工具调用 → 分析 → 再查询这个循环与文本 Agent 的 ReAct 一致,多模态只是把「工具结果」从文本换成了视频片段,理解了这层抽象,视频 Agent 就没有新概念。

七、注意事项

  • 数字是官方自家评测口径,未做独立复现,引用时以官方数据为准;
  • 目前仅 Flash 系模型(3.7/3.6 Flash、3.5 Flash-Lite)支持,不是全系能力;
  • 决策由模型自治:内部工具何时触发、每轮延迟多少,官方未公开细节,生产使用前建议在自家长视频上实测 token 收益与准确率的变化;
  • 模态切换(画面/音频/转录)意味着结果质量依赖视频本身有没有干净音轨或字幕,纯无声画面场景要单独验证。

八、总结

Agentic 视频理解把「感知策略」从开发者手里移交给了模型:看什么、看多细、用什么模态,全部在智能体循环里按查询动态决定,换来最高 88% 的 token 削减和 7% 的准确率提升。对做 Agent 的人,它的价值不只是省 token,而是给出一个可迁移的设计模式——把昂贵的感知、检索、计算都做成循环里按需调用的工具,用目标驱动代替全量平均用力。下一个你要写的多模态 Agent,值得先问一句:它真的需要看完每一帧,还是只需要知道自己要看哪几帧?

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐