
视频理解过去常用一条简单路线:按固定帧率把整段内容塞进上下文。视频越长,模型读到的重复画面越多;帧率降得太狠,又可能漏掉瞬间动作。9月1日,Google为Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite加入智能体式视频理解,让模型先判断问题需要什么,再决定去看哪一段、用多快的帧率,以及调用画面、音频还是转写。
这让视频检索更接近真实编辑流程:人不会为找一句话逐帧看完两小时录像,而会先靠目录、语音和画面线索缩小范围,再放慢关键片段。模型现在也能执行类似的分层查看,但每一步是否可靠,仍取决于转写质量、镜头变化和问题表述。对于跨镜头人物追踪、稀疏异常定位和操作步骤计数,团队还应分别准备难例,确认模型没有因快速跳转而丢失上下文,也没有把相似片段误当成同一事件。
静态模式默认每秒提取一帧,再把画面与音频一次性送进模型。新模式则先接受一个轻量视频引用,在推理过程中调用内部处理工具,按需要加载某段转写、声音或更高帧率画面。若问题是“讲座里哪一处改变了结论”,模型可以先扫转写定位候选时间,再回看画面;若任务是数快速动作,它可以把相关窗口重新以更高帧率读取。
这不是给模型增加一个更大的上下文窗口,而是改变取数策略。开发者过去要自己切片、检索、重采样并拼接结果,现在这套循环由模型在任务中完成。返回结果还会包含处理调用和处理结果步骤,团队可检查它是否真的进入了主动导航,而不是把“智能体”当成不可见标签。
Google给出的最高数字是:词元用量减少88%、分析成本降低66%、准确率提升7%。收益主要来自10分钟到90分钟的课程、操作指南和多小时录制,因为这类内容只有少量片段与问题真正相关。官方开发文档也确认,三款支持模型可在时间线中动态选择转写、帧率和分辨率,并建议长视频或寻找特定时刻时优先尝试新模式。
但“最高”不能理解为每个任务都能省这么多。视频内容越均匀、问题越要求逐帧核对,模型越难跳过大段信息。导航本身还会产生思考词元和工具调用词元,短于5分钟的片段可能因为内部往返增加首字延迟。要求全片逐帧精度的质检、医学影像或安全审查,也不能只靠选择性查看。
开发者在视频输入中把处理模式设为agentic即可启用,仍按标准Gemini API词元价格计费,不另收功能费。当前支持文件上传和YouTube链接;同一次请求还可以让长视频使用主动模式、短视频保留静态模式。Google表示该能力将很快进入Gemini应用,随后用于YouTube页面里的问答功能。
生产接入的关键不是开关,而是验收集。团队应拿自己的长视频建立问题、关键时间段和可接受答案,分别记录静态与主动模式的准确率、词元、首字延迟和总耗时。还要检查模型是否反复查看错误区间、是否在无转写场景下降,以及跨轮对话是否保留处理步骤。否则成本下降可能只是模型少看了本来就该看的内容。
这次变化值得关注,因为它把智能体方法从调用外部工具推进到管理输入本身。模型不只回答视频问题,还要决定把有限预算花在哪个时间段、哪种信号和哪档采样精度上。对媒体检索、培训分析、质检复盘和会议归档,这种能力可能比再扩一次上下文更实用。
局限也同样明确:核心收益目前来自Google自报基准,尚缺独立、跨行业的长视频评测。企业应把“省词元”与“未漏掉关键事件”同时设为上线门槛,并保留静态全量扫描的兜底路径。真正的进步不是模型看得更少,而是它能证明为什么少看、看过哪里,以及在看错时能被发现。
