少用88%词元,Gemini开始自己挑视频片段

2026年09月02日 由 ATYUN编辑部 发表 933 0
光学剪辑台让长胶片在多个检查门之间跳转并放大关键帧
智能体式视频理解不再均匀读取整段视频,而是围绕问题主动寻找和复看片段。示意图。

视频理解过去常用一条简单路线:按固定帧率把整段内容塞进上下文。视频越长,模型读到的重复画面越多;帧率降得太狠,又可能漏掉瞬间动作。9月1日,Google为Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite加入智能体式视频理解,让模型先判断问题需要什么,再决定去看哪一段、用多快的帧率,以及调用画面、音频还是转写。

这让视频检索更接近真实编辑流程:人不会为找一句话逐帧看完两小时录像,而会先靠目录、语音和画面线索缩小范围,再放慢关键片段。模型现在也能执行类似的分层查看,但每一步是否可靠,仍取决于转写质量、镜头变化和问题表述。对于跨镜头人物追踪、稀疏异常定位和操作步骤计数,团队还应分别准备难例,确认模型没有因快速跳转而丢失上下文,也没有把相似片段误当成同一事件。

效率:官方称标准基准上最高减少88%词元、降低66%分析成本。
质量:长视频任务准确率最高提升约7%,并支持亚秒级时刻检索。
上线:三款Flash模型已在Gemini API、AI Studio和企业智能体平台开放。

从固定抽帧改成目标驱动

静态模式默认每秒提取一帧,再把画面与音频一次性送进模型。新模式则先接受一个轻量视频引用,在推理过程中调用内部处理工具,按需要加载某段转写、声音或更高帧率画面。若问题是“讲座里哪一处改变了结论”,模型可以先扫转写定位候选时间,再回看画面;若任务是数快速动作,它可以把相关窗口重新以更高帧率读取。

这不是给模型增加一个更大的上下文窗口,而是改变取数策略。开发者过去要自己切片、检索、重采样并拼接结果,现在这套循环由模型在任务中完成。返回结果还会包含处理调用和处理结果步骤,团队可检查它是否真的进入了主动导航,而不是把“智能体”当成不可见标签。

长视频最先吃到成本红利

Google给出的最高数字是:词元用量减少88%、分析成本降低66%、准确率提升7%。收益主要来自10分钟到90分钟的课程、操作指南和多小时录制,因为这类内容只有少量片段与问题真正相关。官方开发文档也确认,三款支持模型可在时间线中动态选择转写、帧率和分辨率,并建议长视频或寻找特定时刻时优先尝试新模式。

但“最高”不能理解为每个任务都能省这么多。视频内容越均匀、问题越要求逐帧核对,模型越难跳过大段信息。导航本身还会产生思考词元和工具调用词元,短于5分钟的片段可能因为内部往返增加首字延迟。要求全片逐帧精度的质检、医学影像或安全审查,也不能只靠选择性查看。

接入只需一项配置,验收却不能省

开发者在视频输入中把处理模式设为agentic即可启用,仍按标准Gemini API词元价格计费,不另收功能费。当前支持文件上传和YouTube链接;同一次请求还可以让长视频使用主动模式、短视频保留静态模式。Google表示该能力将很快进入Gemini应用,随后用于YouTube页面里的问答功能。

生产接入的关键不是开关,而是验收集。团队应拿自己的长视频建立问题、关键时间段和可接受答案,分别记录静态与主动模式的准确率、词元、首字延迟和总耗时。还要检查模型是否反复查看错误区间、是否在无转写场景下降,以及跨轮对话是否保留处理步骤。否则成本下降可能只是模型少看了本来就该看的内容。

编辑判断:多模态开始自己管理预算

这次变化值得关注,因为它把智能体方法从调用外部工具推进到管理输入本身。模型不只回答视频问题,还要决定把有限预算花在哪个时间段、哪种信号和哪档采样精度上。对媒体检索、培训分析、质检复盘和会议归档,这种能力可能比再扩一次上下文更实用。

局限也同样明确:核心收益目前来自Google自报基准,尚缺独立、跨行业的长视频评测。企业应把“省词元”与“未漏掉关键事件”同时设为上线门槛,并保留静态全量扫描的兜底路径。真正的进步不是模型看得更少,而是它能证明为什么少看、看过哪里,以及在看错时能被发现。

文章来源:AI Agent
欢迎关注ATYUN官方公众号
商务合作及内容投稿请联系邮箱:bd@atyun.com
评论 登录
热门职位
Maluuba
20000~40000/月
Cisco
25000~30000/月 深圳市
PilotAILabs
30000~60000/年 深圳市
写评论取消
回复取消