少17%输出token,Gemini 3.6 Flash提升智能体效率

2026年07月23日 由 ATYUN编辑部 发表 393 0
开发者在真实工作站中调试多步骤AI智能体工作流
开发者在多屏工作站中检查代码与任务流程(原创配图)

Google把新一轮Gemini升级的重点放在一个更现实的问题上:智能体完成任务时,能否少输出、少绕路、少调用工具。7月21日发布的Gemini 3.6 Flash在官方对比中比3.5 Flash少用17%的输出token,输出价格也从每百万9美元降至7.5美元;与此同时,3.5 Flash-Lite把速度推到每秒350个输出token。对需要持续运行代理工作流的团队,这些变化直接影响账单、延迟和系统稳定性。

三点看懂:这次升级改变了什么

第一,3.6 Flash不是单纯追求更高分,而是减少推理步骤、对话轮次和工具调用。对于长链路智能体,少一次无效循环就可能同时降低成本和失败概率。

第二,Google用两档模型覆盖不同负载。3.6 Flash侧重编码、多模态与复杂任务,3.5 Flash-Lite则面向高并发提取、分类、搜索和子智能体执行。

第三,两款通用模型已经正式可用于生产环境,开发者可通过Gemini API接入;专门用于漏洞发现与修复的3.5 Flash Cyber则只会在CodeMender中向政府与受信伙伴开放受限试点。

少输出与少循环,为何比单次速度更重要

传统聊天场景通常只计算一次请求的输入和输出,智能体却会拆分任务、调用搜索或代码执行、读取结果,再继续下一轮判断。一个看似不大的冗余,会在几十次工具循环中被放大。Google称,3.6 Flash在Artificial Analysis Index上比3.5 Flash减少17%的输出token;在DeepSWE等部分任务中,降幅最高可达65%。这些数字不能直接套用到所有业务,但它们指出了模型竞争的新指标:完成同一件事需要多少推理和交互。

价格变化进一步强化了这种方向。3.6 Flash输入仍为每百万token 1.5美元,输出降至7.5美元;3.5 Flash-Lite输入为0.3美元,输出为2.5美元。两款模型都支持约100万token输入上下文和最多65536个输出token,并提供函数调用、代码执行、文件搜索、结构化输出与计算机使用等工具。对于企业来说,模型价格只是成本的一部分,工具执行时间、失败重试、上下文膨胀和人工复核同样会进入总账。

基准提升集中在编码、研究与计算机操作

Google公布的对比显示,3.6 Flash在DeepSWE上从3.5 Flash的37%提高到49%,MLE Bench从49.7%升至63.9%,OSWorld-Verified从78.4%升至83.0%。这些结果分别对应软件工程、机器学习研究和计算机操作能力,说明改进目标与智能体常见工作流一致。不过它们仍是特定评测条件下的结果,不能等同于任何代码仓库、桌面环境或企业流程都会获得同样幅度。

Flash-Lite的定位更偏吞吐量。官方引用的第三方测量为每秒350个输出token,并称其在Terminal-Bench 2.1、长上下文和真实任务执行评测中明显领先旧一代。它还允许团队用不同思考等级在速度与复杂任务能力之间取舍:批量解析、路由和分类可以使用较低等级,多步骤子智能体则应提高思考等级,避免过早结束工具链。

开发者迁移时也需要改代码。新模型弃用temperature、top_p和top_k等采样参数,未来继续传入可能触发错误;API也不再接受以预填模型回复结尾的对话。团队若依赖这些方式控制语气或输出格式,需要改用系统指令与结构化输出,并重新测试函数调用、思考等级和多轮状态管理。

真正考验在生产账单,而不是发布表格

这次发布对开发者最直接的意义,是快速模型正在从“便宜的通用问答”变成可以承担主代理工作的生产组件。3.6 Flash已经成为Google部分托管智能体的默认模型,3.5 Flash-Lite则适合放在批处理、文档抽取和大量子任务层。合理组合两者,可能比让单一大模型处理所有步骤更容易控制延迟与预算。

局限同样明确。官方基准与客户案例不能替代独立复测;计算机使用仍标注为预览,真实界面的弹窗、权限和长时间漂移可能拉低成功率。Google还提到,3.6 Flash在功能代码方面进步,但人类评估者对部分视觉布局和样式更偏好旧模型。Cyber版本的受限开放也说明,高能力工具并不会因为模型发布就立即面向所有开发者。

ATYUN编辑判断:Gemini 3.6 Flash最值得关注的不是又多了几个高分,而是Google开始把“少走弯路”量化为模型卖点。智能体进入生产后,单位任务成本、工具循环数量和可恢复性会比单轮回答更重要。接下来应观察真实项目的任务完成成本是否同步下降,以及开发团队为新API规则付出的迁移成本,是否会抵消模型端节省的token。

文章来源:AI Agent
欢迎关注ATYUN官方公众号
商务合作及内容投稿请联系邮箱:bd@atyun.com
评论 登录
热门职位
Maluuba
20000~40000/月
Cisco
25000~30000/月 深圳市
PilotAILabs
30000~60000/年 深圳市
写评论取消
回复取消