输入价先减半,Gemini 3.7 Flash把编码得分推至43.6%

2026年08月15日 由 ATYUN编辑部 发表 1004 0
四块光学棱柱分别呈现代码、网页、文档和任务流程纹理
Gemini 3.7 Flash面向多类工作流的编辑示意图。

在Gemini 3.6 Flash发布仅三周后,Google又推出Gemini 3.7 Flash。新版本没有只追求更大的参数或更长的上下文,而是把升级重点放在编码、工具调用、文档处理和企业自动化上。官方披露的FrontierCode 1.1 Main得分从34.4%升至43.6%,年底前输入价格则降到3.6 Flash初始价格的一半。性能上调与临时降价同时出现,意味着Flash系列正被进一步推向高频生产任务,也让三周一次的快速版本迭代成为新的部署变量。对开发者来说,版本锁定与回归测试也因此变得更重要。

五组结果同时抬升,编码不再是唯一看点

看点一:FrontierCode 1.1 Main由34.4%升至43.6%,DeepSWE v1.1由49.0%升至65.3%。
看点二:复杂PDF理解与企业自动化得分分别从22.0%升至34.0%、从17.0%升至30.4%。
看点三:年底前输入和输出价格为每百万token 0.75美元、3.75美元,但该价格并非长期固定。

在网页开发评测WebDev Arena上,3.7 Flash的Elo分数为1588,高于3.6 Flash的1538。Google还强调模型在遇到阻碍时更愿意澄清意图,并在多步计划和工具调用中投入更多推理。对开发团队而言,这类变化的价值不只体现在一次生成的代码长度,而在于减少返工、错误恢复和人工接管。

不过,这些数字来自不同评测体系:有的测首轮代码正确率,有的测长时软件工程,有的依赖人工偏好或特定自动化环境。它们能说明升级方向,却不能直接换算成所有代码仓库都会提高同样比例。实际效果仍会受提示方式、工具权限、测试覆盖和项目语言影响。

半价只到年底,真正成本还取决于输出与重试

Gemini 3.7 Flash在2026年12月31日前采用推广价格:每百万输入token 0.75美元、输出token 3.75美元。自2027年1月1日起,两项价格将分别调整为1.50美元和7.50美元。团队不能只按眼前单价测算年度预算,更应同时记录单任务输入、输出、工具调用次数和失败重试率。

如果模型更认真地规划,却生成更多中间输出,名义单价下降未必等比例转化为账单下降;反过来,若更高的一次通过率减少多轮修正,即使单次推理更长,总成本仍可能更低。最稳妥的做法,是用自有任务集同时比较完成率、端到端时间和每个成功任务成本,而不是只看每百万token报价。

从API到Spark,Google在拉通开发与个人入口

开发者已经可以在Gemini API、Google AI Studio、Android Studio和Antigravity中使用3.7 Flash,企业入口覆盖Gemini Enterprise Agent Platform和Gemini Enterprise。Google还把它接入Gemini Spark,面向160多个国家的Google AI Pro与Ultra订阅者,用于整理文件、起草邮件和更新状态文档。

这组入口说明3.7 Flash不是实验室里的单点升级,而是要承担Google生态中的通用工作模型角色。相应地,权限隔离、工具白名单、敏感数据边界和操作日志比单次聊天分数更重要。模型具备更强工具使用能力,并不等于企业可以放宽执行审批。

编辑判断:Flash竞争已从速度转向成功任务成本

ATYUN认为,Gemini 3.7 Flash最关键的信号不是某一项榜单上涨,而是Google在快速迭代中同时压低入口价格、增强工具调用并扩大产品覆盖。Flash不再只是“更快但更弱”的备选,而是在争夺可持续运行的智能体和软件工程任务。

目前仍需等待独立复测、长上下文稳定性和真实代码仓库的数据。企业若准备迁移,应锁定模型版本和价格周期,用同一组任务对比3.6与3.7的成功率、人工接管次数和最终账单。只有当更高得分转化为更少返工,所谓“半价升级”才真正成立。

文章来源:AI Agent
欢迎关注ATYUN官方公众号
商务合作及内容投稿请联系邮箱:bd@atyun.com
评论 登录
热门职位
Maluuba
20000~40000/月
Cisco
25000~30000/月 深圳市
PilotAILabs
30000~60000/年 深圳市
写评论取消
回复取消