
企业部署Agent后,云账单不再像传统软件那样按席位稳定增长。一个任务可能循环调用模型、检索数据、生成代码并多次重试,成本在用户看不到的后台累积。Google Cloud新推出的AI计费与成本控制,把这个问题从“月底解释为什么超支”前移到运行中:企业可以按量付费、共享开发额度、购买节省计划,并给项目设置真正会暂停调用的月度硬上限。
传统SaaS席位适合稳定使用,却难以描述Agent执行强度。同一个员工可能一天只问两次,也可能发起一个跨系统、运行数小时的流程。Google允许Gemini Enterprise在席位之外使用按量模式,避免任务撞到固定额度后半途停止;开发侧则把Antigravity和Android Studio AI等使用量纳入同一企业视图,部分能力先向选定客户开放并逐步扩大。
统一并不等于成本自然降低,它首先解决的是归属问题。企业需要知道一次客服处置、合同审查或代码迁移分别消耗多少模型Token、检索、工具调用和运行时。若仍只按项目看总账,团队无法比较“更聪明但更贵的模型”和“多次重试的便宜模型”谁的成功任务成本更低。
新的月度上限不是一封超支提醒。项目触达限制后,相关Agent API调用会暂时暂停,其他生产基础设施不受影响;管理员可以在控制台恢复,也可以允许超额用量继续运行。系统还会在预算消耗约一半、五分之四和全部用尽时发送邮件,让团队在真正停机前处理异常。
这给FDE提出了新要求:哪些任务可以暂停,哪些必须连续运行,不能由财务部门单独决定。面向客户的售后Agent、夜间批处理和内部草稿工具,需要不同策略。硬上限触发时还应有降级路径,例如切换轻量模型、减少并行分支、关闭非必要工具或转人工队列。否则“控制预算”可能直接变成业务中断。
对于用量稳定的团队,灵活节省计划按月承诺支出,一年期折扣约10%,三年期约20%,不设统一的最低或最高支出门槛。Google还提出面向可延迟任务的弹性按量模式,部分工作负载折扣最高可到50%,但这类能力仍在逐步推出,且只适合对开始时间不敏感的批处理。
真正能避免失控的不是打折,而是及时发现“哪三项SKU突然变化、是哪条Agent路径导致”。成本异常若没有会话、工具、模型和业务结果的关联,FinOps只能看到费用升高,却无法判断是流量增长、提示膨胀、无限重试还是外部接口故障。企业应把云账单标签与Agent追踪ID打通,才能从财务异常回放到具体任务。
过去的上线清单强调权限、评测和审计,Agent时代还要加上预算阈值、单位任务成本、异常告警、限流与降级。Google的新工具把这些控制做进云平台,但企业仍需定义自己的业务优先级。最实用的做法,是在试点阶段同时测试正常任务、长任务、失败重试和流量突增,观察硬上限前后的系统行为。
当成本能被分配到具体任务并与成功率联动,团队才有资格讨论ROI。否则,10%或20%的承诺折扣只是让同样的浪费更便宜。对生产Agent而言,FinOps不是采购谈判的尾声,而应成为FDE设计工作流时的第一类可靠性约束。
治理上还应避免一刀切。研发沙箱可以设置低额度硬停,客户服务可允许短时超额但自动降级,批处理则适合转入可延迟队列。预算策略与任务等级绑定后,财务控制才不会破坏可用性;反过来,业务团队也必须为每次例外续费留下责任人与到期时间。
