
企业Agent真正烧钱的,往往不是偶尔一次的复杂推理,而是每天反复发生的摘要、分类、查询、压缩和子任务。10月7日,Anthropic发布Claude Haiku 5.5,把10万token以内请求的输入与输出价格分别降到每百万0.10和0.50美元,相比Haiku 4.5标价降低90%。它不是要取代更大的Sonnet与Opus,而是争夺那些需要跑得多、回得快、范围又足够清楚的工作。
Haiku 5.5采用分档计价。提示不超过10万token时,缓存读取和写入分别为每百万0.01和0.125美元;超过阈值后,输入、输出、缓存读取与写入价格都变成低档的五倍。与Haiku 4.5相比,低档价格下降90%,高档下降50%。因此,“便宜九成”只适用于较短请求,不能直接套到长文档、多轮记忆或大型代码库。
Anthropic称旧版Haiku约90%的请求落在低档区间,并估算新版平均运行成本约下降75%。后一个数字还考虑了新tokenizer和每项任务实际消耗的token数量。企业做预算时应以完整任务为单位,统计提示、输出、缓存、重试和工具调用,而不是只比较价目表上的单token价格。
这是首个支持可调effort的Haiku级模型,开发者可以在成本、延迟与能力之间选择。它适合摘要、上下文压缩、数据库查询、分类、实时客服、浏览器操作,也适合在更大模型负责总体规划时,承担读取财报、查找字段或整理证据等窄任务。把不同难度的步骤交给不同模型,往往比所有步骤都调用旗舰模型更省钱。
边界同样明确。Anthropic仍建议复杂的Agent编码使用Sonnet 5.5或Opus 5.5。官方称Haiku 5.5是标准速度下最快的Claude,但没有公布统一tokens/s;Opus的Fast Mode也更快。企业不能把“最快”理解为每个任务的端到端耗时最低,网络、工具、检索和失败重试都可能成为主要延迟。
AlphaSense披露,其Ask in Document生产流量约每周800万次调用。在400条查询测试中,Haiku 5.5相对4.5的得分从0.76提升到0.84。Asana在缺陷分流、建项目和组合风险检索等评测中,报告任务完成延迟降低超过30%,单次Agent回合推理最高快2.5倍。
HubSpot在模拟CRM门户任务的三轮测试中得到92.8%的平均分;Box报告相对4.5高11分、延迟约减半。这些案例有具名团队和明确任务,比抽象基准更接近企业使用,但仍由厂商发布页汇集,评分量表、样本分布、对照模型和人工复核并未完整公开,不能外推成所有业务的平均收益。
Haiku 5.5最现实的机会,不是把所有Agent统一降配,而是让高频、可验证的步骤获得更便宜的执行层。分类、字段抽取、短摘要和子Agent检索如果能稳定完成,就可以把昂贵模型留给规划、综合判断和高风险决策。企业的收益来自任务拆分与模型路由,而不是一次简单替换。
实施时应先按任务建立质量门槛,再逐步下放流量。至少跟踪一次完成率、误报漏报、重试次数、人工接管率、P95延迟和每个成功任务的总成本;10万token阈值也要作为路由条件,避免上下文膨胀突然把价格推入高档。缓存降价有利于重复上下文,但缓存命中率低时,账单不会按宣传幅度下降。
对安全敏感行业还要注意,Haiku 5.5比4.5增加了更严格的网络安全防护,部分渗透测试会被标准策略阻止。便宜、快速和可跨云部署降低了试点门槛,却没有替企业完成权限、评测与审计。只有当模型在自己的数据、工具和审批链上稳定过线,90%的标价降幅才可能变成可兑现的单位任务成本。
