
企业部署Agent,贵的不只是模型token。每一次工具调用都要重放上下文,长任务还要处理会话恢复、沙箱、审批、失败重试和权限边界。TrueFoundry在8月18日开源TrueForge,把这些能力做成可自托管的Agent Harness。其14项企业任务基准显示:同样使用Claude Opus 4.8,TrueForge平均每次任务成本8.5美元,Claude Managed Agents为11.8美元,少约30%。这个结果尚不足以代表所有生产负载,却把企业AI成本竞争从模型价格推进到了执行层。
单次模型调用只会给出下一步建议,真正的Agent要不断规划、调用工具、读取结果并继续判断。TrueForge的核心服务负责这条循环,同时保存会话状态、流式返回每一步、压缩过长上下文,并在敏感动作前暂停等待批准。应用既能使用现成聊天界面,也能通过HTTP API和TypeScript SDK把同一运行时嵌入客服、运维、销售或内部开发平台。
它没有把模型、工具和执行环境绑定在一起。团队可接入OpenAI、Anthropic、Gemini或兼容接口,也可配置自己的MCP服务。代码和文件操作需要隔离时,沙箱才作为工具临时创建,而不是让每段对话持续占用一个执行环境。上下文层还会延迟加载暂时用不到的工具说明,把大型工具结果转存为文件,并用子Agent拆开独立任务,目标是减少每轮重复发送的token。
基准采用Enterprise-Bench的14项跨系统任务,Agent需要在CRM、项目管理和文档系统之间调用相同的三组MCP工具。每项任务使用全新会话,由不知道模型和Harness身份的模型裁判按完整标准评分,不给部分分。成本按实际token与公开价计算,并计入缓存;延迟则记录整次任务的墙钟时间。
固定Opus 4.8后,TrueForge约完成11项,平均消耗380万token、8.5美元和40分钟;Claude Managed Agents同为约11项,但消耗1000万token、11.8美元和63分钟;LangGraph的deepagents约完成10项,消耗1650万token、21美元和64分钟。换成GLM-5.2后,TrueForge仍约完成11项,成本降至2.9美元,比Claude组合低约75%。前一个对比主要反映Harness效率,后一个同时叠加了模型价格差,不能把75%全部归因于运行时。
这些数字也有清晰边界:样本只有14项,裁判仍是LLM,任务集中在B2B信息检索与多工具协作,且结果由供应商组织测试。仓库公开了基准目录和运行方法,方便复现,但不同工具延迟、提示、模型版本、缓存命中和云价格都可能改变结果。企业评估时更应比较每个正确任务的成本、人工接管次数和失败恢复时间,而不是只看平均token。
TrueForge可用一条命令在本地启动,默认使用SQLite,适合个人验证;项目明确警告这种模式没有登录保护,只能留在本机。共享部署则需要Postgres、Redis和多副本服务,可通过Docker Compose或Helm运行,并配置OIDC。对FDE而言,这条路径的价值是让原型与生产继续使用同一Harness,但数据迁移、密钥管理、备份、容量和升级仍需要平台团队负责。
开源也不自动等于受治理。工具权限、身份、预算、隐私遮蔽、审计和故障切换,要由企业现有控制层或TrueFoundry的商业AI Gateway补齐。公司披露NetApp曾参与测试需求,并将相关能力用于事件响应和工单分流,Automattic也是早期使用方;但目前没有公开任务完成率、人工介入率或节省工时,因此这些具名线索只能证明有人试用,不能当作规模化ROI。
TrueForge最值得关注的不是“比某家便宜”这个宣传结论,而是把Agent运行时拆成可以审查、替换和自托管的工程层。模型路由、工具连接、上下文压缩、沙箱和人工审批不再必须从同一家供应商整包购买,FDE也能把一次客户交付沉淀为可复用模板,而不是为每个项目重写执行循环。
真正的考验随后才开始:开放Harness会把省下的token账单,换成多少部署、监控、安全和升级工作?如果企业能用真实任务复现成本优势,并把权限、审计和恢复流程纳入同一交付标准,它会成为多模型架构的有力底座;如果缺少这些能力,开源只是把托管平台的隐性成本重新交回内部团队。
