
很多团队能在一周内做出Agent演示,却要花几个月补会话恢复、上下文压缩、工具选择、沙箱、凭据和并发编排。9月10日,OpenAI将Codex背后的执行层拆成Agents API并开放Public Beta。开发者给出任务、模型、工具和环境,一次调用就能创建长时间运行的会话;平台负责维护Harness,任务可跨多个上下文窗口持续数小时甚至数天。
Agents API保存会话中的上下文、文件、工具结果和中间产物。当会话接近窗口上限时,系统自动压缩较早内容,保留继续执行所需的信息,让工作流跨越多个上下文窗口。开发团队不必自己设计摘要触发、记忆选择和恢复协议,也不用在模型升级时同步重写整套执行循环。
这层能力来自开源Codex Harness,开发者可以检查负责模型调用、工具和上下文协调的公开代码,但线上运维由OpenAI承担。平台还会随模型版本更新Harness。好处是新模型能力更快进入业务;代价是行为变化、版本节奏和故障域也更多依赖供应商,因此生产团队仍要保留自己的任务级评测和回滚策略。
工具搜索会按需加载相关定义,减少一次性塞入全部工具说明造成的token消耗,并尽量维持缓存。程序化工具调用允许Agent在代码中并行调用、串联和过滤结果,只把相关部分带回上下文。平台支持MCP、自定义函数和网页搜索,也能挂载Skills目录、Vault凭据与文件。
复杂任务可拆给多个子Agent并行执行,每个子Agent保持独立上下文,由主Agent汇总。官方示例把并发子Agent上限设为3,这不是平台统一上限,而是提醒开发者把并行度作为成本和可靠性参数。更多子任务可能缩短墙上时间,也会放大token、外部API、审批和失败重试的总量。
OpenAI负责Agent逻辑,但执行环境可选托管沙箱、自有基础设施或Blaxel、Cloudflare、E2B、Modal、Oracle、Vercel等合作伙伴。企业因此可以按数据驻留、VPC、秘密存储、CPU/GPU配置、冷启动和价格选择环境,而不必把所有代码和文件交给同一运行时。OpenAI托管沙箱则复用Codex与ChatGPT的隔离基础设施,可装载文件、软件包、Skills和插件。
具名客户材料显示了这层分离的价值:Hypha称把Harness与沙箱拆开后,失败响应减少86%;Nash称数千个长时Agent正在管理数亿次配送。两组数字都来自客户自述,业务基线、样本和长期SLA并未完全公开,不能直接当作所有团队的预期收益。
Agents API真正拿走的是模型之外的重复工程:长会话、工具发现、并发委派和环境接入。它让团队更快进入业务逻辑,但Public Beta意味着接口、性能和支持承诺仍可能变化;“生产就绪”也不能替代应用自己的权限、审批、审计、幂等和灾难恢复。
还要把“平台不额外收费”与“任务便宜”区分开。自动压缩、工具搜索和并行调用可能节省上下文,也可能因为任务跑得更久、分支更多而扩大总账单。开发者需要在每个会话里归集模型、工具、沙箱和失败重试成本,不能只看API价目表。
最稳妥的采用方式,是先把单任务成功率、人工介入率、恢复时间、每次成功成本和外部系统副作用设成上线门槛,再比较自建Harness与托管API。若团队只是少写了编排代码,却没有获得可观测、可回滚和可解释的执行链,省下的工程量最终会以运营风险返还。
