把Codex执行层变成API,OpenAI让Agent连续跑几天

2026年09月12日 由 ATYUN编辑部 发表 220 0
模块化工程台把隔离执行、工具、文件和审批连接成Agent任务链
原创示意图:托管Harness负责长任务的上下文与编排,执行环境和业务工具可按需替换。

很多团队能在一周内做出Agent演示,却要花几个月补会话恢复、上下文压缩、工具选择、沙箱、凭据和并发编排。9月10日,OpenAI将Codex背后的执行层拆成Agents API并开放Public Beta。开发者给出任务、模型、工具和环境,一次调用就能创建长时间运行的会话;平台负责维护Harness,任务可跨多个上下文窗口持续数小时甚至数天。

开放范围:当前面向所有开发者,但仍是公开测试,不是正式商用GA。
环境选择:可用OpenAI托管沙箱、自有基础设施或合作伙伴沙箱。
计费:Agents API不另收平台费,按实际模型token与工具用量付费。

一层Harness,把长任务最难维护的状态接走

Agents API保存会话中的上下文、文件、工具结果和中间产物。当会话接近窗口上限时,系统自动压缩较早内容,保留继续执行所需的信息,让工作流跨越多个上下文窗口。开发团队不必自己设计摘要触发、记忆选择和恢复协议,也不用在模型升级时同步重写整套执行循环。

这层能力来自开源Codex Harness,开发者可以检查负责模型调用、工具和上下文协调的公开代码,但线上运维由OpenAI承担。平台还会随模型版本更新Harness。好处是新模型能力更快进入业务;代价是行为变化、版本节奏和故障域也更多依赖供应商,因此生产团队仍要保留自己的任务级评测和回滚策略。

工具不必全塞进提示词,多Agent也不必自己造调度器

工具搜索会按需加载相关定义,减少一次性塞入全部工具说明造成的token消耗,并尽量维持缓存。程序化工具调用允许Agent在代码中并行调用、串联和过滤结果,只把相关部分带回上下文。平台支持MCP、自定义函数和网页搜索,也能挂载Skills目录、Vault凭据与文件。

复杂任务可拆给多个子Agent并行执行,每个子Agent保持独立上下文,由主Agent汇总。官方示例把并发子Agent上限设为3,这不是平台统一上限,而是提醒开发者把并行度作为成本和可靠性参数。更多子任务可能缩短墙上时间,也会放大token、外部API、审批和失败重试的总量。

Harness与沙箱分开,部署边界更清楚

OpenAI负责Agent逻辑,但执行环境可选托管沙箱、自有基础设施或Blaxel、Cloudflare、E2B、Modal、Oracle、Vercel等合作伙伴。企业因此可以按数据驻留、VPC、秘密存储、CPU/GPU配置、冷启动和价格选择环境,而不必把所有代码和文件交给同一运行时。OpenAI托管沙箱则复用Codex与ChatGPT的隔离基础设施,可装载文件、软件包、Skills和插件。

具名客户材料显示了这层分离的价值:Hypha称把Harness与沙箱拆开后,失败响应减少86%;Nash称数千个长时Agent正在管理数亿次配送。两组数字都来自客户自述,业务基线、样本和长期SLA并未完全公开,不能直接当作所有团队的预期收益。

小编判断:托管执行层会降低入场成本,也会抬高验证要求

Agents API真正拿走的是模型之外的重复工程:长会话、工具发现、并发委派和环境接入。它让团队更快进入业务逻辑,但Public Beta意味着接口、性能和支持承诺仍可能变化;“生产就绪”也不能替代应用自己的权限、审批、审计、幂等和灾难恢复。

还要把“平台不额外收费”与“任务便宜”区分开。自动压缩、工具搜索和并行调用可能节省上下文,也可能因为任务跑得更久、分支更多而扩大总账单。开发者需要在每个会话里归集模型、工具、沙箱和失败重试成本,不能只看API价目表。

最稳妥的采用方式,是先把单任务成功率、人工介入率、恢复时间、每次成功成本和外部系统副作用设成上线门槛,再比较自建Harness与托管API。若团队只是少写了编排代码,却没有获得可观测、可回滚和可解释的执行链,省下的工程量最终会以运营风险返还。

文章来源:AI Agent
欢迎关注ATYUN官方公众号
商务合作及内容投稿请联系邮箱:bd@atyun.com
评论 登录
热门职位
Maluuba
20000~40000/月
Cisco
25000~30000/月 深圳市
PilotAILabs
30000~60000/年 深圳市
写评论取消
回复取消