Codex开放Agent Harness:打工人的真正压力来了

2026年08月21日 由 ATYUN编辑部 发表 1042 0
企业应用、Codex Agent Harness与业务系统组成的可控工作流结构
Agent进入企业工作流后,界面、业务规则和审批仍由应用掌握,执行循环由Harness承接。概念示意图。

过去两年,打工人面对AI的典型姿势,是打开聊天框,让它写邮件、整理材料或生成一段代码。OpenAI在8月19日公布Codex平台化路线后,真正值得警惕的变化出现了:企业不必再把员工赶进一个通用AI工具,而可以把Codex背后的Agent Harness直接嵌进客服台、运营看板、安全调查和内部业务系统。AI不再只是给建议,而是开始在岗位原有界面里接任务、查记录、调用工具、等待审批并把结果写回。

看点一:开放的是智能体执行循环与集成层,并非Codex模型本身。
看点二:AI从独立聊天窗口进入现有业务界面,员工甚至不必从提示词开始。
看点三:最先承压的不是某个完整职业,而是可结构化、可验证、可写回系统的任务。

开放的不是模型,而是让模型持续干活的执行层

把大模型接进应用并不难,难的是让它可靠地做完一项长任务。一个生产级Agent需要理解目标、保持上下文、读取业务资料、选择工具、展示进度、处理失败、在关键动作前请求批准,并在多轮交互后继续工作。模型负责推理,Harness则像一套运行制度,把这些步骤组织成可观察、可约束的执行循环。

Codex Harness正是OpenAI在Codex App、命令行和IDE扩展背后使用的这一层。它负责会话状态、流式事件、工具调用、沙箱与审批策略,也能通过app-server协议让外部应用创建任务线程、开始或中断执行、接收事件并处理批准请求。企业可以选择用codex exec运行脚本或CI任务,用SDK启动和恢复程序化工作流,或者用app-server把Agent直接变成产品的一部分。

这次开放的重要性,在于企业不必从零发明智能体运行时。OpenAI披露,在ARC-AGI-3测试中,仅通过保留推理状态与压缩上下文,GPT-5.6 Sol得分就由13.3%升至38.3%,同时输出token减少到原来的六分之一。这是特定基准结果,不能等同于企业任务成功率,却足以说明:同一个模型放进不同Harness,最终可用性可能完全不同。

真正的变化,是员工不再需要主动“去用AI”

聊天助手的推广一直受制于一个隐形门槛:员工要知道什么时候打开AI、怎样组织提示词、该给哪些资料,还要把答案复制回业务系统。Agent Harness平台化之后,触发点可以变成工单状态、异常告警、待审核记录或一个业务按钮。上下文由应用自动提供,工具与权限提前配置,结果直接回到系统记录,AI使用因此从个人技巧变成流程设计。

OpenAI展示的Relay样例很有代表性。物流人员选中异常货运记录并点击比较恢复方案,应用提供订单上下文,Agent调用MCP工具读取最新数据,给出选项;涉及改订货运时必须由人批准,写入后业务看板随之刷新。Relay使用的是虚构数据,不能证明真实物流收益,但它展示了企业Agent的关键形态:用户面对的仍是熟悉的业务软件,AI在背后完成调查、比较和执行。

这也解释了为什么官方配图同时出现Support、Engineering、Operations和Security。客服工程师可以让Agent调取账户历史、产品日志与内部文档后生成回复;安全分析师可以从告警队列开始调查,在创建修复工单前保留审批;产品团队甚至可以把卡片移动到“就绪”作为实现任务的起点。AI不再争夺一个新的入口,而是潜入岗位原有入口。

打工人的压力,不是岗位瞬间消失,而是任务被重新定价

最容易被Harness吸收的工作通常有四个特征:入口明确,所需信息能从系统读取,动作可以通过工具执行,结果能够被检查。工单分流、日志排查、账户研究、材料初审、测试修复、异常处理和报告更新都符合这一逻辑。它们未必占满一个岗位,却常常占掉员工大量时间,也是企业最容易计算成本和回报的部分。

当这些任务被嵌入式Agent接走,组织未必立即裁撤整个职位,更可能先提高产能基准:同样人数要处理更多客户、更多告警和更多项目;初级员工过去依靠重复任务积累经验的路径会变窄;中层协调者如果主要价值是跨系统搬运信息,也会被迫转向判断、授权和异常处理。所谓“真正压力”,不是AI今天拿走工牌,而是企业明天重新定义一个人应该完成多少工作。

已有案例给出早期信号。OpenAI列举的税务工作流试点处理了7000份申报表,并在吸收执业人员反馈后将准备时间缩短约三分之一。这个数字来自特定试点,不能直接外推到所有税务岗位,但它表明一旦Agent拥有业务上下文、工具和人工反馈,效率改进的单位就会从“生成一段文字”升级为“完成一段流程”。

对企业和FDE而言,门槛降低了,交付责任反而更重

开放Harness会压低企业搭建Agent底座的成本,却不会自动解决企业AI实施。真实项目仍需回答:什么任务值得自动化,数据能否被可信读取,工具权限如何最小化,哪些动作必须审批,失败后怎样回滚,效果用什么指标衡量。开放代码只是提供发动机,业务规则、系统连接、评测和组织采用仍要由企业自己完成。

这使FDE的角色更加关键。过去FDE可能花大量时间拼接会话状态、工具调用和运行框架;现在可以把精力前移到流程发现,把员工的隐性经验转成上下文、权限和验收标准,再把一次性交付沉淀为可复用模板。真正稀缺的能力不再只是会调用模型,而是能判断哪一步交给Agent、哪一步必须留给人,并让整个链路可审计、可中断、可恢复。

企业也要防止“能执行”被误读为“可以放权”。自动化动作越接近系统记录、客户账户和生产环境,错误代价越高。上线前至少应建立最小权限、分级审批、全程日志、结果抽检、成本上限和回滚机制;同时跟踪任务完成率、人工介入率、错误写入、处理时延与单次任务成本。没有这些护栏,Harness只会让错误执行得更快。

编辑判断:这是一场工作流竞争,不是一次开源庆典

仍需看清边界:开放的是Harness和集成接口,模型访问与托管服务依然独立;Relay是演示应用,现实企业的数据质量、权限体系和例外情况远复杂得多。大量工作还包含模糊责任、线下沟通和无法结构化的判断,短期内不会因为一个开源项目自动消失。

但OpenAI释放的方向已经十分明确:AI竞争正在从谁拥有更强聊天框,转向谁能嵌入更多真实工作流。对企业,这是把模型能力变成生产力的新基础设施;对软件厂商,这是在原有产品里重做任务入口和审批链路的机会;对打工人,则意味着最稳妥的防线不是拒绝AI,而是掌握业务规则、例外判断与结果责任。未来更难被替代的,不一定是最会亲手执行每一步的人,而是最清楚哪些步骤可以交给Agent、怎样验证它做对了、出错时如何把流程拉回来的人。

文章来源:AI Agent
欢迎关注ATYUN官方公众号
商务合作及内容投稿请联系邮箱:bd@atyun.com
评论 登录
热门职位
Maluuba
20000~40000/月
Cisco
25000~30000/月 深圳市
PilotAILabs
30000~60000/年 深圳市
写评论取消
回复取消