
让Agent在企业软件里点按钮、填表和配置审批,看起来已经不是难题;真正困难的是,它能否记住几十条业务规则,走完整条流程,并证明每个例外都被正确处理。OpenAI与合同管理平台Ironclad把这个问题做成11项研究任务。GPT-6 Astra的平均得分达到55.0%,高于GPT-5.6 Sol的41.6%,模拟用时也从37.0分钟降至19.2分钟,但这个结果更像一张能力诊断单,而不是“法务自动化已经成熟”的通行证。它也提醒采购方,模型参数再大,最终验收仍要回到业务规则、证据与责任边界。
这些任务不是通用网页浏览。它们包括设置保密协议、建立采购审批流程、根据申请人选择的法域更新可复用条款等操作。经验用户完成一项任务通常需要30至40分钟,因为结果不仅要“看起来完成”,还要让金额门槛、法务例外、安全审查和最终记录在不同输入下保持一致。
研究团队为每项任务设置8至50条评分标准,把成败拆到具体字段、规则和分支。模型在Ironclad提供的托管环境中练习,研究人员再用强化学习改善行为。训练与评测任务由公开SEC EDGAR合同制作,经过个人信息过滤;双方明确没有使用OpenAI客户数据、OpenAI内部合同或Ironclad客户的非公开合同。
在各自最高得分设置下,Astra使用Max推理,平均rubric得分55.0%;Sol使用High推理,得分41.6%,相对提升约32%。Astra开发过程中使用的内部模型达到63.7%。同一任务的演示中,Astra满足约94%的标准,估算用时20分钟;Sol满足约85%,估算用时32分钟,说明模型差距会因任务而变化。
更醒目的48%时间下降必须谨慎理解。19.2分钟与37.0分钟来自假设处理和生成速度的模拟估算,不是对真实客户员工的前后测量,不能换算为“节省48%人力”。更重要的是,平均55%意味着大量条件仍可能遗漏。合同、采购和审批一旦错过权限、金额或法域分支,后果远比普通办公助手写错一句话严重。
这项研究最有价值的部分,是把“Agent会不会用软件”改写成可检查的交付链路:先由懂业务的人挑选高价值任务,再把隐含规则写成细粒度标准,在隔离环境中允许模型练习,最后按完成项、失败点和耗时分别评分。企业可以把同一方法用于ERP录单、客服工单、财务对账或研发流程,而不是只看一次演示是否顺利。
真正上线还要补齐身份与最小权限、敏感字段遮蔽、操作回放、审批留痕、失败恢复和回滚。测试集也只有11项合成任务,任务选择由合作双方完成,尚无独立第三方复现或具名客户的长期数据。真实环境里的脏数据、并发修改、临时授权和跨系统中断,都可能让研究分数失去代表性。
企业若要借鉴这套方法,起点不该是让Agent独立处理合同,而是选一个可回滚、规则明确的流程,先记录人工基线,再为每个关键分支设置强制检查。涉及付款、合同生效、权限变更和非标准条款的步骤,应保留人工批准;Agent可以准备材料、执行低风险操作并解释证据,但不能把“页面已提交”当成“业务已正确完成”。
下一阶段真正值得追踪的指标,是任务一次完成率、人工介入率、错误发现时间、回滚成功率、每次任务成本以及上线后的规则漂移。OpenAI与Ironclad证明了专业软件可以成为可训练的操作环境,也同时给出一个清醒结论:模型已经能做更长的工作,但在合同这类高后果流程里,55%的平均得分仍然是在提醒企业把验证做厚,而不是把人拿走。
