得分55%仍需复核,OpenAI把合同Agent拉上操作台

2026年10月10日 由 ATYUN编辑部 发表 794 0
机械执行器在合同工作流测试台上操作键盘并接受规则核验
原创示意图:计算机操作智能体执行合同工作流,并由细粒度规则与人工复核共同验收。

让Agent在企业软件里点按钮、填表和配置审批,看起来已经不是难题;真正困难的是,它能否记住几十条业务规则,走完整条流程,并证明每个例外都被正确处理。OpenAI与合同管理平台Ironclad把这个问题做成11项研究任务。GPT-6 Astra的平均得分达到55.0%,高于GPT-5.6 Sol的41.6%,模拟用时也从37.0分钟降至19.2分钟,但这个结果更像一张能力诊断单,而不是“法务自动化已经成熟”的通行证。它也提醒采购方,模型参数再大,最终验收仍要回到业务规则、证据与责任边界。

任务:11项法务、商务和采购操作,每项按8至50条标准评分。
结果:Astra平均55.0%,Sol为41.6%;时间是模拟估算,并非客户实测。
价值:把企业工作流拆成可训练、可回放、可验收的计算机操作评测。

不是会点鼠标,而是要把业务规则跑到底

这些任务不是通用网页浏览。它们包括设置保密协议、建立采购审批流程、根据申请人选择的法域更新可复用条款等操作。经验用户完成一项任务通常需要30至40分钟,因为结果不仅要“看起来完成”,还要让金额门槛、法务例外、安全审查和最终记录在不同输入下保持一致。

研究团队为每项任务设置8至50条评分标准,把成败拆到具体字段、规则和分支。模型在Ironclad提供的托管环境中练习,研究人员再用强化学习改善行为。训练与评测任务由公开SEC EDGAR合同制作,经过个人信息过滤;双方明确没有使用OpenAI客户数据、OpenAI内部合同或Ironclad客户的非公开合同。

55.0%是进步,也是不能放手的警报

在各自最高得分设置下,Astra使用Max推理,平均rubric得分55.0%;Sol使用High推理,得分41.6%,相对提升约32%。Astra开发过程中使用的内部模型达到63.7%。同一任务的演示中,Astra满足约94%的标准,估算用时20分钟;Sol满足约85%,估算用时32分钟,说明模型差距会因任务而变化。

更醒目的48%时间下降必须谨慎理解。19.2分钟与37.0分钟来自假设处理和生成速度的模拟估算,不是对真实客户员工的前后测量,不能换算为“节省48%人力”。更重要的是,平均55%意味着大量条件仍可能遗漏。合同、采购和审批一旦错过权限、金额或法域分支,后果远比普通办公助手写错一句话严重。

企业可复用的不是分数,而是一套验收方法

这项研究最有价值的部分,是把“Agent会不会用软件”改写成可检查的交付链路:先由懂业务的人挑选高价值任务,再把隐含规则写成细粒度标准,在隔离环境中允许模型练习,最后按完成项、失败点和耗时分别评分。企业可以把同一方法用于ERP录单、客服工单、财务对账或研发流程,而不是只看一次演示是否顺利。

真正上线还要补齐身份与最小权限、敏感字段遮蔽、操作回放、审批留痕、失败恢复和回滚。测试集也只有11项合成任务,任务选择由合作双方完成,尚无独立第三方复现或具名客户的长期数据。真实环境里的脏数据、并发修改、临时授权和跨系统中断,都可能让研究分数失去代表性。

小编判断:先把人工接管点写进流程

企业若要借鉴这套方法,起点不该是让Agent独立处理合同,而是选一个可回滚、规则明确的流程,先记录人工基线,再为每个关键分支设置强制检查。涉及付款、合同生效、权限变更和非标准条款的步骤,应保留人工批准;Agent可以准备材料、执行低风险操作并解释证据,但不能把“页面已提交”当成“业务已正确完成”。

下一阶段真正值得追踪的指标,是任务一次完成率、人工介入率、错误发现时间、回滚成功率、每次任务成本以及上线后的规则漂移。OpenAI与Ironclad证明了专业软件可以成为可训练的操作环境,也同时给出一个清醒结论:模型已经能做更长的工作,但在合同这类高后果流程里,55%的平均得分仍然是在提醒企业把验证做厚,而不是把人拿走。

文章来源:AI Agent
欢迎关注ATYUN官方公众号
商务合作及内容投稿请联系邮箱:bd@atyun.com
评论 登录
热门职位
Maluuba
20000~40000/月
Cisco
25000~30000/月 深圳市
PilotAILabs
30000~60000/年 深圳市
写评论取消
回复取消