从30%到100%,NVIDIA把Harness做成第二个模型

2026年08月23日 由 ATYUN编辑部 发表 1160 0
机械测试系统在多个陌生谜题环境中反复行动并保存历史状态
长程Agent依靠持续试错、外部记忆与监督重定向,把单次模型能力转化为跨任务进展。原创示意图。

同一个Claude Opus 5,直接参加ARC-AGI-3公开交互测试时得分约30.2%;被放进NVIDIA的Agentic Variation Operators系统后,却完成25个环境、全部183个关卡,RHAE达到100.00。差距并不来自换了更大的模型,而来自模型之外的Harness:持久记忆、工具执行、反馈解释,以及在路线停滞时介入的监督器。

看点一:AVO在ARC-AGI-3公开集完成全部183关,环境动作比VISTA少12%。
看点二:同一架构连续运行7天探索500多个GPU内核方向,提交40个版本,部分配置比FlashAttention-4快10.5%。
看点三:成绩来自公开环境与指定硬件配置,完整ARC适配尚缺独立复现,不能把100%理解成通用智能已解决。

模型会推理,系统负责让它不半途而废

ARC-AGI-3不是静态选择题。Agent进入没有说明书的游戏式环境,要通过动作猜规则、发现目标、记住结果,并在有限操作内逐级完成任务。一次回答很聪明并不够:上下文会耗尽,错误假设会累积,连续失败还会把模型困在同一条路上。模型分数因此只测到原材料,系统分数才测到它能否持续工作。

AVO把主Agent留在执行循环中:观察环境、形成假设、调用工具、读取反馈、修正策略。外部记忆保存此前尝试、测试结果和有效结论,避免每次换上下文都重新学习;监督器则观察更长的轨迹,识别重复无效循环,并在进展停滞时引导主Agent尝试另一条路线。它不是替模型解题,而是管理模型的时间、状态和失败。

从游戏到GPU内核,迁移的是工作循环

NVIDIA先在GPU内核优化上验证这套方法。AVO连续运行7天,探索超过500个优化方向,形成40个提交版本。在DGX B200上的指定配置中,生成的多头注意力内核最高比cuDNN快3.5%、比FlashAttention-4快10.5%;随后又用约30分钟把结果适配到分组查询注意力。

游戏与内核看起来毫不相关,底层循环却相同:都要从不完整证据提出假设,通过外部接口行动,观察后果,保存有效状态,纠正错误,并在长时间里继续推进。AVO真正证明的不是它掌握了两个领域,而是“记忆+执行+监督”可以成为跨领域的长程工作骨架。

企业落地要复制机制,不要复制满分叙事

对FDE来说,最可复用的设计是把长任务分成三层状态:当前步骤需要的短上下文、跨步骤保存的结构化工作记忆,以及独立于主Agent的监督指标。代码迁移、数据修复、运营调查和批量测试都可以这样组织。监督器不必是更强模型,也可以是超时、重复率、测试通过率和成本上限组成的规则。

验收也不应只看最终成功率。还要记录完成一次任务用了多少环境动作、多少模型token、多少次回退、监督器介入几次,以及失败后能否从检查点恢复。一个成功率略低但成本可控、轨迹可审计的系统,往往比偶尔满分却无法解释的Agent更适合生产。

编辑判断:Harness正在变成可独立优化的能力层

100.00必须加上边界:这是25个公开环境,不是隐藏赛道;参与者可以反复观察公开任务,NVIDIA也没有在文章中交付一套可直接独立复现的完整ARC配置。内核性能同样是特定DGX B200和特定工作负载下的最高增益,不能外推到所有模型与序列长度。

但30%到100%的差距仍然给出清晰信号:企业购买模型能力后,真正决定产出的,是如何保存状态、设计反馈、安排监督与约束资源。生产团队还需要给监督器本身设置审计和预算,避免“纠偏”变成无限重试,或者让第二个模型悄悄扩大权限。ATYUN认为,下一阶段Agent竞争会越来越像系统工程,而不是模型榜单。这种系统能力还需要用单位任务成本和人工接管率衡量,不能只看最终是否通关。模型决定单步智力,Harness决定这份智力能否连续工作七天,并把失败变成下一次行动的资产。

文章来源:AI Agent
欢迎关注ATYUN官方公众号
商务合作及内容投稿请联系邮箱:bd@atyun.com
评论 登录
写评论取消
回复取消