不用重写Agent,微软3500行框架把真实Harness接进RL

2026年10月10日 由 ATYUN编辑部 发表 915 0
完整Agent harness模块通过标准接口接入训练控制平面和GPU底座
原创示意图:部署时使用的Agent harness通过标准接口直接接入强化学习控制平面。

训练一个真实Agent,最麻烦的往往不是奖励函数,而是先把它重写一遍。企业已经在生产中使用的Agent包含上下文压缩、工具协议、子任务、执行环境和失败恢复,传统强化学习框架却常要求把这些循环搬进训练系统。微软研究院10月7日公开Agent Lightning v1.0完整技术方案,试图把这道重写成本拿掉:部署时运行的那个harness,直接成为训练时的harness。

代码规模:完整控制平面约3500行,由API Gateway、Rollout Controller和定制训练器组成。
接入方式:既有Agent通常只需把模型端点指向兼容OpenAI接口的代理,不必改写工具和控制流。
实验结果:约6000个样本把Qwen3.5-9B在SWE-bench Verified的Pass@1从41.8%提升至56.4%。

训练对象终于和上线对象是同一个Agent

传统Agent强化学习通常由训练框架掌握环境交互循环:模型给出动作,环境返回观察,再把整段轨迹拼成连续token序列。但mini-SWE-agent、OpenHands等真实harness会自行管理上下文、工具和依赖,重建一份训练版不仅昂贵,还可能改变Agent的实际行为。最终优化的,未必是上线后真正执行任务的系统。

Agent Lightning把兼容OpenAI接口的LLM代理放在harness和模型之间,记录每次请求对应的prompt、response与log probability。API Gateway保存rollout、模型和事件;Rollout Controller负责本地进程或Kubernetes Job;建立在verl之上的训练器收集样本并完成更新。对于已有Agent,连接模型端点通常就是主要改动,原有工具协议和执行逻辑继续保留。

3500行控制平面解决的是连接,不是把复杂性变没

真实harness让一次rollout拆成数量和长度都不固定的多次模型调用。文本重新分词可能改变边界,子Agent与上下文摘要会切开轨迹;按样本计算优势或平均损失,又会让“调用次数更多”的rollout获得不合理权重。GPU后端还要把任务完成后才知道的样本量,塞进预先固定的数据并行与张量并行配置。

微软为此把优势计算和损失归一化放回rollout层级,并增加样本适配器处理重分词与合并。约3500行说明控制面刻意保持轻量,不代表Agent训练只有3500行即可投产。企业仍要维护奖励、数据清洗、环境镜像、权限、测试集和失败恢复;轻量的价值,是让团队更容易读懂和改造关键连接层。

约2倍加速来自调度,6000样本结果不能外推

同步强化学习会等一批里最慢的Agent,GPU因此空转;完全异步方法提高利用率,却往往为rollout和训练准备两组GPU。Agent Lightning的Collocated Async RL让两者共享同一组GPU:样本足够时暂停接收新请求,等待在途调用结束后更新模型,再恢复rollout。官方实验中,它相对同步RL实现约2倍端到端加速,同时比传统完全异步方案占用更少GPU。

代码任务实验使用SWE-smith、mini-SWE-agent和Qwen3.5-9B,约6000个训练样本把SWE-bench Verified Pass@1从41.8%提高到56.4%,绝对增加14.6个百分点。这个结果来自单一模型、单一任务管线和官方环境;公开材料没有给出可直接换算企业TCO的完整硬件、并发、网络与故障成本,也没有具名生产客户。

小编判断:先复用Harness,再把数据与集群责任补齐

对企业Agent团队,最值得复用的不是某个基准分数,而是“训练与部署共用harness”的边界设计。它能减少双套Agent漂移,让评测失败更接近真实生产行为,也便于把强化学习接到已有工具和审批流程。Rollout Controller支持自管集群、云Kubernetes与本地基础设施,也让敏感任务不必强制进入付费商业沙箱。

但自管不等于免运维。代理会记录提示词、响应和训练所需概率数据,企业必须定义敏感信息脱敏、数据留存、访问审计和训练集授权;Kubernetes还要处理镜像漏洞、执行权限、资源配额、任务清理与异常重启。真正的上线门槛,是训练数据和执行环境能否被同一套治理规则覆盖。

Agent Lightning没有证明所有Agent都能用6000个样本得到14.6个百分点提升,却提供了一条更现实的工程路径:不要为了训练复制一个“像生产”的Agent,而是让生产harness本身进入可观测、可调度、可审计的训练回路。对已经拥有复杂Agent栈的团队,这比再造一个演示框架更有价值。

文章来源:AI Agent
欢迎关注ATYUN官方公众号
商务合作及内容投稿请联系邮箱:bd@atyun.com
评论 登录
热门职位
Maluuba
20000~40000/月
Cisco
25000~30000/月 深圳市
PilotAILabs
30000~60000/年 深圳市
写评论取消
回复取消