90次提交,slime 0.3.1补齐大模型强化学习链路

2026年08月07日 由 ATYUN编辑部 发表 620 0
工程师在GPU实验室监控大模型强化学习训练与权重同步
工程团队监控大模型强化学习训练与分布式权重同步的原创配图。

大模型强化学习真正烧钱的时刻,往往不是算法写进论文,而是训练与推理抢显存、数百张卡等待权重更新、采样分布和训练分布悄悄错位。THUDM在北京时间8月6日晚发布slime 0.3.1:相较5月底的0.3.0,版本跨越90次提交、279个文件和17名贡献者,集中处理显存、权重同步、采样对齐与长时间运行稳定性。它没有宣称新增颠覆性算法,却把后训练系统最容易拖慢规模化的环节放到同一次升级里。

看点不在新功能数量,而在四条工程主线

看点一:训练进程可在迭代间释放并重载,为采样推理和缓存腾出更多GPU显存。
看点二:磁盘增量权重同步、节点级检查点写入和外部推理引擎接入被进一步打通。
看点三:top-p掩码与FLOPs均衡微批次,分别处理采样偏差和变长样本负载不均。

slime是一套面向大语言模型强化学习扩展的后训练框架。它把Megatron负责的训练、SGLang负责的生成与路由,以及连接两者的数据缓冲区放在同一条数据流中。模型先批量生成回答或智能体轨迹,奖励器和验证器为样本打分,训练侧再读取这些数据更新参数,并把新权重同步回推理侧,周而复始。

这条链路的难点是不同阶段对GPU资源的需求并不一致。训练需要大块显存保存参数、梯度和优化器状态,采样又需要并发推理与KV缓存。如果两套进程长期共存,任何一侧的峰值都可能触发显存不足。0.3.1新增的release-train机制允许训练工作进程在迭代之间释放并重新加载,把暂时闲置的显存交给采样推理和HiCache,而不是永久为训练预留。

权重更新从集中搬运走向分离部署

强化学习每轮结束后,推理集群必须尽快拿到新权重。模型越大,复制整份检查点带来的磁盘、网络和等待成本越突出。新版本优化并行update_from_disk,加入节点级写入的原始Hugging Face检查点保存,并把分离式采样扩展到磁盘级增量权重同步和推理引擎主动拉取。外部推理引擎地址也获得完整支持,路由器甚至可以在没有GPU的节点启动。

这意味着训练和采样不必绑在同一组机器、同一种GPU或同一个软件环境。团队可以让高带宽训练节点专注反向传播,把另一组设备用于长时间智能体轨迹生成,再通过共享存储或增量同步交换权重。灵活性提升的代价是运维边界变多:共享文件系统、版本一致性、失败恢复和同步时序都必须被监控,不能把“分离”误读成部署自动变简单。

采样一致性和吞吐,被放进同一个版本修补

另一个隐蔽问题来自top-p采样。推理阶段只从累计概率达到阈值的候选词中采样,如果训练仍按完整词表计算目标,优化分布就可能和真实采样分布不一致。0.3.1加入top-p掩码,让训练端复现采样时实际生效的候选集合;同时修复多智能体轨迹中的logprob保留问题,减少“生成时是一套概率,更新时却按另一套概率学习”的风险。

性能侧,版本把PPO的logprob与熵计算融合,优化词表并行算子,并按FLOPs而非样本条数平衡微批次。对长短差异巨大的推理轨迹,两个批次即使样本数相同,计算量也可能相差数倍;按估算计算量分桶更接近真实负载。数据加载还可与SGLang初始化重叠,减少每次启动阶段的纯等待。

代码智能体训练也得到专门整理:轨迹管理被改成可插拔Harness层,可选择不同编码智能体适配器,并补充中止处理、会话清理、评分协议和沙箱通信的稳定性修复。这些改动不会直接让模型写代码更准,但会降低长回合工具调用在采集、重放和计分阶段丢失关键信息的概率。

90次提交之后,性能增幅仍要看真实集群

slime仓库当前约有7800颗星、1100个分支,并采用Apache 2.0许可证;项目也列出GLM系列训练和多种模型架构支持,说明它已超出实验脚本阶段。不过官方没有给出0.3.1在统一硬件、统一模型和统一批量下的显存下降比例、端到端吞吐或故障恢复时间。版本说明还明确表示此次重点不是重大新功能,部分收益会高度依赖集群拓扑与任务长度。

升级也存在边界。slime深度绑定Megatron训练与SGLang采样,团队若使用其他推理后端,迁移成本不会消失;内部化模型转换组件并移除Megatron Bridge支持,也可能影响既有脚本。新增外部引擎、增量权重和进程重载后,测试矩阵反而更大,生产环境需要先用小规模作业验证数值一致性、检查点可恢复性和异常中断行为。

ATYUN认为,slime 0.3.1的价值恰恰在于没有把后训练包装成一次算法魔法。强化学习规模化的竞争,越来越取决于显存能否在训练和采样之间周转、权重能否低成本跨集群更新、轨迹概率能否准确重放。真正决定这次升级分量的,将是随后公开的可复现基准和大型集群案例;在此之前,它更像一份扎实的工程清单,而不是已经兑现的性能承诺。

文章来源:AI Agent
欢迎关注ATYUN官方公众号
商务合作及内容投稿请联系邮箱:bd@atyun.com
评论 登录
热门职位
Maluuba
20000~40000/月
Cisco
25000~30000/月 深圳市
PilotAILabs
30000~60000/年 深圳市
写评论取消
回复取消