终端得分从4.6到28.3,GLM-5.3权重两周后开放

2026年08月16日 由 ATYUN编辑部 发表 608 0
服务器底座连接多组后训练测试模块,前景模型介质置于透明安全盒内
同一模型底座接受多环境后训练、权重暂时封存评估的编辑示意图。

不重新预训练基础模型,只扩大后训练,编程智能体还能前进多远?智谱Z.ai给出的新答案是GLM-5.3:它沿用GLM-5.2的基础模型,却把Terminal-Bench 3.0得分从4.6推到28.3,DeepSWE v1.1从46.2升到66.9。更值得注意的是,模型在漏洞发现和多阶段安全分析上的能力增长快于团队预期,因此当前先面向Coding Plan与ZCode用户开放,完整权重要等约两周的安全评估与加固。

快速看点:升级发生在后训练,而不是底座

同一基础模型:GLM-5.3没有重做预训练,增益来自更多环境、更复杂任务和更大的强化学习投入。
长任务明显上升:Terminal-Bench 3.0达到28.3,AutomationBench从26.2升至48.2,终端与自动化任务增幅突出。
开放节奏收紧:产品已可使用,但权重不会同步公开;团队计划完成安全评估和加固后约两周再放出。

GLM-5.2已经搭好百万上下文、长任务强化学习和异步训练框架,5.3做的是继续放大这套系统。训练环境不再只是补函数或修单个报错,而是模拟完整工程工作:模型要进入代码库、读取文档、运行实验、定位瓶颈、修改系统,并用可验证结果证明优化没有破坏正确性。部分任务被设计成相当于资深工程师数天的工作量。

环境生成与验证,成为能力增长的新杠杆

为了扩大这类训练,Z.ai用研究智能体从真实工作中提取任务模式,生成带多步依赖和隐藏状态的可运行环境,再让判断智能体确认任务确实可解。验证器看不到参考答案,还要通过正确解、空操作和未解决状态检查,尽量堵住奖励投机。训练侧继续使用slime框架,把数学、代码、沙箱和验证器接入同一数据流。

系统优化同样贡献明显。官方称,面向长程编程强化学习的联合调度、缓存和负载均衡把端到端训练吞吐提高到2.3倍以上。私有Z.ai Code Bench中,5.3在Max档以约7.5万输出token取得34.5%的任务完成结果,5.2则用约9.6万token得到23.4%。这说明升级不只追求更高分,也在压缩长循环的token消耗;但私有评测仍需外部复现。

安全能力翻升,也拉高了开放门槛

在CyberGym漏洞发现评测中,GLM-5.3从上一版77.2%升到84.5%;要求更深利用链推理的ExploitBench从24.4%升到54.4%。不过它没有全面超过闭源前沿模型:Terminal-Bench 3.0仍低于Fable 5的33.7和GPT-5.6 Sol的34.6,在更复杂利用任务上也保留明显差距。把单项领先写成“全面最强”并不准确。

团队还与中国多家安全团队合作,将模型用于真实开源代码审查。公开披露台账当前收录2436项发现,覆盖269个项目,其中严重和高危共1097项;53项已公开,2383项仍处披露保护期。台账验证了项目数量和严重性分布,却不能单独证明每项发现都由5.3独立完成,也不能替代受影响项目和安全机构的最终确认。

迁移先改思考参数,权重开放仍待观察

GLM-5.3提供low、high和max三档推理强度,默认max,编程任务也推荐使用max。与旧版不同,它不再允许关闭思考;现有应用若传入disabled,必须先改为enabled并设置推理档位,再切换模型标识,否则请求会失败。这个变化意味着生产迁移不能只替换模型名,还要检查参数、延迟、token预算与失败处理。

当前模型已覆盖GLM Coding Plan,并可在ZCode及兼容编程智能体中调用;本地部署仍要等待权重。官方给出的“两周”是计划,不是不可变的交付日期,安全评估结果、许可、模型卡和本地运行要求都需在真正开放时重新核对。

ATYUN编辑判断:GLM-5.3最有价值的信号不是又一张排行榜,而是基础模型不变时,环境规模、验证质量和强化学习系统仍能释放大幅增益。与此同时,安全能力越接近完整利用链,开放模型团队越难把“尽快发布”与“负责任披露”同时做到极致。两周后的权重、第三方复测以及更清晰的访问控制,才会决定这次后训练跃升能否转化为开发者真正可用的生产能力。

文章来源:AI Agent
欢迎关注ATYUN官方公众号
商务合作及内容投稿请联系邮箱:bd@atyun.com
评论 登录
写评论取消
回复取消