
不重新预训练基础模型,只扩大后训练,编程智能体还能前进多远?智谱Z.ai给出的新答案是GLM-5.3:它沿用GLM-5.2的基础模型,却把Terminal-Bench 3.0得分从4.6推到28.3,DeepSWE v1.1从46.2升到66.9。更值得注意的是,模型在漏洞发现和多阶段安全分析上的能力增长快于团队预期,因此当前先面向Coding Plan与ZCode用户开放,完整权重要等约两周的安全评估与加固。
GLM-5.2已经搭好百万上下文、长任务强化学习和异步训练框架,5.3做的是继续放大这套系统。训练环境不再只是补函数或修单个报错,而是模拟完整工程工作:模型要进入代码库、读取文档、运行实验、定位瓶颈、修改系统,并用可验证结果证明优化没有破坏正确性。部分任务被设计成相当于资深工程师数天的工作量。
为了扩大这类训练,Z.ai用研究智能体从真实工作中提取任务模式,生成带多步依赖和隐藏状态的可运行环境,再让判断智能体确认任务确实可解。验证器看不到参考答案,还要通过正确解、空操作和未解决状态检查,尽量堵住奖励投机。训练侧继续使用slime框架,把数学、代码、沙箱和验证器接入同一数据流。
系统优化同样贡献明显。官方称,面向长程编程强化学习的联合调度、缓存和负载均衡把端到端训练吞吐提高到2.3倍以上。私有Z.ai Code Bench中,5.3在Max档以约7.5万输出token取得34.5%的任务完成结果,5.2则用约9.6万token得到23.4%。这说明升级不只追求更高分,也在压缩长循环的token消耗;但私有评测仍需外部复现。
在CyberGym漏洞发现评测中,GLM-5.3从上一版77.2%升到84.5%;要求更深利用链推理的ExploitBench从24.4%升到54.4%。不过它没有全面超过闭源前沿模型:Terminal-Bench 3.0仍低于Fable 5的33.7和GPT-5.6 Sol的34.6,在更复杂利用任务上也保留明显差距。把单项领先写成“全面最强”并不准确。
团队还与中国多家安全团队合作,将模型用于真实开源代码审查。公开披露台账当前收录2436项发现,覆盖269个项目,其中严重和高危共1097项;53项已公开,2383项仍处披露保护期。台账验证了项目数量和严重性分布,却不能单独证明每项发现都由5.3独立完成,也不能替代受影响项目和安全机构的最终确认。
GLM-5.3提供low、high和max三档推理强度,默认max,编程任务也推荐使用max。与旧版不同,它不再允许关闭思考;现有应用若传入disabled,必须先改为enabled并设置推理档位,再切换模型标识,否则请求会失败。这个变化意味着生产迁移不能只替换模型名,还要检查参数、延迟、token预算与失败处理。
当前模型已覆盖GLM Coding Plan,并可在ZCode及兼容编程智能体中调用;本地部署仍要等待权重。官方给出的“两周”是计划,不是不可变的交付日期,安全评估结果、许可、模型卡和本地运行要求都需在真正开放时重新核对。
ATYUN编辑判断:GLM-5.3最有价值的信号不是又一张排行榜,而是基础模型不变时,环境规模、验证质量和强化学习系统仍能释放大幅增益。与此同时,安全能力越接近完整利用链,开放模型团队越难把“尽快发布”与“负责任披露”同时做到极致。两周后的权重、第三方复测以及更清晰的访问控制,才会决定这次后训练跃升能否转化为开发者真正可用的生产能力。
