
GLM-5.3 是 Z.ai 最新推出的模型,专为复杂、长周期的编码任务而设计。通过大规模的后训练扩展,它在智能体编码方面达到了开源领域的顶尖水平,并在漏洞发现和网络防御方面展现出新兴能力。
Loading comments…
制作者
blueprint_b
访问网站
z.ai/blog/glm-5.3
项目信息
产品关键词
GLM-5.3 是 Z.ai 最新的前沿模型,专为复杂、长周期的编码和智能体任务而构建。它与前代模型 GLM-5.2 共享相同的基础模型——所有改进均来自大规模的后训练扩展,而非架构变更。其结果是,在智能体编码方面达到了开源模型的顶尖水平,同时在漏洞发现和网络防御方面展现出训练中并未明确针对的新兴能力。
GLM-5.3 的提升完全来自在 GLM-5.2 构建的栈上进行后训练扩展:IndexShare 用于高效长上下文处理,SAO 用于长周期任务的强化学习,以及 slime 用于大规模异步训练。在过去一个月中,Z.ai 扩展了环境、任务多样性和计算资源——基础模型未做任何更改。
为了超越手工构建的基准测试,Z.ai 构建了端到端合成可运行、可验证环境的流水线。研究代理从真实工作中收集任务模式,并将其转化为具有多步骤依赖和隐藏状态的长周期环境。裁判代理验证可解性,验证器在无参考解决方案的情况下合成,从而堵住奖励捷径。
通过在类生产工作流上的训练,GLM-5.3 在漏洞发现和网络防御方面展现出意想不到的优势。它在 CyberGym 上得分 84.5,在 ExploitBench 上得分 54.4——相比 GLM-5.2 在 ExploitGym 2小时/6小时任务上的 29/39 有显著提升——这表明在多样化专家工作上扩展后训练可以解锁超出原始训练目标的能力。
从 GLM-5.2 延续的 SAO 策略与压缩机制,帮助提升在扩展任务上的表现,而非在短任务上衰减。改进效果显著:Terminal-Bench 3.0 从 4.6 跃升至 28.3,DeepSWE v1.1 从 46.2 上升至 66.9。
GLM-5.3 证明,仅扩展后训练——而非架构——是智能体编码和网络能力的新前沿。
这是开源模型在智能体编码基准测试中最强的表现,网络能力的结果也着实令人惊喜。合成环境流水线也是一项重大的基础设施成就:它将瓶颈从模型能力转移到环境生成上,Z.ai 已经在推进该过程的进一步自动化。对于需要能够端到端承担实质性工作的开源模型的团队,GLM-5.3 目前是值得超越的基准。
你正在构建智能体编码工具、安全研究工作流,或需要模型真正自主承担任务的长周期自动化。如果你一直在等待一个在复杂编码和网络工作中接近闭源前沿模型的开源模型,GLM-5.3 值得认真评估。
其他您可能感兴趣的工具