返回博客

GLM-5.3正式发布:基座架构保持不变,后训练强化让开源编程能力再提升

人工智能8629
GLM-5.3正式发布:基座架构保持不变,后训练强化让开源编程能力再提升

发布日期:2026年8月14日
数据来源:智谱AI公开信息整理
关键词:GLM-5.3、智谱AI、开源大模型、AI Agent、代码智能体

2026年8月14日,智谱AI正式推出GLM-5系列最新版本——GLM-5.3。

与此前大模型升级通常依赖参数规模增长不同,GLM-5.3采用了一条更加明确的技术路线:保持基础模型架构不变,通过扩大后训练规模提升模型实际任务能力。

根据官方披露,GLM-5.3仍采用约7430亿参数MoE架构,模型能力提升主要来自训练环境扩展、任务复杂度增加以及强化训练周期延长。

在编程Agent相关测试中,GLM-5.3相比GLM-5.2取得明显进步。其中在Z.ai Code Bench高难度任务测试中,模型完成率达到31.4%,超过Claude Opus 4.8的29.5%,同时消耗Token数量明显降低。

此外,GLM-5.3还首次公布网络安全方向评测数据,在CyberGym测试中取得84.5%的成绩,并披露了模型辅助发现真实开源项目漏洞的实践结果。


一、GLM-5.3升级重点:模型结构不变,强化后训练能力

从技术路线来看,GLM-5.3并没有重新设计基础模型规模,而是继续优化后训练阶段。

智谱AI表示:

“基座模型保持稳定,通过后训练Scaling提升模型智能上限。”

简单理解,就是模型基础能力框架没有变化,但通过增加更多真实任务训练,让模型积累更强的问题解决能力。

此次优化主要集中在三个方向:

1. 长周期任务训练规模扩大

过去的大模型训练更多关注单轮问答或短流程任务。

而AI Agent应用需要模型持续完成:

GLM-5.3增加了更加复杂、更接近真实开发环境的任务训练,使模型在连续任务执行方面获得提升。


2. 训练环境更加丰富

GLM-5.3训练任务覆盖范围进一步扩大。

除了传统代码生成外,还加入:

这意味着模型目标从“生成代码”逐渐转向“完成开发任务”。


3. 后训练时间增加

大模型能力提升并不完全依赖参数增加。

近年来,行业逐渐关注后训练阶段的重要性。

通过更多高质量任务反馈,让模型学习如何:

GLM-5.3的升级路线正体现了这一趋势。


二、编程能力测试:高难度任务超过Claude Opus 4.8

对于开发者而言,模型是否适合实际使用,代码能力是重要指标。

GLM-5.3主要参考Z.ai Code Bench测试。

测试结果如下:

模型高难度任务完成率Token消耗
GLM-5.331.4%约5万Token
Claude Opus 4.829.5%约12万Token

在高难度任务中,GLM-5.3完成率略高于Claude Opus 4.8,同时减少了大量Token消耗。

对于开发者而言,这意味着:

相同复杂度任务下,模型可能通过更少上下文调用完成目标。

这对于API调用成本、响应速度以及Agent运行效率都有实际影响。


三、第三方测试表现:Agent能力明显提升

除了官方测试外,GLM-5.3在多个公开评测中也取得提升。

部分测试结果:

测试项目GLM-5.2GLM-5.3提升
DeepSWE v1.146.266.9+20.7
Terminal-Bench 3.04.628.3+23.7
Agents’ Last Exam23.828.5+4.7

其中:

GLM-5.3在Terminal-Bench 3.0中达到28.3分,目前在公开开源模型中处于领先位置。

相比简单代码补全,Agent时代更加关注模型是否能够独立完成完整任务流程。


四、网络安全能力增强:CyberGym测试排名靠前

除了编程能力,GLM-5.3此次重点展示了安全领域表现。

官方公布数据显示:

模型CyberGym成绩
GLM-5.384.5%
Mythos 583.8%
GPT-5.6 Sol83.6%

在CyberGym测试中,GLM-5.3取得较高成绩。

同时,智谱AI披露:

模型联合安全团队,在269个真实开源项目中发现2436个漏洞,其中包含1097个中高危漏洞。

这说明大模型应用方向正在从内容生成逐渐扩展到:


五、Token效率成为模型竞争的新指标

过去比较大模型能力,通常关注:

但随着企业大量使用API,Token效率也成为重要因素。

例如:

同一个代码任务:

GLM-5.3:

约5万Token完成。

Claude Opus 4.8:

约12万Token完成。

如果应用场景涉及大量Agent调用,Token消耗差异会直接影响整体使用成本。

因此,模型选择已经不只是比较单次能力,也需要考虑长期运行效率。


六、GLM-5.3开源计划与API接入

根据智谱AI公布信息:

开源路线对于企业和开发者来说具有一定吸引力。

相比只能通过API调用的模型,开源模型可以提供:

不过,企业实际使用时,也需要考虑:


七、GLM-5.3与DeepSeek V4 Pro如何选择?

近期国产大模型市场竞争进一步加剧。

DeepSeek V4 Pro与GLM-5.3几乎同期更新,两者定位存在一定差异。

简单来看:

GLM-5.3:

DeepSeek V4 Pro:

实际选择需要结合业务需求:

如果需要模型私有部署,可以关注开源路线。

如果更关注快速调用和应用开发,则API方式可能更加方便。


八、通过API聚合平台接入GLM-5.3也是一种方案

对于很多开发团队来说,并不是所有场景都需要自行维护多个模型接口。

目前市场上也存在API聚合类型服务,例如4SAPI这类模型接口管理平台,可以帮助开发者通过统一入口调用不同大模型。

这类方式主要解决:

尤其是在DeepSeek近期价格调整、模型调用成本受到关注的情况下,一些开发者会考虑通过统一API入口寻找更灵活的调用方式。

通过API聚合平台,可以根据项目需求选择不同模型,在模型能力、调用成本和开发便利性之间进行平衡。


九、开发者使用GLM-5.3需要关注什么?

虽然GLM-5.3在多个测试中表现提升明显,但实际应用仍需要结合业务场景。

建议关注几个方面:

1. 模型稳定性

测试成绩代表能力上限,生产环境还需要关注:


2. Agent权限管理

如果用于代码开发,需要合理控制:


3. 根据任务选择模型

不同模型存在优势方向。

例如:

选择适合的模型比单纯追求参数规模更重要。


总结

GLM-5.3的发布代表国产大模型竞争进入新的阶段。

此次升级没有依赖更大参数规模,而是通过后训练Scaling提升模型实际任务能力。

从公开数据来看,GLM-5.3在代码Agent、终端任务以及安全测试方向都有明显提升,高难度编程任务表现超过Claude Opus 4.8,同时保持开源路线。

随着GLM-5.3开源计划推进,以及API服务逐步完善,开发者未来可以根据需求选择:

对于希望快速构建AI应用的团队而言,模型能力、调用成本和工程便利性将成为选择大模型时的重要考量因素。

本文信息整理截至2026年8月14日,具体模型接口、价格及开源细节请以智谱AI官方平台后续公告为准。

标签:GLM-5.3智谱AI开源大模型AI编程Agent

推荐阅读

探索更多前沿洞察与行业干货。