发布日期:2026年8月14日
数据来源:智谱AI公开信息整理
关键词:GLM-5.3、智谱AI、开源大模型、AI Agent、代码智能体
2026年8月14日,智谱AI正式推出GLM-5系列最新版本——GLM-5.3。
与此前大模型升级通常依赖参数规模增长不同,GLM-5.3采用了一条更加明确的技术路线:保持基础模型架构不变,通过扩大后训练规模提升模型实际任务能力。
根据官方披露,GLM-5.3仍采用约7430亿参数MoE架构,模型能力提升主要来自训练环境扩展、任务复杂度增加以及强化训练周期延长。
在编程Agent相关测试中,GLM-5.3相比GLM-5.2取得明显进步。其中在Z.ai Code Bench高难度任务测试中,模型完成率达到31.4%,超过Claude Opus 4.8的29.5%,同时消耗Token数量明显降低。
此外,GLM-5.3还首次公布网络安全方向评测数据,在CyberGym测试中取得84.5%的成绩,并披露了模型辅助发现真实开源项目漏洞的实践结果。
一、GLM-5.3升级重点:模型结构不变,强化后训练能力
从技术路线来看,GLM-5.3并没有重新设计基础模型规模,而是继续优化后训练阶段。
智谱AI表示:
“基座模型保持稳定,通过后训练Scaling提升模型智能上限。”
简单理解,就是模型基础能力框架没有变化,但通过增加更多真实任务训练,让模型积累更强的问题解决能力。
此次优化主要集中在三个方向:
1. 长周期任务训练规模扩大
过去的大模型训练更多关注单轮问答或短流程任务。
而AI Agent应用需要模型持续完成:
- 项目分析;
- 多文件修改;
- 长流程代码调试;
- 系统设计任务。
GLM-5.3增加了更加复杂、更接近真实开发环境的任务训练,使模型在连续任务执行方面获得提升。
2. 训练环境更加丰富
GLM-5.3训练任务覆盖范围进一步扩大。
除了传统代码生成外,还加入:
- 软件工程任务;
- 安全分析;
- 系统级问题处理;
- 复杂工程场景。
这意味着模型目标从“生成代码”逐渐转向“完成开发任务”。
3. 后训练时间增加
大模型能力提升并不完全依赖参数增加。
近年来,行业逐渐关注后训练阶段的重要性。
通过更多高质量任务反馈,让模型学习如何:
- 分析问题;
- 制定计划;
- 验证结果;
- 修正错误。
GLM-5.3的升级路线正体现了这一趋势。
二、编程能力测试:高难度任务超过Claude Opus 4.8
对于开发者而言,模型是否适合实际使用,代码能力是重要指标。
GLM-5.3主要参考Z.ai Code Bench测试。
测试结果如下:
| 模型 | 高难度任务完成率 | Token消耗 |
|---|---|---|
| GLM-5.3 | 31.4% | 约5万Token |
| Claude Opus 4.8 | 29.5% | 约12万Token |
在高难度任务中,GLM-5.3完成率略高于Claude Opus 4.8,同时减少了大量Token消耗。
对于开发者而言,这意味着:
相同复杂度任务下,模型可能通过更少上下文调用完成目标。
这对于API调用成本、响应速度以及Agent运行效率都有实际影响。
三、第三方测试表现:Agent能力明显提升
除了官方测试外,GLM-5.3在多个公开评测中也取得提升。
部分测试结果:
| 测试项目 | GLM-5.2 | GLM-5.3 | 提升 |
|---|---|---|---|
| DeepSWE v1.1 | 46.2 | 66.9 | +20.7 |
| Terminal-Bench 3.0 | 4.6 | 28.3 | +23.7 |
| Agents’ Last Exam | 23.8 | 28.5 | +4.7 |
其中:
- DeepSWE v1.1主要关注软件工程任务;
- Terminal-Bench测试模型使用终端工具完成任务能力。
GLM-5.3在Terminal-Bench 3.0中达到28.3分,目前在公开开源模型中处于领先位置。
相比简单代码补全,Agent时代更加关注模型是否能够独立完成完整任务流程。
四、网络安全能力增强:CyberGym测试排名靠前
除了编程能力,GLM-5.3此次重点展示了安全领域表现。
官方公布数据显示:
| 模型 | CyberGym成绩 |
|---|---|
| GLM-5.3 | 84.5% |
| Mythos 5 | 83.8% |
| GPT-5.6 Sol | 83.6% |
在CyberGym测试中,GLM-5.3取得较高成绩。
同时,智谱AI披露:
模型联合安全团队,在269个真实开源项目中发现2436个漏洞,其中包含1097个中高危漏洞。
这说明大模型应用方向正在从内容生成逐渐扩展到:
- 软件安全检测;
- 自动化测试;
- 工程维护。
五、Token效率成为模型竞争的新指标
过去比较大模型能力,通常关注:
- 参数数量;
- benchmark分数;
- 上下文长度。
但随着企业大量使用API,Token效率也成为重要因素。
例如:
同一个代码任务:
GLM-5.3:
约5万Token完成。
Claude Opus 4.8:
约12万Token完成。
如果应用场景涉及大量Agent调用,Token消耗差异会直接影响整体使用成本。
因此,模型选择已经不只是比较单次能力,也需要考虑长期运行效率。
六、GLM-5.3开源计划与API接入
根据智谱AI公布信息:
- GLM-5.3 API将陆续开放;
- 模型权重计划在发布后两周内开源;
- 开源协议预计延续宽松模式。
开源路线对于企业和开发者来说具有一定吸引力。
相比只能通过API调用的模型,开源模型可以提供:
- 私有化部署可能;
- 自定义微调空间;
- 更灵活的数据管理方式。
不过,企业实际使用时,也需要考虑:
- 部署成本;
- 算力要求;
- 运维能力。
七、GLM-5.3与DeepSeek V4 Pro如何选择?
近期国产大模型市场竞争进一步加剧。
DeepSeek V4 Pro与GLM-5.3几乎同期更新,两者定位存在一定差异。
简单来看:
GLM-5.3:
- 更强调开源生态;
- 编程Agent能力提升明显;
- 适合关注模型可控性的团队。
DeepSeek V4 Pro:
- API生态成熟;
- 推理能力受到开发者关注;
- 适合快速接入应用。
实际选择需要结合业务需求:
如果需要模型私有部署,可以关注开源路线。
如果更关注快速调用和应用开发,则API方式可能更加方便。
八、通过API聚合平台接入GLM-5.3也是一种方案
对于很多开发团队来说,并不是所有场景都需要自行维护多个模型接口。
目前市场上也存在API聚合类型服务,例如4SAPI这类模型接口管理平台,可以帮助开发者通过统一入口调用不同大模型。
这类方式主要解决:
- 多模型接口维护复杂;
- 不同平台账号管理困难;
- 项目切换模型成本较高。
尤其是在DeepSeek近期价格调整、模型调用成本受到关注的情况下,一些开发者会考虑通过统一API入口寻找更灵活的调用方式。
通过API聚合平台,可以根据项目需求选择不同模型,在模型能力、调用成本和开发便利性之间进行平衡。
九、开发者使用GLM-5.3需要关注什么?
虽然GLM-5.3在多个测试中表现提升明显,但实际应用仍需要结合业务场景。
建议关注几个方面:
1. 模型稳定性
测试成绩代表能力上限,生产环境还需要关注:
- 响应速度;
- 调用稳定性;
- 长任务连续性。
2. Agent权限管理
如果用于代码开发,需要合理控制:
- 文件访问范围;
- 自动执行权限;
- 项目数据安全。
3. 根据任务选择模型
不同模型存在优势方向。
例如:
- 普通代码补全;
- 架构设计;
- 安全分析;
- 长流程Agent任务。
选择适合的模型比单纯追求参数规模更重要。
总结
GLM-5.3的发布代表国产大模型竞争进入新的阶段。
此次升级没有依赖更大参数规模,而是通过后训练Scaling提升模型实际任务能力。
从公开数据来看,GLM-5.3在代码Agent、终端任务以及安全测试方向都有明显提升,高难度编程任务表现超过Claude Opus 4.8,同时保持开源路线。
随着GLM-5.3开源计划推进,以及API服务逐步完善,开发者未来可以根据需求选择:
- 本地部署;
- 官方API调用;
- 第三方API聚合接入。
对于希望快速构建AI应用的团队而言,模型能力、调用成本和工程便利性将成为选择大模型时的重要考量因素。
本文信息整理截至2026年8月14日,具体模型接口、价格及开源细节请以智谱AI官方平台后续公告为准。




