GLM-5.3是一款由智谱AI于2026年8月推出的编程与网络安全特化开源大模型,总参数7430亿(MoE架构),主要用于代码生成与审计、漏洞发现及Agent推理,支持后训练Scaling能力跃升和两周后完整权重开源,适用于企业安全团队、软件研发团队和个人开发者的代码工程与安全审查场景。相比上代GLM-5.2编程能力提升约50%,CyberGym 84.5%持平GPT-5.6 Sol;与Kimi K3相比,漏洞发现和代码安全审计优势明显。
| 基础信息 | 内容 |
|---|---|
| 开发公司 | 北京智谱华章科技股份有限公司(智谱AI) |
| 发布时间 | 2026年8月14日 |
| 参数规模 | 总参数7430亿,MoE架构 |
| 核心能力 | 编程、网络安全(代码审计与漏洞发现)、Agent推理 |
| 开源计划 | 发布两周后开放模型权重 |
| 使用渠道 | ZCode、AutoClaw、扣子、WorkBuddy/CodeBuddy等 |
| 产品定位 | 编程与网络安全特化的开源旗舰大模型 |
| 适用人群 | 企业安全团队、软件研发团队、个人开发者 |

GLM-5.3核心能力与性能
以下评测数据均来自智谱AI官方GLM-5.3技术报告及红队合作团队的实测结果。
编程能力
编程能力是GLM-5.3相对上代最大的增量。Terminal-Bench 3.0(终端命令行任务执行基准)取28.3分,是开源模型最佳成绩,超过同期发布的Kimi K3的17.4分。DeepSWE v1.1(真实软件工程任务基准)从GLM-5.2的46.2提升至66.9。
智谱内部体感测评显示编程能力较GLM-5.2提升50%,编程体感接近Claude Fable 5,在国产开源模型中排名第一。
网络安全能力
白帽代码安全审计是GLM-5.3的差异化卖点。CyberGym(代码审计与漏洞发现基准)得84.5%,持平甚至略超Mythos 5的83.8%和GPT-5.6 Sol的83.6%。ExploitBench(漏洞利用推理基准)得54.4%,是GLM-5.2(24.4%)的两倍多。ExploitGym(6小时漏洞挖掘吞吐测试)完成130项,相比GLM-5.2的39项提升3.3倍。
深度漏洞利用方面,开源与闭源旗舰仍有差距:ExploitBench低于Mythos 5的78.0%,ExploitGym吞吐量也落后于Mythos 5的247项。
Token效率
GLM-5.3在High档位下以约5万tokens的单任务输出,达到Claude Opus 4.8约12万tokens才能实现的准确率水平。更短的执行路径意味着更低的API调用成本。
Agent长程任务
GDPval-AA v2(覆盖44种职业的真实任务基准)得1769分。模型支持跨文件理解、项目级修改和问题定位等复杂工程任务,从”辅助写代码”走向”参与大语言模型驱动的软件工程全过程”。
红队实战验证
发布前两周,智谱联合清华大学、南开大学、奇安信、腾讯玄武等团队开展红队测试,累计发现2404个潜在漏洞,覆盖269个项目。最引人注目的发现是一个潜伏40余年的DNS协议级零日(0-day)漏洞——攻击者仅需少量特殊请求即可将服务器压力放大近8万倍,潜在影响超过1000万处公网DNS服务。
GLM-5.3与Kimi K3对比
| 对比维度 | GLM-5.3 | Kimi K3 |
|---|---|---|
| 开发方 | 智谱(Z.ai) | 月之暗面(Moonshot AI) |
| 模型定位 | 编程+网络安全特化 | 通用编程+Agent均衡 |
| 开源性 | 两周后开源完整权重 | 开源 |
| Terminal Bench 3.0 | 28.3 | 17.4 |
| DeepSWE | 66.9 | 67.5 |
| Agents’ Last Exam | 28.5 | 27.6 |
| CyberGym | 84.5% | 80.0% |
| ExploitBench | 54.4% | 32.2% |
| ExploitGym 6小时任务数 | 130 | 70 |
GLM-5.3和Kimi K3都是2026年8月发布的国产开源大模型,但定位差异明显。GLM-5.3在网络安全能力上全面领先——CyberGym 84.5% vs 80.0%,ExploitBench 54.4% vs 32.2%,ExploitGym六小时任务数130 vs 70。编程方面两者互有胜负。一个月内,月之暗面、DeepSeek、智谱三家头部国产厂商先后完成关键版本迭代,编程能力集体向国际前沿靠拢。如果需求是代码安全审计和漏洞发现,选GLM-5.3;如果是通用编程和Agent任务,两者差距不大。
应用场景与适用人群
GLM-5.3的能力分布决定了它并非”全面升级”,以下三类场景收益最高:
- 企业安全团队:代码安全审计、渗透测试辅助、漏洞复现与验证。GLM-5.3在CyberGym、ExploitBench上的漏洞推理能力可直接转化为安全生产力,红队发现的2404个漏洞也验证了实战可用性。
- 软件研发团队:跨文件代码修改、项目级问题定位等Agent长程任务。GDPval-AA v2的高分说明它适合承担多步骤工程工作,而不只是补全单段代码。
- 个人开发者与安全研究者:编程辅助、白帽技能学习、开源模型研究与二次开发。两周后权重开放,本地化部署和微调需求可以等到那时再动手。
适合谁用:安全工程师、渗透测试人员、全栈开发者、AI Agent开发者值得第一时间切换。如果主要用大模型做写作、问答、翻译等通用任务,GLM-5.2甚至更轻量的免费版本已经够用,不必跟风升级。
如何使用GLM-5.3
- 官方工具:通过ZCode或AutoClaw直接体验。8月14日13:00起GLM Coding Plan全员额度已重置。
- 第三方平台:已在扣子、WorkBuddy/CodeBuddy、Qoder/QwenWork等平台开放体验,开发者可在熟悉的开发环境中调用。
- API与本地部署:API发布后上线,完整权重计划两周后开源。安全能力仅通过受信访问计划向验证用户开放。AI Agent工作流中。
开源策略与已知局限
GLM-5.3采用分层开源策略,在开放与安全之间做平衡:
- 两周后开放权重:发布后需完成安全评估与模型加固,两周后开放完整模型权重
- 分层受信访问:最敏感的攻击能力仅向验证用户开放,防御能力对开源社区开放——分层的考虑是攻击能力滥用风险高,需要先建立使用方身份审核机制
- 漏洞负责任披露:红队发现的2404个漏洞已提交CNNVD、CNVD等国家漏洞库,覆盖269个项目
GLM-5.3也存在已知局限:
- 基座未更新:与GLM-5.2共享基座(同GLM-5.1系列基座),能力提升全部来自后训练,基座智能上界是否接近极限尚不确定
- 深度安全仍落后闭源:ExploitBench 54.4% vs Mythos 5的78.0%,ExploitGym 130项 vs Mythos 5的247项
- Terminal-Bench绝对分偏低:28.3虽是开源最佳,但与GPT-5.6 Sol的34.6仍有差距
常见问题
GLM-5.3和GLM-5.2有什么区别?
基座模型相同,提升全部来自后训练Scaling。编程能力提升50%,CyberGym从77.2%提升至84.5%,ExploitBench从24.4%翻倍至54.4%,ExploitGym吞吐量提升3-4倍。
GLM-5.3和Kimi K3怎么选?
网络安全需求选GLM-5.3(CyberGym 84.5% vs 80.0%,ExploitBench 54.4% vs 32.2%),通用编程和Agent任务两者差距不大(DeepSWE 66.9 vs 67.5)。
GLM-5.3的网络安全能力能直接用吗?
最敏感的攻击能力仅通过受信访问计划向验证用户开放,需要身份审核和安全评估。普通用户可使用编程和代码安全审查功能,防御能力对开源社区开放。
GLM-5.3什么时候开源,怎么用?
模型权重计划发布两周后开放。发布后可通过ZCode、AutoClaw、扣子、WorkBuddy/CodeBuddy等平台使用,API服务发布后上线。
GLM-5.3本地部署需要多少算力?
按7430亿参数MoE估算,FP8精度全量部署约需800GB显存(8卡H20/H800级别服务器),INT4量化后约400GB。以上为工程估算值,实际要求以开源时的官方部署文档为准。个人开发者建议优先使用API或第三方平台。
浙公网安备33010202004812号