GLM-5.3 – 智谱推出的编程与网络安全能力开源大模型

AI模型3天前更新 智小研
99 0

GLM-5.3是一款由智谱AI于2026年8月推出的编程与网络安全特化开源大模型,总参数7430亿(MoE架构),主要用于代码生成与审计、漏洞发现及Agent推理,支持后训练Scaling能力跃升和两周后完整权重开源,适用于企业安全团队、软件研发团队和个人开发者的代码工程与安全审查场景。相比上代GLM-5.2编程能力提升约50%,CyberGym 84.5%持平GPT-5.6 Sol;与Kimi K3相比,漏洞发现和代码安全审计优势明显。

基础信息内容
开发公司北京智谱华章科技股份有限公司(智谱AI)
发布时间2026年8月14日
参数规模总参数7430亿,MoE架构
核心能力编程、网络安全(代码审计与漏洞发现)、Agent推理
开源计划发布两周后开放模型权重
使用渠道ZCode、AutoClaw、扣子、WorkBuddy/CodeBuddy等
产品定位编程与网络安全特化的开源旗舰大模型
适用人群企业安全团队、软件研发团队、个人开发者
GLM-5.3 – 智谱推出的编程与网络安全能力开源大模型

GLM-5.3核心能力与性能

以下评测数据均来自智谱AI官方GLM-5.3技术报告及红队合作团队的实测结果。

编程能力

编程能力是GLM-5.3相对上代最大的增量。Terminal-Bench 3.0(终端命令行任务执行基准)取28.3分,是开源模型最佳成绩,超过同期发布的Kimi K3的17.4分。DeepSWE v1.1(真实软件工程任务基准)从GLM-5.2的46.2提升至66.9。

智谱内部体感测评显示编程能力较GLM-5.2提升50%,编程体感接近Claude Fable 5,在国产开源模型中排名第一。

网络安全能力

白帽代码安全审计是GLM-5.3的差异化卖点。CyberGym(代码审计与漏洞发现基准)得84.5%,持平甚至略超Mythos 5的83.8%和GPT-5.6 Sol的83.6%。ExploitBench(漏洞利用推理基准)得54.4%,是GLM-5.2(24.4%)的两倍多。ExploitGym(6小时漏洞挖掘吞吐测试)完成130项,相比GLM-5.2的39项提升3.3倍。

深度漏洞利用方面,开源与闭源旗舰仍有差距:ExploitBench低于Mythos 5的78.0%,ExploitGym吞吐量也落后于Mythos 5的247项。

Token效率

GLM-5.3在High档位下以约5万tokens的单任务输出,达到Claude Opus 4.8约12万tokens才能实现的准确率水平。更短的执行路径意味着更低的API调用成本。

Agent长程任务

GDPval-AA v2(覆盖44种职业的真实任务基准)得1769分。模型支持跨文件理解、项目级修改和问题定位等复杂工程任务,从”辅助写代码”走向”参与大语言模型驱动的软件工程全过程”。

红队实战验证

发布前两周,智谱联合清华大学、南开大学、奇安信、腾讯玄武等团队开展红队测试,累计发现2404个潜在漏洞,覆盖269个项目。最引人注目的发现是一个潜伏40余年的DNS协议级零日(0-day)漏洞——攻击者仅需少量特殊请求即可将服务器压力放大近8万倍,潜在影响超过1000万处公网DNS服务。

GLM-5.3与Kimi K3对比

对比维度GLM-5.3Kimi K3
开发方智谱(Z.ai)月之暗面(Moonshot AI)
模型定位编程+网络安全特化通用编程+Agent均衡
开源性两周后开源完整权重开源
Terminal Bench 3.028.317.4
DeepSWE66.967.5
Agents’ Last Exam28.527.6
CyberGym84.5%80.0%
ExploitBench54.4%32.2%
ExploitGym 6小时任务数13070

GLM-5.3和Kimi K3都是2026年8月发布的国产开源大模型,但定位差异明显。GLM-5.3在网络安全能力上全面领先——CyberGym 84.5% vs 80.0%,ExploitBench 54.4% vs 32.2%,ExploitGym六小时任务数130 vs 70。编程方面两者互有胜负。一个月内,月之暗面、DeepSeek、智谱三家头部国产厂商先后完成关键版本迭代,编程能力集体向国际前沿靠拢。如果需求是代码安全审计和漏洞发现,选GLM-5.3;如果是通用编程和Agent任务,两者差距不大。

应用场景与适用人群

GLM-5.3的能力分布决定了它并非”全面升级”,以下三类场景收益最高:

  • 企业安全团队:代码安全审计、渗透测试辅助、漏洞复现与验证。GLM-5.3在CyberGym、ExploitBench上的漏洞推理能力可直接转化为安全生产力,红队发现的2404个漏洞也验证了实战可用性。
  • 软件研发团队:跨文件代码修改、项目级问题定位等Agent长程任务。GDPval-AA v2的高分说明它适合承担多步骤工程工作,而不只是补全单段代码。
  • 个人开发者与安全研究者:编程辅助、白帽技能学习、开源模型研究与二次开发。两周后权重开放,本地化部署和微调需求可以等到那时再动手。

适合谁用:安全工程师、渗透测试人员、全栈开发者、AI Agent开发者值得第一时间切换。如果主要用大模型做写作、问答、翻译等通用任务,GLM-5.2甚至更轻量的免费版本已经够用,不必跟风升级。

如何使用GLM-5.3

  1. 官方工具:通过ZCodeAutoClaw直接体验。8月14日13:00起GLM Coding Plan全员额度已重置。
  2. 第三方平台:已在扣子、WorkBuddy/CodeBuddy、Qoder/QwenWork等平台开放体验,开发者可在熟悉的开发环境中调用。
  3. API与本地部署:API发布后上线,完整权重计划两周后开源。安全能力仅通过受信访问计划向验证用户开放。AI Agent工作流中。

开源策略与已知局限

GLM-5.3采用分层开源策略,在开放与安全之间做平衡:

  • 两周后开放权重:发布后需完成安全评估与模型加固,两周后开放完整模型权重
  • 分层受信访问:最敏感的攻击能力仅向验证用户开放,防御能力对开源社区开放——分层的考虑是攻击能力滥用风险高,需要先建立使用方身份审核机制
  • 漏洞负责任披露:红队发现的2404个漏洞已提交CNNVD、CNVD等国家漏洞库,覆盖269个项目

GLM-5.3也存在已知局限:

  • 基座未更新:与GLM-5.2共享基座(同GLM-5.1系列基座),能力提升全部来自后训练,基座智能上界是否接近极限尚不确定
  • 深度安全仍落后闭源:ExploitBench 54.4% vs Mythos 5的78.0%,ExploitGym 130项 vs Mythos 5的247项
  • Terminal-Bench绝对分偏低:28.3虽是开源最佳,但与GPT-5.6 Sol的34.6仍有差距

常见问题

GLM-5.3和GLM-5.2有什么区别?

基座模型相同,提升全部来自后训练Scaling。编程能力提升50%,CyberGym从77.2%提升至84.5%,ExploitBench从24.4%翻倍至54.4%,ExploitGym吞吐量提升3-4倍。

GLM-5.3和Kimi K3怎么选?

网络安全需求选GLM-5.3(CyberGym 84.5% vs 80.0%,ExploitBench 54.4% vs 32.2%),通用编程和Agent任务两者差距不大(DeepSWE 66.9 vs 67.5)。

GLM-5.3的网络安全能力能直接用吗?

最敏感的攻击能力仅通过受信访问计划向验证用户开放,需要身份审核和安全评估。普通用户可使用编程和代码安全审查功能,防御能力对开源社区开放。

GLM-5.3什么时候开源,怎么用?

模型权重计划发布两周后开放。发布后可通过ZCode、AutoClaw、扣子、WorkBuddy/CodeBuddy等平台使用,API服务发布后上线。

GLM-5.3本地部署需要多少算力?

按7430亿参数MoE估算,FP8精度全量部署约需800GB显存(8卡H20/H800级别服务器),INT4量化后约400GB。以上为工程估算值,实际要求以开源时的官方部署文档为准。个人开发者建议优先使用API或第三方平台。

© 版权声明
AI工具站赚钱操作手册横幅,分享AI工具站SEO、GEO流量增长、CPS、CPA及数字产品变现经验

相关文章