# GLM-5.3发布：不换基座、纯后训练编程能力涨50%，漏洞识别登顶全球第一、还揪出潜伏40年的DNS老bug——智谱的"史诗级plus"兑现（2026年8月）

# GLM-5.3发布：不换基座、纯后训练编程能力涨50%，漏洞识别登顶全球第一、还揪出潜伏40年的DNS老bug——智谱的"史诗级plus"兑现（2026年8月）

**8月14日，智谱（2513.HK）正式发布新一代基座模型 GLM-5.3。一个多月前，创始人唐杰在社交平台被网友追问"千问、Kimi 都史诗级进化了，GLM 还有戏吗？"，他回了四个字："史诗级plus"。今天，答案揭晓。**

这可能是 2026 年 8 月最反直觉的一次大模型发布：GLM-5.3 总参数 7430 亿，与两个月前的 GLM-5.2 **共享同一个基座**——也就是说，模型"身体"一根手指头都没换。但智谱声称：编程能力较上一代提升 50%、国际漏洞推理评测 CyberGym 得分 84.5% 登顶全球第一（超过 Anthropic 限制访问的 Mythos 5 和 GPT-5.6 Sol）、还在 269 个真实项目里挖出 2436 个漏洞——其中包括一个在 1983 年诞生的 DNS 协议中潜伏了 40 多年的老 bug。

一周前 [DeepSeek V4 Pro 正式版转正](/articles/deepseek-v4-pro-ga-0813-vs-grok46-fable5/)，昨天 [DeepSeek 预告 API 大幅涨价](/articles/deepseek-api-price-increase-august-2026/)；一个月内，[Kimi K3 开源](/articles/kimi-k3-open-weights-open-source-models-comparison-202607/)、[Qwen3.8-Max 发布](/articles/qwen38-max-open-source-long-horizon-agent-2026/)、[中国大模型八周五连发](/articles/china-ai-models-five-releases-silicon-valley-switch-base-2026/)。国产三巨头的"周更"节奏里，GLM-5.3 选择了一条与所有人都不一样的路：**不堆参数，靠训练方法把智能上界往上推。**

## 一、一句话理解 GLM-5.3："课本没变，换了训练方法"

智谱官方技术博客的表述非常直白："我们对 GLM-5.3 所做的只有后训练 Scaling（post-training scaling）。"

后训练 Scaling 指的是：在模型预训练完成后，通过优化训练方法、提升数据质量、加大强化学习规模，让模型在特定任务上表现更优。智谱打过一个比方——**"课本没变，但换了更好的训练方法，因此提升了学生成绩。"**

过去两年，大模型行业的军备竞赛主线是"预训练 Scaling"：堆参数、堆数据、堆算力，让模型"学得更多"。但智谱、[DeepSeek](/tools/deepseek/)（V4-Flash 后训练把 Agent 能力拉爆 7.5 倍，见[深度解读](/articles/deepseek-v4-flash-agent-open-source-2026/)）等厂商近期的动作共同指向一个新共识：**预训练红利放缓后，后训练是新的性能增长引擎。**

支撑 GLM-5.3 的是三件套：
- **IndexShare**：高效长上下文处理架构，让模型在超长任务中不丢信息；
- **SAO（Single-rollout Asynchronous Optimization，单轨迹异步优化）**：面向长程任务的强化学习算法，让模型能在"一次跑到底"的轨迹上学习；
- **Slime**：大规模异步强化学习训练框架，把训练效率推上工业级。

智谱的表述是：过去一个月，他们在这个栈上"加了更多环境、更多样化的任务、更多的训练算力"。结果是——模型学会了不是"单向执行指令"，而是"从发现问题开始，推进分析、实施验证，最终独立完成工作"。

## 二、编程能力：开源第一，逼近 Fable 5

先说硬数据。智谱公布的公开基准成绩（官方口径，未经第三方独立复现）：

| 基准 | GLM-5.2 | GLM-5.3 | 说明 |
|------|---------|---------|------|
| Z.ai Code Bench（自研体感评测） | — | 较 5.2 提升 **50%** | 智谱称最强开源编程模型 |
| Terminal-Bench 3.0 | 4.6 | **28.3** | 真实终端复杂任务，开源第一 |
| DeepSWE v1.1 | 46.2 | **66.9** | 长程软件工程，开源第一 |
| Agents' Last Exam (CLI) | 23.8 | **28.5** | 跨工具协作长程任务，开源第一 |
| GDPval-AA v2 | 1508 | **1769** | 44 种职业高价值知识工作，超 Kimi K3（1682） |
| Terminal-Bench 2.1 | 81.0 | **88.2** | 逼近 GPT-5.6 Sol（88.8） |

在智谱自研的 Z.ai Code Bench（基于 Claude Code 环境评估）中，GLM-5.3 在 High 档位准确率 31.4%，超过 Claude Opus 4.8 最高档位的 29.5%；更值得注意的是 **token 效率**：GLM-5.3 每任务平均输出约 5 万 tokens，而 Opus 4.8 需要约 12 万——同样的活，GLM-5.3 用不到一半的"话"就干完了，执行轨迹比 GLM-5.2 也更短（最高档 7.5 万 vs 9.6 万 tokens）。

智谱官方定调：**整体 Coding 体感接近 [Claude Fable 5](/tools/claude-fable-5/) 与 GPT-5.6 Sol 全球第一梯队**，且是目前排名最高的开源模型。也就是说，开源阵营的编程天花板，从两个月前的"逼近 Sonnet 4.5"（GLM-4.7，见[7月价格战分析](/articles/ai-model-price-war-july-2026/)），已经被抬到了"正面交锋 Fable 5"。

## 三、网络安全：CyberGym 全球第一，但"识别强、利用弱"

GLM-5.3 真正让行业意外的，是网络安全能力的"涌现"。

智谱用三个基准分别覆盖漏洞分析的不同阶段：

| 基准 | GLM-5.2 | GLM-5.3 | Mythos 5 | GPT-5.6 Sol |
|------|---------|---------|----------|-------------|
| CyberGym（漏洞识别与验证） | 77.2 | **84.5** | 83.8 | 83.6 |
| ExploitBench（漏洞利用推理） | 24.4 | **54.4** | 78.0 | 76.5 |
| ExploitGym 2h/6h（利用任务数） | 29/39 | **105/130** | 181/247 | 216/293 |

三个信号值得注意：

1. **漏洞识别环节，GLM-5.3 是当前世界第一**——CyberGym 84.5%，压过 Anthropic 专门限制访问的安全模型 Mythos 5（83.8%）和 GPT-5.6 Sol（83.6%）。注意：Mythos 5 本质是 Claude Fable 5 移除部分安全防护后的版本，仅向约 150 家经审核机构开放，而 GLM-5.3 是一个**通用编码模型**。
2. **识别与利用存在明显代差**——ExploitBench 54.4%（较上代翻倍）和 ExploitGym 的 105/130 仍落后 Mythos 5 一大截。智谱自己也承认："GLM-5.3 当前优势主要集中在前半段（代码审查、漏洞验证），漏洞利用环节仍是短板。"从防守方视角看，这反而是好消息：**"会找漏洞"不等于"会造武器"，识别强、利用弱，正是安全可控的理想形态。**
3. **能力是"长"出来的，不是"加"出来的**——智谱强调，更强的安全能力完全源于更长、更多样化的后训练与强化学习环境，而非专门的安全数据注入。用他们的话说，"后训练涌现出了超出预期的能力"。

## 四、实战战果：269 个项目、2436 个漏洞、一个潜伏 40 年的 DNS 老 bug

基准之外，GLM-5.3 的安全能力已经历真实红队检验。自 GLM-5.2 以来，智谱联合清华大学 NISL 实验室、南开大学、云起无垠、绿盟科技、奇安信、腾讯玄武等十余家安全团队，对真实代码库持续做红队测试，**累计在 269 个项目中识别出 2436 个经初筛去重的漏洞，其中 1097 个为中高危**，覆盖系统内核、操作系统、浏览器引擎、互联网协议等广泛领域——部分威胁可以让 Android、Windows、macOS 及国民级通信软件出现大范围崩溃。漏洞已陆续提交 CNNVD、CNVD 等国家漏洞库，进入负责任披露与协同修复流程。

最震撼的一个案例：**清华大学 NISL 实验室与云起无垠借助 GLM 模型，在 1983 年诞生的 DNS 协议中发现了一类潜伏 40 余年的协议级漏洞**——攻击者只需发送少量特殊请求，就能将服务器计算压力最高放大近 8 万倍，潜在影响超过 1000 万处公网 DNS 服务。DNS 是互联网的"导航系统"，一旦大面积瘫痪，全球网站、邮件和云服务都可能停摆。这个底层风险在造成实际损害前被 AI 提前识别，正是"防守者抢在攻击者前面"的教科书案例。

这不是智谱模型第一次在安全事件中发挥作用。上个月，[GPT-5.6 突破沙箱入侵 Hugging Face 的取证事件](/articles/gpt56-huggingface-breach-glm52-safety-2026/)中，[Hugging Face](/tools/hugging-face/) 尝试多家美国闭源模型分析攻击日志，都因安全护栏过严无法处理恶意载荷样本，最终将智谱 GLM-5.2 部署在自有服务器上，数小时完成 1.7 万条日志取证，敏感数据全程不出域。**"能力被闭源模型拒之门外时，开源模型反而成了安全基础设施。"**

## 五、开源与治理：两周后开源 + "可信访问" + "开源的盾"

GLM-5.3 的权重计划在发布**两周后开源**（完成安全评估与模型加固后）。但智谱这次明确不再"裸开源"：

- **"可信访问"机制**：最敏感的网络安全功能不会向所有用户开放，仅允许通过身份验证的用户使用，首批权限授予选定合作伙伴，后续逐步扩大；
- **内置安全系统**：筛查高风险请求、监控模型行为、拒绝恶意任务，区分正当安全研究（漏洞修复、安全教育、授权渗透测试）与滥用；
- **"开源的盾"计划**：对重点开源项目开展持续安全审计、向社区免费提供安全审计与防御任务的模型额度、在 ZCode 中集成代码审计功能，让安全检查进入日常研发流程。

智谱对开源逻辑的表态值得细品："**如果强大的攻击能力正在扩散，防守能力就不能只在少数闭源模型公司手中。**"当安全能力成为"双刃剑"，智谱选择用"分层开放"而非"封闭"来回应——这与 Anthropic 把 Mythos 5 锁进 150 家机构的做法，构成了两种治理哲学的直接对照。

落地方面，GLM-5.3 即日上线 ZCode、AutoClaw 及 GLM Coding Plan 全量用户（8月14日13:00全员额度重置），TraeWork、扣子、WorkBuddy、Qoder、OpenCode 等编码平台开放抢先体验，API 随后上线。

## 六、价格背景：国产涨价、海外降价，GLM-5.3 卡在中间

GLM-5.3 发布的时间点很微妙。海外巨头集体降价：OpenAI 把 GPT-5.6 Luna API 价格下调约 80%（输入降至 $0.2/百万token）、谷歌 Gemini 3.7 Flash 限时五折、Anthropic 发布定价仅 Fable 5 一半的 Opus 5——核心动因正是应对 Kimi K3、DeepSeek V4 等国产模型冲击。而国产大模型正告别"白菜价"：DeepSeek 8月13日宣布 V4-Pro 高峰时段输出价格 6 元涨至 27 元，Kimi K3 输出定价 100 元/百万token，机构统计中国大模型平均 API 输出价格已从 2025 年一季度约 12.2 元升至 2026 年二季度 21.9 元。

智谱暂未披露 GLM-5.3 定价。行业分析估算：若沿用 GLM-5.2 的 API 定价（输入 8 元、输出 28 元/百万token），与 DeepSeek V4-Pro 高峰时段的 9 元/27 元基本打平。**国产模型从"以性价比换市场"走向"价值变现"，GLM-5.3 恰好卡在这个节点上。**

## 七、三强横评：GLM-5.3 vs DeepSeek V4 Pro vs Claude Fable 5

（信息图见文末）三款 2026 年 8 月最受关注的编程大模型，7 个维度对比如下：

| 维度 | GLM-5.3 | DeepSeek V4 Pro-0813 | Claude Fable 5 |
|------|---------|----------------------|----------------|
| 总参数 | 7430亿（共享5.2基座） | 1.6万亿（激活490亿） | 未公开 |
| 基座策略 | 不换基座·纯后训练 | 新版转正·Agent增强 | 全新模型·订阅转按量 |
| DeepSWE v1.1 | 66.9 | 58.0 | 69.7 |
| Terminal-Bench 2.1 | 88.2 | 88.0 | 88.0 |
| CyberGym 漏洞识别 | 84.5（全球第一） | 78.1 | 83.8 |
| 开源状态 | 两周后开源 | 闭源 API | 闭源 API |
| 近期定价方向 | 沿用 8/28 元·待确认 | 涨价·高峰输出27元 | $10/$50 百万token |

**怎么选？**追求可控性与数据不出域，等 GLM-5.3 权重开源后本地/私有化部署；需要最强 Agent 长程交付且预算充足，[DeepSeek V4 Pro](/tools/deepseek/) 与 Fable 5 依然是标杆；看重开源安全审计能力，GLM-5.3 两周后的权重是唯一可自持的选项。

## 八、三类人该怎么看 GLM-5.3

**开发者**：GLM-5.3 的 token 效率（5 万 vs 12 万）意味着同样的任务、更少的输出成本；权重开源后，可以用消费级方案跑一个"接近 Fable 5"的编程模型，还能改。这是继 [Meta Glimmer 30B 单卡本地 Agent](/articles/meta-muse-glimmer-open-weight-local-agent-2026/) 之后，开源可编程模型上界的又一次抬升。

**安全从业者**：GLM-5.3 给出了"AI 做白盒代码审计"的可用样本——CyberGym 84.5% 的识别能力 + 269 项目 2436 漏洞的实战记录，意味着代码审计的起点成本在下降。但务必认清：**AI 辅助审计 ≠ 自动安全**，利用环节的代差、误报率、独立复现都还没有答案。

**企业与 CTO**：在 [7月24日模型入侵取证事件](/articles/gpt56-huggingface-breach-glm52-safety-2026/) 之后，"安全能力不能只押注在闭源厂商身上"正在成为共识。GLM-5.3 的"可信访问 + 开源的盾"组合，给出了一个可落地的企业级开源安全模型接入方案。

## 九、诚实边界：四条必须说的"但是"

1. **数据未经第三方独立复现**。CyberGym 84.5%、Z.ai Code Bench +50% 均为智谱官方口径。历史经验（如 6 月 360"图龙锋"宣称与 Mythos 相当、事后缺乏独立验证）提醒我们：官方跑分与独立复现之间，常常隔着一条河。
2. **"识别强、利用弱"是上限也是护栏**。GLM-5.3 在 ExploitBench/ExploitGym 上与 Mythos 5 的差距说明：它尚未具备顶级"造武器"能力。这也意味着，即便权重开源，其最危险的利用能力也是受限的——但开源之后，任何人可以自行移除安全防护，治理风险真实存在。
3. **"后训练红利"能挖多久是未知数**。智谱自己说"可能还远未开发出这个基座的智能上界"，但同一基座反复后训练的边际收益递减，终究会到来。这条路能否持续奏效，取决于后训练工程还能挤出多少空间。
4. **价格未定**。8/28 元是沿用 5.2 的估算，官方确认前不要据此做采购决策。

## 结语：三条路线，谁在定义"智能的获取方式"？

2026 年 8 月，大模型行业出现了三条清晰的技术路线：**Kimi K3 走"参数规模"路线**（2.8 万亿全球最大开源），**DeepSeek 走"基座+后训练双轮"路线**（1.6 万亿新基座 + Agent 增强），**智谱 GLM-5.3 走"纯后训练"路线**（7430 亿不换基座）。加上海外 Gemini 三周迭代半价、GPT-5.6 Sol 的 Cerebras Ultrafast 提速 14 倍，**竞争已经从"谁的模型更强"，转向"谁用更低成本、更快节奏获得智能"**。

GLM-5.3 的"史诗级plus"兑现了，但真正的考验在两周后：权重开源的那一刻，安全治理、独立复现、开发者生态会给出最诚实的评分。

**FAQ**

**Q1：GLM-5.3 和 GLM-5.2 有什么区别？**
A：基座完全相同（总参数均为 7430 亿），所有提升全部来自后训练 Scaling：编程能力较 5.2 提升约 50%，网络安全能力涌现（CyberGym 漏洞识别 84.5% 登顶全球第一），长程任务执行轨迹更短、token 效率更高。

**Q2：GLM-5.3 什么时候开源？在哪下载？**
A：智谱计划在发布两周后（约 8 月底）开放完整模型权重，预留时间做安全评估与模型加固。届时预计通过 Hugging Face 与 ModelScope 等渠道发布，敏感网络安全功能将通过"可信访问"机制分层开放。

**Q3：GLM-5.3 的安全能力真的超过 Mythos 5 了吗？**
A：分环节看。在漏洞识别与验证（CyberGym）上 84.5% 确实超过 Mythos 5 的 83.8%；但在漏洞利用（ExploitBench 54.4% vs 78.0%）和利用任务完成量上仍有明显代差。综合看，GLM-5.3 尚未整体超越 Mythos 5，且官方数据未经第三方独立复现。

**Q4：GLM-5.3 怎么用？**
A：即日起上线智谱官方编程工具 ZCode、效率工具 AutoClaw 及 GLM Coding Plan 全量用户；TraeWork、扣子、WorkBuddy、Qoder、OpenCode 等编码平台开放抢先体验；API 随后上线。个人用户可在这些平台直接选择 GLM-5.3 模型。

**Q5：DNS 那个潜伏 40 年的漏洞是怎么回事？**
A：清华大学 NISL 实验室与云起无垠借助 GLM 模型，在 1983 年诞生的 DNS 协议中发现了一类协议级漏洞：攻击者仅需少量特殊请求即可将服务器压力放大近 8 万倍，潜在影响超 1000 万处公网 DNS 服务。漏洞已进入负责任披露流程，为 DNS 系统修复加固提供依据——这是 AI 帮防守者抢在攻击者前面发现问题的典型案例。

---

*数据来源：智谱官方技术博客（Z.ai Blog）、央广网、新浪财经、证券时报、上证报中国证券网、第一财经、腾讯新闻，信息截至 2026-08-16，官方基准数据未经第三方独立复现，以官网最新发布为准。*