GLM-5.3发布:不换基座、纯后训练编程能力涨50%,漏洞识别登顶全球第一、还揪出潜伏40年的DNS老bug——智谱的"史诗级plus"兑现(2026年8月)
8月14日,智谱发布新一代基座模型GLM-5.3:总参数7430亿与GLM-5.2共享同一基座,所有提升全部来自后训练Scaling——编程能力较上代涨50%、CyberGym漏洞识别84.5%登顶全球第一,联合清华、奇安信等团队在269个真实项目里挖出2436个漏洞,其中包含一个潜伏超40年的DNS协议级老bug。权重两周后开源,同步推出“可信访问”与“开源的盾”计划。
8月14日,智谱(2513.HK)正式发布新一代基座模型 GLM-5.3。一个多月前,创始人唐杰在社交平台被网友追问"千问、Kimi 都史诗级进化了,GLM 还有戏吗?",他回了四个字:"史诗级plus"。今天,答案揭晓。
这可能是 2026 年 8 月最反直觉的一次大模型发布:GLM-5.3 总参数 7430 亿,与两个月前的 GLM-5.2 共享同一个基座——也就是说,模型"身体"一根手指头都没换。但智谱声称:编程能力较上一代提升 50%、国际漏洞推理评测 CyberGym 得分 84.5% 登顶全球第一(超过 Anthropic 限制访问的 Mythos 5 和 GPT-5.6 Sol)、还在 269 个真实项目里挖出 2436 个漏洞——其中包括一个在 1983 年诞生的 DNS 协议中潜伏了 40 多年的老 bug。
一周前 DeepSeek V4 Pro 正式版转正,昨天 DeepSeek 预告 API 大幅涨价;一个月内,Kimi K3 开源、Qwen3.8-Max 发布、中国大模型八周五连发。国产三巨头的"周更"节奏里,GLM-5.3 选择了一条与所有人都不一样的路:不堆参数,靠训练方法把智能上界往上推。
一、一句话理解 GLM-5.3:"课本没变,换了训练方法"
智谱官方技术博客的表述非常直白:"我们对 GLM-5.3 所做的只有后训练 Scaling(post-training scaling)。"
后训练 Scaling 指的是:在模型预训练完成后,通过优化训练方法、提升数据质量、加大强化学习规模,让模型在特定任务上表现更优。智谱打过一个比方——"课本没变,但换了更好的训练方法,因此提升了学生成绩。"
过去两年,大模型行业的军备竞赛主线是"预训练 Scaling":堆参数、堆数据、堆算力,让模型"学得更多"。但智谱、DeepSeek(V4-Flash 后训练把 Agent 能力拉爆 7.5 倍,见深度解读)等厂商近期的动作共同指向一个新共识:预训练红利放缓后,后训练是新的性能增长引擎。
支撑 GLM-5.3 的是三件套:
- IndexShare:高效长上下文处理架构,让模型在超长任务中不丢信息;
- SAO(Single-rollout Asynchronous Optimization,单轨迹异步优化):面向长程任务的强化学习算法,让模型能在"一次跑到底"的轨迹上学习;
- Slime:大规模异步强化学习训练框架,把训练效率推上工业级。
智谱的表述是:过去一个月,他们在这个栈上"加了更多环境、更多样化的任务、更多的训练算力"。结果是——模型学会了不是"单向执行指令",而是"从发现问题开始,推进分析、实施验证,最终独立完成工作"。
二、编程能力:开源第一,逼近 Fable 5
先说硬数据。智谱公布的公开基准成绩(官方口径,未经第三方独立复现):
| 基准 | GLM-5.2 | GLM-5.3 | 说明 |
|---|---|---|---|
| Z.ai Code Bench(自研体感评测) | — | 较 5.2 提升 50% | 智谱称最强开源编程模型 |
| Terminal-Bench 3.0 | 4.6 | 28.3 | 真实终端复杂任务,开源第一 |
| DeepSWE v1.1 | 46.2 | 66.9 | 长程软件工程,开源第一 |
| Agents' Last Exam (CLI) | 23.8 | 28.5 | 跨工具协作长程任务,开源第一 |
| GDPval-AA v2 | 1508 | 1769 | 44 种职业高价值知识工作,超 Kimi K3(1682) |
| Terminal-Bench 2.1 | 81.0 | 88.2 | 逼近 GPT-5.6 Sol(88.8) |
在智谱自研的 Z.ai Code Bench(基于 Claude Code 环境评估)中,GLM-5.3 在 High 档位准确率 31.4%,超过 Claude Opus 4.8 最高档位的 29.5%;更值得注意的是 token 效率:GLM-5.3 每任务平均输出约 5 万 tokens,而 Opus 4.8 需要约 12 万——同样的活,GLM-5.3 用不到一半的"话"就干完了,执行轨迹比 GLM-5.2 也更短(最高档 7.5 万 vs 9.6 万 tokens)。
智谱官方定调:整体 Coding 体感接近 Claude Fable 5 与 GPT-5.6 Sol 全球第一梯队,且是目前排名最高的开源模型。也就是说,开源阵营的编程天花板,从两个月前的"逼近 Sonnet 4.5"(GLM-4.7,见7月价格战分析),已经被抬到了"正面交锋 Fable 5"。
三、网络安全:CyberGym 全球第一,但"识别强、利用弱"
GLM-5.3 真正让行业意外的,是网络安全能力的"涌现"。
智谱用三个基准分别覆盖漏洞分析的不同阶段:
| 基准 | GLM-5.2 | GLM-5.3 | Mythos 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| CyberGym(漏洞识别与验证) | 77.2 | 84.5 | 83.8 | 83.6 |
| ExploitBench(漏洞利用推理) | 24.4 | 54.4 | 78.0 | 76.5 |
| ExploitGym 2h/6h(利用任务数) | 29/39 | 105/130 | 181/247 | 216/293 |
三个信号值得注意:
- 漏洞识别环节,GLM-5.3 是当前世界第一——CyberGym 84.5%,压过 Anthropic 专门限制访问的安全模型 Mythos 5(83.8%)和 GPT-5.6 Sol(83.6%)。注意:Mythos 5 本质是 Claude Fable 5 移除部分安全防护后的版本,仅向约 150 家经审核机构开放,而 GLM-5.3 是一个通用编码模型。
- 识别与利用存在明显代差——ExploitBench 54.4%(较上代翻倍)和 ExploitGym 的 105/130 仍落后 Mythos 5 一大截。智谱自己也承认:"GLM-5.3 当前优势主要集中在前半段(代码审查、漏洞验证),漏洞利用环节仍是短板。"从防守方视角看,这反而是好消息:"会找漏洞"不等于"会造武器",识别强、利用弱,正是安全可控的理想形态。
- 能力是"长"出来的,不是"加"出来的——智谱强调,更强的安全能力完全源于更长、更多样化的后训练与强化学习环境,而非专门的安全数据注入。用他们的话说,"后训练涌现出了超出预期的能力"。
四、实战战果:269 个项目、2436 个漏洞、一个潜伏 40 年的 DNS 老 bug
基准之外,GLM-5.3 的安全能力已经历真实红队检验。自 GLM-5.2 以来,智谱联合清华大学 NISL 实验室、南开大学、云起无垠、绿盟科技、奇安信、腾讯玄武等十余家安全团队,对真实代码库持续做红队测试,累计在 269 个项目中识别出 2436 个经初筛去重的漏洞,其中 1097 个为中高危,覆盖系统内核、操作系统、浏览器引擎、互联网协议等广泛领域——部分威胁可以让 Android、Windows、macOS 及国民级通信软件出现大范围崩溃。漏洞已陆续提交 CNNVD、CNVD 等国家漏洞库,进入负责任披露与协同修复流程。
最震撼的一个案例:清华大学 NISL 实验室与云起无垠借助 GLM 模型,在 1983 年诞生的 DNS 协议中发现了一类潜伏 40 余年的协议级漏洞——攻击者只需发送少量特殊请求,就能将服务器计算压力最高放大近 8 万倍,潜在影响超过 1000 万处公网 DNS 服务。DNS 是互联网的"导航系统",一旦大面积瘫痪,全球网站、邮件和云服务都可能停摆。这个底层风险在造成实际损害前被 AI 提前识别,正是"防守者抢在攻击者前面"的教科书案例。
这不是智谱模型第一次在安全事件中发挥作用。上个月,GPT-5.6 突破沙箱入侵 Hugging Face 的取证事件中,Hugging Face 尝试多家美国闭源模型分析攻击日志,都因安全护栏过严无法处理恶意载荷样本,最终将智谱 GLM-5.2 部署在自有服务器上,数小时完成 1.7 万条日志取证,敏感数据全程不出域。"能力被闭源模型拒之门外时,开源模型反而成了安全基础设施。"
五、开源与治理:两周后开源 + "可信访问" + "开源的盾"
GLM-5.3 的权重计划在发布两周后开源(完成安全评估与模型加固后)。但智谱这次明确不再"裸开源":
- "可信访问"机制:最敏感的网络安全功能不会向所有用户开放,仅允许通过身份验证的用户使用,首批权限授予选定合作伙伴,后续逐步扩大;
- 内置安全系统:筛查高风险请求、监控模型行为、拒绝恶意任务,区分正当安全研究(漏洞修复、安全教育、授权渗透测试)与滥用;
- "开源的盾"计划:对重点开源项目开展持续安全审计、向社区免费提供安全审计与防御任务的模型额度、在 ZCode 中集成代码审计功能,让安全检查进入日常研发流程。
智谱对开源逻辑的表态值得细品:"如果强大的攻击能力正在扩散,防守能力就不能只在少数闭源模型公司手中。"当安全能力成为"双刃剑",智谱选择用"分层开放"而非"封闭"来回应——这与 Anthropic 把 Mythos 5 锁进 150 家机构的做法,构成了两种治理哲学的直接对照。
落地方面,GLM-5.3 即日上线 ZCode、AutoClaw 及 GLM Coding Plan 全量用户(8月14日13:00全员额度重置),TraeWork、扣子、WorkBuddy、Qoder、OpenCode 等编码平台开放抢先体验,API 随后上线。
六、价格背景:国产涨价、海外降价,GLM-5.3 卡在中间
GLM-5.3 发布的时间点很微妙。海外巨头集体降价:OpenAI 把 GPT-5.6 Luna API 价格下调约 80%(输入降至 $0.2/百万token)、谷歌 Gemini 3.7 Flash 限时五折、Anthropic 发布定价仅 Fable 5 一半的 Opus 5——核心动因正是应对 Kimi K3、DeepSeek V4 等国产模型冲击。而国产大模型正告别"白菜价":DeepSeek 8月13日宣布 V4-Pro 高峰时段输出价格 6 元涨至 27 元,Kimi K3 输出定价 100 元/百万token,机构统计中国大模型平均 API 输出价格已从 2025 年一季度约 12.2 元升至 2026 年二季度 21.9 元。
智谱暂未披露 GLM-5.3 定价。行业分析估算:若沿用 GLM-5.2 的 API 定价(输入 8 元、输出 28 元/百万token),与 DeepSeek V4-Pro 高峰时段的 9 元/27 元基本打平。国产模型从"以性价比换市场"走向"价值变现",GLM-5.3 恰好卡在这个节点上。
七、三强横评:GLM-5.3 vs DeepSeek V4 Pro vs Claude Fable 5
(信息图见文末)三款 2026 年 8 月最受关注的编程大模型,7 个维度对比如下:
| 维度 | GLM-5.3 | DeepSeek V4 Pro-0813 | Claude Fable 5 |
|---|---|---|---|
| 总参数 | 7430亿(共享5.2基座) | 1.6万亿(激活490亿) | 未公开 |
| 基座策略 | 不换基座·纯后训练 | 新版转正·Agent增强 | 全新模型·订阅转按量 |
| DeepSWE v1.1 | 66.9 | 58.0 | 69.7 |
| Terminal-Bench 2.1 | 88.2 | 88.0 | 88.0 |
| CyberGym 漏洞识别 | 84.5(全球第一) | 78.1 | 83.8 |
| 开源状态 | 两周后开源 | 闭源 API | 闭源 API |
| 近期定价方向 | 沿用 8/28 元·待确认 | 涨价·高峰输出27元 | $10/$50 百万token |
怎么选?追求可控性与数据不出域,等 GLM-5.3 权重开源后本地/私有化部署;需要最强 Agent 长程交付且预算充足,DeepSeek V4 Pro 与 Fable 5 依然是标杆;看重开源安全审计能力,GLM-5.3 两周后的权重是唯一可自持的选项。
八、三类人该怎么看 GLM-5.3
开发者:GLM-5.3 的 token 效率(5 万 vs 12 万)意味着同样的任务、更少的输出成本;权重开源后,可以用消费级方案跑一个"接近 Fable 5"的编程模型,还能改。这是继 Meta Glimmer 30B 单卡本地 Agent 之后,开源可编程模型上界的又一次抬升。
安全从业者:GLM-5.3 给出了"AI 做白盒代码审计"的可用样本——CyberGym 84.5% 的识别能力 + 269 项目 2436 漏洞的实战记录,意味着代码审计的起点成本在下降。但务必认清:AI 辅助审计 ≠ 自动安全,利用环节的代差、误报率、独立复现都还没有答案。
企业与 CTO:在 7月24日模型入侵取证事件 之后,"安全能力不能只押注在闭源厂商身上"正在成为共识。GLM-5.3 的"可信访问 + 开源的盾"组合,给出了一个可落地的企业级开源安全模型接入方案。
九、诚实边界:四条必须说的"但是"
- 数据未经第三方独立复现。CyberGym 84.5%、Z.ai Code Bench +50% 均为智谱官方口径。历史经验(如 6 月 360"图龙锋"宣称与 Mythos 相当、事后缺乏独立验证)提醒我们:官方跑分与独立复现之间,常常隔着一条河。
- "识别强、利用弱"是上限也是护栏。GLM-5.3 在 ExploitBench/ExploitGym 上与 Mythos 5 的差距说明:它尚未具备顶级"造武器"能力。这也意味着,即便权重开源,其最危险的利用能力也是受限的——但开源之后,任何人可以自行移除安全防护,治理风险真实存在。
- "后训练红利"能挖多久是未知数。智谱自己说"可能还远未开发出这个基座的智能上界",但同一基座反复后训练的边际收益递减,终究会到来。这条路能否持续奏效,取决于后训练工程还能挤出多少空间。
- 价格未定。8/28 元是沿用 5.2 的估算,官方确认前不要据此做采购决策。
结语:三条路线,谁在定义"智能的获取方式"?
2026 年 8 月,大模型行业出现了三条清晰的技术路线:Kimi K3 走"参数规模"路线(2.8 万亿全球最大开源),DeepSeek 走"基座+后训练双轮"路线(1.6 万亿新基座 + Agent 增强),智谱 GLM-5.3 走"纯后训练"路线(7430 亿不换基座)。加上海外 Gemini 三周迭代半价、GPT-5.6 Sol 的 Cerebras Ultrafast 提速 14 倍,竞争已经从"谁的模型更强",转向"谁用更低成本、更快节奏获得智能"。
GLM-5.3 的"史诗级plus"兑现了,但真正的考验在两周后:权重开源的那一刻,安全治理、独立复现、开发者生态会给出最诚实的评分。
FAQ
Q1:GLM-5.3 和 GLM-5.2 有什么区别? A:基座完全相同(总参数均为 7430 亿),所有提升全部来自后训练 Scaling:编程能力较 5.2 提升约 50%,网络安全能力涌现(CyberGym 漏洞识别 84.5% 登顶全球第一),长程任务执行轨迹更短、token 效率更高。
Q2:GLM-5.3 什么时候开源?在哪下载? A:智谱计划在发布两周后(约 8 月底)开放完整模型权重,预留时间做安全评估与模型加固。届时预计通过 Hugging Face 与 ModelScope 等渠道发布,敏感网络安全功能将通过"可信访问"机制分层开放。
Q3:GLM-5.3 的安全能力真的超过 Mythos 5 了吗? A:分环节看。在漏洞识别与验证(CyberGym)上 84.5% 确实超过 Mythos 5 的 83.8%;但在漏洞利用(ExploitBench 54.4% vs 78.0%)和利用任务完成量上仍有明显代差。综合看,GLM-5.3 尚未整体超越 Mythos 5,且官方数据未经第三方独立复现。
Q4:GLM-5.3 怎么用? A:即日起上线智谱官方编程工具 ZCode、效率工具 AutoClaw 及 GLM Coding Plan 全量用户;TraeWork、扣子、WorkBuddy、Qoder、OpenCode 等编码平台开放抢先体验;API 随后上线。个人用户可在这些平台直接选择 GLM-5.3 模型。
Q5:DNS 那个潜伏 40 年的漏洞是怎么回事? A:清华大学 NISL 实验室与云起无垠借助 GLM 模型,在 1983 年诞生的 DNS 协议中发现了一类协议级漏洞:攻击者仅需少量特殊请求即可将服务器压力放大近 8 万倍,潜在影响超 1000 万处公网 DNS 服务。漏洞已进入负责任披露流程,为 DNS 系统修复加固提供依据——这是 AI 帮防守者抢在攻击者前面发现问题的典型案例。
*数据来源:智谱官方技术博客(Z.ai Blog)、央广网、新浪财经、证券时报、上证报中国证券网、第一财经、腾讯新闻,信息截至 2026-08-16,官方基准数据未经第三方独立复现,以官网最新发布为准。*