智谱 GLM-5.3 发布评测 2026:编程能力提升50%、开源第一、两周后开放权重
海外梯子

更新:2026-08-19 — 智谱 GLM-5.3 于 8 月 14 日正式发布。本文基于智谱官方公告、bigmodel.cn 官方定价页与多家媒体报道整理。

8 月 14 日,智谱把 GLM-5.3 端了上来。这一周的大模型圈已经卷到几乎一天一个新旗舰:Grok 4.6 刚发完,DeepSeek V4 Pro 正式版虚晃一枪,然后智谱的答卷也到了。

但 GLM-5.3 这次有个不太一样的点:基座没换。 7430 亿参数,跟 GLM-5.2 同一套底子,所有性能提升全部来自后训练阶段的 Scaling——智谱官方原话是 “scaling post-training is all we did”。

不换基座,靠训练方法把智能上界往上推,还顺便点亮了一个谁都没预告的技能树:网络安全。这篇把 GLM-5.3 到底强在哪、怎么用、价格多少讲清楚。

太长不看版

维度结论
发布时间2026-08-14,智谱(港交所 02513)
模型规格7430 亿参数,与 GLM-5.2 同基座,纯后训练升级
编程能力内部体感评测较 GLM-5.2 提升 50%,Terminal-Bench 3.0 从 4.6 涨到 28.3
开源排名Terminal-Bench 3.0、Agents’ Last Exam (CLI) 等公开基准开源第一
网络安全CyberGym 84.5%(开源第一),白盒代码审查追平 Anthropic Mythos 5
Token 效率高思考档位下 31.5% 准确率,超过 Claude Opus 4.8 的 29.5%
开源计划发布两周后开放模型权重(先做安全加固)
当前入口GLM Coding Plan、ZCode、AutoClaw 已上线,API 很快上线
适合谁编程、终端操作、长程 Agent 任务开发者

这版 GLM-5.3 为什么值得关注

先说清楚这次的定位:GLM-5.3 不是”新一代基座”,而是同一基座下的后训练极限。智谱官方技术博客开篇就写得很直白——scaling post-training is all we did。基座没换、参数没加,所有提升来自后训练阶段的强化学习和数据工程。

对行业来说,这是个信号:堆参数的路线告一段落,训练方法成了新的竞争焦点。 之前传闻的万亿参数升级没有出现(那枚牌大概留给了 GLM-5.5),但智谱靠后训练硬是把性能拉高了 50%。

对开发者来说,重点就两个:编程真的变强了,而且意外多出来一个网络安全能力——后者是智谱自己都承认”超出预期”的涌现能力。

核心性能评测

1. 编程能力:Terminal-Bench 3.0 涨了 6 倍

编程是 GLM-5.3 的主场。官方数据:内部自建体感评测较 GLM-5.2 提升 50%。公开基准上的跃升更直观:

基准GLM-5.2GLM-5.3变化
Terminal-Bench 3.04.628.3约 6 倍
DeepSWE v1.146.266.9+20.7
CyberGym 漏洞推理77.2%84.5%+7.3%

Terminal-Bench 3.0 衡量的是模型在真实终端环境中完成复杂任务的能力——跑命令、改代码、查日志,不是单纯的代码生成。GLM-5.3 从 4.6 干到 28.3,是智谱公布的所有基准里涨幅最夸张的一个。

2. Agent 能力:开源第一,逼近 Claude Fable 5

在 Agents’ Last Exam (CLI) 等公开基准中,GLM-5.3 拿下开源模型第一。多家媒体的实测结论是:编程与智能体能力接近 Claude Fable 5 和 GPT-5.6 Sol,编程体感超过其他国产模型。

与国产竞品比:GLM-5.3 和 Kimi K3 在编程、智能体领域互有胜负,但在绝大部分基准上领先 DeepSeek V4 Pro 正式版(0813)。

3. Token 效率:花更少的钱办同样的事

这次智谱专门强调了 Token 利用率。实测数据:在相同的高思考档位预算下,GLM-5.3 的准确率达到 31.5%,超过 Claude Opus 4.8 的 29.5%;任务平均输出约 5 万个 token,不到 Opus 的一半。

对 API 用户来说,这意味着同样的效果、更低的账单——在 OpenAI 刚刚把 GPT-5.6 Luna API 价格下调 80%(每百万 token 输入从 $1 降到 $0.2)的价格战背景下,Token 效率比单看分数更重要。

4. 网络安全:意外涌现的技能树

GLM-5.3 最大的惊喜在这里。智谱说这是”充分的模型后训练涌现出的超出预期能力”:在白盒代码审查与漏洞发现任务上,表现与 Anthropic 的 Mythos 5 持平——而 GLM-5.3 的参数体量只有 Mythos 的十分之一。

最出圈的案例:清华 NASP 实验室用它深入 Cursor 的底层架构,直接在权限校验逻辑里发现了一个可任意写文件的漏洞。2436 个漏洞被翻出来,有些藏了 45 年。

当然要客观说:招银国际的研报指出,GLM-5.3 的网络安全能力在任务链较前端的环节(代码审查、漏洞推理)表现强,但完整漏洞利用链条任务上还有提升空间。它是”安全之盾”的胚子,不是已经完工的攻防一体。

定价方案

API 定价(bigmodel.cn 官方)

项目价格
输入8 元 / 百万 token
输出28 元 / 百万 token
缓存命中2 元 / 百万 token
限时免费✅(新品限时免费阶段)

注意:GLM-5.3 与 GLM-5.2 定价一致(输入 8 元、输出 28 元),但上下文窗口升级到 1M。限时免费阶段是体验窗口,之后恢复标准价格。

GLM Coding Plan 订阅

GLM Coding Plan 已全量开放订阅,按 Token 扣积分计费(7 月底刚从”按 prompt 次数”改为积分制)。8 月 14 日发布当天 13:00,全员额度重置——订阅用户当天起就能用上 GLM-5.3。具体档位价格以官网实时显示为准。

使用教程:四种方式接入

方式一:GLM Coding Plan(订阅用户最快)

8 月 14 日当天,GLM-5.3 已在 GLM Coding Plan 全量上线。订阅用户打开就能切到新模型,不需要任何额外配置。适合日常用 AI 写代码、跑 Agent 任务的开发者。

方式二:ZCode / AutoClaw(官方编程工具)

智谱同步上线了官方编程工具 ZCode 和效率工具 AutoClaw。ZCode 是围绕 GLM-5.3 打造的编程 Agent 工作台,AutoClaw 偏自动化效率场景。两个工具都内置了 GLM-5.3,开箱即用。

方式三:兼容主流编码平台

GLM-5.3 兼容 Claude Code、OpenCode 等主流代码代理工具——把模型后端切到智谱的 API 即可,调用逻辑不用重写。同时 TraeWork/TraeCode、扣子、WorkBuddy/CodeBuddy、Qoder/QwenWork、CatPaw、JoyCode 等编码平台已开放抢先体验;范式集团的 PhanRouter 平台 8 月 17 日完成适配,首批支持 GLM-5.3 调用,原有 API 接口和账号体系可直接沿用,只改模型名。

方式四:等两周后的开源权重

智谱承诺发布两周后开放完整模型权重(约 8 月底),在此之前先做分层风险审查和安全加固,“尽可能限制潜在攻击能力,保留防御价值”。想本地部署、想微调、想自托管推理的团队,直接等开源权重即可,到时 Hugging Face 上会有官方仓库。

竞品对比:和 Kimi K3 / DeepSeek V4 Pro / Claude Fable 5 怎么选

维度GLM-5.3Kimi K3DeepSeek V4 ProClaude Fable 5
编程定位开源第一,逼近 Fable 5编程/Agent 互有胜负生产环境 Agent 强闭源标杆
终端操作Terminal-Bench 3.0 开源第一87.9 分88 分(最高)
网络安全白盒审查追平 Mythos 5Mythos 系同厂
开源两周后开源权重部分开源闭源 API闭源
价格输入 8 元 / 输出 28 元高峰 $1.32/$3.96最高
Token 效率31.5% / 5 万 tokenOpus 级 29.5%

一句话:要开源、要自托管、要编程性价比 → GLM-5.3;要生产环境 Agent 稳定 → DeepSeek V4 Pro;预算不敏感要闭源标杆 → Claude Fable 5。 GLM-5.3 和 Kimi K3 是同一赛道的直接对手,互有胜负,建议按你实际跑的基准自测。

FAQ

Q1:GLM-5.3 是开源的吗? 权重计划在发布两周后(约 8 月底)开放,先做安全加固。当前通过 GLM Coding Plan、ZCode 和第三方平台(PhanRouter、Trae 等)使用。

Q2:GLM-5.3 和 GLM-5.2 有什么区别? 基座相同(7430 亿参数),所有提升来自后训练。编程能力 +50%,Terminal-Bench 3.0 从 4.6 涨到 28.3,新增网络安全能力(CyberGym 开源第一)。

Q3:API 什么时候上线? 官方口径是”很快上线”。目前 bigmodel.cn 定价页已列出 GLM-5.3(输入 8 元 / 输出 28 元 / 1M 上下文),限时免费阶段可以先体验。

Q4:国内开发者可以直接用吗? 可以。智谱是国内公司(港交所 02513 上市),bigmodel.cn 开放平台直接注册使用,不需要额外的网络环境。

Q5:GLM Coding Plan 值得订阅吗? 如果你每天高强度用 AI 写代码,订阅制按 Token 扣积分比按次付费划算;轻度用户建议先等 API 上线按量付费,别急着锁订阅。

Q6:网络安全能力对普通开发者有什么用? 代码审查、漏洞发现这类”找茬”任务可以交给它——比人工翻代码快得多。日常开发用它做代码 review 也能覆盖一部分安全视角。

总结

GLM-5.3 是 2026 年 8 月国产模型混战里性价比很高的一张牌:不换基座纯靠后训练,编程能力冲上开源第一,还白捡一个网络安全技能树。两周后开源权重是最大的变量——到时候本地部署、微调、自托管全都解锁,价格敏感型团队值得等。

想第一时间体验 GLM-5.3 和国内大模型生态,稳定的网络环境是刚需。下面几家跨境网络加速服务可以按需选择:

推荐场景服务商特点
编程开发为主光速云IEPL专线 抗抖动,不限设备数,团队友好
性价比入门飞猫云IEPL 专线 + 住宅 IP,一鱼两吃
稳定专线SS-ID老牌专线,稳定性优先
长期包年MESL企业级线路,长期使用更划算

相关阅读:DeepSeek V4 Pro 正式版指南 2026Kimi K3 指南 2026Grok 4.6 发布评测DeepSeek Harness 上手指南