时效性提示:GLM-5.3 于 2026-08-14 正式发布。本文基于官方文档 + 发布会报道整理,引用的 benchmark 数据为智谱官方口径,引用前请复核。

发布概况

2026 年 8 月 14 日,智谱 AI 正式发布新一代旗舰基座模型 GLM-5.3

  • 核心卖点:编程能力最强的开源模型,编程体感较前代提升 50%,编程与智能体能力接近 Claude Fable 5
  • 关键事实:与 GLM-5.2 使用完全相同的基座(总参数约 7430 亿),性能提升全部来自极致的后训练 Scaling
  • 即日上线智谱官方编程工具 ZCode、效率工具 AutoClaw,及 GLM Coding Plan 全量用户
    请添加图片描述

核心技术

参数规格

项目 规格
总参数 约 7430 亿(与 GLM-5.2 相同基座)
输入模态 文本
输出模态 文本
上下文窗口 1M(100 万 token)
最大输出 Tokens 128K
支持能力 思考模式 / 流式输出 / Function Calling / 上下文缓存 / 结构化输出(JSON) / MCP

后训练 Scaling(本轮最大看点)

GLM-5.3 证明:不改基座,靠后训练硬拉性能

  • 训练基于 IndexShare、SAO 及新一代 Slime 框架,在与 GLM-5.2 完全相同的基座上推进强化学习
  • 数十倍规模的长程任务环境、更丰富多样的环境类型、超长的后训练周期
  • 训练不再局限于孤立编程题,而是扩展至"发现问题 → 分析方案 → 实施 → 验证 → 交付"完整流程
  • 部分训练任务工作量相当于资深工程师连续数天的工作,模型需使用真实的计算集群、存储系统、内部文档与代码库完成任务
  • 智谱称基座的智能上限"远未开发完全"

基准成绩

编程与智能体能力(较前代提升 50%)

基准 GLM-5.2 GLM-5.3 说明
Terminal-Bench 3.0 4.6 28.3 开源第一
DeepSWE v1.1 46.2 66.9 长程软件工程,开源第一
Agents’ Last Exam (CLI) 23.8 28.5 开源第一
GDPval-AA v2 1769 覆盖 44 种职业

请添加图片描述

  • 编程与智能体能力接近 Claude Fable 5,实际编程体感领先其他国产模型
  • Kimi K3 在编程/智能体领域互有胜负
  • 在绝大多数基准上领先 DeepSeek-V4-Pro-0813

Token 效率(Z.ai Code Bench)

请添加图片描述

  • 智谱自研 Z.ai Code Bench 的 High 档位准确率 31.4%,超过 Claude Opus 4.8 最高档位的 29.5%
  • 每项任务平均输出约 5 万 tokens,远低于 Opus 4.8 的约 12 万 tokens
  • 能以更短执行路径完成任务 → 更快、更省

网络安全能力(后训练"涌现")

基准 GLM-5.2 GLM-5.3 对比
CyberGym 77.2% 84.5% 高于 Mythos 5 (83.8%) / GPT-5.6 Sol (83.6%)
ExploitBench 24.4% 54.4% 涨幅超一倍
  • 在白盒代码审查、漏洞发现与验证任务中表现接近 Mythos 5
  • 已与国内安全团队合作:在 269 个项目中识别 2436 个漏洞(中高危 1097 个),覆盖系统内核、操作系统、浏览器引擎等领域
  • 智谱自述:当前优势集中在漏洞利用链前端,更深入的漏洞利用与完整攻防仍有提升空间

实测能力

  • 复杂项目交付:能接住数万行代码、上百个文件、多个相互依赖系统的长期工程目标,极少人工干预下自主开发、反复验证到可交付状态
  • 实测案例:从 0 到 1 开发 3D 开放世界驾驶游戏;"裸考"读懂超 7000 个文件的代码仓库

产品落地

  • ZCode(官方编程工具)、AutoClaw(效率工具)即日上线
  • GLM Coding Plan 全量用户可用(发布当天重置额度)
  • 第三方平台抢先体验:Trae / 扣子(Coze) / WorkBuddy / CodeBuddy / Qoder / CatPaw / JoyCode / OpenCode 等
  • 同步推出"开源的盾"计划:为核心开源项目提供免费持续安全审计,代码审计能力集成进 ZCode

请添加图片描述

评价与展望

  • 行业意义:证明后训练 Scaling 的巨大潜力——同基座、性能跃迁,为"基座不变、后训练迭代"路线背书
  • 开源地位:多项主流基准开源第一,整体逼近海外顶尖闭源模型(Fable 5 / Mythos 5)
  • 待验证:benchmark 为智谱官方口径,需第三方复测
  • 落地看点:编程 + 安全双能力走强,配合 Coding Plan 商业化,是"开源模型 + 编程入口"打法

参考来源

  • 智谱官方文档:docs.bigmodel.cn GLM-5.3 模型页
  • IT 之家 / 澎湃 / 中国站长网 / 品玩 / 网易 发布会报道
Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐