project
GLM-5.3 - 智谱最新开源的基座大模型,编程能力提升50%
GLM-5.3 是智谱最新开源的基座大模型,与 GLM-5.2 基座相同,通过极致的后训练 Scaling 大幅提升智能上限。GLM-5.3 是当前编程能力最强的开源模型
GLM-5.3是什么
GLM-5.3 是智谱最新开源的基座大模型,与 GLM-5.2 基座相同,通过极致的后训练 Scaling 大幅提升智能上限。GLM-5.3 是当前编程能力最强的开源模型,在 Terminal Bench、DeepSWE 等多项基准测试中排名第一;同时涌现出强大的网络安全能力,在白盒代码审查与漏洞发现方面持平 Mythos 5。智谱将两周内开源模型权重,并启动”开源的盾”计划,推动安全防御能力成为全球开发者的公共品。
GLM-5.3的主要功能
- 编程开发:GLM-5.3 是当前开源模型中编程能力最强的,能处理复杂软件工程、终端操作、长程代码修改以及端到端的开发任务执行。在真实开发环境中,能像工程师一样完成从需求分析到代码实现、测试验证的完整流程。
- 智能体任务:支持跨工具协作和长程任务规划与执行,覆盖 44 种职业场景下的高价值知识工作,在 Agents’ Last Exam 等基准测试中表现突出。
- 网络安全防御:具备白盒代码审查、漏洞发现与验证、漏洞利用分析等能力,在 CyberGym、ExploitBench 等安全基准测试中达到顶尖水平,可用于安全审计和 CTF 解题。
- 代码审计:已集成到智谱官方编程工具 ZCode 中,能在日常研发流程中自动进行安全检查,帮助开发者在编码阶段就发现潜在风险。
- 多平台接入:支持 TraeWork、扣子、WorkBuddy、Qoder、CatPaw 等主流编码平台,开发者可在多种开发环境中调用 GLM-5.3 的能力。
GLM-5.3的技术原理
- 后训练 Scaling:GLM-5.3 与 GLM-5.2 共享完全相同的基座模型,性能跃升完全来自极致的后训练 Scaling,通过将训练环境规模扩大数十倍、引入更丰富多样的任务类型,并投入超长的后训练时间,基于 IndexShare、SAO 及新一代 Slime 强化学习框架,在不变更基座的前提下高效推进模型能力边界。
- 涌现能力机制:模型训练环境从传统的”完成编程题”扩展为接近真实专家工作的完整流程,任务工作量可达工程师连续数天的规模,模型需在真实计算集群、存储系统、代码库和实验结果中端到端执行,学会从发现问题、分析推理、实施验证到独立完成工作的闭环能力。
- 分层风险审查系统:GLM-5.3 采用纵深防御原则构建了横跨 API 到模型内部的三层审查架构,外层轻量分类器拦截大规模滥用请求,推理监控器在模型运行中实时审查任务意图,深度安全对齐则让模型从根本上自主识别并拒绝攻击性请求,形成多层冗余、相互独立的鲁棒防护体系。
- 智能审查方法:审查系统以”意图”而非”关键词”为核心区分攻击与防御任务,通过差分数据合成和对抗性训练应对越狱变体与伪装手段,同时对网络安全任务按风险等级分类(如安全知识问答、蓝队防御、CTF、漏洞挖掘、渗透测试、真实入侵等),分别构造阶梯型风险实例,确保精准拦截高风险请求而不误杀合法低风险的常规任务。
- 安全评估体系:智谱联合国内顶级安全团队开展持续红队测试与自动化攻击越狱评估,用新产生的越狱样本不断迭代加固审查系统,在开源前邀请 DARKNAVY 等专业团队对模型风险任务能力进行独立评估,确保防护与能力释放之间取得良好平衡。
如何使用GLM-5.3
- ZCode(编程工具):智谱官方推出的 AI 编程工具,已集成 GLM-5.3,支持代码生成、审查和端到端开发任务。
- AutoClaw(效率工具):智谱官方效率工具,已接入 GLM-5.3,可用于日常办公和自动化任务。
- GLM Coding Plan:智谱官方编程订阅计划,已面向全量用户开放。
GLM-5.3的核心优势
- 编程能力:GLM-5.3 是当前开源模型中编程能力最强的,在 Terminal Bench、DeepSWE 等多项基准测试中排名第一,且 Token 利用效率显著优于同类闭源模型。
- 网络安全防御:通过后训练涌现出强大的白盒代码审查与漏洞发现能力,在 CyberGym 等安全基准中持平 Mythos 5,并已在真实环境中协助发现数千个高危漏洞。
- 后训练 Scaling:与 GLM-5.2 共享相同基座,仅通过数十倍扩展训练环境、丰富任务类型和超长后训练时间,即实现能力跃升,证明基座智能上界远未被充分开发。
- Token 效率:在真实编程场景中,GLM-5.3 以约 5 万 tokens 达到 31.4% 的准确率,超过 Claude Opus 4.8 用 12 万 tokens 实现的 29.5%,执行路径更短、成本更低。
- 开源安全民主化:坚持开源模型权重并启动”开源的盾”计划,将前沿安全防御能力从少数闭源机构的特权转变为全球开发者和开源社区可平等获取的公共品。
- 分层风险审查:采用外层分类器、推理监控器和深度安全对齐的三层纵深防御架构,以意图而非关键词为核心精准拦截高风险攻击请求,同时保障蓝队防御、CTF 教学等合法安全任务不受影响。
GLM-5.3的同类竞品对比
| 对比维度 | GLM-5.3 | Kimi K3 |
|---|---|---|
| 开发方 | 智谱(Z.ai) | 月之暗面(Moonshot AI) |
| 开源性 | 两周后开源完整权重 | 开源 |
| 编程能力(Terminal Bench 3.0) | 28.3 | 17.4 |
| 编程能力(DeepSWE) | 66.9 | 67.5(略高) |
| 编程能力(Agents’ Last Exam) | 28.5 | 27.6 |
| 网络安全(CyberGym) | 84.5% | 80.0% |
| 网络安全(ExploitBench) | 54.4% | 32.2% |
| 网络安全(ExploitGym 6小时任务数) | 130 | 70 |
GLM-5.3的应用场景
- AI 辅助编程与复杂软件开发:开发者通过 ZCode 或第三方编码平台调用 GLM-5.3,完成从需求分析、代码生成、长程修改到测试验证的端到端软件工程任务,特别适合大型项目迭代和终端环境操作。
- 企业代码安全审计与漏洞防御:安全团队用 GLM-5.3 的白盒代码审查能力,对自有代码库、开源依赖组件进行自动化漏洞扫描和风险评估,在攻击者利用前提前发现并修复隐患。
- 开源项目持续安全维护:“通过”开源的盾”计划,开源项目维护者可申请免费模型额度,对重点开源项目进行持续安全审计,帮助社区免费发现和修复多年未察觉的底层风险。
- 安全研究与人才培养:高校和培训机构使用 GLM-5.3 开展 CTF 教学、蓝队防御演练和安全知识问答,模型在拦截真实攻击任务的同时,支持低风险的实验性和教学性安全任务。
- 关键基础设施与协议安全:安全实验室借助 GLM-5.3 分析操作系统内核、浏览器引擎、DNS 协议、通信软件等底层基础设施,发现潜伏数十年的协议级或架构级漏洞,防止大规模系统性风险。