GLM-5.3 实测 - 编程、网络安全与 3D 创作能力全面解析
这两天的大模型圈,简直是神仙打架。 xAI 发布 Grok 4.6,智能指数直接追平 GPT-5.6 Sol,价格还一分没涨;DeepSeek-V4-Pro 正式版上线,在 Terminal Bench ...
这两天的大模型圈,简直是神仙打架。
xAI 发布 Grok 4.6,智能指数直接追平 GPT-5.6 Sol,价格还一分没涨;DeepSeek-V4-Pro 正式版上线,在 Terminal Bench 得分 87.9,比 Claude Fable 5 仅低 0.1 分。
昨天,智谱 GLM-5.3 压轴登场了,先看测评数据,9 个权威榜单 GLM-5.3 的表现都很亮眼,编程体验较 GLM-5.2 提升了 50%,复杂软件工程、长程任务和 Agent 能力进一步提升,直接杀进了由 Fable 5 和 GPT-5.6 Sol 统治的第一梯队。
那个熟悉的开源一哥、国模一哥,重回巅峰了。
重点是,GLM-5.3 基座还是那台 743B 的 GLM-5.2,没改架构、没重新预训练,全部提升全靠后训练硬堆出来的。
性能更强、消耗却更低了
Z.ai Code Bench 测评显示,Max 满血档的 GLM-5.3 拿到 34.5%,平均只烧了约 75K 输出 Token;GLM-5.2 要烧 96K 才拿 23.4%,Claude Opus 4.8 烧 120K 拿 29.5%。
不过跑分归跑分,实际体验如何,咱们还是得自己上手感受一下。
目前,GLM-5.3 已上线智谱官方编程工具 ZCode、效率工具 AutoClaw,上线 GLM Coding Plan 全量用户及开放订阅。
API 很快也会上线,完整模型权重将在两周内开源,
我们打开 ZCode,模型选择 GLM-5.3,模式切换为完全访问。
一句话捏出一架大疆 Mavic 3 Pro
我们输入一句简单的提示词感受一下:
使用 Three.js 创建大疆 Mavic 3 Pro 无人机的 3D 模型。
不到 2 分钟,GLM-5.3 就输出了结果,效率相当高:
细节把控也不错,GLM-5.3 用 LatheGeometry 车出流线型机身,连云台减震板、前置避障摄像头都清晰可见,连哈苏镜头标志性的金圈都做出来了。
我们可以手动调节螺旋桨转速,调节画面大小、旋转视角,功能全面且流畅,这个完成度没话说。
复刻绿金迪手表
我上传了一张劳力士绿金迪的参考图,让 GLM-5.3 进行 3D 还原。
我们输入提示词之后,GLM-5.3 只用了十几分钟就做出来了。
我们一起看看生成的效果:
功能逻辑没啥问题,但是手表的屏幕有点出戏,像悬浮在空中的隐形眼镜。表带衔接也有点小问题。
我们让 ZCode 继续优化一下,ZCode 很快就定位并修复了问题。
打开页面,表针指向和我系统时间一致,可以手动调整指针,还支持变换视角、拆解视图。
3D 微缩城市天气
我尝试让 GLM-5.3 生成上海的微缩城市天气系统:
天气渲染效果非常准确,闪电、阳光、能见度随天气实时切换。
而且真的可以查询每小时的天气情况:
不过城市建模方面,还没有上海的标志特色,我们上传一张上海的实拍图优化时,GLM-5.3 能迅速在原有建模中精准补全地标建筑。
如果说编程是 GLM-5.3 的基本功,那网络安全能力就是 GLM-5.3 捅破天花板的独门秘籍。
智谱这次把海量的漏洞发现数据喂进了模型,结果产生了惊人的能力涌现:
- CyberGym 评分 84.5,登顶开源 SOTA;
- ExploitBench 54.4,比前代翻了一倍多。
在实战中,GLM-5.3 配合国内安全团队扫描真实代码库,累计挖出了 2436 个漏洞,横跨 269 个开源项目。
最玄幻的是,其中一个高危漏洞写于 1981 年,藏了 45 年没人发现,被 AI 给揪出来了。
这意味着,GLM-5.3 已经具备了超越普通安全专家、进行深层代码审计的神觉。
GLM 就像一个带着成熟方案进场、甚至能反向审计安全漏洞的全栈合伙人。
从灵感到成品的过程,正在被快速缩减,生产力门槛被抹平。
有想法的个人创作者,一个人就能拥有团队的开发效率。
大模型的战场已经从卷参数转向了卷交付。智谱通过极致的后训练证明,即使不堆架构、不改基座,靠工程化对齐也能实现智能的暴力拉升。
GLM-5.3 把做产品的起跑线,直接划在了工业级的水准之上。
闭源模型虽然在高墙内保持着先发优势,但以 GLM 为代表的开源势力正在以更快的节奏填平代差,让最前沿的技术从少数巨头的私人围城,变成了全行业共享的生产力基座。
国产开源模型能够正面硬刚硅谷顶流,让每一个人都能站在巨人的肩膀上,去定义属于自己的产品起跑线。