刚刚,GLM-5.3来了,拿下多个开源SOTA,我用它“魔改”DeepSeek Harness
智东西8月14日报道,就在刚刚,智谱发布了其最新一代旗舰模型GLM-5.3,并宣布模型将在两周内开源。这是一个拥有7430亿个参数的模型,和此前的GLM模型一样主打编程。
在多项主流基准测试中,GLM-5.3位居所有已开源或即将开源模型中的第一;其在编程与智能体任务上的能力,已逼近Claude Fable 5、GPT-5.6 Sol等海外顶尖模型。
与国内模型相比,GLM-5.3与
同时,GLM-5.3还在能力和token效率之间取得了更好的平衡。在相同的高档位思考预算下,GLM-5.3的准确率达到31.5%,超过Claude Opus 4.8的29.5%,任务平均输出约5万个token,不到Opus 4.8平均输出量的一半。
智东西在发布前获得了GLM-5.3的内测资格,得以提前深度体验这款模型在真实开发场景中的完整能力。在我们的实测中,GLM-5.3+ZCode的组合不仅能从0到1开发一款以真实地图数据1:1复刻上海陆家嘴至外滩区域的3D开放世界驾驶游戏,还能“裸考”
除了编程能力之外,智谱称GLM-5.3在充分的预训练之后,还涌现出了不错的网络安全能力,在与国内高校、企业的合作中,GLM-5.3用两周时间揪出了2436个漏洞。在白盒代码审查与漏洞推理等安全任务中,GLM-5.3的表现与Claude Mythos 5接近。
目前,GLM-5.3已上线智谱的AI编程工具Zcode、效率工具AutoClaw,支持通过GLM Coding Plan使用。同时,这一模型还在TraeWork、
智谱称,GLM-5.3的API将很快上线。同时,在模型开源之前,GLM-5.3还将完成安全评估、安全加固,以限制其在网安领域的潜在攻击能力,保留其防御价值。
01 拿真实数据1:1复刻外滩建筑群,还做了个开放世界驾驶游戏
此次测试,我们用到了智谱最近更新的ZCode,搭配旗舰模型GLM-5.3。我们交给GLM-5.3的第一个任务是一份有难度的产品需求文档:以真实的OpenStreetMap数据为基础,开发一款上海陆家嘴至外滩区域的3D开放世界驾驶游戏。
文档中要求,地图解析、坐标转换和游戏逻辑等关键模块全部让模型“手写”,只允许使用Three.js的底层渲染能力。为了测试模型在长任务中的记忆可靠性,我们还在文档中部埋下了两条“陷阱条款”,包括凌晨两点到四点外滩建筑灯光熄灭一半,以及地图边缘需要设置带有提示的软性阻挡。
GLM-5.3拿到需求后先验证了数据的真实形态。它编写脚本从Overpass API拉取了8万多个OSM节点,先做了一轮数据勘查,确认地图数据的完整性后,才开始开发。
整个开发过程持续了多轮,最终交付了约4900行代码,覆盖数据管线、车辆物理、车辆音效、导航、昼夜循环和存档系统,两条埋雷条款在最终验收中全部通过。
开发过程中,可以观察到GLM-5.3排查问题的思路很清晰。测试早期,游戏页面完全卡死,它没有盲目改动代码,而是给本地服务器加了请求探针,通过面包屑日志定位到问题。
在精准定位后,GLM-5.3修复bug的效率得到了提升。比如,当我提出游戏相机视角存在问题,有时会穿过建筑时,GLM-5.3从这条模糊的描述出发,统计出全部6300多栋建筑中有大约4成的轮廓环绕方向与墙面法线约定相反,从而导致了上述问题,实际修复只改了几行代码。
因为测试环境无法直接目检画面,它甚至自己写了一个零依赖的PNG解码器,用像素统计来客观证明水面、标线和夜间灯光确实被正确渲染。
值得一提的是,搭配ZCode使用时,整个对话的平均缓存命中率达超过了99%,可以节省不少钱。
不过,在这一项目的开发过程中,我们也发现了GLM-5.3的一些短板。工程能力之外,它的审美判断还有提升空间,建筑贴图和道路标线的观感先后经过四轮人工反馈,还是没能达到预期,略显简陋。
总体来看,GLM-5.3搭配ZCode基本可以顺利完成用户交代的开发任务,但用户仍需要给模型提供一定的反馈,才能打磨出更好的交付物。
02 读懂超7000个文件,连夜打造DeepSeek Harness“人格插件”
如果说驾驶游戏考察的是GLM-5.3从零创造的交付能力,第二项实测考察的则是另一个方向:面对一个完全陌生的大型代码仓库,能否读懂它,再按它的规矩改造它。
我们的测试对象是
对GLM-5.3来说,这是一次“裸考”:
第一项任务是仓库级理解。我们向GLM-5.3询问,用户执行dsh web之后,从进程启动到第一条消息抵达模型,中间经过哪些模块,插件如何加载,出错时又如何兜底。
面对这种体量的代码仓库,GLM-5.3派出了4个并行探索子智能体,分别追查CLI入口、插件机制、模型契约与消息通路,再把四份结论汇成一份链路报告,并回头逐条核对关键代码。这些文件的跨度较大,而GLM-5.3成功地找到了它们之间的联系。
报告的关键结论有三条:插件的装配依据一份YAML清单逐行登记,不存在目录扫描式的自动发现;顺着这条线索,它锁定了LlmAdapter这份所有模型提供方共同遵守的契约;启动失败时的策略是快速失败,而非静默跳过。
在此基础上,我们进一步要求GLM-5.3为
这项任务的难点在于要做到“零侵入”:我们要求GLM-5.3开发的结果功能要生效,但框架的原有行为不能变,插件关闭要立刻复原。
GLM-5.3先派出2个探索子智能体并行通读仓库,约5分钟后各自提交报告,研究页面交互方案时又派出第3个,3个子智能体合计消耗约690万token。规范摸清后,它选定系统提示注册表作为注入口:指令随系统层下发,用户消息没有改动;插件卸载后注册表自行摘除。
下方是GLM-5.3最终交付的插件效果。可以看到这个插件的交互体验是比较原生的,可以与
再来看看具体的执行过程。初版交付涉及20个文件、净增560行,除代码外还包含双语文档配对记录与重新生成的依赖图。同时,配套的11条单元测试一次通过,覆盖开启注入、关闭复原与三人格路由等功能。
不过,在跑全量回归的时候出现了一段插曲:771个测试文件中有6个失败。为排查问题,GLM-5.3先将自己的改动整体撤下,在干净基线上重跑同一批用例,失败原样复现。据此,它确认问题源于本机环境,与新增代码无关。
在解决环境问题后,应我们要求,GLM-5.3复用了
从结果看,GLM-5.3在本轮实测中的长板是任务拆解、跨包溯源与代码引用,以及对陌生工程规范的理解和遵循,对照实验的处置方式也比较严谨。
不过,体验时我们也发现,ZCode在一些长任务执行期间存在反馈不足,我们一度以为进程中断,人工打断了执行。同时,对于一些风险很低的修改,GLM-5.3也会跑完整的检查与测试,这在有些场景下可能会带来不必要的token消耗。
DSH“人格插件”开源地址:
https://github.com/chenjunda0018-sketch/A-persona-plugin-for-
03 能力提升来自后训练Scaling,网安能力涌现
智谱在GLM-5.3博客中,详细介绍了这款模型在技术方面的思考。
GLM-5.3的基座模型与GLM-5.2完全一致,其能力提升主要来自于后训练的Scaling。GLM-5.3在后训练过程中经历了更长的任务环境,更丰富的环境类型,后训练时间也明显加长。
随着任务环境的不断丰富,智谱还观察到GLM-5.3涌现出超预期的网络安全能力。
例如,在白盒源代码安全基准测试CyberGym中,GLM-5.3得分为84.5%,超过GLM-5.2(77.2%)、Claude Mythos 5(83.8%)、GPT-5.6 Sol(83.6%)。在更接近完整漏洞利用的ExploitGym测试中,2小时内,Mythos 5完成了181个任务,GLM-5.3完成105个任务,达到Mythos 5约58%的水平,相比GLM-5.2的29项提升明显。
GLM-5.3发布前两周,智谱联合清华大学、南开大学,以及云起无垠、绿盟科技、赛博昆仑、DARKNAVY、华顺信安、奇安信、腾讯玄武、云鼎实验室等多家安全团队,开展了密集的红队测试与安全评估。
相关测试最终在2周内累计发现漏洞2436个(经过初筛、去重),其中1097个为中高危,最早可追溯至约45年前,代表性漏洞覆盖系统内核、操作系统、浏览器引擎、开源基础组件、互联网应用与互联网协议等269个项目,相关漏洞均已报送国家CNNVD/CNVD国家漏洞库,为提高披露过程的透明度,智谱建立了Z.ai安全披露账本,记录漏洞从发现、确认到修复的全过程。
执行效率方面,智谱自GLM-5.2开始引入effort level(思考档位)控制。智谱称,在相近Token预算下,GLM-5.3在任务完成质量、执行速度和使用成本之间取得了更好的平衡。
04 结语:智谱、DeepSeek等纷纷重押后训练,不换基座也能换代
从我们的实测来看,GLM-5.3已经能在真实工程现场交出完整的交付物;而审美判断等短板,或许可以成为下一轮后训练继续打磨的方向。
后训练这条路线近期的受益者不止智谱一家:
本文来自微信公众号 “智东西”(ID:zhidxcom),作者:陈骏达,36氪经授权发布。















