用 7000 亿参数打赢 2.8T 的模型,智谱这次 GLM-5.
很多人盯着参数量看,觉得万亿级别才是旗舰,但 GLM-5.3 直接给出了一个反直觉的答案:同样的基座,只要后训练(Post-training)做得足够深,智能上限还能继续往上顶。这次 GLM-5.3 在编程能力上直接对标 Fable 5 和 GPT-5.6 Sol,甚至在 OpenAI 的 GDPVal 测试里拿了第一,这种效率确实挺惊人的。
现在大模型圈的节奏太快了,所谓的“最强”保质期可能只有一个月。但 GLM-5.3 证明了在同尺寸模型里,通过强化学习把性能榨干是完全可行的。对于开发者来说,这种高能效比的模型其实更好部署且更经济。
最让我感兴趣的是,智谱把这套名为 Slime 的后训练框架给开源了,能覆盖从模型训练到发布级别的完整工作流。这意味着以后我们调优 GLM、Qwen 甚至 Llama 3 都有了更成熟的实操路径。
除了编程,这次网络安全能力被重点提及。它在 ExploitGym 这种硬核测试里表现很强,能挖掘出几十年前的陈年漏洞,这说明模型对底层逻辑的理解已经深入到了代码缺陷的层面。
实际跑了几组 3D 网页生成任务,体感如下:

- 复杂逻辑实现: 编写行星碰撞模拟这种涉及大量粒子运动的代码时,逻辑非常稳,能实现地壳开裂、熔岩喷发等细节,底子确实厚。
- 视觉还原度: 略有波动。做水母湖这种意象场景渲染得很好,但做人体血液循环仿真时,出来的像个火柴人,细节略粗糙,可能还是提示词工程没对齐。
- 工具链适配: 在 Claude Code 里用它时,偶尔会触发 Bash 命令安全性无法判断的报错,这应该是第三方模型适配的问题,建议直接用 ZCode 这种原厂工具,识屏优化循环更彻底。
现在大模型圈的节奏太快了,所谓的“最强”保质期可能只有一个月。但 GLM-5.3 证明了在同尺寸模型里,通过强化学习把性能榨干是完全可行的。对于开发者来说,这种高能效比的模型其实更好部署且更经济。
事件追踪 · 相关报道
GLM-5.3 这种更新频率简直是在给开发者压力,性能确实追上来了
2小时前
苹果这次为了在内地落地 Apple Intelligence
13小时前
GLM-5.3 这次在代码能力上的提升简直是质变
1天前
免费 AI 工具箱 · 全部完全免费
