
8月14日,智谱扔出了一枚新模型GLM-5.3。但耐人寻味的是,它和上一代GLM-5.2用的是同一套底子,参数量还是7400多亿——传说中升级到万亿参数的那张牌,智谱没有打,大概率留给了后面的GLM-5.5。
参数没变,本事却大了。智谱靠的是“后训练”这一招,硬是把GLM-5.3的性能比前一代拉升了50%。在多项主流基准测试里,它直接冲到了开源模型的头名,尤其在编程和智能体(也就是AI干活)这块,表现已经贴近Claude Fable5,实际用起来的手感,比目前其他国产模型都顺。
几个分数的跨度和数字很能说明问题。在Terminal-Bench3.0这个考验模型在真实终端环境里完成复杂任务的测试中,它的得分从4.6直接蹦到28.3,涨了6倍。在DeepSWE v1.1这个考察长程软件工程能力的测试里,从46.2涨到66.9。在覆盖真实多场景、强调跨工具协作的长程任务测试Agents' Last Exam中,也从23.8提升到28.5。而在覆盖44种职业的GDPval-AA v2测试里,GLM-5.3拿到了1769分,这个分数说明它基于编程能力,已经涌现出了专业任务上的执行力。
最能直观反映“好用”的,是智谱自家的Z.ai Code Bench。这个评测把模型真的塞进本地开发环境里,在不同思考档位下跑端到端任务,还原的就是程序员用Coding Agent(写代码的AI助手)的真实手感。结果显示,GLM-5.3在效果和成本之间找到了很好的平衡点:在High档位下准确率达到31.4%,超过了Claude Opus4.8最高档位的29.5%。更狠的是,GLM-5.3每个任务平均只输出大约5万tokens,Opus4.8要用掉12万tokens——翻译成大白话就是:同样的活儿,GLM-5.3走的路更短,跑得还更快。
产品落地也没含糊。GLM-5.3从发布之日起就上线了智谱自家的编程工具ZCode和效率工具AutoClaw,开放给GLM Coding Plan全量用户和订阅用户。TraeWork、TraeCode、扣子、WorkBuddy、CodeBuddy、Qoder、QwenWork、CatPaw、JoyCode、OpenCode等第三方编码平台也都开启了抢先体验。API马上就来,完整模型权重会在两周内完成安全加固后开源——智谱的意思是,既要限制模型的攻击潜力,又要保住它的防御价值。今天下午13:00,GLM Coding Plan全员额度已经重置,用户后台可以看到用量满血恢复。
从这次发布的节奏看,智谱在走一条务实路线——不追参数上的面子工程,而是靠训练技巧把现有模型的潜力挖干榨净。当别人还在堆GPU换万亿参数时,它用一个“没涨参数”的版本,靠实打实的性能提升和更低的token消耗,在应用落地这条赛道上抢出了身位。未来几个月,开源模型的竞争或许不再只看“谁家底子厚”,更要看“谁家把饭做得香”。