
一句话把这件事说清楚:智谱昨天开源了一款新模型GLM-5.3-Flash,性能跟Claude Opus 4.8打个平手,但价格只有它的四十分之一,用的还是国产芯片跑的服务。
先看性能到底行不行。
在Artificial Analysis的评测里,GLM-5.3-Flash拿到57分,和Claude Opus 4.8一模一样。编程能力也在同一档位。这还不是重点——它综合表现超过了参数量更大的前代GLM-5.2,属于“小个子打赢大块头”。发布之前,这个模型用了匿名身份“Ox-Alpha”提前在公开测试里亮相,直接把OpenCode和OpenRouter两个平台的调用榜单给登顶了。用匿名号测试再揭晓身份,这招还挺有戏剧性。
再说价格,这才是真正炸裂的地方。
GLM-5.3-Flash的定价是同期GLM-5.3的十分之一,赶上限时折扣能低到二十分之一。折算下来,相当于Opus 4.8的四十分之一。一个零头的价钱,给你同样的智商,这在之前的开源模型里没见过。
性能好又便宜,怎么做到的?两个技术点很关键。
一个是混合架构。它把稀疏注意力和线性注意力拼在一起用,这是开源前沿模型里第一次有人这么干。效果很直接:注意力计算量比前代降了3.01倍,KV缓存缩小了4.44倍。这套组合拳的好处是,长文档处理能力没掉队,但推理成本显著降下来了。
另一个是原生视觉能力。GLM-5.3-Flash不需要额外插件,直接就能“看”屏幕内容。比如让它开发前端页面,它能自己截屏检查效果,发现不对就修改;做3D建模、写文档也一样。金融研报、法律文书这类专业场景,它表现尤其突出。
还有个容易被忽略但很重要的信息:这个模型的全部流量都由国产芯片集群承载。团队自己写了推理引擎,加上EPD分离架构和一系列内存优化,端到端推理性能提升了3倍,硬件使用效率已经能比肩英伟达主流GPU。这等于是在说,用国产算力跑前沿大模型,这条路真的能走通,不再只是纸面推演。
目前GLM-5.3-Flash已经全面开源,API和在线体验同步开放,还上线了ZCode、AutoClaw等智能体平台。开发者现在就可以去拿。智谱还给每天准备了万张体验卡,白嫖党可以先去试试手。
行业观察来看,这个定价策略不是一个单纯的“便宜货”,更像是给闭源头部模型的一次战术测试。当开源模型的性能差距缩小到可以忽略、价格差距却拉到40倍的时候,大家就要重新算账了——自己训练部署合不合算,或者直接调API是不是更香。微软和OpenAI的算力军备竞赛暂时还看不到尽头,但应用层的定价风向,已经开始变了。