只输第一名0.6分,价格却是它的十四分之一:DeepSeek V4 Pro这波不亏

作者: 智享AI发布日期: 2026/8/14阅读时间: 4分钟
只输第一名0.6分,价格却是它的十四分之一:DeepSeek V4 Pro这波不亏 封面图

一份面向国内开发者的编程测评榜单,刚刚给出了一个挺有意思的结果:DeepSeek-V4-Pro-0813拿了第二名,分数51.52,离第一名的Kimi K3差了不到10分,但单题调用成本只要1.42元,大概是Kimi K3的十四分之一,GLM-5.2的十六分之一。

这份榜单叫SuperCLUE-Terminal,由CLUE团队发布,专门测大模型在真实终端场景里干活的能力。跟那种拿公开题库刷分不一样,它用的是本土真实编程任务,所有模型都在同一个框架Claude Code里跑,比的不是谁背题背得熟,而是面对一个实际需求时,能不能听懂中文指令、把任务拆开、调对工具、出了bug自己修。

据官方说明,每道题需要模型完成50到110轮交互,单题跑完要花半小时到一个半小时。换句话说,不是几秒出答案的那种选择题,而是得沉下心来干一个下午活的完整开发场景。

本轮榜单的头部梯队里,Kimi K3以60.61分登顶,DeepSeek-V4-Pro-0813以51.52分紧随其后,GLM-5.2拿下48.48分,老版DeepSeek-V4-Flash则是46.46分。如果只看分数,DeepSeek这版属于“咬住第一梯队”的位置,离冠军还有差距,但没被甩开。

真正拉开差距的,是那个1.42元的单题成本。它用比对手便宜一个数量级的价格,跑出了第二名的成绩。对中小团队和独立开发者来说,这个信号比谁拿了第一更值得注意:你不需要为“接近顶级”的能力付顶级的钱。

实测场景也看得出这模型的落地能力。题里有前端页面、3D游戏、工程脚本修改这类日常需求。比如做一个小游戏,碰撞检测、计分逻辑、结算流程都能完整跑通,页面配色和交互反馈也不像以前那些AI生成物——那种一眼看上去就是“模板味”的紫蓝渐变,这次干净多了。当然,在个别创意绘图类题目上,它还是会出一些结构上的小毛病,但整体完成度已经站在领先位置。

说到底,这份榜传递的信息挺清楚:当第二名的成本只有第一名的十四分之一,AI编程的门槛就不再是“你用不用得起”,而是“你用不用”。对预算敏感的开发者来说,这大概比多考几分更有意义。

aitechtoolupdate
精选评论
评论加载中…
发表讨论 »