千问新模型上线,1块钱就能跑100万Token?训练成本还降了9倍

作者: 智享AI发布日期: 2026/8/27阅读时间: 4分钟
千问新模型上线,1块钱就能跑100万Token?训练成本还降了9倍 封面图

今天,阿里千问又上新了,一口气亮出两款模型:一款是多模态MoE模型Qwen3.8-Flash,另一款是全新架构Qwen3.8-Flash-Next,后者是下一代Qwen4的雏形,权重已开源。

先看参数。Qwen3.8-Flash总参数125B,但别被这个数字吓到——它每处理一个token只激活6B参数。什么意思?相当于一个125人的大公司,但每笔业务只让6个人干活,效率自然高。

更狠的是价格。API定价输入只要每百万Tokens 1块钱,输出3块钱。这么算下来,1块钱就能让模型读完100万token的文本,大概是好几部《三体》的量,这在行业里属于"白菜价"级别。

模型原生支持26万token上下文,通过YaRN技术还能扩展到100万token,别说短篇小说了,长篇小说都能一口气读完。

成本优势同样明显。千问团队透露,Qwen3.8-Flash的训练开销只有前代Qwen3.7-Plus的九分之一,同样的预算,别人训练一次,他们能训练九次,这账怎么算都划算。

架构上,这次四个核心升级都打在性能上。注意力模块换成GDN+QSA混合结构,GDN负责压缩历史信息像记性好的学霸,QSA筛选关键上下文像精准划重点的考前突击生,百万token场景下,Prefill和Decode速度最高分别提速7.6倍和4.9倍。

Gated Residual机制把残差流扩成4条并行分支,靠动态门控优化跨层信息传递,训练起来更稳。N-gram Embedding相当于给模型配了本快速查字典,新增51B参数却几乎不增加计算负担,这波操作挺精明。

训练环节改用Muon与AdamW混合优化策略,重新拟合Scaling Law,直接砍掉了批次预热流程,难怪训练成本能降这么多。

测下来成绩也不含糊。基础模型靠6B激活参数,在14项评测里拿了8项第一。微调版本在SWE-bench Pro上拿下62.5分,CoWorkBench、Toolathlon等智能体榜单上直接甩开同类模型一截。

千问团队提前开源这套架构,思路很明确:先让社区帮着验证创新方案,加速迭代,稳步把Qwen4打磨出来。目前权重已经在Hugging Face和ModelScope上线,技术报告也同步公开,感兴趣的开发者现在就能上手玩。

大模型赛道向来拼的是参数大、数据多,但千问这波动作透露出一个新信号:在算力成本节节攀升的当下,既要跑得快,更得省着烧。轻量化、高性价比,才是让AI真正用得起的路。

aitechtoolinnovation
精选评论
评论加载中…
发表讨论 »