AI推理提速3.18倍,Liquid AI开源“先打草稿再交卷”新技术

作者: 智享AI发布日期: 2026/8/23阅读时间: 5分钟
AI推理提速3.18倍,Liquid AI开源“先打草稿再交卷”新技术 封面图

大模型跑起来有多慢,用过的人都知道。等它一个字一个字往外蹦,急得人想替它打字。现在Liquid AI和Hugging Face联手放了个大招:三款名为DSpark的草稿模型正式开源,推理速度最高能飙到原来的3.18倍,而且输出质量一个字都不带差的。

这三款模型分别叫LFM2.5-1.2B-Instruct、LFM2.5-2.6B和LFM2.5-8B-A1B,尺寸从轻量到中端全覆盖。它们的杀器是一套叫“投机解码”的路径——简单说,就是AI回答前先让一个轻量级“草稿员”快速写一版候选答案,再由“主审官”模型一次性检查验收。主模型只需要把权重从内存读一遍,就能同时验证几十个候选token,省掉了反复读数据的笨功夫。

打个比方:以前是个每题都自己从头算的考生,现在先让助手写满草稿纸,自己只负责最后对答案,效率自然翻着倍往上涨。

实际测试数据相当亮眼。GPU上跑,整体吞吐量最高提升3.18倍;在手机、笔记本这类端侧设备上,最高也能拉到2.87倍。特别值得一提的是智能体(Agent)场景——LFM2.5-2.6B的函数调用延迟平均降了57%。拿M4 Max版MacBook Pro当测试平台时,输出速度最高冲到每秒139个token,本地跑AI智能体应用已经不比云端专有模型差了,门槛一下子低了不少。

DSpark的设计思路也有讲究。它用一个并行主干网络统一生成草稿token的隐藏状态,再通过一个“马尔可夫头”给相邻token之间加上依赖关系,让候选序列更像真货。最妙的是那个置信度调度验证器——它会预测每个token的存活概率,发现验证成本要超过节省的成本时,直接剪掉低置信度的尾巴,绝不浪费算力。

训练数据用的是SFT、聊天、代码和函数调用混合的大规模数据集。经过层层消融实验,最终拍板的版本是纯注意力架构,5层、9个块,参数量控制在3亿上下。小小个子,干大活。

有人会问:速度快了,质量还能保证?这就是投机解码的巧妙之处了——草稿token只有在和目标模型分布完全一致时才会被接收,一旦对不上,目标模型当场用自己的token替换。因此输出结果和原来逐字生成的结构一模一样,基准测试准确率零损失。提速,但不降智。

这活儿干得很漂亮。发布当天,DSpark就兼容了SGLang和llama.cpp两大主流推理框架,Safetensors和GGUF格式的权重文件也都挂在了Hugging Face上,开发者拿来就能用,从云端大集群到随身设备,想部署哪就部署哪。

这次发布给行业提了个醒:AI竞赛的下半场,拼的不只是模型聪不聪明,还有跑得快不快、省不省。Liquid AI这波操作,等于给整个开源社区递了一把钥匙——让大模型在普通设备上也能流畅跑起来,离“人人都能用上AI”这个目标,又近了一步。

aidesigntechupdateproduct
精选评论
评论加载中…
发表讨论 »