
大模型跑起来总是慢半拍?Liquid AI和Hugging Face刚刚发布了LFM2.5系列三款新模型的DSpark草稿版,GPU端吞吐量最高飙升3.18倍,端侧设备也能提速2.87倍。别以为“草稿”意味着将就,实测输出质量和原版模型完全一致,一个字的毛病都不带差的。
说实话,做大模型的公司不少,但肯在“加速”上做文章的,Liquid AI算一个。他们这次推出的是1.2B、2.6B和8B-A1B三款模型的“草稿检查点”——听着像草稿,实际是专门用来加速的白牌选手。原理用大白话讲:大模型回答问题时分两步走,先由一个小号的“草稿模型”先快速写一版答案,再由原模型大佬过目审批,认可的放行,不认可的当场纠正。这就好比你派实习生先写好初稿,自己只需扫一眼改几处,时间省下大半。
最让我惊艳的一组数据是:在M4 Max MacBook Pro上,本地跑LFM2.5-2.6B,输出速度拉到了每秒139个token,什么概念?就是你打完一行字,它已经把一段话给你写完了。过去本地跑智能体Agent又慢又卡,现在延迟平均降了57%,苹果笔记本上跑AI应用,居然能比部分云服务还丝滑。这等于你在家就能开个AI工作室,不用再眼巴巴等着云端排队。
DSpark的技术底子值得多说一嘴。传统模型卡在哪?大多数时间都耗在从内存里搬权重——权重加载慢,自然跑不快。DSpark改了个思路:用并行主干网络一次性生成所有草稿token,又加了个“马尔可夫头”让每个token跟邻居紧密绑定,最后还有置信度调度器实时判断——这一批token到底值不值得让目标模型验证,不值得就直接砍掉。整个过程一气呵成,把内存搬运成本摊薄到最低。
这个初版草稿模型参数只有3亿上下,5层注意力网络,轻装上阵。训练数据混合了聊天、代码、函数调用等多种场景,明显奔着实用去。发布当天就齐活了SGLang和llama.cpp的适配,Safetensors和GGUF格式也挂上了Hugging Face,开发者在云端和手机笔电之间无缝切换。
坦白讲,模型参数越拼越大,但谁能把大模型跑得又快又稳,谁才真正掌握了落地密码。DSpark这套“草稿加速”的打法,开了个不错的头——不牺牲质量,只追求速度。以后端侧跑AI不再是梦,你手里的设备,或许就是下一台AI超算。