
英伟达昨天甩出一个新武器:把一个大语言模型拆成两个大脑,一个盯着全文意思,一个快速写文字,文本生成速度直接飙到原来的2.42倍,而且输出质量只降了1.3%。
这个叫Nemotron-Labs-TwoTower的模型,总共有600亿参数,但被拆成两座300亿参数的独立网络。一座叫“上下文塔”,全程不动,负责记住整篇文章的语义脉络;另一座叫“去噪塔”,专门接受训练,靠扩散机制一次性并行写出多个词。两座塔之间通过交叉注意力不停交换信息,就像两个默契的搭档:一个翻着剧本,一个飞快抄写,同时出手,效率翻倍。
过去的大模型生成文本,得像打字员一个字一个字往外蹦,串行输出慢得要命。现在双塔并行写入,推理吞吐量直接翻番。更爽的是,英伟达没从头训练这个模型——它直接拿现有的Nemotron骨干网改造,复用预训练权重。相当于给一辆老跑车换了双涡轮增压引擎,省了重新造车的钱和功夫。
基准测试数据显示,这个新模型在常识、数学、代码、阅读理解等任务上的综合能力,保留了原版的98.7%。只有代码和数学类任务稍微打了个小折扣,但文本生成速度硬生生提升2.42倍。对于做自动客服、报告生成、内容批量的公司来说,这简直是“速度和质量我全都要”的福音。
英伟达已经把这个模型的开源权重挂到了Huggingface上,开发者可以免费下载、测试甚至商业部署。不过有个门槛:要跑满双塔模式,得配两张H100或A100 80GB显卡才行。单卡只能走传统的自回归老路,双卡协同才能实现2.42倍的加速。
这次开源,等于把“快且好”的选择直接摆到了开发者面前。以往为了速度牺牲质量,或者为了质量牺牲速度,都是常态。现在有了这位“双脑工人”,或许能改写游戏规则。接下来就看谁能先把它用进真实产品了。
精选评论
评论加载中…