
英伟达昨天开源了一个新AI模型,写文本的速度比之前快了2.42倍,但内容质量几乎没打折——保留原版98.7%的水准。这个叫Nemotron-Labs-TwoTower的模型,最大的卖点就是解决了大模型“一个字一个字往外吐”的慢性子。
传统大模型生成句子,得一个token一个token挨个来,像打字机似的,慢得让人着急。英伟达这次的做法很聪明:把模型拆成两座30B参数的网络,一座负责“看大局”,记住整篇文章的语义;另一座专门“写内容”,并行生成多个token。两座塔通过交叉注意力互通数据,就像两个工人协同作业——一个盯着蓝图,一个同时铺砖,效率自然翻倍。
具体怎么做到的?总参数量60B,但每回只激活3B参数,再搭配128个可路由的“专家模块”,哪个任务该调谁就调谁。最关键的是,这次模型没有从头造轮子,而是基于已有的Nemotron骨干网络改造,复用预训练权重,省了一大笔训练成本。
测试跑了几十项任务,包括常识、数学、代码和阅读理解。除了代码和数学这类高精度任务稍微逊色一点,其他指标基本和原版持平。换句话说,你得到的是差不多的质量,但生成速度快了2.4倍。
现在权重已经在Huggingface上开源,用的是英伟达专属协议,开发者可以自由下载、测试甚至商用。不过注意,想跑双塔完整版,得两张H100或A100 80GB显卡才行——单卡只能跑纯自回归模式,要体验并行加速就得双卡联手。
这个方向对行业挺有启发:大模型越来越大的同时,怎么让推理不拖后腿?双塔架构给出了一个答案——把任务拆开,让“懂全局”的塔固定不变,“写内容”的塔专门加速。虽然目前还需要高端显卡,但趋势已经很明显:未来AI生成文本,会越来越像在纸上画草图,而不是拿刻刀一个字一个字刻。
精选评论
评论加载中…