谷歌发布新模型,速度暴增4倍:不用再一个字一个字等了,还能填空解数独

作者: 智享AI发布日期: 2026/6/11阅读时间: 4分钟
谷歌发布新模型,速度暴增4倍:不用再一个字一个字等了,还能填空解数独 封面图

2026年6月10日,谷歌联合英伟达扔出一个“重磅炸弹”:开源模型DiffusionGemma。它完全颠覆了传统大模型一个字一个字往外蹦的写作方式,而是像AI绘画那样,从一团随机噪声里一步步“变”出完整的文本段落。测试显示,在单块英伟达H100显卡上,它每秒能吐出1000个标记——足足是同类老模型的近4倍。即使换成RTX 5090这样的消费级显卡,也能轻松跑出每秒700多个标记。

这到底是怎么做到的?以前的大模型生成文字,必须按顺序来:先猜第一个字,再猜第二个,只能往后看,不能回头改。DiffusionGemma却把图像AI领域流行的“扩散机制”移植了过来。简单说,它先随机产生一堆毫无意义的词块(好比一团模糊的色块),然后通过一次次迭代优化,让这些词块逐渐变得有意义、有逻辑。神奇的是,它一次能并行处理256个词块,所有词块之间可以互相“商量”、互相引用,而不是傻等前一个词决定之后才行动。

由于这个特性,DiffusionGemma在“填空”和“补全”类任务上表现惊人。比如代码里的空缺、文章中间被挖掉的一段、甚至数独游戏里的空格——它都能直接“看到”上下文,给出靠谱的答案。研究人员还拿它试了氨基酸序列预测,效果也不错。相比之下,传统模型只能强行往后推,遇到需要“回头”看的地方就抓瞎。

当然,有得必有失。DiffusionGemma拥有260亿参数,但每次推理只激活38亿(靠的是混合专家架构,MoE),算力消耗不大。不过在标准文本质量测试中,它写得不如同样谷歌出品的Gemma 4系列流畅、准确。谷歌自己也很坦诚:这不是用来取代Gemma 4的,而是一次“技术实验”。

目前,模型权重已按Apache 2.0协议在Hugging Face上完全开源,并且兼容vLLM、MLX等主流推理框架。这意味着任何开发者都能下载、运行,甚至改造它。英伟达的深度优化也让算力瓶颈不再是问题:过去GPU的内存带宽常常拖慢推理速度,现在由于扩散模型并行输出的特性,这个限制被大大缓解。

一句话总结:谷歌和英伟达联手打开了一扇新大门——未来AI写文章、补代码、解谜题,可能都不需要再按“顺序”办事了。这项技术如果继续迭代,或许将彻底改变我们对生成式AI的认知。

aitechupdate
精选评论
评论加载中…
发表讨论 »