
英伟达刚刚开源了一款新模型Audex,它能同时搞定听懂声音和保持逻辑思维——这个平衡点很多同行至今没做到。过去许多多模态模型像个“偏科生”:为了让耳朵更灵敏,脑子反而变笨了——增强音频理解后,文本推理能力直线下降。Audex的设计思路是直接换条路:基于纯文本的混合专家模型(MoE)架构,用单一Transformer解码器把音频量化成类似文本的token,一起处理。这样一来,音频输入能顺滑嵌入现有的语言模型系统,不用额外搞复杂对接。训练规模也不小:团队喂了1574亿音频token和3205亿文本token,经过多阶段监督训练、强化学习,以及知识蒸馏,最终Audex在语音识别、翻译、音频生成等任务上达到行业一流水准,更重要的是,它的推理、知识储备和长文本处理能力几乎没丢,性能衰退微乎其微。作为一款开源模型,Audex不再只是论文里的演示,而是可以直接评估、部署的工具。对需要处理复杂音频交互的产品开发者来说,这提供了一种平衡性能与功能的新选择,也给未来的多模态智能体铺了条更实用的路。
精选评论
评论加载中…