
输入一段歌词,再补一句“想要什么风格”,AI就能给你一首完整的歌——前奏、主歌、副歌、桥段、间奏、尾奏,全都有。这不是预告,是MiniMax今天已经上线的产品:Music3音乐生成模型。
先说最直观的突破:它能一口气生成最长5分钟的完整歌曲,输出的是32kHz、16-bit立体声WAV文件。比起过去那种只能生成十几秒、几十秒片段的工具,这次是量级上的变化——不是“一段旋律”,而是一首完整作品。
怎么做到的?核心是一套“分工协作”的双模型架构。
一个8B参数的全局语言模型当“总导演”,负责整首歌的骨架:主题怎么推进、段落怎么切换、情绪怎么起伏。它逐帧预测第一个声学码本,把歌曲的长程结构定下来。有趣的是,这个“总导演”是从阿里的Qwen3-8B初始化来的,训练时先让嵌入层和输出层适应音乐语义词元,再和局部模型联合精调。
另一个是0.6B参数的局部模型,干的是细活儿:补全每一帧剩下的声学码本,把鼓点、音色、混响这些血肉一点点填回去。
一个大模型管结构,一个小模型补细节——这套思路不算新鲜,但用在音乐生成上,效果是关键。官方说,模型能在长音频里稳稳守住主题、节奏、人声身份和编曲的推进,不会唱着唱着跑偏或变形。
目前官方已经在Hugging Face放出了模型页面,还有生成示例可以直接试听,搜MiniMax-Music3就能找到。
从Suno到Udio,再到今天的MiniMax-Music3,AI音乐生成正在从“demo级”走向“成品级”。当一首歌的结构、情绪、音色都能被模型稳稳掌控时,真正的分水岭也许不是“能不能生成”,而是“值不值得发”。至少从今天起,写歌这个词,含义又变了一点。
精选评论
评论加载中…