
写歌词给AI,它就能给你整出一首5分钟的歌,前奏副歌间奏尾奏一个不少,这活儿现在真成了。
MiniMax今天发布了新一代音乐生成模型MiniMax-Music3,你把歌词填好、再写上几句想要的风格描述,剩下的全交给它。一分钟的短片段早就过时了,这次一口气能生成最长5分钟的完整歌曲,音质也上了档次——32kHz采样率、16-bit立体声WAV文件,拿专业播放器听也不露怯。
能撑起这个时长还不出戏,靠的是一套“两人分工”的架构。
简单说,这模型内部有两个角色,一个管大局,一个抠细节。管大局的叫Global LLM,8B参数,相当于整首歌的“总导演”——先看整体结构,弄明白哪里是前奏、哪里该进副歌、什么时候情绪该往上推。有意思的是,这个“总导演”是从阿里的Qwen3-8B文本模型“改行”过来的,训练时先让它的输入输出层学会理解音乐语义,再和下面的“细节执行者”配合干活。
抠细节的叫Local LLM,参数只有0.6B,负责把每一帧的声音信息填满,嗓音质感、配器层次、鼓点亮度,都是它一笔一笔描出来的。一个管骨架,一个填血肉,俩模型上下对接,才保证了你听到的不只是一段旋律堆砌,而是一首有呼吸感、有推进结构的歌。
官方特别提到,长音频里最容易翻车的三个事——音乐主题跑偏、节奏松散、人声和编曲“各唱各的”——Music3都能稳住。歌唱者的身份感从头到尾保持一致,编曲也在按情绪逻辑往前走,不会出现副歌突然像换了首歌的情况。
现在模型页面已经挂在Hugging Face上,官方放了几首生成的示例,想看看AI写歌现在到了什么段位,点进去试听一下最直白。
音乐生成卷到今天,拼的不再是“能不能出歌”,而是“能不能出一首能从头听到尾的歌”。MiniMax这张牌打出来之后,压力给到了同赛道的其他玩家。
精选评论
评论加载中…