
AI音乐生成正在越过几十秒样片,开始处理一首歌从主歌到尾奏的完整结构。MiniMax近日公开MiniMax Music 3模型权重、推理代码和示例,允许开发者输入歌词与详细音乐描述,生成最长5分钟的完整歌曲。它的重点不是单个音色更亮,而是让主题、节奏、人声身份和编曲变化在长序列里尽量保持连贯。
Music 3采用分层自回归架构。8B全局语言模型逐帧预测第一组RVQ语义码,负责旋律主题、段落关系和长期推进;0.6B局部语言模型在每一帧内预测其余声学码本,补回人声发音、乐器质感和空间细节。全局模型由Qwen3-8B初始化,再与局部模型共同训练音乐码本。
这种分工针对的是音乐的两种时间尺度:一首歌要在几分钟后回到熟悉副歌,也要在几十毫秒内保住辅音、鼓点和泛音。单一序列模型同时承担两者容易顾此失彼;全局层先守住“歌往哪里走”,局部层再处理“这一瞬间听起来怎样”。
Music 3没有只把离散RVQ token交给声码器。系统融合全局与局部语言模型的最终隐藏状态,再送入24亿参数的Flow Matching模块,生成Flow-VAE潜变量,最后由1.23亿参数解码器还原波形。官方认为连续表示能保留更多发音、乐器纹理和时间连续性信息。
用户控制分成两类输入。歌词可加入Intro、Verse、Chorus、Bridge和Outro等段落标签;音乐描述则可写流派、BPM、调性、情绪推进、听感场景、人声质地、伴唱、乐器分配与混音特征。与只给一句风格提示相比,结构化描述更接近制作人给编曲团队的任务单。
对开发者,模型已接入SGLang-Omni的共享语音接口,也提供Diffusers模块化管线。服务请求把歌词放进input、音乐描述放进instructions,并以25个音频帧每秒计算生成上限。官方还给出可复现脚本和参考WAV,便于先确认环境与输出链路。
Music 3目前要求CUDA,只支持非流式生成。官方Diffusers示例称全精度可放进24GB级显存;自动CPU卸载约占22GB显存,进一步逐层流入语言模型可压到8GB显卡,但速度会更慢。文字提示最多5000 token,音频最多9000个声学帧,长歌曲仍会带来明显等待和存储开销。
段落标签、速度、调性、配器和歌词都是生成式约束,不是MIDI或乐谱那样的硬规则。官方明确提醒,输出不一定逐项匹配请求。当前材料也没有第三方盲听、歌词准确率或长程一致性的量化对比,因此“5分钟”说明可生成的长度,不等于五分钟内每一处都稳定可控。
许可证同样需要单独评估。MiniMax-Music3社区许可证允许使用、修改和分发软件及权重,但商业产品界面需显著显示模型名称;相关产品与服务年收入超过2000万美元时,还需事先取得书面授权。向第三方提供生成服务的团队,也要建立防止侵权和滥用的保障措施。
可下载权重的意义,是开发者能够把音乐模型嵌入本地素材管理、游戏配乐、广告草稿或个性化创作流程,检查推理成本并做针对性评估。结构化提示、可复现脚本和标准WAV输出,也让它比只提供网页按钮的产品更容易进入工程系统。
ATYUN认为,Music 3最值得关注的是把“完整歌曲”拆成可解释的全局结构、局部声学和连续合成三层,并把权重与推理路径一并交给开发者。它距离稳定制作工具仍有控制精度、推理速度、授权和版权治理四道关卡;真正的竞争将发生在谁能让生成结果可编辑、可复现、可合规地进入后续制作,而不只是谁的一段试听最惊艳。
