5分钟完整歌曲,MiniMax Music 3开放权重与推理代码

2026年08月14日 由 ATYUN编辑部 发表 1167 0
空置录音棚内摆放人声麦克风、乐器、调音台与贯穿房间的长卷谱带
从歌词、编曲到完整歌曲合成的录音棚概念图。

AI音乐生成正在越过几十秒样片,开始处理一首歌从主歌到尾奏的完整结构。MiniMax近日公开MiniMax Music 3模型权重、推理代码和示例,允许开发者输入歌词与详细音乐描述,生成最长5分钟的完整歌曲。它的重点不是单个音色更亮,而是让主题、节奏、人声身份和编曲变化在长序列里尽量保持连贯。

8B管结构,0.6B补细节,长歌被拆成两层问题

看点一:模型原生支持最长5分钟歌曲,输出32kHz、16位立体声WAV。
看点二:8B全局语言模型负责长程结构,0.6B局部语言模型负责帧内声学信息。
看点三:权重采用MiniMax社区许可证,商业使用有署名与规模条件,并非无条件宽松许可。

Music 3采用分层自回归架构。8B全局语言模型逐帧预测第一组RVQ语义码,负责旋律主题、段落关系和长期推进;0.6B局部语言模型在每一帧内预测其余声学码本,补回人声发音、乐器质感和空间细节。全局模型由Qwen3-8B初始化,再与局部模型共同训练音乐码本。

这种分工针对的是音乐的两种时间尺度:一首歌要在几分钟后回到熟悉副歌,也要在几十毫秒内保住辅音、鼓点和泛音。单一序列模型同时承担两者容易顾此失彼;全局层先守住“歌往哪里走”,局部层再处理“这一瞬间听起来怎样”。

不只解码离散token,连续隐藏状态也进入音频合成

Music 3没有只把离散RVQ token交给声码器。系统融合全局与局部语言模型的最终隐藏状态,再送入24亿参数的Flow Matching模块,生成Flow-VAE潜变量,最后由1.23亿参数解码器还原波形。官方认为连续表示能保留更多发音、乐器纹理和时间连续性信息。

用户控制分成两类输入。歌词可加入Intro、Verse、Chorus、Bridge和Outro等段落标签;音乐描述则可写流派、BPM、调性、情绪推进、听感场景、人声质地、伴唱、乐器分配与混音特征。与只给一句风格提示相比,结构化描述更接近制作人给编曲团队的任务单。

对开发者,模型已接入SGLang-Omni的共享语音接口,也提供Diffusers模块化管线。服务请求把歌词放进input、音乐描述放进instructions,并以25个音频帧每秒计算生成上限。官方还给出可复现脚本和参考WAV,便于先确认环境与输出链路。

能下载不等于部署轻,控制也不是乐谱级承诺

Music 3目前要求CUDA,只支持非流式生成。官方Diffusers示例称全精度可放进24GB级显存;自动CPU卸载约占22GB显存,进一步逐层流入语言模型可压到8GB显卡,但速度会更慢。文字提示最多5000 token,音频最多9000个声学帧,长歌曲仍会带来明显等待和存储开销。

段落标签、速度、调性、配器和歌词都是生成式约束,不是MIDI或乐谱那样的硬规则。官方明确提醒,输出不一定逐项匹配请求。当前材料也没有第三方盲听、歌词准确率或长程一致性的量化对比,因此“5分钟”说明可生成的长度,不等于五分钟内每一处都稳定可控。

许可证同样需要单独评估。MiniMax-Music3社区许可证允许使用、修改和分发软件及权重,但商业产品界面需显著显示模型名称;相关产品与服务年收入超过2000万美元时,还需事先取得书面授权。向第三方提供生成服务的团队,也要建立防止侵权和滥用的保障措施。

开放权重把竞争推向工作流,而不只是试听样片

可下载权重的意义,是开发者能够把音乐模型嵌入本地素材管理、游戏配乐、广告草稿或个性化创作流程,检查推理成本并做针对性评估。结构化提示、可复现脚本和标准WAV输出,也让它比只提供网页按钮的产品更容易进入工程系统。

ATYUN认为,Music 3最值得关注的是把“完整歌曲”拆成可解释的全局结构、局部声学和连续合成三层,并把权重与推理路径一并交给开发者。它距离稳定制作工具仍有控制精度、推理速度、授权和版权治理四道关卡;真正的竞争将发生在谁能让生成结果可编辑、可复现、可合规地进入后续制作,而不只是谁的一段试听最惊艳。

文章来源:AI Agent
欢迎关注ATYUN官方公众号
商务合作及内容投稿请联系邮箱:bd@atyun.com
评论 登录
热门职位
Maluuba
20000~40000/月
Cisco
25000~30000/月 深圳市
PilotAILabs
30000~60000/年 深圳市
写评论取消
回复取消