MiniMax Music 3 开源:可生成最长 5 分钟完整歌曲,本地部署支持 SGLang-Omni 与 Diffusers
摘要
MiniMax 在 Hugging Face 开放 MiniMax Music 3,可依据歌词与音乐描述生成最长约 5 分钟完整歌曲。模型采用 Global/Local LLM、RVQ 与 Flow VAE 架构,并提供 SGLang Omni、Diffusers 等本地推理方式。
本文目录
MiniMax Music 3开源:从歌词与音乐描述生成最长5分钟完整歌曲
MiniMax在 Hugging Face发布了 MiniMax Music 3,这是一个面向完整歌曲生成的文本到音乐模型。它不是只生成几秒钟的音乐片段,而是把歌词和较详细的音乐描述作为条件,直接生成最长约5分钟的完整歌曲,并重点处理长时结构、演唱一致性、编曲推进和音频质量等问题。对于希望在本地搭建 AI音乐生成服务、研究音乐生成架构,或把音乐能力接入现有应用的开发者来说,这次开放模型权重和推理方式尤其值得关注。

它能生成什么
MiniMax Music 3的输出是32 kHz、16-bit立体声 WAV。官方模型卡介绍,它能够在较长序列中维持音乐主题、节奏、歌手音色与编曲变化,因此可以生成包含 Intro、Verse、Pre-Chorus、Chorus、Bridge、Instrumental、Solo和 Outro等段落的完整歌曲结构。
模型接受两类主要输入。第一类是歌词,歌词中可以直接加入 `[Verse]`、`[Chorus]`、`[Bridge]` 等结构标签;第二类是音乐描述,用于控制曲风、情绪变化、演唱方式、乐器、编曲和制作风格。官方进一步建议把描述组织成 Global Metadata、Vocal Details和 Arrangement三部分,从全局曲风、BPM、调性一路细化到人声、和声、乐器与段落级编排。
核心架构:Global LLM与 Local LLM分工
MiniMax Music 3采用分层自回归架构,把长距离音乐结构与局部声学细节拆开处理。8B参数的 Global LLM负责逐帧预测第一层 RVQ codebook,主要建模歌曲的语义、主题和长期结构;0.6B参数的 Local LLM则预测每一帧剩余的声学 codebook,用于补充更细的声音信息。官方说明 Global LLM由 Qwen3-8B初始化,随后针对音乐语义 token调整 embedding和输出层,再与 Local LLM联合训练。
训练阶段使用八层 Residual Vector Quantization。第一层语义 codebook包含16,384个条目,用来表达主要音乐语义与结构;其余七层声学 codebook各有1,024个条目,用来保存残余声学细节。
连续隐藏状态参与最终音频合成
这套模型并不只依赖离散 RVQ token解码音频。生成阶段会融合 Global LLM和 Local LLM的最终隐藏状态,再交给基于 Flow Matching与 Flow-VAE的连续合成模块。官方给出的组件规模包括2.4B的 Flow Matching模块和123M的 Flow-VAE Decoder。
这种设计的重点是保留离散 token之外更丰富的连续声学信息,用于改善人声发音、乐器纹理以及长时间音频的连续性。Flow-VAE架构来自 MiniMax Speech的相关设计,并针对音乐的动态范围与频谱特征重新训练。
下载与部署
模型可以直接通过 Hugging Face CLI下载:
hf download MiniMaxAI/MiniMax-Music3 --local-dir /path/to/minimax_ttm官方已经给出 SGLang-Omni支持,可以启动一个本地服务:
sgl-omni serve --model-path MiniMaxAI/MiniMax-Music3 --port 8000服务复用了 speech API。歌词放入 `input`,音乐描述放入 `instructions`,例如:
curl http://127.0.0.1:8000/v1/audio/speech \
-H 'Content-Type: application/json' \
-d '{
"model": "MiniMaxAI/MiniMax-Music3",
"input": "[Verse]\nMorning light filtering through the pine\n[Chorus]\nSoftly the world begins to breathe",
"instructions": "A warm acoustic pop song with intimate female vocals, fingerpicked guitar, soft piano, and a gradual emotional build into a wide final chorus.",
"response_format": "wav",
"seed": 7,
"max_new_tokens": 750,
"stream": false
}' \
--output minimax_music3.wav其中 `max_new_tokens` 控制最大音频帧数,官方说明帧率为每秒25帧;如果模型提前产生音频结束 token,实际生成长度也可能提前结束。
Diffusers也能运行,但显存要求不低
MiniMax Music 3同时提供 Diffusers modular pipeline。官方模型卡当前给出的示例适用于24GB以上显存的 GPU,并需要安装对应的 Diffusers版本。对于个人开发者而言,这意味着模型已经具备相对标准化的 Python推理入口,但本地运行仍然需要较强的 GPU环境。
除了 SGLang-Omni与 Diffusers,官方模型卡还列出了 ComfyUI相关入口。不同方式分别适合服务化部署、Python工作流以及节点式创作流程,开发者可以按自己的应用形态选择。
使用时需要注意的限制
MiniMax Music 3更适合被理解为完整的音乐生成模型,而不是轻量级桌面工具。它的架构同时包含 Global LLM、Local LLM、Flow Matching与 Flow-VAE等组件,本地推理对显存和运行环境有明显要求。官方 Diffusers示例直接以24GB+ VRAM为参考,这一点在准备本地部署前需要先确认。
另外,模型能否按照预期完成一首歌,很大程度上取决于歌词结构和音乐描述的质量。相比只写一句“生成一首流行歌”,把曲风、BPM、调性、情绪推进、人声特征、乐器和各段编排写清楚,更接近官方推荐的使用方式。
MiniMax Music 3的价值在于把长歌曲结构、可控歌词演唱和较完整的开源推理链路放到了一起。对音乐生成研究者,它提供了一个可以研究分层语言模型、RVQ与连续隐藏状态合成结合方式的实例;对开发者,则已经有 Hugging Face权重、SGLang-Omni服务接口和 Diffusers工作流可直接开始测试。