MiniMax 推出的音乐生成模型。用歌词+文字描述就能生成长达五分钟完整歌曲的 AI,输出的是高保真立体声 WAV。
MiniMax 推出的音乐生成模型,能直接做出最长五分钟的完整歌曲。你给歌词和一段风格描述,它就能输出带人声、有编曲起伏的立体声 WAV 文件,采样率 32kHz。
Github地址
https://github.com/MiniMax-AI/MiniMax-Music3
功能特性
- 长时连贯:原生支持五分钟全曲,前奏、主歌、副歌、桥段、尾奏这些结构都能自己走通,不会中途散掉或重复鬼畜。
- 输入简单:歌词里可以插段落标签,比如 [Verse]、[Chorus]、[Bridge] 这些;风格描述写清楚情绪、乐器、速度就行。想更精细的话,它自带一个
music-caption-rewriter技能,能把你的大白话扩展成带”全局元数据+人声细节+编曲安排”的结构化提示。 - 声音质量:不是简单拼接采样,而是用 8B 全局模型管整体结构、0.6B 局部模型补声学细节,再通过 Flow Matching 和 Flow-VAE 合成最终音频,人声咬字和乐器质感都在线。
- 输出规格:32kHz、16bit 立体声 WAV,直接能用。
怎么用
模型权重放 Hugging Face 上,用 hf download MiniMaxAI/MiniMax-Music3 拉下来。推理目前走 SGLang-Omni,命令是 sgl-omni serve --model-path MiniMaxAI/MiniMax-Music3 --port 8000。注意要两张 CUDA 显卡:GPU 0 跑语言模型和自回归生成,GPU 1 跑 Flow Matching 和解码。
调接口时走标准的 speech API,歌词塞 input 字段,风格描述塞 instructions,格式选 wav。官方给的 curl 示例里,歌词带段落标签,描述写”A warm acoustic pop song with intimate female vocals…”这种就行,seed 固定可复现。
硬限制
- 必须双卡,单卡跑不动。
- 不支持流式输出,得等整首生成完。
- 文本提示上限 5000 tokens,音频最长 9000 帧。
- 段落标签和风格描述是”引导”不是”死命令”,生成的速度、调性、配器不一定 100% 对上你写的每个字。
本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来自 马斯克的赛博空间!
评论



