MiniMax 推出的音乐生成模型,能直接做出最长五分钟的完整歌曲。你给歌词和一段风格描述,它就能输出带人声、有编曲起伏的立体声 WAV 文件,采样率 32kHz。

Github地址

https://github.com/MiniMax-AI/MiniMax-Music3

功能特性

  • 长时连贯:原生支持五分钟全曲,前奏、主歌、副歌、桥段、尾奏这些结构都能自己走通,不会中途散掉或重复鬼畜。
  • 输入简单:歌词里可以插段落标签,比如 [Verse]、[Chorus]、[Bridge] 这些;风格描述写清楚情绪、乐器、速度就行。想更精细的话,它自带一个 music-caption-rewriter 技能,能把你的大白话扩展成带”全局元数据+人声细节+编曲安排”的结构化提示。
  • 声音质量:不是简单拼接采样,而是用 8B 全局模型管整体结构、0.6B 局部模型补声学细节,再通过 Flow Matching 和 Flow-VAE 合成最终音频,人声咬字和乐器质感都在线。
  • 输出规格:32kHz、16bit 立体声 WAV,直接能用。

怎么用

模型权重放 Hugging Face 上,用 hf download MiniMaxAI/MiniMax-Music3 拉下来。推理目前走 SGLang-Omni,命令是 sgl-omni serve --model-path MiniMaxAI/MiniMax-Music3 --port 8000。注意要两张 CUDA 显卡:GPU 0 跑语言模型和自回归生成,GPU 1 跑 Flow Matching 和解码。

调接口时走标准的 speech API,歌词塞 input 字段,风格描述塞 instructions,格式选 wav。官方给的 curl 示例里,歌词带段落标签,描述写”A warm acoustic pop song with intimate female vocals…”这种就行,seed 固定可复现。

硬限制

  • 必须双卡,单卡跑不动。
  • 不支持流式输出,得等整首生成完。
  • 文本提示上限 5000 tokens,音频最长 9000 帧。
  • 段落标签和风格描述是”引导”不是”死命令”,生成的速度、调性、配器不一定 100% 对上你写的每个字。