从0到第一首 AI 歌:ComfyUI + MiniMax Music 3 完全上手
COMFYUI 新手实战 · 音频篇
不需要懂乐理,不需要会编曲,甚至不需要看得懂代码。这篇文章带你用 ComfyUI 和 MiniMax Music 3,从打开软件开始,做出一首有前奏、有主歌、有副歌、有尾奏的完整歌曲——最长可以到五分钟。全程可复制粘贴,跟着做就能出声。
- ⏱ 阅读约 20 分钟
- 🎯 面向零基础
- 🎵 案例:MiniMax Music 3
- 💻 实测环境:RTX 4070 Laptop 8GB / 16GB 内存
开篇:你能做出什么
先给你一个具体的目标感。读完这篇教程并动手做一遍,你会得到这样一首歌:
- 完整结构:前奏 → 主歌 → 预副歌 → 副歌 → 桥段 → 尾奏,一段不缺,而不是十秒钟的循环片段。
- 有人声:能唱出来的歌词,带旋律、气口和情绪,不是纯伴奏。
- 编曲会推进:主歌安静、副歌进鼓、桥段留白——乐器是随时间变化的,不是从头到尾一个样。
- 成品直接能听:32 kHz / 16-bit 立体声,ComfyUI 直接帮你存成 MP3,拖进播放器就响。
✓ 这不是纸上谈兵
本教程的案例步骤已在 RTX 4070 Laptop(8GB 显存)+ 16GB 内存 的普通笔记本上实测跑通,累计产出过二十余首完整歌曲。文末会专门告诉你 8GB 显存该怎么调参才不崩。
最关键的是:你不需要买任何Token,MiniMax Music 3 是开源模型,ComfyUI 是免费开源的,全部在你自己电脑上跑,完全本地部署
1. 先搞懂:ComfyUI 到底是什么
1.1 它不是一个”按钮软件”
很多人第一次打开 ComfyUI 会懵:满屏的方块和连线,像电路板。这很正常——因为 ComfyUI 的本质是让你亲手搭一条流水线。
打个比方:
🍱 一键式工具(比如各类在线生成器) 像去餐厅点菜:你说”来首抒情歌”,厨房做好端上来。方便,但你控制不了盐放多少、火候几分。
🧩 ComfyUI 像自己进厨房:食材(模型)、步骤(节点)、顺序(连线)全部摆在你面前,你想改哪一步就改哪一步。
ComfyUI 的画面由三类东西组成:
| 元素 | 是什么 | 你要对它做什么 |
|---|---|---|
| 节点(Node) | 一个个彩色方块,每个负责一件事(加载模型、写提示词、采样、保存文件) | 看懂它是干什么的,需要时改它里面的参数 |
| 连线(Link) | 方块之间的线,表示”数据从哪流到哪” | 一般不用动;线断了才需要接回去 |
| 工作流(Workflow) | 整套节点+连线,就是一条完整的生产流程 | 可以直接用官方现成的模板,不用从零画 |
1.2 所以新手也能上手
看到这里你可能想:”我连节点都看不懂,怎么搭?”
答案是:你根本不需要自己搭。
ComfyUI 内置了官方模板库——各种常见任务(出图、出视频、出音乐)都有现成的、经过验证的工作流。你要做的只是:
- 打开模板库,找到对应的模板
- 按提示下载模型(模板会告诉你缺什么,甚至能一键下)
- 改几个文本框(填你的想法、歌词)
- 按运行,等它出成品
本教程的案例(MiniMax Music 3)就有现成模板。所以你今天要掌握的核心技能其实是 「怎么填好那两个文本框」**——也就是怎么写描述和歌词。这才是决定成品好坏的关键,也是本文最核心的部分。
💡 记住这个心法
用 ComfyUI 不需要会”编程”,需要的是理解每一步在做什么。掌握了这个,你换任何一个模型(画图、做视频)都能快速上手——因为套路是通用的
注意事项
2. 环境准备
2.1 安装 Comfy Desktop
去
下载 Comfy Desktop,一路下一步装完即可。
✓ 为什么推荐 Desktop 版
装 Desktop 会自动把 Python、ComfyUI 本体、依赖环境全部配好,你不需要单独装 Python 或捣鼓命令行。Desktop 是个”多实例管理器”,里面跑的才是 ComfyUI 引擎。
硬件要求(官方):
| 项目 | 最低 | 推荐 |
|---|---|---|
| 系统 | Windows 10+ / macOS 13+ | Windows 11 |
| 内存 | 8 GB | 16 GB 起步(跑音乐/视频时内存比显存更容易成为瓶颈) |
| 显存 | 有 N 卡即可 | 8GB 够跑本教程全部内容 |
| 硬盘 | 每个实例 5 GB | 留 50GB+ 放模型(MiniMax 三件套约 15GB) |
2.2 准备模型三件套
MiniMax Music 3 在 ComfyUI 里由三个文件组成,缺一不可。官方把它们打包放在 Hugging Face 的
仓库。
1 | 📂 ComfyUI/ |
两个 diffusion model 该下哪个?
| 文件 | 适合谁 | 特点 |
|---|---|---|
| …dit_fp16 | 显存 ≥12GB | 质量最好,速度最快,但最吃显存 |
| …dit_int8_convrot | 显存 8GB(本教程实测环境) | 量化压缩过,显存占用明显降低,音质损失很小 |
⚠ 实测提醒
如果你的卡是 8GB 显存,强烈建议下载 int8 那个版本。本文实测机器装的是 fp16 版,靠第 6 章的 tiled_decode 分块解码才稳住——如果你还没下,直接下 int8 会省心得多。
文件放哪里?
如果你用的是 Comfy Desktop,模型通常放在共享目录(所有实例共用,避免重复下载):
1 | Windows: %LOCALAPPDATA%\Comfy-Desktop\ComfyUI-Shared\models\ |
放进对应子目录后,回到 ComfyUI 界面按 R 键刷新,模型名才会出现在下拉列表里。
✓ 更省事的办法
其实你不用手动下模型。直接去模板库加载 MiniMax Music 3 工作流,界面会自动检测到缺模型,并给出一键下载。手动下载只是给你一个备选方案。
3. 认识今天的主角:MiniMax Music 3
3.1 它能做什么
MiniMax Music 3 是 MiniMax(稀宇科技)开源的音乐生成模型。它的定位很明确:生成一首完整的歌,而不是一段循环。
| 能力 | 具体表现 |
|---|---|
| 完整歌曲 | 最长 5 分钟(300 秒),可包含前奏、主歌、预副歌、副歌、桥段、器乐间奏、尾奏 |
| 双输入控制 | 你给「音乐描述」+「歌词」,它按你的要求作曲演唱 |
| 长程一致性 | 5 分钟的歌里,旋律主题、节奏、人声音色、编曲推进能保持连贯 |
| 表现力人声 | 自然的人声合成,可控制音色、唱法、和声层次 |
| 输出规格 | 32 kHz / 16-bit 立体声(ComfyUI 中保存为 MP3) |
它背后的架构(了解即可)
MiniMax Music 3 用的是”分层”设计,可以粗略理解为三个人分工:
- 8B 全局 LLM——负责”这首歌整体长什么样”:结构走向、情绪推进。它是从 Qwen3-8B 初始化来的,所以对中文文本的理解底子不错。
- 0.6B 局部 LLM——负责每一帧的声音细节:咬字、音色、质感。
- Flow Matching + Flow-VAE——把上面两位的”想法”真正合成成 32kHz 的音频波形。
3.2 诚实的边界(重要)
教程不说缺点就是耍流氓。以下是官方 README 明确写出的限制,以及实测的体验,请务必心里有数:
⚠ 四条必须知道的实话
- 段落标签不是”命令”。官方原话是:段落标签和描述提供的是生成性控制,而非严格的符号保证。也就是说,你写了 [Chorus],它大概率会给你一个副歌,但速度、调性、具体乐器不保证每次都严格照办。
- 中文演唱需要实测。模型对中文文本的理解有底子(Qwen3 血统),但官方公开的 26 首演示曲全部是英文西方曲风(流行、摇滚、R&B、嘻哈、乡村、灵魂、放克、布鲁斯、波萨诺瓦、都市)。中文人声的实际表现建议你自己试一首再判断,别指望一发入魂。
- 文本有长度上限:提示词最多 5000 tokens;音频最多 9000 声学帧(对应约 5 分钟)。别写长篇大论。
- 它不是”编曲软件”。想要精确到”第 17 秒进鼓”这种级别的控制,它做不到。它的强项是给你一个有模有样的完整成品。
接受这些边界后,我们开始动手——这才是真正有意思的部分。
4. 实战:做出你的第一首歌
4.1 第一步:加载官方模板
- 确保 ComfyUI 是最新版。模板库随版本更新,版本太旧会找不到模板或报节点缺失。
- 打开模板库:菜单栏 → 工作流 → 浏览模板(Templates)。
- 找到音频分类 → 选择 MiniMax Music 3 Text to Music。
- 按弹窗提示下载模型。模板会检测你缺哪些文件,跟着点就行。
- 加载成功后,画布上会出现一条现成的工作流。
💡 如果提示”节点缺失”
两个常见原因:① 你的 ComfyUI 不是最新版 → 去更新;② 启动时有些节点导入失败 → 查看启动日志。更新后重启一般都能解决。
示例:
4.2 第二步:认识这条工作流
官方模板加载出来后,整条流水线其实只有四个环节,非常好懂:
1 | 文本编码器(读你的描述和歌词) |
你要操作的,只有最前面那两个文本框和中间那几个参数。后面的节点基本不用碰。
4.3 第三步:写 Caption(音乐描述)——决定”好不好听”
这是整篇教程最重要的一节。Caption 就是告诉模型”这首歌应该是什么样”。
官方强烈建议用结构化三段式来写,即把描述拆成三块:
| 段落 | 写什么 | 举例 |
|---|---|---|
| Global Metadata(全局元数据) | 流派、BPM、调性、音阶、情绪推进、聆听场景、制作风格 | Mandopop ballad, 72 BPM, F major… |
| Vocal Details(人声细节) | 人声性别、音色、演唱风格、和声、人声效果 | female, soft and breathy, subtle vibrato… |
| Arrangement(编曲) | 主/次乐器、律动、低音、打击乐、织体、空间效果 | solo piano, brushed drums entering at chorus… |
✓ 官方原话
「描述越具体,结果越接近预期」。而且结构化描述能让模型不仅遵循整体风格,还会跟随歌曲随时间的推进——这才是它能做出”完整歌”的关键。
可直接复制的模板(中文抒情流行)
Caption —— 复制粘贴即可用,按需改括号里的内容
1 | [Global Metadata] |
⚠ 写描述的两个坑
- 别写成长篇故事。官方建议”简短具体的提示词比冗长的故事效果更好”。用关键词短语,别写”在一个雨夜,她想起了…”这种散文。
- 别把歌词写进 Caption。歌词有专门的输入框。Caption 只管”音乐长什么样”,歌词管”唱什么词”。
4.4 第四步:写 Lyrics(歌词)——决定”歌在唱什么”
歌词用段落标签来控制歌曲结构。可用的标签有:
[Intro] · [Verse] · [Pre-Chorus] · [Chorus] · [Post-Chorus] · [Bridge] · [Instrumental] · [Solo] · [Outro]
⚠ 最关键的一条规则
标签是唯一的结构指令;歌词文本本身只传达情绪,不传达结构。
换句话说:你写 [Chorus],模型就知道”这里是副歌,该上强度了”;但你在歌词里写”这里是副歌”,模型看不懂。结构只能靠标签。
可直接复制的模板(中文歌词)
Lyrics —— 复制粘贴即可用
1 | [Intro] |
✓ 歌词写法要点
- 副歌要重复出现——这是”歌”和”片段”最大的区别。同一个 [Chorus] 块多放几次,模型会把它当成真正的副歌来对待。
- 括号里可以写演奏提示,比如 (钢琴轻起)、(器乐留白),模型会当作氛围参考。
- 想要纯音乐:歌词框留空或只放 [Instrumental],就得到无人声的伴奏。
4.5 第五步:调参数与运行
工作流上只有三个参数需要你操心:
| 参数 | 作用 | 怎么设 |
|---|---|---|
| max_duration | 目标歌曲时长(秒) | 模板默认 60 秒;模型上限约 300 秒(5 分钟)。歌越长,耗时和显存占用越多 |
| seed | 随机种子 | 固定种子 = 能复现同一首歌;换种子 = 换一个结果。不满意就换种子重跑 |
| tiled_decode | 分块解码音频 | 8GB 显存必须开(详见第 6 章)。会降低显存占用,代价是略慢、分块接缝处有小概率瑕疵 |
✓ 新手第一次跑的建议配置
- max_duration = 60(先用默认,出成品快,方便试手感)
- tiled_decode = 开启(8GB 显存保险)
- seed = 随便一个数,先跑一遍看看
运行与取件
- 按
Ctrl + Enter运行(想中断就 Ctrl + Alt + Enter)。 - 耐心等。60 秒的歌在 8GB 笔记本上通常需要几分钟——这段时间它在后台一点点把音乐”画”出来。
- 去取成品。默认保存在:
1 | ComfyUI/output/audio/audio_minimax_music3.mp3 |
(如果你改过 SaveAudioAdvanced 节点的文件名,就按你设的名字找。多次生成会自动编号成 _00001、_00002…)
⚠ 一个新手必踩的坑:赶紧改文件名
默认文件名是 audio_minimax_music3_00001.mp3 这种,跑十次你就分不清哪首是哪首了。
听完觉得能留的,立刻重命名成歌名(比如《把风留给你.mp3》)。这是血泪教训——跑多了之后,你对着一堆编号文件是真的会忘记哪首好听
🎵 从 0 到第一首 AI 歌,只需要 8 步
1 | ComfyUI |
1.【歌曲描述】caption,对应之前截图中的Theme 英文部分。用于填写曲风、乐器、情感及避开的元素(如:acoustic guitar,quiet hear tbreak,Avoid EDM)
2.【歌词】lyrics:专门用来填写歌词和结构标签(如[Verse]、[Chorus])
3.【时长限制】max_duration 理论300秒以内,也就是5分钟,(看360未验证)
4.【不用动,默认】unet_name,clip_name,vae_name
5.【小显存开启】tiled_decode
6.【文件名称】filename_prefix,取名,不然容易忘
7.【不用动,默认】format原始音频信号压缩打包指定的 MP3 格式(3种格式flac,mp3,opus),quality:MP3 文件的压缩质量(V0 代表最高动态码率)
5. 进阶:从”能听”到”好听”
5.1 提示词技巧三条
- 严格按三段式写描述。Global Metadata / Vocal Details / Arrangement 一个都不能省。实测下来,三段式比”一段话糊在一起”的服从度高很多。
- 歌词里狠狠用段落标签。标签是模型唯一认的结构指令,多用 [Pre-Chorus]、[Bridge] 这种,歌曲层次会明显丰富。
- 平衡时长与资源。歌越长越吃显存和时间。低显存想做长歌:用 INT8 模型 + 开启分块解码。
5.2 去官方示例里”偷师”
MiniMax 官方在
放了11 种流派、26 首示例曲目,每首都附有按三段式写好的完整结构化描述。
这是最好的学习材料:找到你喜欢的风格,看它的 Caption 是怎么写的,照着那个结构改成你自己的内容。
5.3 让 AI 帮你扩写描述(省力技巧)
如果你懒得写那么长的三段式,MiniMax 官方提供了一个提示词重写技能:把你的简短想法自动扩写成标准的结构化描述。
1 | npx skills add MiniMax-AI/MiniMax-Music3 --skill music-caption-rewriter |
装好后在支持的编程助手里调用 $music-caption-rewriter,给它一句话描述(比如”安静的深夜华语抒情,女声,钢琴为主”),它就返回标准的 Global Metadata / Vocal Details / Arrangement 三段,直接粘进 ComfyUI。
5.4 换种子:AI 音乐最重要的工作流
✓ 专业玩家怎么做
同一套描述和歌词,连续换 5~10 个种子各跑一遍,然后挑最好的那首留下。
这是 AI 音乐(和 AI 绘图)最核心的工作方式——不要指望一次就中,要靠”抽卡 + 筛选”。
找到满意的之后,一定要把种子记下来,这样以后想微调(比如只改一句歌词)还能回到同一首歌的基础上。
6. 8GB 显存生存指南
如果你跟我一样用的是 8GB 显存的笔记本(RTX 4070 Laptop 这类),这一节是为你写的。
6.1 三个保命开关
| 手段 | 怎么做 | 效果 |
|---|---|---|
| 开 tiled_decode | 在工作流里把该选项打开 | 最关键。以重叠分块方式解码音频 VAE,大幅降低显存占用。代价:略慢,分块边界有小概率出现接缝 |
| 用 INT8 模型 | 下载 minimax_music3_dit_int8_convrot.safetensors 替代 fp16 | 显存占用明显下降,音质损失很小 |
| 控制时长 | 先用 60 秒试,稳定了再往 120 / 180 / 300 秒加 | 时长是最直接影响显存和时间的参数 |
💡 高显存用户反过来做
如果你有 12GB+ 显存,官方建议关闭 tiled_decode 以获得最佳质量(无缝接、更快)。
6.2 别忘了:内存才是隐形瓶颈,【内存直接炸了】
⚠ 实测教训
跑 AI 生成时,8GB 显存往往不是最先扛不住的,16GB 内存才是。
曾经实测过:开着浏览器(几十个标签页)+ 微信 + 各种后台,16GB 内存只剩不到 1GB 空闲,这时候跑生成任务轻则慢如蜗牛,重则直接卡死崩溃,而且报错信息往往很不明显,让你以为是模型坏了。
跑之前:关掉不用的浏览器窗口和大型软件,给系统留出足够空闲内存
7. 避坑指南
| 症状 | 原因 | 怎么办 |
|---|---|---|
| 模板库里找不到 MiniMax 工作流 | ComfyUI 版本太旧 | 更新 ComfyUI 到最新版 |
| 加载后提示节点缺失 | ① 版本不是最新 ② 启动时节点导入失败 | 更新 ComfyUI;查看启动日志定位失败的节点 |
| 模型下拉列表里没有模型名 | 文件放错目录,或没刷新 | 确认放在 models/diffusion_models 等对应子目录,然后按 R 刷新 |
| 跑到一半爆显存/崩溃 | 显存或内存不够 | 开 tiled_decode;换 INT8 模型;缩短时长;关浏览器腾内存 |
| 生成的歌结构不对(没副歌、太短) | 歌词标签没写对,或标签不被严格保证 | 确认用了 [Chorus] 等标签;接受模型有随机性,换种子重跑 |
| 出来的不是你要的风格 | Caption 太笼统 | 改用三段式结构化描述,写清流派、BPM、人声、乐器 |
| 找不到成品文件 | 不知道输出路径 | 去 ComfyUI/output/audio/ 找,默认名 audio_minimax_music3.mp3(多次生成会自动编号) |
| 文件太多分不清哪首是哪首 | 没及时改名 | 听完立刻重命名为歌名,别攒着 |
8. 下一步
当你跑通第一首歌,接下来可以往这几个方向走:
🎼 把歌做长
从 60 秒逐步加到 180、300 秒,体验它”完整歌曲结构”的真正实力——前奏、桥段、尾奏一个不落。
🎤 换风格玩
官方演示有 11 种流派。把 Caption 换成摇滚、R&B、放克、波萨诺瓦,同一个模型完全是另一个声音。
🖼 AI 绘图
ComfyUI 的主场其实是画图。装上 Z-Image Turbo 或 FLUX 系列,用同样的”模板+改提示词”套路,给你的歌配封面。
🎬 AI 视频
再进一步可以跑 Wan 2.2 做视频。但要做好心理准备:视频对显存和内存的压榨远高于音乐,8GB 卡只能从低分辨率短时长起步。
最后,最重要的一个习惯
✓ 保存你的工作流
调出满意的效果后,把工作流保存下来(Comfy Desktop 还会自动帮你做快照)。这样下次想再做类似的歌,直接打开就能跑,不用重新调一遍。
同时记下种子值——那是你能复现同一首歌的唯一钥匙。
祝你写出第一首让自己起鸡皮疙瘩的歌
本教程基于 ComfyUI 官方文档与 MiniMax Music 3 官方仓库整理,并在 RTX 4070 Laptop(8GB)/ 16GB 内存环境实测。 模型权重遵循 MiniMax-Music3 社区许可证,商用前请查阅许可条款。






