COMFYUI 新手实战 · 音频篇

不需要懂乐理,不需要会编曲,甚至不需要看得懂代码。这篇文章带你用 ComfyUI 和 MiniMax Music 3,从打开软件开始,做出一首有前奏、有主歌、有副歌、有尾奏的完整歌曲——最长可以到五分钟。全程可复制粘贴,跟着做就能出声。

  • ⏱ 阅读约 20 分钟
  • 🎯 面向零基础
  • 🎵 案例:MiniMax Music 3
  • 💻 实测环境:RTX 4070 Laptop 8GB / 16GB 内存

开篇:你能做出什么

先给你一个具体的目标感。读完这篇教程并动手做一遍,你会得到这样一首歌:

  • 完整结构:前奏 → 主歌 → 预副歌 → 副歌 → 桥段 → 尾奏,一段不缺,而不是十秒钟的循环片段。
  • 有人声:能唱出来的歌词,带旋律、气口和情绪,不是纯伴奏。
  • 编曲会推进:主歌安静、副歌进鼓、桥段留白——乐器是随时间变化的,不是从头到尾一个样。
  • 成品直接能听:32 kHz / 16-bit 立体声,ComfyUI 直接帮你存成 MP3,拖进播放器就响。

✓ 这不是纸上谈兵

本教程的案例步骤已在 RTX 4070 Laptop(8GB 显存)+ 16GB 内存 的普通笔记本上实测跑通,累计产出过二十余首完整歌曲。文末会专门告诉你 8GB 显存该怎么调参才不崩。

最关键的是:你不需要买任何Token,MiniMax Music 3 是开源模型,ComfyUI 是免费开源的,全部在你自己电脑上跑,完全本地部署

1. 先搞懂:ComfyUI 到底是什么

1.1 它不是一个”按钮软件”

很多人第一次打开 ComfyUI 会懵:满屏的方块和连线,像电路板。这很正常——因为 ComfyUI 的本质是让你亲手搭一条流水线

打个比方:

🍱 一键式工具(比如各类在线生成器) 像去餐厅点菜:你说”来首抒情歌”,厨房做好端上来。方便,但你控制不了盐放多少、火候几分。

🧩 ComfyUI 像自己进厨房:食材(模型)、步骤(节点)、顺序(连线)全部摆在你面前,你想改哪一步就改哪一步。

ComfyUI 的画面由三类东西组成:

元素 是什么 你要对它做什么
节点(Node) 一个个彩色方块,每个负责一件事(加载模型、写提示词、采样、保存文件) 看懂它是干什么的,需要时改它里面的参数
连线(Link) 方块之间的线,表示”数据从哪流到哪” 一般不用动;线断了才需要接回去
工作流(Workflow) 整套节点+连线,就是一条完整的生产流程 可以直接用官方现成的模板,不用从零画

1.2 所以新手也能上手

看到这里你可能想:”我连节点都看不懂,怎么搭?”

答案是:你根本不需要自己搭。

ComfyUI 内置了官方模板库——各种常见任务(出图、出视频、出音乐)都有现成的、经过验证的工作流。你要做的只是:

  1. 打开模板库,找到对应的模板
  2. 按提示下载模型(模板会告诉你缺什么,甚至能一键下)
  3. 改几个文本框(填你的想法、歌词)
  4. 按运行,等它出成品

本教程的案例(MiniMax Music 3)就有现成模板。所以你今天要掌握的核心技能其实是 「怎么填好那两个文本框」**——也就是怎么写描述和歌词。这才是决定成品好坏的关键,也是本文最核心的部分。

💡 记住这个心法

用 ComfyUI 不需要会”编程”,需要的是理解每一步在做什么。掌握了这个,你换任何一个模型(画图、做视频)都能快速上手——因为套路是通用的

注意事项

2. 环境准备

2.1 安装 Comfy Desktop

comfy.org/download

下载 Comfy Desktop,一路下一步装完即可。

✓ 为什么推荐 Desktop 版

装 Desktop 会自动把 Python、ComfyUI 本体、依赖环境全部配好,你不需要单独装 Python 或捣鼓命令行。Desktop 是个”多实例管理器”,里面跑的才是 ComfyUI 引擎。

硬件要求(官方):

项目 最低 推荐
系统 Windows 10+ / macOS 13+ Windows 11
内存 8 GB 16 GB 起步(跑音乐/视频时内存比显存更容易成为瓶颈)
显存 有 N 卡即可 8GB 够跑本教程全部内容
硬盘 每个实例 5 GB 留 50GB+ 放模型(MiniMax 三件套约 15GB)

2.2 准备模型三件套

MiniMax Music 3 在 ComfyUI 里由三个文件组成,缺一不可。官方把它们打包放在 Hugging Face 的

Comfy-Org/MiniMax-Music-3

仓库。

1
2
3
4
5
6
7
8
9
📂 ComfyUI/
├── 📂 models/
│ ├── 📂 diffusion_models/
│ │ ├── minimax_music3_dit_fp16.safetensors ← 主模型(生成音乐,约 10GB)
│ │ └── minimax_music3_dit_int8_convrot.safetensors ← 量化版(显存紧张时用它)
│ ├── 📂 text_encoders/
│ │ └── minimax_music3_text_encoder_pruned_int8_convrot.safetensors ← 文本编码器
│ └── 📂 vae/
│ └── minimax_music3_dav.safetensors ← 音频解码器(把潜变量变成声音)

两个 diffusion model 该下哪个?

文件 适合谁 特点
…dit_fp16 显存 ≥12GB 质量最好,速度最快,但最吃显存
…dit_int8_convrot 显存 8GB(本教程实测环境) 量化压缩过,显存占用明显降低,音质损失很小

⚠ 实测提醒

如果你的卡是 8GB 显存,强烈建议下载 int8 那个版本。本文实测机器装的是 fp16 版,靠第 6 章的 tiled_decode 分块解码才稳住——如果你还没下,直接下 int8 会省心得多。

文件放哪里?

如果你用的是 Comfy Desktop,模型通常放在共享目录(所有实例共用,避免重复下载):

1
2
Windows:  %LOCALAPPDATA%\Comfy-Desktop\ComfyUI-Shared\models\
(本教程实测机器把它改到了 D:\Comfy-Desktop\ComfyUI-Shared\models\)

放进对应子目录后,回到 ComfyUI 界面按 R 键刷新,模型名才会出现在下拉列表里。

✓ 更省事的办法

其实你不用手动下模型。直接去模板库加载 MiniMax Music 3 工作流,界面会自动检测到缺模型,并给出一键下载。手动下载只是给你一个备选方案。

3. 认识今天的主角:MiniMax Music 3

3.1 它能做什么

MiniMax Music 3 是 MiniMax(稀宇科技)开源的音乐生成模型。它的定位很明确:生成一首完整的歌,而不是一段循环

能力 具体表现
完整歌曲 最长 5 分钟(300 秒),可包含前奏、主歌、预副歌、副歌、桥段、器乐间奏、尾奏
双输入控制 你给「音乐描述」+「歌词」,它按你的要求作曲演唱
长程一致性 5 分钟的歌里,旋律主题、节奏、人声音色、编曲推进能保持连贯
表现力人声 自然的人声合成,可控制音色、唱法、和声层次
输出规格 32 kHz / 16-bit 立体声(ComfyUI 中保存为 MP3)

它背后的架构(了解即可)

MiniMax Music 3 用的是”分层”设计,可以粗略理解为三个人分工:

  • 8B 全局 LLM——负责”这首歌整体长什么样”:结构走向、情绪推进。它是从 Qwen3-8B 初始化来的,所以对中文文本的理解底子不错。
  • 0.6B 局部 LLM——负责每一帧的声音细节:咬字、音色、质感。
  • Flow Matching + Flow-VAE——把上面两位的”想法”真正合成成 32kHz 的音频波形。

3.2 诚实的边界(重要)

教程不说缺点就是耍流氓。以下是官方 README 明确写出的限制,以及实测的体验,请务必心里有数:

⚠ 四条必须知道的实话

  1. 段落标签不是”命令”。官方原话是:段落标签和描述提供的是生成性控制,而非严格的符号保证。也就是说,你写了 [Chorus],它大概率会给你一个副歌,但速度、调性、具体乐器不保证每次都严格照办
  2. 中文演唱需要实测。模型对中文文本的理解有底子(Qwen3 血统),但官方公开的 26 首演示曲全部是英文西方曲风(流行、摇滚、R&B、嘻哈、乡村、灵魂、放克、布鲁斯、波萨诺瓦、都市)。中文人声的实际表现建议你自己试一首再判断,别指望一发入魂。
  3. 文本有长度上限:提示词最多 5000 tokens;音频最多 9000 声学帧(对应约 5 分钟)。别写长篇大论。
  4. 它不是”编曲软件”。想要精确到”第 17 秒进鼓”这种级别的控制,它做不到。它的强项是给你一个有模有样的完整成品

接受这些边界后,我们开始动手——这才是真正有意思的部分。

4. 实战:做出你的第一首歌

4.1 第一步:加载官方模板

  1. 确保 ComfyUI 是最新版。模板库随版本更新,版本太旧会找不到模板或报节点缺失。
  2. 打开模板库:菜单栏 → 工作流 → 浏览模板(Templates)。
  3. 找到音频分类 → 选择 MiniMax Music 3 Text to Music
  4. 按弹窗提示下载模型。模板会检测你缺哪些文件,跟着点就行。
  5. 加载成功后,画布上会出现一条现成的工作流。

💡 如果提示”节点缺失”

两个常见原因:① 你的 ComfyUI 不是最新版 → 去更新;② 启动时有些节点导入失败 → 查看启动日志。更新后重启一般都能解决。

示例:

4.2 第二步:认识这条工作流

官方模板加载出来后,整条流水线其实只有四个环节,非常好懂:

1
2
3
4
5
6
7
文本编码器(读你的描述和歌词)
↓ 把文字变成模型能懂的条件
扩散模型(MiniMax Music 3 主体,作曲+编曲+人声)
↓ 在"潜空间"里把音乐画出来
音频 VAE(解码器)
↓ 把潜变量还原成真正的声音波形
保存音频 → MP3 文件

你要操作的,只有最前面那两个文本框中间那几个参数。后面的节点基本不用碰。

4.3 第三步:写 Caption(音乐描述)——决定”好不好听”

这是整篇教程最重要的一节。Caption 就是告诉模型”这首歌应该是什么样”。

官方强烈建议用结构化三段式来写,即把描述拆成三块:

段落 写什么 举例
Global Metadata(全局元数据) 流派、BPM、调性、音阶、情绪推进、聆听场景、制作风格 Mandopop ballad, 72 BPM, F major…
Vocal Details(人声细节) 人声性别、音色、演唱风格、和声、人声效果 female, soft and breathy, subtle vibrato…
Arrangement(编曲) 主/次乐器、律动、低音、打击乐、织体、空间效果 solo piano, brushed drums entering at chorus…

✓ 官方原话

「描述越具体,结果越接近预期」。而且结构化描述能让模型不仅遵循整体风格,还会跟随歌曲随时间的推进——这才是它能做出”完整歌”的关键。

可直接复制的模板(中文抒情流行)

Caption —— 复制粘贴即可用,按需改括号里的内容

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
[Global Metadata]
Genre: Mandopop ballad (华语抒情流行), BPM 72, Key: F major
Emotional arc: quiet loneliness → gentle warmth → restrained release
Listening scene: late-night headphone listening, rainy window
Production: warm analog warmth, intimate close-mic, light tape saturation

[Vocal Details]
Gender: female, timbre: soft and slightly breathy
Delivery: intimate and controlled, subtle vibrato at phrase endings
Harmony: sparse doubled vocals in chorus, soft high harmony in final chorus
Vocal FX: light reverb, gentle compression, minimal delay

[Arrangement]
Primary: solo piano, warm upright bass
Secondary: subtle string pad, soft brushed drums entering at chorus
Groove: slow and steady, gentle push in chorus
Bass: warm and rounded
Texture: sparse in verse, fuller in chorus
Spatial: intimate and close, wide reverb tail on chorus

⚠ 写描述的两个坑

  • 别写成长篇故事。官方建议”简短具体的提示词比冗长的故事效果更好”。用关键词短语,别写”在一个雨夜,她想起了…”这种散文。
  • 别把歌词写进 Caption。歌词有专门的输入框。Caption 只管”音乐长什么样”,歌词管”唱什么词”。

4.4 第四步:写 Lyrics(歌词)——决定”歌在唱什么”

歌词用段落标签来控制歌曲结构。可用的标签有:

[Intro] · [Verse] · [Pre-Chorus] · [Chorus] · [Post-Chorus] · [Bridge] · [Instrumental] · [Solo] · [Outro]

⚠ 最关键的一条规则

标签是唯一的结构指令;歌词文本本身只传达情绪,不传达结构。

换句话说:你写 [Chorus],模型就知道”这里是副歌,该上强度了”;但你在歌词里写”这里是副歌”,模型看不懂。结构只能靠标签。

可直接复制的模板(中文歌词)

Lyrics —— 复制粘贴即可用

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
[Intro]
(钢琴轻起,雨声)

[Verse]
窗外的雨还没停
我把灯留到天明
你说过的那句话
还在耳边转个不停

[Pre-Chorus]
如果我还能回头
是不是就不必走

[Chorus]
把风留给你 把雨留给我
把最后的温柔 留在转身以后
你别替我担心 我会好好的
只是偶尔 还会想起你的手

[Verse]
旧钥匙还在口袋
却打不开那扇门
你走以后下了雪
覆盖了来时的路

[Chorus]
把风留给你 把雨留给我
把最后的温柔 留在转身以后
你别替我担心 我会好好的
只是偶尔 还会想起你的手

[Bridge]
(器乐留白,弦乐渐起)

[Chorus]
把风留给你 把雨留给我
我终于学会 一个人走到最后

[Outro]
(钢琴渐弱,雨声渐隐)

✓ 歌词写法要点

  • 副歌要重复出现——这是”歌”和”片段”最大的区别。同一个 [Chorus] 块多放几次,模型会把它当成真正的副歌来对待。
  • 括号里可以写演奏提示,比如 (钢琴轻起)、(器乐留白),模型会当作氛围参考。
  • 想要纯音乐:歌词框留空或只放 [Instrumental],就得到无人声的伴奏。

4.5 第五步:调参数与运行

工作流上只有三个参数需要你操心:

参数 作用 怎么设
max_duration 目标歌曲时长(秒) 模板默认 60 秒;模型上限约 300 秒(5 分钟)。歌越长,耗时和显存占用越多
seed 随机种子 固定种子 = 能复现同一首歌;换种子 = 换一个结果。不满意就换种子重跑
tiled_decode 分块解码音频 8GB 显存必须开(详见第 6 章)。会降低显存占用,代价是略慢、分块接缝处有小概率瑕疵

✓ 新手第一次跑的建议配置

  • max_duration = 60(先用默认,出成品快,方便试手感)
  • tiled_decode = 开启(8GB 显存保险)
  • seed = 随便一个数,先跑一遍看看

运行与取件

  1. Ctrl + Enter 运行(想中断就 Ctrl + Alt + Enter)。
  2. 耐心等。60 秒的歌在 8GB 笔记本上通常需要几分钟——这段时间它在后台一点点把音乐”画”出来。
  3. 去取成品。默认保存在:
1
ComfyUI/output/audio/audio_minimax_music3.mp3

(如果你改过 SaveAudioAdvanced 节点的文件名,就按你设的名字找。多次生成会自动编号成 _00001、_00002…)

⚠ 一个新手必踩的坑:赶紧改文件名

默认文件名是 audio_minimax_music3_00001.mp3 这种,跑十次你就分不清哪首是哪首了。

听完觉得能留的,立刻重命名成歌名(比如《把风留给你.mp3》)。这是血泪教训——跑多了之后,你对着一堆编号文件是真的会忘记哪首好听

🎵 从 0 到第一首 AI 歌,只需要 8 步

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
ComfyUI

加载 MiniMax Music 3 官方模板

下载模型

填写 Caption

填写 Lyrics

设置 60s + tiled_decode+名称

Ctrl + Enter 生成

换 Seed 抽卡 → 挑最好的一首

1.【歌曲描述】caption,对应之前截图中的Theme 英文部分。用于填写曲风、乐器、情感及避开的元素(如:acoustic guitar,quiet hear tbreak,Avoid EDM)

2.【歌词】lyrics:专门用来填写歌词和结构标签(如[Verse]、[Chorus])

3.【时长限制】max_duration 理论300秒以内,也就是5分钟,(看360未验证)

4.【不用动,默认】unet_name,clip_name,vae_name

5.【小显存开启】tiled_decode

6.【文件名称】filename_prefix,取名,不然容易忘

7.【不用动,默认】format原始音频信号压缩打包指定的 MP3 格式(3种格式flac,mp3,opus),quality:MP3 文件的压缩质量(V0 代表最高动态码率)

5. 进阶:从”能听”到”好听”

5.1 提示词技巧三条

  1. 严格按三段式写描述。Global Metadata / Vocal Details / Arrangement 一个都不能省。实测下来,三段式比”一段话糊在一起”的服从度高很多。
  2. 歌词里狠狠用段落标签。标签是模型唯一认的结构指令,多用 [Pre-Chorus]、[Bridge] 这种,歌曲层次会明显丰富。
  3. 平衡时长与资源。歌越长越吃显存和时间。低显存想做长歌:用 INT8 模型 + 开启分块解码。

5.2 去官方示例里”偷师”

MiniMax 官方在

music3-demo

放了11 种流派、26 首示例曲目,每首都附有按三段式写好的完整结构化描述

这是最好的学习材料:找到你喜欢的风格,看它的 Caption 是怎么写的,照着那个结构改成你自己的内容。

5.3 让 AI 帮你扩写描述(省力技巧)

如果你懒得写那么长的三段式,MiniMax 官方提供了一个提示词重写技能:把你的简短想法自动扩写成标准的结构化描述。

1
npx skills add MiniMax-AI/MiniMax-Music3 --skill music-caption-rewriter

装好后在支持的编程助手里调用 $music-caption-rewriter,给它一句话描述(比如”安静的深夜华语抒情,女声,钢琴为主”),它就返回标准的 Global Metadata / Vocal Details / Arrangement 三段,直接粘进 ComfyUI。

5.4 换种子:AI 音乐最重要的工作流

✓ 专业玩家怎么做

同一套描述和歌词,连续换 5~10 个种子各跑一遍,然后挑最好的那首留下。

这是 AI 音乐(和 AI 绘图)最核心的工作方式——不要指望一次就中,要靠”抽卡 + 筛选”

找到满意的之后,一定要把种子记下来,这样以后想微调(比如只改一句歌词)还能回到同一首歌的基础上。

6. 8GB 显存生存指南

如果你跟我一样用的是 8GB 显存的笔记本(RTX 4070 Laptop 这类),这一节是为你写的。

6.1 三个保命开关

手段 怎么做 效果
开 tiled_decode 在工作流里把该选项打开 最关键。以重叠分块方式解码音频 VAE,大幅降低显存占用。代价:略慢,分块边界有小概率出现接缝
用 INT8 模型 下载 minimax_music3_dit_int8_convrot.safetensors 替代 fp16 显存占用明显下降,音质损失很小
控制时长 先用 60 秒试,稳定了再往 120 / 180 / 300 秒加 时长是最直接影响显存和时间的参数

💡 高显存用户反过来做

如果你有 12GB+ 显存,官方建议关闭 tiled_decode 以获得最佳质量(无缝接、更快)。

6.2 别忘了:内存才是隐形瓶颈,【内存直接炸了】

⚠ 实测教训

跑 AI 生成时,8GB 显存往往不是最先扛不住的,16GB 内存才是

曾经实测过:开着浏览器(几十个标签页)+ 微信 + 各种后台,16GB 内存只剩不到 1GB 空闲,这时候跑生成任务轻则慢如蜗牛,重则直接卡死崩溃,而且报错信息往往很不明显,让你以为是模型坏了。

跑之前:关掉不用的浏览器窗口和大型软件,给系统留出足够空闲内存

7. 避坑指南

症状 原因 怎么办
模板库里找不到 MiniMax 工作流 ComfyUI 版本太旧 更新 ComfyUI 到最新版
加载后提示节点缺失 ① 版本不是最新 ② 启动时节点导入失败 更新 ComfyUI;查看启动日志定位失败的节点
模型下拉列表里没有模型名 文件放错目录,或没刷新 确认放在 models/diffusion_models 等对应子目录,然后按 R 刷新
跑到一半爆显存/崩溃 显存或内存不够 开 tiled_decode;换 INT8 模型;缩短时长;关浏览器腾内存
生成的歌结构不对(没副歌、太短) 歌词标签没写对,或标签不被严格保证 确认用了 [Chorus] 等标签;接受模型有随机性,换种子重跑
出来的不是你要的风格 Caption 太笼统 改用三段式结构化描述,写清流派、BPM、人声、乐器
找不到成品文件 不知道输出路径 去 ComfyUI/output/audio/ 找,默认名 audio_minimax_music3.mp3(多次生成会自动编号)
文件太多分不清哪首是哪首 没及时改名 听完立刻重命名为歌名,别攒着

8. 下一步

当你跑通第一首歌,接下来可以往这几个方向走:

🎼 把歌做长

从 60 秒逐步加到 180、300 秒,体验它”完整歌曲结构”的真正实力——前奏、桥段、尾奏一个不落。

🎤 换风格玩

官方演示有 11 种流派。把 Caption 换成摇滚、R&B、放克、波萨诺瓦,同一个模型完全是另一个声音。

🖼 AI 绘图

ComfyUI 的主场其实是画图。装上 Z-Image Turbo 或 FLUX 系列,用同样的”模板+改提示词”套路,给你的歌配封面。

🎬 AI 视频

再进一步可以跑 Wan 2.2 做视频。但要做好心理准备:视频对显存和内存的压榨远高于音乐,8GB 卡只能从低分辨率短时长起步。

最后,最重要的一个习惯

✓ 保存你的工作流

调出满意的效果后,把工作流保存下来(Comfy Desktop 还会自动帮你做快照)。这样下次想再做类似的歌,直接打开就能跑,不用重新调一遍。

同时记下种子值——那是你能复现同一首歌的唯一钥匙。

祝你写出第一首让自己起鸡皮疙瘩的歌

本教程基于 ComfyUI 官方文档与 MiniMax Music 3 官方仓库整理,并在 RTX 4070 Laptop(8GB)/ 16GB 内存环境实测。 模型权重遵循 MiniMax-Music3 社区许可证,商用前请查阅许可条款。