第 1 章 ComfyUI 是什么

ComfyUI 是一个免费开源的 AI 出图工具,用”节点连线”的方式把生成流程摆在你面前。

你可以把它理解成 AI 绘画界的乐高:每个功能是一块积木,用线把它们连起来,就成了一条完整的生产流水线。

跟别的 AI 出图工具比:

图片 & 视频 & 音频都能做,搭配不同的工作流和模型就可以。

第 2 章 先看电脑能跑到哪一步

先别急着下载,花两分钟确认硬件,根据硬件选方案。

2.1 决定性因素是显存,不是内存

AI 出图吃的是GPU显存,不是内存,显存决定了你能跑多大的模型,也决定了会不会跑到一半崩掉。

查显存:

8GB 是门槛线,也是 26 年做本地 AI 出图的实际起步线。

2.2 没有 N 卡怎么办

三条路:

  1. Mac 用户,ComfyUI 支持 Apple 芯片的 MPS 加速,出图能出,就是慢,视频基本别想。
  2. 没独显的可以用 CPU 跑,慢到没法用,只适合验证软件装没装对。
  3. 用云端服务,官方的 Comfy Cloud、RunComfy 都是浏览器里直接开,算力在人家机房。

2.3 磁盘留够

这一点特别容易被忽略,模型是真的大。

装之前在空间大的盘上留出 100GB,别装 C 盘,玩得多一点,两三百 GB 很正常。

第 3 章 装好 ComfyUI

3.1 三种装法,选哪个

给小白的建议:用秋叶整合包。 理由是它内置了 Python 环境、内置了节点管理器、国内下载快,而且规避掉了一堆手动安装会遇到的报错。

手动装不是不行,但你需要懂 git、懂 Python 环境管理、还得会换源,不适合小白。

3.2 装完立刻做两件事

第一件:确认节点管理器在

节点管理器叫 ComfyUI Manager,是插件的应用商店。秋叶整合包自带,官方 Desktop 版在菜单里叫管理扩展。

它能干这些活:装和卸自定义节点、一键补齐工作流缺的节点、下载模型、更新 ComfyUI 本体。

后面第 5 章和第 7 章会反复用到它,现在先确认菜单里能找到。

手动安装版没有的话,命令行进 ComfyUI/custom_nodes 目录执行:

1
git clone https://github.com/ltdrdata/ComfyUI-Manager

装完完整重启 ComfyUI。

第二件:切成中文

点设置里的齿轮,找到语言选项,选中文,界面会重新加载。

如果出现只汉化了一半的情况,多半是版本问题,在启动器里退回上一个版本通常就好了。

3.3 模型该放哪个文件夹

这张表是整篇最该收藏的东西之一。模型放错文件夹,ComfyUI 就是找不到,下拉菜单里空空如也,新手一半的困惑来自这里。

两个提醒:

  1. 放完模型如果 ComfyUI 正在运行,要点刷新按钮或者按 R 键刷新,不然识别不到新文件
  2. 优先下 .safetensors 格式,部分 .bin 格式不支持

第 4 章 跑通第一张图

打开 ComfyUI,画布上默认就摆好了一条文生图工作流。先别动它,把这张图读懂再说。

4.1 六个方块,串起来读成一句话

默认工作流一共六个节点,从左往右读,它就是一句完整的话:

1
加载模型 → 把提示词翻译成信号 → 准备一张空白画布 → 采样出图 → 解码成像素 → 存盘

对应到界面上:

一个常见困惑:怎么知道哪个是正面提示词?

看连线。 上面那个框的输出接到了 KSampler 的 positive 接口,它就是正面; 下面那个接到 negative,就是负面。决定它是正是负的是接线,不是位置,也不是颜色

4.2 真的跑一次

  1. 在 Load Checkpoint 节点点模型名,从下拉里选一个大模型(下拉是空的说明模型没放对目录,回第 3 章)
  2. 在正面提示词框里随便写点什么,比如 a cat wearing sunglasses, sitting on a beach, sunset
  3. 点右上角的 Run,或者按 Ctrl+Enter

等几十秒,Save Image 节点里就出图了。生成时间取决于你的显卡,第一次会慢一些,因为要把模型从硬盘读进显存。

看到图,就说明你跑通了 hello world。

4.3 一个必须知道的特性

ComfyUI 生成的每一张图,都把完整工作流写进了图片的元数据里

把这张图拖回画布,整条工作流原样恢复,参数、连线、模型选择全都在。

这带来两个实际好处:

  1. 你自己存图就等于存工作流,不用另外保存
  2. 社区分享工作流最主流的方式就是直接发图,你下载别人的图往画布一拖就能用

前提是图片没被处理过:经过微信压缩、或者被某些平台转存过的图,元数据会被清掉,拖进去没反应。

第 5 章 选模型

跑通默认工作流之后,你会发现出图质量一般。 那是因为默认用的是 SD 1.5,一个 2022 年的老模型。

5.1 26 年的四个主流选择

怎么选,对着自己的情况找:

FLUX.1 dev 的权重是免费的,但许可证写明非商用。

而Z-Image Turbo 是 Apache 2.0,这一条在实际工作里价值很大。

5.2 小白第一个该下的:Z-Image Turbo

这是阿里通义实验室 2025 年 11 月发布的模型,6B 参数。

该模型适合新人练手:

  1. 。官方数据是 RTX 4090 上出一张 1024×1024 大约 2 到 3 秒。对比 FLUX 满精度的 15 到 30 秒,迭代体验是两回事
  2. 省显存。FP8 版本 8GB 就能跑,社区的 GGUF 量化版 6GB 也行
  3. 可商用。Apache 2.0
  4. 中英文字都能写。这是老一代模型的老大难

官方效果图:

中英文字渲染能力:

5.3 Z-Image Turbo 完整配置(照抄即可)

第一步:下三个文件,放三个文件夹

目录结构确认一下:

1
2
3
4
5
6
7
ComfyUI/models/
├── diffusion_models/
│ └── z_image_turbo_bf16.safetensors
├── text_encoders/
│ └── qwen_3_4b.safetensors
└── vae/
└── ae.safetensors

第二步:加载官方模板

ComfyUI 里点 Workflow,选浏览模板,进 Image 分类,找 Z-Image Turbo。

第三步:三个加载器分别指向你的文件

显存不够 14GB 的话,把 BF16 那个模型文件换成 FP8 版本(约 8GB)或者 GGUF 量化版(约 6GB)。

用 GGUF 还得先在 Manager 里装 ComfyUI-GGUF 节点,并用它的加载器替换标准的扩散模型加载器。

5.4 显存不够时的通用思路

模型塞不进显存会发生什么: ComfyUI 会把装不下的部分卸载到内存,走 PCIe 通道读取。 这条通道的速度大约是显存带宽的三十分之一。

所以量化版本的价值不在于量化本身更好,而在于它能装得下

一个能完整放进显存的量化模型,比一个不断在内存和显存之间倒腾的满精度模型快得多,这也是为啥dgx spark 受追捧的原因,能跑模型能做图。

第 6 章 做视频:从 Wan 2.2 开始

先讲 Wan 2.2,因为配置要求低,且是Apache 2.0 许可,可商用。

6.1 做视频和做图差在哪

本质上是同一套流程,多了一个时间维度。

多出来的核心难点就是”连贯”:相邻两帧不能各画各的,得像是同一个场景在动。 这也是视频模型比图像模型吃资源得多的原因。

心理准备:出图是几十秒,出视频是几分钟到几十分钟

第一次跑别用大分辨率长帧数,先跑通再说。

6.2 5B 还是 14B

Wan 2.2 有两档,先选对再下模型。

新手一律从 5B 开始。它一个模型同时管文生视频和图生视频,8GB 显存就能跑,跑通的成功率高太多,摸清楚了再上 14B。

6.3 文生视频

模板加载后,官方把节点分好了组,跟着组名走:

  1. Step1 加载模型:三个加载器分别指向刚才那三个文件
  2. Video Size & length:设分辨率和帧数。第一次跑往小了设
  3. Step3 提示词:写你想要的画面
  4. 按 Ctrl+Enter 运行

节点是怎么串的,跟出图对着看就懂:

1
2
3
4
5
6
7
8
9
10
11
UNETLoader(扩散模型)
CLIPLoader → CLIPTextEncode(正负提示词)
ModelSamplingSD3(配置采样器,保证帧间连贯)

KSampler(采样出连贯的潜空间序列)

VAEDecode(解码成一串 RGB 帧)

CreateVideo(按帧率和长度组装)

SaveVideo(存盘)

提示词怎么写才有用

视频提示词和出图提示词最大的区别:你得描述运动

写”一个女孩站在海边”,模型不知道要发生什么,出来可能就是一段几乎静止的画面。

要写清楚动作和镜头:

1
2
一个女孩站在海边,海风吹动她的长发,她缓缓转过头看向镜头,
镜头慢慢推近,夕阳的光打在脸上

有用的描述维度:主体在做什么动作、镜头怎么运动(推、拉、摇、跟)、光线和氛围怎么变化。

6.5 图生视频:让一张图动起来

这是更实用的玩法,因为你可以先用第 5 章的方法把图做到满意,再让它动。

5B 模板里图生视频是默认关掉的,藏在一个分组里。

打开方式:选中那个写着”For i2v, use Ctrl + B to enable”的分组,按 Ctrl+B

Ctrl+B 是禁用和启用节点的快捷键。官方默认把它关掉,是为了让你打开模板就能直接跑文生视频。

启用之后:

  1. 在 LoadImage 节点上传你的图
  2. 提示词写你希望它怎么动
  3. 在 Wan22ImageToVideoLatent 节点调分辨率和帧数
  4. 运行

这里的原理是:Wan22ImageToVideoLatent 这个节点把你那张图的结构和运动线索注入进去,作为整段视频的起点。所以出来的视频第一帧会很接近你的原图,然后开始动。

6.6 首尾帧:指定开头和结尾

进阶玩法,给两张图,让 AI 补中间的过渡。

用 14B 的首尾帧工作流,模型文件跟 14B 图生视频那套一样。

  1. 第一个 LoadImage 传起始帧
  2. 第二个 LoadImage 传结束帧
  3. 在 WanFirstLastFrameToVideo 节点调分辨率(官方默认给的是小尺寸,防止爆显存,显存够可以上 720P)
  4. 提示词写这个过渡应该怎么发生
  5. 运行

这个玩法做转场、做变身效果特别好用。

6.7 显存和参数的现实建议

Wan 2.2 原生是 720P、24 帧每秒。

6.8 关于 MiniMax H3

MiniMax H3(也叫海螺 3.0)在 2026 年 8 月开源了权重,ComfyUI 从 0.30.0 版本起原生支持本地运行。它的能力确实是另一个档次:

ComfyUI 团队为了让它跑得动做了不少工程优化:把大约 40% 的调制参数剪枝换成查找表、上 int8 量化、写专门的算子,把显存占用从 123.6GB 压到 42.5GB,降了 66%。

但”能跑”和”跑得动”是两回事。 42.5GB 的模型塞进十几 GB 的卡,靠的是不断在内存和显存之间倒腾,速度会掉下来。而且它的文本编码器是个 32B 的大家伙,光这一个文件就比整个 Wan 2.2 5B 还大。

所以建议新手还是 wan2.2 开始,熟悉以后才上 minimax h3。

第 7 章 用别人的工作流

自己从零搭节点是效率最低的学法。ComfyUI 真正的威力在于工作流能原样传递。

7.1 官方模板库

最该先逛的地方。侧边栏点模板图标,或者菜单里 Workflow,浏览工作流模板。

里面按任务分好类了:图像生成、视频、放大等等。每个模板都嵌了所需模型的下载链接,第一次加载时如果检测到文件缺失,会直接弹窗提示你下载。

Desktop 版点下载会自动帮你下好放对位置;其他版本会用浏览器下载,你需要自己放进对应的 models 子目录。

7.2 三种加载别人工作流的方式

7.3 工作流去哪找

下几个功能相近的工作流,对着看它们哪里一样哪里不一样,比通读节点文档快得多。

7.4 存自己的工作流

两种方式:

  1. Ctrl+S 存成 JSON 文件
  2. 出的图本身就带工作流,存图等于存工作流

搭出满意的流程之后,习惯性 Ctrl+S 存一份,可以随时发给需要的人。

ComfyUI 的核心思路就一句话: 把 AI 出图的流程可视化成数据流,每个节点是一个函数,连线是输入输出。

“加载模型、编码提示词、采样、解码、输出”理解这条主线,不管模型怎么换,思路不会变。

你们想学的:未审查模型做视频

  1. 需要本地部署(把上面读完),一是涉及到版权,二是涉及到参数修改,线上做不到;
  2. 在 comfyui 里用 wan2.2 或者 minimax h3 都可以,核心逻辑是替换越狱编码器;

\3. 替换完以后你的生视频工作流就有了不抗拒台词的能力;

\4. 利用本地越狱模型给你写台词,当然你想写金瓶梅也可以;

\5. 导入工作流(评论区),放入图片,填上台词,点击运行就能出片了;