ComfyUI 本地大模型当导演,从此看片不求人
第 1 章 ComfyUI 是什么
ComfyUI 是一个免费开源的 AI 出图工具,用”节点连线”的方式把生成流程摆在你面前。
你可以把它理解成 AI 绘画界的乐高:每个功能是一块积木,用线把它们连起来,就成了一条完整的生产流水线。
跟别的 AI 出图工具比:
图片 & 视频 & 音频都能做,搭配不同的工作流和模型就可以。
第 2 章 先看电脑能跑到哪一步
先别急着下载,花两分钟确认硬件,根据硬件选方案。
2.1 决定性因素是显存,不是内存
AI 出图吃的是GPU显存,不是内存,显存决定了你能跑多大的模型,也决定了会不会跑到一半崩掉。
查显存:
8GB 是门槛线,也是 26 年做本地 AI 出图的实际起步线。
2.2 没有 N 卡怎么办
三条路:
- Mac 用户,ComfyUI 支持 Apple 芯片的 MPS 加速,出图能出,就是慢,视频基本别想。
- 没独显的可以用 CPU 跑,慢到没法用,只适合验证软件装没装对。
- 用云端服务,官方的 Comfy Cloud、RunComfy 都是浏览器里直接开,算力在人家机房。
2.3 磁盘留够
这一点特别容易被忽略,模型是真的大。
装之前在空间大的盘上留出 100GB,别装 C 盘,玩得多一点,两三百 GB 很正常。
第 3 章 装好 ComfyUI
3.1 三种装法,选哪个
给小白的建议:用秋叶整合包。 理由是它内置了 Python 环境、内置了节点管理器、国内下载快,而且规避掉了一堆手动安装会遇到的报错。
手动装不是不行,但你需要懂 git、懂 Python 环境管理、还得会换源,不适合小白。
3.2 装完立刻做两件事
第一件:确认节点管理器在
节点管理器叫 ComfyUI Manager,是插件的应用商店。秋叶整合包自带,官方 Desktop 版在菜单里叫管理扩展。
它能干这些活:装和卸自定义节点、一键补齐工作流缺的节点、下载模型、更新 ComfyUI 本体。
后面第 5 章和第 7 章会反复用到它,现在先确认菜单里能找到。
手动安装版没有的话,命令行进 ComfyUI/custom_nodes 目录执行:
1 | git clone https://github.com/ltdrdata/ComfyUI-Manager |
装完完整重启 ComfyUI。
第二件:切成中文
点设置里的齿轮,找到语言选项,选中文,界面会重新加载。
如果出现只汉化了一半的情况,多半是版本问题,在启动器里退回上一个版本通常就好了。
3.3 模型该放哪个文件夹
这张表是整篇最该收藏的东西之一。模型放错文件夹,ComfyUI 就是找不到,下拉菜单里空空如也,新手一半的困惑来自这里。
两个提醒:
- 放完模型如果 ComfyUI 正在运行,要点刷新按钮或者按 R 键刷新,不然识别不到新文件
- 优先下 .safetensors 格式,部分 .bin 格式不支持
第 4 章 跑通第一张图
打开 ComfyUI,画布上默认就摆好了一条文生图工作流。先别动它,把这张图读懂再说。
4.1 六个方块,串起来读成一句话
默认工作流一共六个节点,从左往右读,它就是一句完整的话:
1 | 加载模型 → 把提示词翻译成信号 → 准备一张空白画布 → 采样出图 → 解码成像素 → 存盘 |
对应到界面上:
一个常见困惑:怎么知道哪个是正面提示词?
看连线。 上面那个框的输出接到了 KSampler 的 positive 接口,它就是正面; 下面那个接到 negative,就是负面。决定它是正是负的是接线,不是位置,也不是颜色。
4.2 真的跑一次
- 在 Load Checkpoint 节点点模型名,从下拉里选一个大模型(下拉是空的说明模型没放对目录,回第 3 章)
- 在正面提示词框里随便写点什么,比如 a cat wearing sunglasses, sitting on a beach, sunset
- 点右上角的 Run,或者按 Ctrl+Enter
等几十秒,Save Image 节点里就出图了。生成时间取决于你的显卡,第一次会慢一些,因为要把模型从硬盘读进显存。
看到图,就说明你跑通了 hello world。
4.3 一个必须知道的特性
ComfyUI 生成的每一张图,都把完整工作流写进了图片的元数据里。
把这张图拖回画布,整条工作流原样恢复,参数、连线、模型选择全都在。
这带来两个实际好处:
- 你自己存图就等于存工作流,不用另外保存
- 社区分享工作流最主流的方式就是直接发图,你下载别人的图往画布一拖就能用
前提是图片没被处理过:经过微信压缩、或者被某些平台转存过的图,元数据会被清掉,拖进去没反应。
第 5 章 选模型
跑通默认工作流之后,你会发现出图质量一般。 那是因为默认用的是 SD 1.5,一个 2022 年的老模型。
5.1 26 年的四个主流选择
怎么选,对着自己的情况找:
FLUX.1 dev 的权重是免费的,但许可证写明非商用。
而Z-Image Turbo 是 Apache 2.0,这一条在实际工作里价值很大。
5.2 小白第一个该下的:Z-Image Turbo
这是阿里通义实验室 2025 年 11 月发布的模型,6B 参数。
该模型适合新人练手:
- 快。官方数据是 RTX 4090 上出一张 1024×1024 大约 2 到 3 秒。对比 FLUX 满精度的 15 到 30 秒,迭代体验是两回事
- 省显存。FP8 版本 8GB 就能跑,社区的 GGUF 量化版 6GB 也行
- 可商用。Apache 2.0
- 中英文字都能写。这是老一代模型的老大难
官方效果图:
中英文字渲染能力:
5.3 Z-Image Turbo 完整配置(照抄即可)
第一步:下三个文件,放三个文件夹
目录结构确认一下:
1 | ComfyUI/models/ |
第二步:加载官方模板
ComfyUI 里点 Workflow,选浏览模板,进 Image 分类,找 Z-Image Turbo。
第三步:三个加载器分别指向你的文件
显存不够 14GB 的话,把 BF16 那个模型文件换成 FP8 版本(约 8GB)或者 GGUF 量化版(约 6GB)。
用 GGUF 还得先在 Manager 里装 ComfyUI-GGUF 节点,并用它的加载器替换标准的扩散模型加载器。
5.4 显存不够时的通用思路
模型塞不进显存会发生什么: ComfyUI 会把装不下的部分卸载到内存,走 PCIe 通道读取。 这条通道的速度大约是显存带宽的三十分之一。
所以量化版本的价值不在于量化本身更好,而在于它能装得下。
一个能完整放进显存的量化模型,比一个不断在内存和显存之间倒腾的满精度模型快得多,这也是为啥dgx spark 受追捧的原因,能跑模型能做图。
第 6 章 做视频:从 Wan 2.2 开始
先讲 Wan 2.2,因为配置要求低,且是Apache 2.0 许可,可商用。
6.1 做视频和做图差在哪
本质上是同一套流程,多了一个时间维度。
多出来的核心难点就是”连贯”:相邻两帧不能各画各的,得像是同一个场景在动。 这也是视频模型比图像模型吃资源得多的原因。
心理准备:出图是几十秒,出视频是几分钟到几十分钟。
第一次跑别用大分辨率长帧数,先跑通再说。
6.2 5B 还是 14B
Wan 2.2 有两档,先选对再下模型。
新手一律从 5B 开始。它一个模型同时管文生视频和图生视频,8GB 显存就能跑,跑通的成功率高太多,摸清楚了再上 14B。
6.3 文生视频
模板加载后,官方把节点分好了组,跟着组名走:
- Step1 加载模型:三个加载器分别指向刚才那三个文件
- Video Size & length:设分辨率和帧数。第一次跑往小了设
- Step3 提示词:写你想要的画面
- 按 Ctrl+Enter 运行
节点是怎么串的,跟出图对着看就懂:
1 | UNETLoader(扩散模型) |
提示词怎么写才有用
视频提示词和出图提示词最大的区别:你得描述运动。
写”一个女孩站在海边”,模型不知道要发生什么,出来可能就是一段几乎静止的画面。
要写清楚动作和镜头:
1 | 一个女孩站在海边,海风吹动她的长发,她缓缓转过头看向镜头, |
有用的描述维度:主体在做什么动作、镜头怎么运动(推、拉、摇、跟)、光线和氛围怎么变化。
6.5 图生视频:让一张图动起来
这是更实用的玩法,因为你可以先用第 5 章的方法把图做到满意,再让它动。
5B 模板里图生视频是默认关掉的,藏在一个分组里。
打开方式:选中那个写着”For i2v, use Ctrl + B to enable”的分组,按 Ctrl+B。
Ctrl+B 是禁用和启用节点的快捷键。官方默认把它关掉,是为了让你打开模板就能直接跑文生视频。
启用之后:
- 在 LoadImage 节点上传你的图
- 提示词写你希望它怎么动
- 在 Wan22ImageToVideoLatent 节点调分辨率和帧数
- 运行
这里的原理是:Wan22ImageToVideoLatent 这个节点把你那张图的结构和运动线索注入进去,作为整段视频的起点。所以出来的视频第一帧会很接近你的原图,然后开始动。
6.6 首尾帧:指定开头和结尾
进阶玩法,给两张图,让 AI 补中间的过渡。
用 14B 的首尾帧工作流,模型文件跟 14B 图生视频那套一样。
- 第一个 LoadImage 传起始帧
- 第二个 LoadImage 传结束帧
- 在 WanFirstLastFrameToVideo 节点调分辨率(官方默认给的是小尺寸,防止爆显存,显存够可以上 720P)
- 提示词写这个过渡应该怎么发生
- 运行
这个玩法做转场、做变身效果特别好用。
6.7 显存和参数的现实建议
Wan 2.2 原生是 720P、24 帧每秒。
6.8 关于 MiniMax H3
MiniMax H3(也叫海螺 3.0)在 2026 年 8 月开源了权重,ComfyUI 从 0.30.0 版本起原生支持本地运行。它的能力确实是另一个档次:
ComfyUI 团队为了让它跑得动做了不少工程优化:把大约 40% 的调制参数剪枝换成查找表、上 int8 量化、写专门的算子,把显存占用从 123.6GB 压到 42.5GB,降了 66%。
但”能跑”和”跑得动”是两回事。 42.5GB 的模型塞进十几 GB 的卡,靠的是不断在内存和显存之间倒腾,速度会掉下来。而且它的文本编码器是个 32B 的大家伙,光这一个文件就比整个 Wan 2.2 5B 还大。
所以建议新手还是 wan2.2 开始,熟悉以后才上 minimax h3。
第 7 章 用别人的工作流
自己从零搭节点是效率最低的学法。ComfyUI 真正的威力在于工作流能原样传递。
7.1 官方模板库
最该先逛的地方。侧边栏点模板图标,或者菜单里 Workflow,浏览工作流模板。
里面按任务分好类了:图像生成、视频、放大等等。每个模板都嵌了所需模型的下载链接,第一次加载时如果检测到文件缺失,会直接弹窗提示你下载。
Desktop 版点下载会自动帮你下好放对位置;其他版本会用浏览器下载,你需要自己放进对应的 models 子目录。
7.2 三种加载别人工作流的方式
7.3 工作流去哪找
下几个功能相近的工作流,对着看它们哪里一样哪里不一样,比通读节点文档快得多。
7.4 存自己的工作流
两种方式:
- Ctrl+S 存成 JSON 文件
- 出的图本身就带工作流,存图等于存工作流
搭出满意的流程之后,习惯性 Ctrl+S 存一份,可以随时发给需要的人。
ComfyUI 的核心思路就一句话: 把 AI 出图的流程可视化成数据流,每个节点是一个函数,连线是输入输出。
“加载模型、编码提示词、采样、解码、输出”理解这条主线,不管模型怎么换,思路不会变。
你们想学的:未审查模型做视频
- 需要本地部署(把上面读完),一是涉及到版权,二是涉及到参数修改,线上做不到;
- 在 comfyui 里用 wan2.2 或者 minimax h3 都可以,核心逻辑是替换越狱编码器;
\3. 替换完以后你的生视频工作流就有了不抗拒台词的能力;
\4. 利用本地越狱模型给你写台词,当然你想写金瓶梅也可以;
\5. 导入工作流(评论区),放入图片,填上台词,点击运行就能出片了;





