LTX 2.3 是由 Lightricks 推出的新一代开源音视频生成模型。相比上一代,LTX 2.3 在提升视频画质、运动平滑度与提示词理解能力的同时,支持在本地同步生成视频与匹配音频。通过结合 FP8、NVFP4 及 GGUF 等量化方案,显存需求最低可降至 8GB 左右。本文将详细介绍 LTX 2.3 在 ComfyUI 中的模型下载、文件路径配置及低显存部署流程。


一、 环境准备

运行新版 LTX 2.3 模型(包括越狱/微调版本)需要使用最新版的 ComfyUI 客户端。若此前已安装旧版本,建议重新下载并覆盖更新:


二、 模型文件下载与目录配置

请根据下方分类下载所需模型,并将其放置于 ComfyUI Desktop 的对应共享文件夹中(默认根路径为:C:\Users\你的用户名\AppData\Local\Comfy-Desktop\ComfyUI-Shared\models\)。

1、越狱主模型

PinkCherry_FineTune_bf16_v1_8_LTX23(满血版)

PinkCherry_FineTune_Q5_K_M_v18_LTX23 (8G显存版)

点击下载

2、Loas

LTX-2.3\ltx-2.3-22b-distilled-lora-384-1.1

点击下载

3、Vae

总共3个

LTX23_video_vae_bf16

点击下载

taeltx2_3

点击下载

LTX23_audio_vae_bf16

点击下载

4、文本编码器

总共2个

gemma-3-12b-it-heretic-v2

点击下载

ltx-2.3_text_projection_bf16

点击下载

模型放到 C:\Users\你的用户名\AppData\Local\Comfy-Desktop\ComfyUI-Shared\models 对应的文件夹里


文件路径对照表

模型文件名目标放置路径(相对 …\ComfyUI-Shared\models\)
ltx-2.3-22b-distilled-lora-384-1.1.safetensorsloras\LTX-2.3\ (需手动新建 LTX-2.3 文件夹)
LTX23_video_vae_bf16.safetensorsvae\
taeltx2_3.safetensorsvae\
LTX23_audio_vae_bf16.safetensorsvae\
gemma-3-12b-it-heretic-v2.safetensorstext_encoders\
ltx-2.3_text_projection_bf16.safetensorstext_encoders\

三、 工作流导入与低显存节点配置

1. 导入基础工作流

下载配置文件并直接拖入 ComfyUI 画布中:

导入后若出现红色节点报错,点击弹窗中的“下载/安装缺失节点”即可自动补齐。

2. 8GB 显存(GGUF 量化版)配置步骤

若显卡显存为 8GB(如 RTX 3060 / 3070 等),请按照以下步骤调整配置:

  1. 打开 ComfyUI Manager(扩展管理中心),搜索并安装 ComfyUI-GGUF 插件。
  2. 将下载好的 PinkCherry_FineTune_Q5_K_M_v18_LTX23.gguf 模型文件放入 models\unet\ 文件夹中。
  3. 在 ComfyUI 空白处双击,搜索并添加 Unet Loader (GGUF) 节点。
  4. 移除默认的 Checkpoint 加载器,将 Unet Loader (GGUF)MODEL 输出连接至后方的模型输入端口。

四、 提示词配置模版

LTX 2.3 支持原生音视频同步生成,在撰写提示词(Prompt)时,可采用结构化的分段描述形式。

1. 国风古装图生视频(中文提示词模版)

1
2
3
4
5
6
7
8
9
10
11
中国古风电影感短剧,保持参考图片中人物的脸部特征、发型、妆容、淡蓝色汉服、蓝色发簪和整体视觉风格完全一致。

0-3秒:近距离特写,女子安静地看向镜头,微微眨眼,嘴角带着自然温柔的笑意。几缕黑色发丝被微风吹动,蓝色流苏耳饰轻轻摇晃。镜头缓慢推进,浅景深。

3-7秒:女子缓缓转过脸回眸看向镜头,手指整理耳边发丝。背景显现江南庭院,白墙黛瓦,远处有竹林与薄雾。

7-11秒:镜头缓慢环绕人物,女子微微低头后再次抬眼,露出含蓄笑容。阳光透过竹叶形成柔和光影。

11-15秒:女子靠近镜头,用非常轻柔温婉的中文低声说道:“公子,今日的风,很温柔。”

声音与音效:生成自然的中文女声对白,与嘴型同步。同时包含古筝背景音乐、微风声与竹叶沙沙声。

2. 电影感剧情对白(英文提示词模版)

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
Cinematic realistic image-to-video scene, 10 seconds.
Keep the woman's face, clothing, and background strictly consistent with the reference image.

0-3 seconds:
She speaks softly, looking slightly toward the right. Lips move accurately synchronized with Chinese dialogue.
Mandarin Dialogue: “你终于来了,我等你很久了。”

3-6 seconds:
She notices something unusual off-camera. Speech stops briefly, her expression turns cautious and confused.

6-10 seconds:
She turns toward the camera, looking into the lens with a nervous expression, whispering:
Mandarin Dialogue: “但是……你身后有人。”

Audio Requirements:
Natural Mandarin female dialogue, realistic lip sync, subtle indoor ambience. No extra background music.

五、 常见问题排查

  • 缺少 GGUF 加载节点:未安装 ComfyUI-GGUF 插件会导致 .gguf 格式主模型无法载入,可在 ComfyUI Manager 中搜索插件名进行安装。
  • 音频与画面不同步:请确保已正确加载 LTX23_audio_vae_bf16 音频 VAE 模型,并在提示词中明确标注语音对白的时间戳与文本。