MiniMax 推出并开源了其第三代 AI 视频生成系统 MiniMax H3。作为一款全模态生成系统,H3 能够统一处理文本、图像、视频和音频上下文,并生成带有原生立体声的同步视频,摆脱了以往生成视频后需额外后期配音的痛点。


模型核心特性

  • 音画同步生成:生成视频的同时产生 32kHz 立体声音频,实现音画精准同步。
  • 高质量输出:支持 4 至 15 秒时长输出,最高可达 2K 分辨率。
  • 多语言唇形匹配:支持中、英、日、韩、法等 11 种语言的语音与唇形匹配。
  • 精准角色与镜头控制:集成 Ref2VA 模块,支持通过多张参考图锁定角色一致性,并能准确识别专业的镜头调度术语。

硬件配置与显存需求

MiniMax H3 通过 ComfyUI 的动态层调度机制,降低了显存的硬性门槛:

显存配置建议量化版本运行表现及建议
24GB 及以上Q8 / INT8 / NVFP4可流畅运行较高分辨率,生成质量最佳。
16GBQ5 / Q4兼顾画质与生成速度。
12GBQ4推荐配置。实测生成 5 秒 480p 视频(20步)约需 5 分钟。
8GBQ3 / Q2 (混合精度)最低起跑线。需搭配 32GB+ 系统内存与 NVMe 固态硬盘,从 480p 5秒基础参数试跑。

注意:显存较低时,系统会自动将部分权重 offload 至内存和硬盘。请务必将模型与软件部署在 NVMe 固态硬盘中,否则加载速度会严重受限。


本地部署步骤

第一步:升级并准备 ComfyUI

H3 需要 ComfyUI 0.27 或更高版本才能正常识别原生节点。

1、官方下载:【点击前往

2、备用下载:【点击前往】,含越狱工作流及节点

第二步:下载模型文件

根据机器显存情况下载对应的组件并放置于指定目录下:

  1. 主模型 (models/unet/):

    • 下载 GGUF 量化版本主模型(如 MiniMax-H3-FL2VA-Q4_K_M.gguf)。

      hugging face下载: 【点击前往

      备用整合包下载 :【点击前往

  2. 文本编码器 (models/text_encoders/):

    • qwen3vl_32b_minimax_h3_Q4_K_M.gguf
  3. 视频与音频 VAE (models/vae/):

    • 视频 VAE:minimax_h3_video_vae_fp16.safetensors
    • 音频 VAE:minimax_h3_audio_vae_fp32.safetensors (必须使用 fp32 版本,fp16 会导致失真或无声)

第三步:加载工作流并配置节点

  1. 越狱工作流节点:【点击下载】或 【备用下载

    工作流文件:【点击下载】或 【备用下载

  2. 将工作流拖入 ComfyUI,检查并绑定以下关键节点:

    • **Unet Loader (GGUF)**:选择已下载的主模型。
    • **CLIP Loader (GGUF)**:选择 Qwen3-VL 文本编码器。
    • VAE Loader:分别连接视频 VAE 与音频 VAE,注意勿颠倒接口。
  3. 初次测试建议将分辨率设置为 480p,时长设为 5 秒。


进阶提示词与出片技巧

1. 结构化分镜替代简单标签

H3 具备较强的镜头语言理解能力,撰写提示词时应包含画面、动作、运镜、光影与背景音:

示例:黄昏的咖啡馆靠窗位置,窗外下着小雨。一位穿米色针织衫的女性正低头搅拌咖啡,镜头从手部特写缓慢上摇至面部,她抬头看向窗外。暖色调室内灯与窗外冷色光对比。背景音:雨声、咖啡杯轻碰声。

2. 精准运用镜头运动术语

支持标准运镜指令,如推(dolly in)、拉(dolly out)、摇(pan)、移(track)、跟(follow)以及手持感(handheld)。

3. 锁定角色一致性(Ref2VA)

通过 Ref2VA 引入 3 到 5 张不同角度的高清角色参考图以及一段音频样本,即可在多镜头生成中保持人物外观与音色的连贯性。


常见问题排查 (FAQ)

  • 节点报错缺失:升级 ComfyUI 至最新版,并安装 ComfyUI-GGUF 插件。
  • **加载时爆显存 (OOM)**:换用 Q3/Q2 等更低量化版本,并在启动参数中追加 --lowvram
  • 视频无声音或音画不同步:确认音频 VAE 是否为 fp32 格式,并检查 VAE Loader 的线路连接是否正确。
  • 高清后期处理:生成低分辨率视频后,可使用视频高清放大工具: 【网盘下载 】或【备用下载】将画质超分升至 1080p 或 4K。