📦 Pixelle-Video 详细部署教程

Pixelle-Video 是一个 AI 全自动短视频引擎。你只需要输入一个主题,它就能自动完成文案撰写、AI 配图/视频生成、语音解说合成、背景音乐添加和视频合成,整个过程无需任何剪辑经验。本文档将指导您完成部署和首次使用。


⚙️ 部署前准备

根据您的部署方式,需要准备不同的环境。

方式一:Windows 整合包(最推荐新手)

  • 操作系统:Windows 10/11。
  • 无需任何环境:整合包已包含 Python、依赖库和 ffmpeg,解压即用。

方式二:从源码部署(推荐 macOS/Linux 或需要自定义的用户)

  • Python 环境:需要 Python 3.10 或更高版本。
  • 包管理器:需要安装 uv (一个快速的 Python 包管理器)。请参考 uv 官方安装指南
  • 视频处理工具必须安装 ffmpeg 并确保其在系统 PATH 中。
    • macOS: brew install ffmpeg
    • Ubuntu/Debian: sudo apt update && sudo apt install ffmpeg
    • Windows: 从 ffmpeg.org 下载,解压后将 bin 目录添加到系统环境变量 PATH
  • 验证:在终端中运行 ffmpeg -version 确认安装成功。

🚀 部署步骤

方案一:Windows 整合包(最简单)

  1. 下载:从项目的 Releases 页面 下载最新的 Windows 整合包 (.zip 文件)。
  2. 解压:将压缩包解压到一个路径不含中文或空格的文件夹(如 D:\Pixelle-Video)。
  3. 运行:双击文件夹中的 start.bat 脚本。
  4. 访问:脚本会自动启动 Web 服务,并在浏览器中打开 http://localhost:8501。如果没有自动打开,请手动访问该地址。

方案二:从源码部署(macOS / Linux / 开发者)

  1. 克隆仓库

    1
    2
    git clone https://github.com/ATH-MaaS/Pixelle-Video.git
    cd Pixelle-Video
  2. 启动 Web 界面
    使用 uv 运行 Streamlit 应用,uv 会自动安装所有 Python 依赖。

    1
    uv run streamlit run web/app.py

    注意:首次运行会下载并安装依赖,需要一些时间,请耐心等待。

  3. 访问:在浏览器中打开 http://localhost:8501

方案三:Docker 部署(适合服务器)

对于熟悉 Docker 的用户,可以使用项目提供的 Docker Compose 快速部署。

  1. 克隆并进入项目

    1
    2
    git clone https://github.com/ATH-MaaS/Pixelle-Video.git
    cd Pixelle-Video
  2. 启动容器

    1
    docker-compose up -d
  3. 访问:在浏览器中打开 http://localhost:8501


⚙️ 首次配置(必须)

打开 Web 界面后,在左侧边栏展开 「⚙️ 系统配置」 面板,填写以下关键信息:

  1. LLM 配置(大语言模型):用于生成视频文案。
    • 从下拉菜单选择预设模型(如通义千问、DeepSeek、GPT 等),或手动填写 Base URLModel
    • 填入你的 API Key。点击旁边的“获取 API Key”链接可前往对应平台注册。
  2. ComfyUI / RunningHub 配置:用于生成配图和视频(推荐本地部署)。
    • 本地 ComfyUI:如果你本地部署了 ComfyUI,填写其地址(默认 http://127.0.0.1:8188),并点击“测试连接”。
    • 云端 RunningHub:如果你使用 RunningHub 服务,填入 API Key。
  3. API 媒体模型配置(可选)
    • 如果你想直连图像/视频生成 API(如 OpenAI、DashScope、Kling 等),在此处填写对应供应商的 API KeyBase URL
    • 注意:如果已经配置了本地 ComfyUI,这部分可以跳过。

配置完成后,点击 「保存配置」


🎬 生成您的第一个视频

  1. 输入内容(左侧栏)
    • AI 生成内容:在输入框中输入一个主题,例如“为什么要养成阅读习惯”。
    • 固定文案内容:如果你已有现成文案,选择此模式并粘贴。
  2. 语音与视觉设置(中间栏)
    • 语音:选择一个 TTS 工作流(如 Edge-TTS,免费且效果好)。如需声音克隆,可上传参考音频。
    • 图像:选择一个图像生成工作流(如 image_flux.json),并设置图像尺寸。
    • 视频模板:选择一个模板,决定视频画面的布局和风格。
  3. 生成视频(右侧栏)
    • 点击 「🎬 生成视频」
    • 界面会显示实时进度(生成文案 → 生成配图 → 合成语音 → 合成视频)。
    • 生成完成后,视频会自动播放,并保存在 output/ 文件夹中。

❓ 常见问题

  • Q: 生成的视频效果不满意怎么办?
    • A: 可以尝试更换 LLM 模型(不同模型文案风格不同)、调整图像生成的提示词前缀(Prompt Prefix)、更换视频模板,或调整 TTS 音色。
  • Q: 使用这个工具需要花很多钱吗?
    • A: 完全免费运行是可行的。你可以使用本地部署的 Ollama (LLM) + ComfyUI (图像生成) 实现零成本运行。使用云端 API(如通义千问)则费用很低,性价比高。
  • Q: Windows 下运行 start.bat 报错怎么办?
    • A: 请确保解压路径不含中文或空格。如果问题依旧,可以尝试以管理员身份运行,或检查 Windows Defender 等安全软件是否拦截了脚本。
  • Q: 提示 ffmpeg 找不到?
    • A: 请确保 ffmpeg 已正确安装并添加到系统环境变量 PATH 中。安装后需要重启终端才能生效。

更多高级功能(如数字人口播、动作迁移、自定义素材)和详细的故障排查,请查阅项目的 GitHub 仓库 和文档。