🧭 核心功能与定位

VoiceStudio 将多种先进的语音 AI 模型集成到一个桌面应用中,其核心特点在于:

  • 本地优先:核心工作流无需账户、API 密钥或订阅,所有数据(声音、项目、设置)默认保存在本地。
  • 功能全面:整合了语音克隆、视频配音、实时听写、有声书制作等多种工作流。
  • 多引擎支持:内置 16 种 TTS 引擎和 11 种 ASR 引擎,可在“模型目录”中切换或通过快捷键 Ctrl/Cmd+E 快速选择。
  • 跨平台:提供 macOS、Windows 和 Linux 的桌面客户端,并支持 Docker 部署。
  • 开发者友好:提供本地 REST API、OpenAI 兼容音频 API 和 MCP 服务器,便于集成。

📦 安装与首次启动

1. 系统要求

  • 操作系统
    • macOS:13.3+,仅支持 Apple Silicon(Intel Mac 不支持本地后端)。
    • Windows:10/11 x64。
    • Linux:x86_64,需要 glibc 2.39+。
  • 硬件:最低 8GB 内存、10GB 磁盘空间。推荐 16GB+ 内存、20GB+ SSD。GPU 可选,但推荐使用 NVIDIA CUDA 或 Apple Silicon 以获得更好性能。
  • Python(从源码运行时):需要 3.11 或 3.12 版本。

2. 安装包下载

从项目的 GitHub Releases 页面 下载对应系统的安装包:

  • macOS.dmg 文件(Apple Silicon)。
  • Windows.msi 安装包。
  • Linux.AppImage 文件。

3. 首次启动配置

  1. 安装并启动 VoiceStudio。
  2. 首次启动时,应用会自动创建一个托管的 Python 环境,并下载默认的 TTS 模型(这可能需要一些时间)。
  3. macOS 用户:首次启动可能需要右键点击应用图标 → 选择“打开” 来绕过 Gatekeeper 验证。
  4. 后续启动会复用已创建的环境和模型,速度会快很多。

🚀 快速上手:生成你的第一段语音

  1. 打开“语音克隆”:在主界面进入 Voice Cloning 功能。
  2. 提供参考音频:添加一段清晰的语音样本(3秒即可,5-15秒效果通常更好)。确保样本只包含一位说话者,无背景音乐和噪音。
  3. 输入文本与生成:在文本框中输入你想要合成的文字,选择语言,然后点击 Generate
  4. 等待并试听:应用会调用本地模型进行推理,稍等片刻即可播放和保存生成的音频。

⚙️ 高级功能与配置

  • 语音设计:不依赖参考音频,通过调整年龄、口音、音调、风格等参数创造全新声音。
  • 视频配音:导入视频,自动转录、翻译并替换原音轨,支持多说话人识别。
  • 有声书创作:导入 EPUB/PDF,支持多角色脚本和章节渲染,可导出 .m4b 格式。
  • 听写部件:通过系统级快捷键呼出,进行实时语音转录,并可选择本地 LLM 进行文本润色。
  • 模型目录:在 Model Catalogue 中,你可以安装、卸载和切换不同的 TTS/ASR 引擎,并根据硬件配置(CUDA/MPS/ROCm/CPU)为每个引擎设置运行设备。
  • 批处理队列:支持批量添加音频/视频生成任务,并查看每个任务的进度。

🔧 开发者集成

1. OpenAI 兼容 API

VoiceStudio 在本地 http://localhost:3900/v1 提供了一个与 OpenAI 音频 API 兼容的端点。你可以像使用 OpenAI API 一样调用它,例如使用 Python openai 库:

1
2
3
4
5
6
7
8
9
10
11
12
from openai import OpenAI

client = OpenAI(base_url="http://localhost:3900/v1", api_key="local")

# 语音合成
with client.audio.speech.with_streaming_response.create(
model="tts-1",
voice="<本地声音配置ID>",
input="你好,这是我的本地语音合成测试。",
response_format="wav",
) as response:
response.stream_to_file("speech.wav")

2. MCP 服务器

VoiceStudio 为 MCP 客户端提供了语音合成和转录工具。可通过 npx skills add debpalash/omnivoice-studio 为 Claude Code 等 AI 编程助手安装技能。

3. 远程工作节点(Remote Workers)

对于性能不足或需要多机协同的场景,可以配置远程工作节点,将生成任务分发到其他有 GPU 的机器上执行。

❓ 常见问题与排查

  • 首次启动或生成失败?
    1. 前往 Settings → About → Run self-check 运行诊断。
    2. 检查网络连接,确保能下载所需的模型权重(首次运行需要)。
    3. 查看 安装故障排查指南
  • 性能如何?
    性能高度依赖所选引擎和硬件。OmniVoice 引擎在 Apple Silicon 上使用 MPS 加速效果良好。具体可参考项目中的 性能基准测试
  • 生成的语音质量不如预期?
    • 克隆效果主要依赖参考音频质量(清晰、无噪音、情绪匹配)。
    • 可以尝试在“模型目录”中切换其他 TTS 引擎(如 CosyVoice 3, VoxCPM2)。
    • 长文本可尝试使用“有声书”或“批量生成”工作流以获得更好的连贯性。
  • 如何卸载?
    项目提供了卸载脚本:macOS/Linux 使用 scripts/uninstall.sh,Windows 使用 scripts\uninstall.ps1。脚本会先显示预删除项目清单,确认后才执行。

总结

VoiceStudio 是一个功能强大的本地语音 AI 工作站。对于普通用户,建议直接从官网下载对应系统的安装包,使用默认的 OmniVoice 引擎体验语音克隆和配音功能。其本地优先的特性保障了数据隐私,而丰富的引擎和功能使其足以应对从个人娱乐到专业内容创作的各种需求。如果你需要将语音能力集成到自己的应用中,其提供的 OpenAI 兼容 API 和 MCP 服务器降低了集成门槛。项目的 AGPL-3.0 许可证允许自由使用,但修改后公开提供服务需开源相应代码。