一个开源的桌面语音工具,能在本地完成声音克隆、配音、有声书制作这些活儿,不用订阅付费,数据也不往上传。

Github地址

https://github.com/debpalash/VoiceStudio

功能特性

  • 语音克隆:给3秒参考音频就能复刻声音,零样本起步
  • 声音设计:性别、年龄、口音、音高、语速、情感都能调
  • 视频配音:丢YouTube链接或本地视频进去,自动转录、翻译、重新配音,输出MP4
  • 有声书编辑器:导入EPUB或PDF,自动分章节,做完导出.m4b
  • 故事模式:多角色分派不同声音,整段故事配出来
  • 全局听写:按⌘+⇧+Space,在哪都能转文字,自动粘贴
  • 人声分离、说话人分离、批量队列、AI水印这些也有

系统要求

最低配置推荐配置
操作系统Windows 10、macOS 12+(Apple Silicon)、Ubuntu 24.04+(glibc 2.39+)任意现代 64 位操作系统
内存8 GB16 GB+
显存(GPU)4 GB(自动将 TTS 卸载到 CPU)8 GB+(NVIDIA RTX 3060+)
硬盘10 GB 可用空间(模型 + 缓存)20 GB+ SSD
Python3.10+(由 uv 管理)3.11–3.12
GPU可选——CPU 也能跑NVIDIA CUDA · Apple Silicon MPS · AMD ROCm(仅 Linux)

部署方式

直接下安装包最省事,macOS、Windows、Linux都有对应版本。macOS第一次开可能得右键点”打开”过Gatekeeper,Intel Mac跑不了本地后端,只能连远程。Linux要glibc 2.39以上,显存4GB能跑,8GB以上更顺。也可以走Docker,镜像在Docker Hub和GitHub Container Registry都有。喜欢折腾的从源码跑,用uv管Python环境,装完依赖启动前后端就行。

远程后端、MCP服务器这些进阶玩法也支持,UI可以连到另一台机器上跑的后端,Tailscale组网也能用。