一个开源的桌面语音工具。能在本地完成克隆、设计、配音、听写和有声书制作。没有订阅,也没有用量计费
一个开源的桌面语音工具,能在本地完成声音克隆、配音、有声书制作这些活儿,不用订阅付费,数据也不往上传。
Github地址
https://github.com/debpalash/VoiceStudio
功能特性
- 语音克隆:给3秒参考音频就能复刻声音,零样本起步
- 声音设计:性别、年龄、口音、音高、语速、情感都能调
- 视频配音:丢YouTube链接或本地视频进去,自动转录、翻译、重新配音,输出MP4
- 有声书编辑器:导入EPUB或PDF,自动分章节,做完导出.m4b
- 故事模式:多角色分派不同声音,整段故事配出来
- 全局听写:按⌘+⇧+Space,在哪都能转文字,自动粘贴
- 人声分离、说话人分离、批量队列、AI水印这些也有
系统要求
| 最低配置 | 推荐配置 | |
|---|---|---|
| 操作系统 | Windows 10、macOS 12+(Apple Silicon)、Ubuntu 24.04+(glibc 2.39+) | 任意现代 64 位操作系统 |
| 内存 | 8 GB | 16 GB+ |
| 显存(GPU) | 4 GB(自动将 TTS 卸载到 CPU) | 8 GB+(NVIDIA RTX 3060+) |
| 硬盘 | 10 GB 可用空间(模型 + 缓存) | 20 GB+ SSD |
| Python | 3.10+(由 uv 管理) | 3.11–3.12 |
| GPU | 可选——CPU 也能跑 | NVIDIA CUDA · Apple Silicon MPS · AMD ROCm(仅 Linux) |
部署方式
直接下安装包最省事,macOS、Windows、Linux都有对应版本。macOS第一次开可能得右键点”打开”过Gatekeeper,Intel Mac跑不了本地后端,只能连远程。Linux要glibc 2.39以上,显存4GB能跑,8GB以上更顺。也可以走Docker,镜像在Docker Hub和GitHub Container Registry都有。喜欢折腾的从源码跑,用uv管Python环境,装完依赖启动前后端就行。
远程后端、MCP服务器这些进阶玩法也支持,UI可以连到另一台机器上跑的后端,Tailscale组网也能用。
本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来自 马斯克的赛博空间!
评论


