Pocket TTS 是一个极其轻量、高效,专为CPU运行设计的文本转语音(TTS)模型。它的核心目标是让高质量的语音合成变得简单、快速且资源友好。

🎯 核心特点与优势

Pocket TTS 的设计哲学是“轻量”和“高效”,其主要特点如下:

  • 极轻量级:模型仅有 1亿参数,体积小巧。
  • CPU高效运行:专为CPU优化,无需GPU。在MacBook Air M4上测试,速度可达实时播放速度的6倍,并且仅使用 2个CPU核心
  • 超低延迟:从输入文本到生成第一个音频块,延迟仅约 200毫秒,支持音频流式输出。
  • 功能丰富:支持语音克隆(可通过几秒的音频样本复制声音)、多语言(英、法、德、西、葡、意)以及无限长文本处理。
  • 易于使用:提供简洁的Python API和命令行工具,通过 pip install pocket-tts 即可安装。

🚀 快速上手

你可以通过以下几种方式立即体验:

  1. 命令行(CLI):最直接的方式。

    1
    2
    3
    uvx pocket-tts generate --text "你好,世界" --voice alba
    # 或使用 pip 安装后
    pocket-tts generate --text "Hello world" --voice anna
  2. Python库:集成到你的代码中。

    1
    2
    3
    4
    5
    from pocket_tts import TTSModel
    model = TTSModel.load_model()
    voice = model.get_state_for_audio_prompt("alba") # 或使用本地音频文件
    audio = model.generate_audio(voice, "你的文本")
    # 保存音频...
  3. 本地Web服务:运行 pocket-tts serve 启动一个带Web界面的本地服务器,方便快速测试不同声音和文本。

  4. 在线Demo:直接访问Kyutai官网在线体验,无需安装。

🔧 高级功能与生态

  • 语音克隆:通过 --voice 参数传递一个 .wav 音频文件路径,即可克隆该声音。
  • 社区与扩展:项目拥有活跃的社区,已经产生了许多有趣的二次开发和集成,例如:
    • 浏览器运行:通过WebAssembly (Wasm) 实现,如 wasm-pocket-tts
    • 其他语言绑定:如C++ (PocketTTS.cpp)、C#、Rust等。
    • 平台集成:有开发者将其集成到Home Assistant、Discord机器人、Unity游戏引擎等。
  • 训练代码已开源:你可以使用 training/ 目录下的代码训练自己的模型。

⚠️ 注意事项

  • 硬件依赖:虽然设计为CPU优先,但在某些x86 VM上,使用GPU可能获得更高速度(官方测试约2.6倍)。项目文档也详细说明了在GPU上运行的配置方法。
  • 使用限制:项目明确禁止将模型用于非法、欺骗、骚扰或未经同意的语音克隆等用途。
  • 许可证:代码和模型的具体许可证需查看项目根目录的 LICENSE 文件(通常为开源许可)。

💎 总结

Pocket TTS 是一个为“普及化”而生的TTS工具。它在保持高质量语音和丰富功能(如克隆、多语言)的同时,将运行门槛降到了最低——让普通的CPU电脑甚至浏览器都能流畅运行。如果你需要一个轻量、快速、可离线运行的语音合成解决方案,Pocket TTS是一个非常理想的选择。