VibeVoice是微软开源的一个前沿语音AI模型家族,专注于高质量的语音合成(TTS)和识别(ASR)
VibeVoice是微软开源的一个前沿语音AI模型家族,专注于高质量的语音合成(TTS)和识别(ASR)。它的核心特点是能处理超长音频,并支持多说话人场景。
🎯 核心模型与能力
VibeVoice包含三个主要模型,各有侧重:
| 模型 | 核心能力 | 关键数据 |
|---|---|---|
| VibeVoice-ASR (语音识别) | 一次处理长达60分钟的音频,能同时输出“谁(Who)、何时(When)、说什么(What)”的结构化转录,并支持自定义热词。 | 7B参数,支持50+语言,已集成到Hugging Face Transformers库。 |
| VibeVoice-TTS (语音合成) | 生成最长90分钟、包含最多4个不同说话人的连贯对话式语音,适用于播客、有声书等。 | 1.5B参数,支持中英文等多语言。注意:因滥用风险,TTS代码已从仓库移除,但模型权重仍可通过Hugging Face获取。 |
| VibeVoice-Realtime (实时流式TTS) | 轻量级(0.5B参数)实时语音合成,支持流式文本输入,首次延迟约300毫秒。 | 支持9种语言的多语言声音和11种英语风格声音。 |
💡 技术亮点与创新
整个VibeVoice系列共享一项核心技术:使用超低帧率(7.5Hz)的连续语音标记器。这项技术能在保证音频质量的同时,大幅提升处理超长语音序列的计算效率。模型采用“下一个令牌扩散”框架,结合了LLM的文本理解能力和扩散头的高保真音频生成能力。
⚠️ 重要注意事项
- 研究用途为主:项目明确声明,模型主要用于研究开发,不推荐未经充分测试就在商业或实际应用中使用。
- 风险与局限:项目指出了潜在风险,包括可能产生有偏见或不准确的输出,以及被滥用于制造深度伪造语音的风险。用户需合法、负责任地使用。
- 代码可用性:由于早期版本(TTS)曾被滥用,微软已移除其代码,但模型权重仍然开放。ASR和Realtime模型的代码和权重均可用。
🚀 快速上手
你可以通过以下方式快速体验:
- ASR模型:在Hugging Face上直接使用,或通过Azure AI Foundry Labs测试。
- Realtime模型:在Google Colab上运行示例。
- 所有模型:从Hugging Face下载模型权重进行本地部署。
本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来源 极客的赛博空间 | 专注 AI 与技术分享!
评论









