Open-Source Frontier Voice AI
| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
| 6 个月前 | ||
| 3 个月前 | ||
| 4 个月前 | ||
| 6 个月前 | ||
| 4 个月前 | ||
| 4 个月前 | ||
| 8 个月前 | ||
| 4 个月前 | ||
| 11 个月前 | ||
| 1 个月前 | ||
| 11 个月前 | ||
| 4 个月前 |
📰 新闻
2026-07-23: ⚡ 我们发布了 VibeVoice-ASR-BitNet,这是一款适用于 VibeVoice-ASR 的边缘 CPU 推理引擎。通过异构量化(I8_S + I2_S),模型大小从 4.62 GB 压缩至 1.58 GB,并可在 3+ CPU 线程上实现实时推理(RTF < 1)——无需 GPU。[代码] [模型] [报告]
2026-03-12: 🚀 VibeVoice-ASR 现已集成到 Azure AI Foundry Labs!您现在可以通过 Microsoft Foundry 直接探索和测试我们的统一语音转文本功能。
2026-03-06: 🚀 VibeVoice ASR 现已成为 Transformers 发布版本的一部分!您现在可以通过 Hugging Face Transformers 库直接使用我们的语音识别模型,轻松集成到您的项目中。
2026-01-21: 📣 我们开源了 VibeVoice-ASR,这是一款统一的语音转文本模型,设计用于单次处理 60 分钟长音频,生成包含谁(说话人)、何时(时间戳)和内容(文本)的结构化转录,并支持用户自定义上下文。可在 演示平台 中试用。
- ⭐️ VibeVoice-ASR 原生支持多语言,覆盖 50 多种语言——详情请查看 支持语言。
- 🔥 VibeVoice-ASR 微调代码 现已发布!
- ⚡️ 现已支持 vLLM 推理,以实现更快的推理速度;更多详情请参见 vllm-asr。
- 📑 VibeVoice-ASR 技术报告 已发布。
2025-12-16: 📣 我们为 VibeVoice‑Realtime‑0.5B 添加了实验性说话人供探索,包括 9 种语言(德语、法语、意大利语、日语、韩语、荷兰语、波兰语、葡萄牙语、西班牙语)的多语言语音,以及 11 种不同风格的英语语音。试用。未来将添加更多类型的说话人。
2025-12-03: 📣 我们开源了 VibeVoice‑Realtime‑0.5B,这是一款实时文本转语音模型,支持流式文本输入和稳健的长语音生成。可在 Colab 中试用。
2025-09-05: VibeVoice 是一个开源研究框架,旨在促进语音合成社区的合作。发布后,我们发现该工具的使用方式与既定意图不一致。由于负责任地使用 AI 是微软的指导原则之一,我们已从本仓库中移除 VibeVoice-TTS 代码。
2025-08-25: 📣 我们开源了 VibeVoice-TTS,这是一款长音频多说话人文本转语音模型,可合成长达 90 分钟的语音,支持多达 4 个不同说话人。——已被 ICLR 2026 接收为 口头报告!🔥
概述
VibeVoice 是一个开源前沿语音 AI 模型系列,包含文本转语音(TTS)和自动语音识别(ASR)模型。
VibeVoice 的核心创新在于采用连续语音 tokenizer(声学和语义),其运行频率低至7.5 Hz。这些 tokenizer 在高效保留音频保真度的同时,显著提升了长序列处理的计算效率。VibeVoice 采用 next-token diffusion 框架,借助大型语言模型(LLM)理解文本语境和对话流程,并通过扩散头生成高保真度的声学细节。
如需更多信息、演示及示例,请访问我们的 项目页面。
| 模型 | 权重 | 快速试用 |
|---|---|---|
| VibeVoice-ASR-7B | HF 链接 | 体验平台 |
| VibeVoice-ASR-BitNet (CPU) | HF 链接 | VibeASR.cpp |
| VibeVoice-TTS-1.5B | HF 链接 | 暂未开放 |
| VibeVoice-Realtime-0.5B | HF 链接 | Colab |
模型
1. 📖 VibeVoice-ASR - 长音频语音识别
VibeVoice-ASR 是一款统一的语音转文本模型,设计用于单次处理 60 分钟长音频,生成包含说话人(Who)、时间戳(When)和内容(What) 的结构化转录文本,并支持自定义热词。
-
🕒 60 分钟单次处理: 不同于传统 ASR 模型将音频分割为短片段(常导致全局上下文丢失),VibeVoice ASR 可接受长达60 分钟的连续音频输入(64K token 长度内)。这确保了整个小时内一致的说话人跟踪和语义连贯性。
-
👤 自定义热词: 用户可提供自定义热词(如特定名称、技术术语或背景信息)来指导识别过程,显著提高特定领域内容的识别准确率。
-
📝 丰富转录信息(Who, When, What): 该模型联合执行 ASR、说话人分离和时间戳标注,生成结构化输出,清晰指示谁在何时说了什么。
📖 文档 | 🤗 Hugging Face | 🎮 体验平台 | 🛠️ 微调 | 📊 论文


2. 🎙️ VibeVoice-TTS - 长文本多 speaker 语音合成
适用场景:长对话音频、播客、多角色对话
-
⏱️ 90分钟长文本生成: 单次合成长达90分钟的对话式/单角色语音,全程保持角色一致性和语义连贯性。
-
👥 多角色支持: 支持单对话中4个不同角色,实现自然的对话交替和长对话中的角色一致性。
-
🎭 情感化语音: 生成富有表现力、自然流畅的语音,捕捉对话动态和情感细微差别。
-
🌐 多语言支持: 支持英语、中文及其他语言。
📖 文档 | 🤗 Hugging Face | 📊 论文
英语
中文
跨语言
即兴演唱
4人长对话
3. ⚡ VibeVoice-Streaming - 实时流式语音合成
VibeVoice-Realtime 是一款轻量级实时文本转语音模型,支持流式文本输入和稳定长文本语音生成。
- 参数规模:0.5B(部署友好)
- 实时语音合成(首段可听延迟约300毫秒)
- 流式文本输入
- 稳定长文本语音生成(约10分钟)
📖 文档 | 🤗 Hugging Face | 🚀 Colab
贡献指南
详细的贡献指南请参见 CONTRIBUTING.md。
⚠️ 风险与局限性
尽管我们已通过多种技术对其进行优化,但它仍可能产生意外、有偏见或不准确的输出。VibeVoice 会继承其基础模型(本版本中具体为 Qwen2.5 1.5b)所产生的任何偏见、错误或遗漏。
深度伪造与虚假信息风险:高质量的合成语音可能被滥用,用于创建具有说服力的虚假音频内容,以进行 impersonation、欺诈或传播虚假信息。用户必须确保转录文本可靠,检查内容准确性,并避免以误导性方式使用生成的内容。用户应确保以合法方式使用生成的内容和部署模型,完全遵守相关司法管辖区的所有适用法律法规。分享 AI 生成内容时,最好披露 AI 的使用情况。
我们不建议在未经进一步测试和开发的情况下,将 VibeVoice 用于商业或实际应用。本模型仅供研究和开发目的使用。请负责任地使用。