VibeVoice:基于语音AI技术的开源语音模型项目

Open-Source Frontier Voice AI

分支4Tags0
文件最后提交记录最后更新时间
6 个月前
3 个月前
4 个月前
6 个月前
4 个月前
4 个月前
8 个月前
4 个月前
11 个月前
1 个月前
11 个月前
4 个月前

🎙️ VibeVoice: Open-Source Frontier Voice AI

项目页面 Hugging Face TTS 报告 ASR 报告 Colab ASR 演示平台

microsoft%2FVibeVoice | Trendshift

VibeVoice Logo

📰 新闻

2026-07-23: ⚡ 我们发布了 VibeVoice-ASR-BitNet,这是一款适用于 VibeVoice-ASR 的边缘 CPU 推理引擎。通过异构量化(I8_S + I2_S),模型大小从 4.62 GB 压缩至 1.58 GB,并可在 3+ CPU 线程上实现实时推理(RTF < 1)——无需 GPU。[代码] [模型] [报告]

2026-03-12: 🚀 VibeVoice-ASR 现已集成到 Azure AI Foundry Labs!您现在可以通过 Microsoft Foundry 直接探索和测试我们的统一语音转文本功能。

2026-03-06: 🚀 VibeVoice ASR 现已成为 Transformers 发布版本的一部分!您现在可以通过 Hugging Face Transformers 库直接使用我们的语音识别模型,轻松集成到您的项目中。

2026-01-21: 📣 我们开源了 VibeVoice-ASR,这是一款统一的语音转文本模型,设计用于单次处理 60 分钟长音频,生成包含谁(说话人)、何时(时间戳)和内容(文本)的结构化转录,并支持用户自定义上下文。可在 演示平台 中试用。

  • ⭐️ VibeVoice-ASR 原生支持多语言,覆盖 50 多种语言——详情请查看 支持语言
  • 🔥 VibeVoice-ASR 微调代码 现已发布!
  • ⚡️ 现已支持 vLLM 推理,以实现更快的推理速度;更多详情请参见 vllm-asr
  • 📑 VibeVoice-ASR 技术报告 已发布。

2025-12-16: 📣 我们为 VibeVoice‑Realtime‑0.5B 添加了实验性说话人供探索,包括 9 种语言(德语、法语、意大利语、日语、韩语、荷兰语、波兰语、葡萄牙语、西班牙语)的多语言语音,以及 11 种不同风格的英语语音。试用。未来将添加更多类型的说话人。

2025-12-03: 📣 我们开源了 VibeVoice‑Realtime‑0.5B,这是一款实时文本转语音模型,支持流式文本输入和稳健的长语音生成。可在 Colab 中试用。

2025-09-05: VibeVoice 是一个开源研究框架,旨在促进语音合成社区的合作。发布后,我们发现该工具的使用方式与既定意图不一致。由于负责任地使用 AI 是微软的指导原则之一,我们已从本仓库中移除 VibeVoice-TTS 代码。

2025-08-25: 📣 我们开源了 VibeVoice-TTS,这是一款长音频多说话人文本转语音模型,可合成长达 90 分钟的语音,支持多达 4 个不同说话人。——已被 ICLR 2026 接收为 口头报告!🔥

概述

VibeVoice 是一个开源前沿语音 AI 模型系列,包含文本转语音(TTS)和自动语音识别(ASR)模型。

VibeVoice 的核心创新在于采用连续语音 tokenizer(声学和语义),其运行频率低至7.5 Hz。这些 tokenizer 在高效保留音频保真度的同时,显著提升了长序列处理的计算效率。VibeVoice 采用 next-token diffusion 框架,借助大型语言模型(LLM)理解文本语境和对话流程,并通过扩散头生成高保真度的声学细节。

如需更多信息、演示及示例,请访问我们的 项目页面

模型 权重 快速试用
VibeVoice-ASR-7B HF 链接 体验平台
VibeVoice-ASR-BitNet (CPU) HF 链接 VibeASR.cpp
VibeVoice-TTS-1.5B HF 链接 暂未开放
VibeVoice-Realtime-0.5B HF 链接 Colab

模型

1. 📖 VibeVoice-ASR - 长音频语音识别

VibeVoice-ASR 是一款统一的语音转文本模型,设计用于单次处理 60 分钟长音频,生成包含说话人(Who)、时间戳(When)和内容(What) 的结构化转录文本,并支持自定义热词

  • 🕒 60 分钟单次处理: 不同于传统 ASR 模型将音频分割为短片段(常导致全局上下文丢失),VibeVoice ASR 可接受长达60 分钟的连续音频输入(64K token 长度内)。这确保了整个小时内一致的说话人跟踪和语义连贯性。

  • 👤 自定义热词: 用户可提供自定义热词(如特定名称、技术术语或背景信息)来指导识别过程,显著提高特定领域内容的识别准确率。

  • 📝 丰富转录信息(Who, When, What): 该模型联合执行 ASR、说话人分离和时间戳标注,生成结构化输出,清晰指示何时说了什么

📖 文档 | 🤗 Hugging Face | 🎮 体验平台 | 🛠️ 微调 | 📊 论文

DER
cpWER
tcpWER


2. 🎙️ VibeVoice-TTS - 长文本多 speaker 语音合成

适用场景:长对话音频、播客、多角色对话

  • ⏱️ 90分钟长文本生成: 单次合成长达90分钟的对话式/单角色语音,全程保持角色一致性和语义连贯性。

  • 👥 多角色支持: 支持单对话中4个不同角色,实现自然的对话交替和长对话中的角色一致性。

  • 🎭 情感化语音: 生成富有表现力、自然流畅的语音,捕捉对话动态和情感细微差别。

  • 🌐 多语言支持: 支持英语、中文及其他语言。

📖 文档 | 🤗 Hugging Face | 📊 论文

VibeVoice Results

英语

中文

跨语言

即兴演唱

4人长对话


3. ⚡ VibeVoice-Streaming - 实时流式语音合成

VibeVoice-Realtime 是一款轻量级实时文本转语音模型,支持流式文本输入稳定长文本语音生成

  • 参数规模:0.5B(部署友好)
  • 实时语音合成(首段可听延迟约300毫秒)
  • 流式文本输入
  • 稳定长文本语音生成(约10分钟)

📖 文档 | 🤗 Hugging Face | 🚀 Colab


贡献指南

详细的贡献指南请参见 CONTRIBUTING.md

⚠️ 风险与局限性

尽管我们已通过多种技术对其进行优化,但它仍可能产生意外、有偏见或不准确的输出。VibeVoice 会继承其基础模型(本版本中具体为 Qwen2.5 1.5b)所产生的任何偏见、错误或遗漏。

深度伪造与虚假信息风险:高质量的合成语音可能被滥用,用于创建具有说服力的虚假音频内容,以进行 impersonation、欺诈或传播虚假信息。用户必须确保转录文本可靠,检查内容准确性,并避免以误导性方式使用生成的内容。用户应确保以合法方式使用生成的内容和部署模型,完全遵守相关司法管辖区的所有适用法律法规。分享 AI 生成内容时,最好披露 AI 的使用情况。

我们不建议在未经进一步测试和开发的情况下,将 VibeVoice 用于商业或实际应用。本模型仅供研究和开发目的使用。请负责任地使用。

星标历史

Star History Chart

项目介绍

开源前沿语音人工智能【此简介由AI生成】

定制我的领域
26153.37 K6.02 K访问 GitHub