Amphion:基于音频技术的生成工具包项目

Amphion (/æmˈfaɪən/) is a toolkit for Audio, Music, and Speech Generation. Its purpose is to support reproducible research and help junior researchers and engineers get started in the field of audio, music, and speech generation research and development.

分支2Tags3
当前项目代码仓暂无内容

Amphion: 开源音频、音乐与语音生成工具包

open-mmlab%2FAmphion | Trendshift

Amphion (/æmˈfaɪən/) 是一个用于音频、音乐和语音生成的工具包。 其目的是支持可复现的研究,并帮助初级研究人员和工程师在音频、音乐和语音生成的研发领域快速入门。Amphion 具有一项独特功能:经典模型或架构的可视化。我们相信,这些可视化对于希望深入理解模型的初级研究人员和工程师大有裨益。

Amphion 的核心目标是提供一个研究如何将任意输入转换为音频的平台。 Amphion 旨在支持多种独立的生成任务,包括但不限于:

  • TTS:文本转语音(⛳ 已支持)
  • SVS:歌声合成(⛳ 已支持)
  • VC:语音转换(⛳ 已支持)
  • AC:口音转换(⛳ 已支持)
  • SVC:歌声转换(⛳ 已支持)
  • TTA:文本转音频(⛳ 已支持)
  • TTM:文本转音乐(👨‍💻 开发中)
  • 更多……

除了特定的生成任务外,Amphion 还包含多个声码器评估指标。声码器是生成高质量音频信号的重要模块,而评估指标对于确保生成任务中度量标准的一致性至关重要。此外,Amphion 致力于推动音频生成在实际应用中的发展,例如为语音合成构建大规模数据集

🚀 最新动态

  • 2026/03/25:我们发布了 Vevo2,这是一个用于语音和歌唱声音生成的统一且可控的框架。Vevo2 通过统一的韵律学习,架起了可控语音与歌唱声音生成之间的桥梁,支持文本转语音(TTS)、歌声合成(SVS)、语音转换(VC)、歌唱声音转换(SVC)、歌唱声音编辑、歌唱风格转换、旋律控制等多种功能。arXiv hf WebPage readme
  • 2025/05/26:我们发布了 DualCodec,这是一种低帧率(12.5Hz 或 25Hz)、语义增强(含 SSL 特征)的神经音频编解码器,旨在提取离散令牌以实现高效的语音生成。paperOpen In Colabdemo pagecode
  • 2025/04/12:我们发布了 Vevo1.5,它扩展了 Vevo,专注于语音和歌唱声音的统一可控生成。Vevo1.5 可应用于一系列语音和歌唱声音生成任务,包括语音转换(VC)、文本转语音(TTS)、音频转换(AC)、歌声合成(SVS)、歌唱声音转换(SVC)、语音/歌唱声音编辑、歌唱风格转换等。blog
  • 2025/02/26:我们发布了 Metis,这是一个用于统一语音生成的基础模型。该系统支持零样本文本转语音、语音转换、目标说话人提取、语音增强以及唇语转语音。arXiv hf
  • 2025/02/26Emilia-Large 数据集现已发布,包含超过 200,000 小时的数据! Emilia-Large 结合了原始的 101k 小时 Emilia 数据集(基于 CC BY-NC 4.0 许可)和全新的 114k 小时 Emilia-YODAS 数据集(基于 CC BY 4.0 许可)。可通过 hf 下载。详情请查看 arXiv
  • 2025/01/30:我们发布了 Amphion v0.2 技术报告,全面概述了 2024 年 Amphion 的更新内容。arXiv
  • 2025/01/23MaskGCTVevo 已被 ICLR 2025 接收!🎉
  • 2024/12/22:我们发布了 Vevo 的复现版本,这是一个具有可控音调和风格的零样本声音模仿框架。Vevo 可应用于一系列语音生成任务,包括语音转换(VC)、文本转语音(TTS)、音频转换(AC)等。发布的预训练模型在 Emilia 数据集上训练,实现了最先进的零样本语音转换性能。arXiv hf WebPage readme
  • 2024/10/19:我们发布了 MaskGCT,这是一种完全非自回归的文本转语音模型,无需文本和语音监督之间的显式对齐信息。MaskGCT 在 Emilia 数据集上训练,实现了最先进的零样本文本转语音性能。 arXiv hf hf ModelScope ModelScope readme
  • 2024/09/01AmphionEmiliaDSFF-SVC 已被 IEEE SLT 2024 接收!🤗
  • 2024/08/28:欢迎加入 Amphion 的 Discord 频道,与我们的社区保持联系并参与互动!
  • 2024/08/20SingVisio 已被《Computers & Graphics》接收,点击此处查看!🎉
  • 2024/08/27Emilia 数据集现已公开! 探索这个拥有 101k 小时野外语音数据的最广泛、最多样化的语音生成数据集,可通过 hfOpenDataLab 获取!👑👑👑
  • 2024/07/01:Amphion 现已发布 Emilia,这是首个开源的多语言野外语音生成数据集,包含超过 101k 小时的语音数据,以及 Emilia-Pipe,这是首个开源的预处理管道,旨在将野外语音数据转换为带注释的高质量训练数据,用于语音生成!arXiv hf demo readme
  • 2024/03/12:Amphion 现已支持 NaturalSpeech3 FACodec 并发布预训练检查点。arXiv hf hf readme
  • 2024/02/22:首个 Amphion 可视化工具 SingVisio 发布。arXiv openxlab Video readme
  • 2023/12/18:Amphion v0.1 版本发布。arXiv hf youtube readme
  • 2023/11/28:Amphion alpha 版本发布。readme

⭐ 核心特性

文本转语音(TTS)

  • Amphion 在文本转语音(TTS)系统上实现了与现有开源仓库相比的最先进性能。它支持以下模型或架构:
    • FastSpeech2:一种非自回归 TTS 架构,采用前馈 Transformer 块。code
    • VITS:一种端到端 TTS 架构,采用带有对抗学习的条件变分自编码器。code
    • VALL-E:一种零样本 TTS 架构,使用带有离散码的神经编解码器语言模型。code
    • NaturalSpeech2:一种 TTS 架构,采用潜在扩散模型生成自然听感的语音。code
    • Jets:一种端到端 TTS 模型,通过对齐模块联合训练 FastSpeech2 和 HiFi-GAN。code
    • MaskGCT:一种完全非自回归 TTS 架构,无需文本和语音监督之间的显式对齐信息。code
    • Vevo-TTS:一种具有可控音色和风格的零样本 TTS 架构。它由一个自回归 Transformer 和一个流匹配 Transformer 组成。code
    • DualCodec-VALLE:一种在 12.5Hz DualCodec 令牌上训练的 VALLE 模型,可实现超快速生成。

语音转换(VC: Voice Conversion)

Amphion 支持以下语音转换模型:

  • Vevo:一种零样本语音模仿框架,支持可控的音色和风格。Vevo-Timbre 用于保留风格的语音转换,Vevo-Voice 用于转换风格的语音转换。code
  • FACodec:FACodec 将语音分解为代表不同属性(如内容、韵律和音色)的子空间。它可以实现零样本语音转换。code
  • Noro:一个噪声鲁棒的零样本语音转换系统。Noro 引入了专为使用含噪参考语音进行语音转换而设计的创新组件,包括双分支参考编码模块和噪声无关对比说话人损失。code

神经音频编解码器(Neural Audio Codec)

  • DualCodec,一种低帧率(12.5Hz 或 25Hz)、语义增强(含 SSL 特征)的神经音频编解码器,旨在提取离散令牌以实现高效语音生成。paperOpen In Colabdemo pagecode
  • FACodec:FACodec 将语音分解为代表不同属性(如内容、韵律和音色)的子空间。code

AC:口音转换

  • Amphion 通过 Vevo-Style 支持口音转换。特别地,它能够以零样本的方式进行口音转换。code

SVC:歌唱 voice 转换

  • Vevo2:一个用于语音和歌唱 voice 生成的统一且可控的框架。Vevo2 支持风格保留的 VC/SVC、风格转换的 VC/SVC、TTS、SVS、歌唱 voice 编辑、歌唱风格转换、旋律控制等功能。arXiv code
  • Vevo1.5:一个用于统一语音和歌唱 voice 生成的多功能零样本 voice 模仿框架,支持 VC、TTS、AC、SVS、SVC、编辑、歌唱风格转换等功能。code
  • Amphion 支持来自多种预训练模型的多种基于内容的特征,包括 WeNetWhisperContentVec。它们在 SVC 中的具体作用已在我们的 SLT 2024 论文中进行了研究。arXiv code
  • Amphion 实现了多种最先进的模型架构,包括基于扩散、Transformer、VAE 和流的模型。基于扩散的架构使用 双向扩张 CNN 作为后端,并支持多种采样算法,如 DDPMDDIMPNDM。此外,它还支持基于 一致性模型 的单步推理。code

TTA:文本转音频

  • Amphion 通过潜在扩散模型支持 TTA。其设计参考了 AudioLDMMake-an-AudioAUDIT。同时,它也是我们 NeurIPS 2023 论文中文本转音频生成部分的官方实现。arXiv code

声码器

评估

Amphion 提供对生成音频的全面客观评估。code

支持的评估指标包括:

  • F0 建模:F0 皮尔逊相关系数、F0 周期性均方根误差、F0 均方根误差、清浊音 F1 分数等。
  • 能量建模:能量均方根误差、能量皮尔逊相关系数等。
  • 可懂度:字符/词错误率,可基于 Whisper 等工具计算。
  • 频谱失真:弗雷歇音频距离(FAD)、梅尔倒谱失真(MCD)、多分辨率短时傅里叶变换距离(MSTFT)、语音质量感知评估(PESQ)、短时客观可懂度(STOI)等。
  • 说话人相似度:余弦相似度,可基于 RawNet3ResemblyzerWeSpeakerWavLM 等工具计算。

数据集

可视化

Amphion 提供了可视化工具,用于交互式地展示经典模型的内部处理机制。这为教学目的和促进可理解的研究提供了宝贵资源。

目前,Amphion 支持 SingVisio,这是一个用于歌声转换的扩散模型可视化工具。arXiv openxlab Video

📀 安装

Amphion 可通过安装程序或 Docker 镜像进行安装。

安装程序

git clone https://github.com/open-mmlab/Amphion.git
cd Amphion

# Install Python Environment
conda create --name amphion python=3.9.15
conda activate amphion

# Install Python Packages Dependencies
sh env.sh

Docker 镜像

  1. 安装 DockerNVIDIA 驱动NVIDIA Container ToolkitCUDA

  2. 运行以下命令:

git clone https://github.com/open-mmlab/Amphion.git
cd Amphion

docker pull realamphion/amphion
docker run --runtime=nvidia --gpus all -it -v .:/app realamphion/amphion

使用 Docker 时,通过参数 -v 挂载数据集是必要的操作。更多详细信息,请参考在 Docker 容器中挂载数据集Docker 文档

🐍 Python 中的使用方法

以下教程详细说明了不同任务的操作步骤:

👨‍💻 贡献代码

我们非常欢迎所有有助于改进 Amphion 的贡献。贡献指南请参见CONTRIBUTING.md

🙏 致谢

©️ 许可证

Amphion 遵循 MIT 许可证。它可免费用于研究和商业用途。

📚 引用

Amphion v0.2:

@article{amphion_v0.2,
  title        = {Overview of the Amphion Toolkit (v0.2)},
  author       = {Jiaqi Li and Xueyao Zhang and Yuancheng Wang and Haorui He and Chaoren Wang and Li Wang and Huan Liao and Junyi Ao and Zeyu Xie and Yiqiao Huang and Junan Zhang and Zhizheng Wu},
  year         = {2025},
  journal      = {arXiv preprint arXiv:2501.15442},
}

Amphion v0.1:

@inproceedings{amphion,
    author={Xueyao Zhang and Liumeng Xue and Yicheng Gu and Yuancheng Wang and Jiaqi Li and Haorui He and Chaoren Wang and Ting Song and Xi Chen and Zihao Fang and Haopeng Chen and Junan Zhang and Tze Ying Tang and Lexiao Zou and Mingxuan Wang and Jun Han and Kai Chen and Haizhou Li and Zhizheng Wu},
    title={Amphion: An Open-Source Audio, Music and Speech Generation Toolkit},
    booktitle={{IEEE} Spoken Language Technology Workshop, {SLT} 2024},
    year={2024}
}

项目介绍

阿姆菲翁(/æmˈfaɪən/)是一款用于音频、音乐与语音生成的工具包。其宗旨在于支持可复现的研究,并帮助初级研究人员和工程师在音频、音乐与语音生成研究领域和开发工作中入门。【此简介由AI生成】

定制我的领域
9010.28 K850访问 GitHub