speech:基于 PyTorch 的自动语音识别端到端模型项目

A PyTorch Implementation of End-to-End Models for Speech-to-Text

分支5Tags0
文件最后提交记录最后更新时间
7 年前
7 年前
7 年前
8 年前
8 年前
8 年前
7 年前
8 年前
5 年前
8 年前
7 年前

语音识别

语音是一个开源包,旨在构建用于自动语音识别的端到端模型。当前支持注意力机制的序列到序列模型、连接时序分类(CTC)和循环神经网络序列转换器。

该软件的目标是促进语音识别中端到端模型的研究。模型使用PyTorch实现。

此软件仅在Python 3.6上进行了测试。

我们不会提供对Python 2.7的向后兼容性。

安装

建议创建一个虚拟环境并在其中安装Python需求。

virtualenv <你的环境路径>
source <你的环境路径>/bin/activate
pip install -r requirements.txt

然后按照适合您机器的PyTorch版本的安装说明操作。

所有Python依赖安装完成后,在项目顶层目录运行:

make

构建过程需要CMake和Make工具。

之后,从仓库根目录源码执行setup.sh脚本。

source setup.sh

考虑将其添加到您的bashrc文件中。

通过运行tests目录下的测试来验证安装是否成功。

cd tests
pytest

运行

要训练模型,请运行:

python train.py <配置文件路径>

模型训练完成后,可以使用以下命令进行评估:

python eval.py <模型路径> <数据JSON路径>

每个脚本可用选项可通过-h查看:

python {train, eval}.py -h

示例

欲了解模型配置与数据集的示例,请访问示例目录。每个示例数据集应包含下载和准备数据的指示和/或脚本。还应该有一个或多个模型配置可供选择。每个配置的结果将在对应的示例README.md文档中记录。

项目介绍

端到端语音识别模型在PyTorch框架下的实现:将语音转换为文本【此简介由AI生成】

定制我的领域