A PyTorch Implementation of End-to-End Models for Speech-to-Text
以下内容由 AI 翻译,如有问题请 点此提交 issue 反馈
语音识别
语音是一个开源包,旨在构建用于自动语音识别的端到端模型。当前支持注意力机制的序列到序列模型、连接时序分类(CTC)和循环神经网络序列转换器。
该软件的目标是促进语音识别中端到端模型的研究。模型使用PyTorch实现。
此软件仅在Python 3.6上进行了测试。
我们不会提供对Python 2.7的向后兼容性。
安装
建议创建一个虚拟环境并在其中安装Python需求。
virtualenv <你的环境路径>
source <你的环境路径>/bin/activate
pip install -r requirements.txt
然后按照适合您机器的PyTorch版本的安装说明操作。
所有Python依赖安装完成后,在项目顶层目录运行:
make
构建过程需要CMake和Make工具。
之后,从仓库根目录源码执行setup.sh脚本。
source setup.sh
考虑将其添加到您的bashrc文件中。
通过运行tests目录下的测试来验证安装是否成功。
cd tests
pytest
运行
要训练模型,请运行:
python train.py <配置文件路径>
模型训练完成后,可以使用以下命令进行评估:
python eval.py <模型路径> <数据JSON路径>
每个脚本可用选项可通过-h查看:
python {train, eval}.py -h
示例
欲了解模型配置与数据集的示例,请访问示例目录。每个示例数据集应包含下载和准备数据的指示和/或脚本。还应该有一个或多个模型配置可供选择。每个配置的结果将在对应的示例README.md文档中记录。