本中英平行语料库提供了8400多对经过精细预处理的中英语句,适用于自然语言处理研究和开发。语料库采用jieba工具进行中文分词,并确保标点符号的准确性,所有数据以制表符分隔保存于en-zh.csv文件中。数据以句粒度对齐,经过裁剪后可提供5万对高质量中英语句。原始数据中的问题句子已被剔除,确保语料库质量。项目还提供预处理脚本和适用于pytorch框架的数据集实现,方便用户使用。本语料库仅供个人研究和学术用途,期待您的反馈,共同推动自然语言处理技术的发展。
本中英平行语料库提供了8400多对经过精细预处理的中英语句,适用于自然语言处理研究和开发。语料库采用jieba工具进行中文分词,并确保标点符号的准确性,所有数据以制表符分隔保存于en-zh.csv文件中。数据以句粒度对齐,经过裁剪后可提供5万对高质量中英语句。原始数据中的问题句子已被剔除,确保语料库质量。项目还提供预处理脚本和适用于pytorch框架的数据集实现,方便用户使用。本语料库仅供个人研究和学术用途,期待您的反馈,共同推动自然语言处理技术的发展。