Recognizers-Text:多语言实体识别与解析工具,支持数字、日期时间等多类型实体

Microsoft.Recognizers.Text provides recognition and resolution of numbers, units, date/time, etc. in multiple languages (ZH, EN, FR, ES, PT, DE, IT, TR, HI, NL. Partial support for JA, KO, AR, SV). Packages available at: https://www.nuget.org/profiles/Recognizers.Text, https://www.npmjs.com/~recognizers.text

分支50Tags64
文件最后提交记录最后更新时间
8 个月前
6 年前
3 年前
3 年前
1 年前
1 年前
6 年前
1 年前
3 年前
5 年前
7 年前
7 年前
9 年前
3 年前
4 年前
4 年前
3 年前
7 年前

微软识别器文本概览

构建状态 构建状态

微软的Microsoft.Recognizers.Text提供了一套强大的实体识别与解析功能,能够处理多种语言中的数字、单位和日期/时间表达。它全面支持中文、英语、法语、西班牙语、葡萄牙语、德语、意大利语、土耳其语、印地语和荷兰语。部分支持日语、韩语、阿拉伯语和瑞典语,并计划进一步扩展。

利用该项目

Microsoft.Recognizers.Text为LUIS:语言理解智能服务、Power Virtual Agents以及微软机器人框架提供了预建的实体识别能力,同时也是Text Analytics认知服务中基础实体类型的基础,并可作为独立包(用于基本类和其他不同实体的识别器)使用。

目前,Microsoft.Recognizers.Text针对以下四个平台开发:

非常欢迎贡献!无论是对现有支持的语言进行修复和扩展,还是向新的语言迈进。 特别是对于日语、韩语、阿拉伯语、瑞典语等!更多信息请见下方。

.NET是主要的包版本,随着时间推移,贡献会传播到其他平台。

引用Recognizers-Text项目

如果您在学术作品中使用了这些识别器,请按以下方式引用(您可以省略版本号或更新为特定版本,如果相关):

@software{soft:recognizers-text,
  author    = {Wenhao Huang and Zijia Lin and Chris McConnell and Börje F. Karlsson},
  title     = {Recognizers-Text: Recognition and resolution of numbers, units, and date/time entities expressed across multiple languages},
  month     = jul,
  year      = 2017,
  publisher = {Zenodo},
  version   = {1.0.0},
  doi       = {10.5281/zenodo.6860598},
  url       = {https://doi.org/10.5281/zenodo.6860598}
}

如果适合您的模板,可以自由地将"@software"更改为"@misc"。

帮助

如果有任何问题,尽管创建一个议题,即使它并非实际的错误。议题也是合适的讨论论坛。

贡献

本项目采纳了微软开源行为准则。更多详情请看行为准则常见问题或通过opencode@microsoft.com联系以提出额外的问题或评论。

贡献的良好起点包括:

  • 开放的问题列表(尤其是标记为“帮助需要”的那些);
  • 暂时标记为“不支持”的JSON规范案例(Specs);
  • 翻译英文的JSON测试规范案例,但目标语言中尚不存在。

下面的链接描述了项目结构,并提供了概述和如何贡献的提示(虽然某些步骤可能稍显过时)。谢谢!

不同文化背景下的支持实体

下表总结了当前支持的实体。通常,对英语的支持更为完整。主要平台为.NET(如表格所示),支持应逐渐扩展到其他平台。

实体类型 EN ZH-CN NL FR DE IT JA KO PT ES
数字(基数) √ √ √ √ √ √ √ √ √ √
序数 √ √ √ √ √ √ √ √ √ √
百分比 √ √ √ √ √ √ √ √ √ √
数字范围 √ √ √ √ √ √ PA/EO √ √ √
单位 - 年龄 √ √ √ √ √ √ √ PA/EO √ √
单位 - 货币 √ √ √ √ √ √ √ PA/EO √ √
单位 - 尺寸 √ √ √ √ √ √ √ PA/EO √ √
单位 - 温度 √ √ √ √ √ √ √ √ √ √
选择 - 布尔 √ √ √ √ √ √ √ SO √ √
序列 - 电子邮件 G G* G G G G G* G* G G
序列 - GUID G G G G G G G G G G
序列 - 社交媒体 G G G G G G G G G G
序列 - IP地址 G G G G G G G G G G
序列 - 电话号码 G G G G G G G G G G
序列 - URL G G* G G G G G* G* G G
日期/时间(子类型) √ √ √ √ √ √ √ SO √ √

其他文化和支持情况也在表中列出,符号说明如下:

  • G: 通用实体,非语言特有(不支持Unicode顶级域名);
  • EO: 仅抽取(解析/规范化待完成);
  • PA: 部分支持(类型未完全支持);
  • SO: 只有规范(测试规范覆盖良好,但支持待完成);
  • SP: 部分规范;
  • SI: 非常初步的规范(通常是新语言支持的开始)。

项目介绍

Microsoft.Recognizers.Text 提供了对多种语言(包括中文、英文、法语、西班牙语、葡萄牙语、德语、意大利语、土耳其语、印地语、荷兰语等,以及日语、韩语、阿拉伯语、瑞典语的局部支持)中的数字、单位、日期/时间的识别与解析功能。相关软件包可通过以下链接获取:https://www.nuget.org/profiles/Recognizers.Text, https://www.npmjs.com/~recognizers.text。【此简介由AI生成】

定制我的领域
621.8 K435访问 GitHub