飞桨多语言OCR工具包(实用超轻量OCR系统,支持80+种语言识别,提供数据标注与合成工具,支持服务器、移动端、嵌入式及IoT设备端的训练与部署) Awesome multilingual OCR toolkits based on PaddlePaddle (practical ultra lightweight OCR system, support 80+ languages recognition, provide data annotation and synthesis tools, support training and deployment among server, mobile, embedded and IoT devices)
PaddleOCR能够将PDF文档和图像转换为结构化、LLM就绪的数据(JSON/Markdown),且具备行业领先的准确率。凭借70k+星标以及Dify、RAGFlow、Cherry Studio等顶级项目的信赖,PaddleOCR已成为构建智能RAG和智能体应用的坚实基础。
🚀 核心特性
📄 智能文档解析(支持大语言模型)
为大语言模型时代将杂乱的视觉内容转化为结构化数据。
- 业界领先的文档视觉语言模型:搭载PaddleOCR-VL-1.6(0.9B),这是业界领先的轻量级文档解析视觉语言模型。在OmniDocBench v1.6上准确率达到96.3%,在文本、公式和表格识别方面处于领先地位,并在古籍、生僻字、印章和图表识别能力上有显著提升,支持Markdown和JSON格式的结构化输出。
- 结构感知转换:借助PP-StructureV3,可将复杂的PDF和图像无缝转换为Markdown或JSON格式。与PaddleOCR-VL系列模型不同,它能提供更精细的坐标信息,包括表格单元格坐标、文本坐标等。
- 生产级效率:以超小模型体积实现商业级精度。在公开基准测试中表现优于众多闭源解决方案,同时保持资源高效性,适用于边缘/云端部署。
🔍 通用文本识别(场景OCR)
全球高速多语言文本检测与识别的黄金标准。
- 支持100+种语言:原生支持海量全球语言库。PP-OCRv6通过单一统一模型支持50种语言(中文、英文、日文及46种拉丁字母语言)——多语言文档无需切换模型。
- 复杂元素识别:除标准文本识别外,我们支持在各种环境下的自然场景文本检测与识别,包括身份证、街景、书籍和工业部件等。
- 性能飞跃:PP-OCRv6相比PP-OCRv5,检测准确率提升4.6%,识别准确率提升5.1%,超越主流视觉语言模型。端到端CPU推理速度提升5.2倍。
🛠️ 以开发者为中心的生态系统
- 无缝集成:AI Agent 生态系统的首选——深度集成 Dify、RAGFlow、Pathway 和 Cherry Studio。
- LLM 数据飞轮:构建高质量数据集的完整流水线,为大语言模型微调提供可持续的“数据引擎”。
- 一键部署:支持多种硬件后端(NVIDIA GPU、Intel CPU、昆仑芯 XPU 及各类 AI 加速器)。
📣 近期更新
🔥 2026.07.22:HPD-Parsing 正式发布
- HPD-Parsing 是一款轻量级视觉语言模型,专为高吞吐量文档解析设计。它采用分层并行解码范式和渐进式多 token 预测(P-MTP),在公开基准测试中实现 4,752 tokens/s 的峰值吞吐量,同时保持具有竞争力的解析精度。
- HPD-Parsing 支持 OpenAI 兼容服务和基于定制化 vLLM 运行时的本地推理,适用于对推理效率和部署吞吐量有高要求的文档解析场景。
- 环境配置、服务部署和本地推理说明,请参见 HPD-Parsing 使用教程。
2026.06.11:PaddleOCR 3.7.0 版本发布
-
PP-OCRv6 亮点:
- 精度提升:中型模型在检测和识别任务上较 PP-OCRv5_server 分别提升 4.6% 和 5.1%,仅用 34.5M 参数即超越主流 VLM(Qwen3-VL-235B、GPT-5.5)。
- 50 种语言统一:单一模型覆盖中文、英文、日文及 46 种拉丁文字语言——无需切换模型。
- 特定场景优化:数字显示屏、点阵字符、轮胎印记和工业文本识别性能大幅提升。
- 推理加速:CPU 速度提升 5.2 倍(OpenVINO),Apple M4 设备提升 6.1 倍(tiny 模型),A100 GPU 上推理仅需 0.13 秒。
- 全场景三级模型:tiny(1.5M)/ small(7.7M)/ medium(34.5M)分别适配边缘端、移动端和服务器端部署。
- 模型获取:所有模型已在 HuggingFace 和 ModelScope 开放下载。
2026.05.28:PaddleOCR 3.6.0 版本发布
-
PaddleOCR-VL-1.6 亮点:
- 全新 SOTA 精度:在 OmniDocBench v1.6 上达到 96.3% 以上准确率,同时刷新 OmniDocBench v1.5 和 Real5-OmniDocBench 基准记录,在文本、公式和表格识别领域领先开源及闭源方案。
- 综合能力升级:表格、古籍和生僻字识别显著提升,多场景下印章识别、文字检测和图表理解能力增强。
- 无缝迁移:模型架构与 PaddleOCR-VL-1.5 完全一致,实现零成本适配——即换即用。
- 立即体验:可在 HuggingFace 或 官方网站 获取。
2026.04.21:PaddleOCR 3.5.0 版本发布
- 灵活推理后端:无缝切换 Paddle 静态图、Paddle 动态图或 Transformers。PaddleOCR 现已深度集成 Hugging Face 生态,20 个主要模型支持以 Transformers 作为推理后端。
- 办公文档转 Markdown:支持将 Word、Excel、PowerPoint 等常见文档格式转换为 Markdown。
- 解析结果 DOCX 导出:
PaddleOCR-VL系列、PP-StructureV3和PP-DocTranslation支持将解析结果导出为 DOCX 格式,便于在 Microsoft Word 中查看和编辑。 - 官方浏览器推理 SDK:发布官方浏览器推理 SDK
PaddleOCR.js,支持在浏览器中直接运行PP-OCRv5。
2026.01.29:PaddleOCR 3.4.0 版本发布
- PaddleOCR-VL-1.5(SOTA 0.9B VLM):最新旗舰级文档解析模型正式上线!
- OmniDocBench 94.5% 准确率:超越顶级通用大模型和专业文档解析器。
- 真实场景鲁棒性:首创 PP-DocLayoutV3 算法实现不规则形状定位,攻克 倾斜、弯曲、扫描、光照不均、屏幕拍摄 5 大难题。
- 能力扩展:新增 印章识别、文字检测,语言支持扩展至 111 种(含中国藏文、孟加拉语等)。
- 长文档处理:支持跨页表格自动合并和层级标题识别。
- 立即体验:可在 HuggingFace 或 官方网站 获取。
2025.10.16:PaddleOCR 3.3.0 版本发布
-
发布 PaddleOCR-VL:
-
模型介绍:
- PaddleOCR-VL 是一款 SOTA 级高效文档解析模型。其核心组件 PaddleOCR-VL-0.9B 是一个紧凑而强大的视觉语言模型(VLM),集成了 NaViT 风格的动态分辨率视觉编码器与 ERNIE-4.5-0.3B 语言模型,实现精准元素识别。该创新模型高效支持 109 种语言,擅长识别复杂元素(如文本、表格、公式、图表),同时保持极低资源消耗。通过在主流公开基准和内部基准上的全面评估,PaddleOCR-VL 在页面级文档解析和元素级识别任务中均达到 SOTA 性能。它显著优于现有解决方案,与顶级 VLM 相比具有很强的竞争力,且推理速度快,非常适合实际场景部署。模型已在 HuggingFace 发布,欢迎下载使用!更多介绍请参见 PaddleOCR-VL。
-
核心特性:
- 紧凑高效的 VLM 架构:提出专为资源高效推理设计的新型视觉语言模型,在元素识别任务中实现卓越性能。通过将 NaViT 风格的动态高分辨率视觉编码器与轻量级 ERNIE-4.5-0.3B 语言模型集成,显著提升模型识别能力和解码效率。这种集成在保持高精度的同时降低计算需求,非常适合高效实用的文档处理应用。
- 文档解析 SOTA 性能:PaddleOCR-VL 在页面级文档解析和元素级识别任务中均达到 state-of-the-art 性能。它显著优于现有基于流水线的解决方案,并在文档解析任务中展现出与领先视觉语言模型(VLM)的强大竞争力。此外,它擅长识别复杂文档元素,如文本、表格、公式和图表,适用于包括手写文本和历史文档在内的多种挑战性内容类型,使其具有高度的通用性和广泛的文档类型适用性。
- 多语言支持:PaddleOCR-VL 支持 109 种语言,覆盖全球主要语言,包括但不限于中文、英文、日文、拉丁文、韩文,以及具有不同文字体系的语言,如俄语(西里尔字母)、阿拉伯语、印地语(天城文)和泰语。广泛的语言覆盖大幅提升了系统在多语言和全球化文档处理场景中的适用性。
-
-
发布 PP-OCRv5 多语言识别模型:
- 提升拉丁文字识别精度和覆盖范围;新增对西里尔文、阿拉伯文、天城文、泰卢固文、泰米尔文等语言体系的支持,覆盖 109 种语言识别。模型仅 2M 参数,部分模型精度较上一代提升超 40%。
2025.08.21:PaddleOCR 3.2.0 版本发布
-
重要模型新增:
- 新增 PP-OCRv5 英文、泰文、希腊文识别模型的训练、推理与部署支持。PP-OCRv5 英文模型在英文场景下较主 PP-OCRv5 模型提升 11%,泰文和希腊文识别模型准确率分别达到 82.68% 和 89.28%。
-
部署能力升级:
- 全面支持 PaddlePaddle 框架 3.1.0 和 3.1.1 版本。
- PP-OCRv5 C++ 本地部署方案全面升级,现已支持 Linux 和 Windows 系统,功能与精度和 Python 实现完全一致。
- 高性能推理支持 CUDA 12,可使用 Paddle Inference 或 ONNX Runtime 后端进行推理。
- 高稳定性服务化部署方案完全开源,用户可按需定制 Docker 镜像和 SDK。
- 高稳定性服务化部署方案同时支持通过手动构造 HTTP 请求调用,可实现任意编程语言的客户端代码开发。
-
基准测试支持:
- 所有产线支持细粒度基准测试,可测量端到端推理时间及每层、每模块的延迟数据,辅助性能分析。点击查看 基准测试功能的设置与使用方法。
- 文档更新主流硬件常用配置的关键指标,如推理延迟和内存占用,为用户提供部署参考。
-
问题修复:
- 解决模型训练过程中日志保存失败的问题。
- 升级公式模型的数据增强组件,以兼容新版本 albumentations 依赖,并修复多进程场景下使用 tokenizers 包时的死锁警告。
- 修复 PP-StructureV3 配置文件中开关行为(如
use_chart_parsing)与其他流水线不一致的问题。
-
其他增强:
- 分离核心依赖与可选依赖。基础文本识别仅需最小化核心依赖;文档解析、信息抽取等附加功能可按需安装依赖。
- 支持 Windows 系统 NVIDIA RTX 50 系列显卡;用户可参考 安装指南 获取对应的 PaddlePaddle 框架版本。
- PP-OCR 系列模型支持返回单字符坐标。
- 新增 AIStudio、ModelScope 等模型下载源,用户可指定模型下载来源。
- 新增 PP-Chart2Table 模块,支持图表转表格功能。
- 优化文档描述,提升易用性。
🚀 快速开始
步骤 1:在线体验
PaddleOCR 官方网站提供了交互式的 体验中心 和 API——无需进行任何设置,一键即可体验。
👉 访问官方网站
步骤 2:本地部署
若需在本地使用,请根据您的需求参考以下文档:
- PP-OCR 系列:参见 PP-OCR 文档
- PaddleOCR-VL 系列:参见 PaddleOCR-VL 文档
- PP-StructureV3:参见 PP-StructureV3 文档
- 更多功能:参见 更多功能文档
🧩 更多功能
- 将模型转换为 ONNX 格式:获取 ONNX 模型。
- 使用 OpenVINO、ONNX Runtime、TensorRT 等引擎加速推理,或使用 ONNX 格式模型进行推理:高性能推理。
- 使用多 GPU 和多进程加速推理:流水线并行推理。
- 将 PaddleOCR 集成到 C++、C#、Java 等语言编写的应用程序中:服务部署。
🔄 执行结果快速概览
PP-OCRv5
PP-StructureV3
PaddleOCR-VL
✨ 敬请期待
⭐ 请为该仓库点亮星标,以便及时获取令人振奋的更新和新版本发布,包括强大的OCR及文档解析功能! ⭐
👩👩👧👦 社区交流
| 飞桨官方微信公众号 | 加入技术交流群 |
|---|---|
![]() |
![]() |
😃 基于PaddleOCR的优秀项目
PaddleOCR能有今天的成就,离不开卓越的社区支持!💗 衷心感谢所有长期以来的合作伙伴、新加入的协作者,以及每一位为PaddleOCR倾注热情的朋友——无论是否提及您的名字。您的支持是我们前进的动力!
| 项目名称 | 项目描述 |
|---|---|
| Dify |
用于智能体工作流开发的生产级平台。 |
| RAGFlow |
基于深度文档理解的RAG引擎。 |
| pathway |
用于流处理、实时分析、LLM管道和RAG的Python ETL框架。 |
| MinerU |
多类型文档转Markdown转换工具 |
| Umi-OCR |
免费、开源、批量离线OCR软件。 |
| cherry-studio |
支持多种LLM提供商的桌面客户端。 |
| haystack |
用于构建可定制、生产级LLM应用的AI编排框架。 |
| OmniParser |
OmniParser:基于纯视觉的GUI智能体屏幕解析工具。 |
| QAnything |
基于任意内容的问答系统。 |
| 了解更多项目 | 更多基于PaddleOCR的项目 |
👩👩👧👦 贡献者
🌟 星标
📄 许可证
本项目基于 Apache 2.0 许可证 开源。
🎓 引用
@misc{cui2025paddleocr30technicalreport,
title={PaddleOCR 3.0 Technical Report},
author={Cheng Cui and Ting Sun and Manhui Lin and Tingquan Gao and Yubo Zhang and Jiaxuan Liu and Xueqing Wang and Zelun Zhang and Changda Zhou and Hongen Liu and Yue Zhang and Wenyu Lv and Kui Huang and Yichao Zhang and Jing Zhang and Jun Zhang and Yi Liu and Dianhai Yu and Yanjun Ma},
year={2025},
eprint={2507.05595},
archivePrefix={arXiv},
primaryClass={cs.CV},
url={https://arxiv.org/abs/2507.05595},
}
@misc{cui2025paddleocrvlboostingmultilingualdocument,
title={PaddleOCR-VL: Boosting Multilingual Document Parsing via a 0.9B Ultra-Compact Vision-Language Model},
author={Cheng Cui and Ting Sun and Suyin Liang and Tingquan Gao and Zelun Zhang and Jiaxuan Liu and Xueqing Wang and Changda Zhou and Hongen Liu and Manhui Lin and Yue Zhang and Yubo Zhang and Handong Zheng and Jing Zhang and Jun Zhang and Yi Liu and Dianhai Yu and Yanjun Ma},
year={2025},
eprint={2510.14528},
archivePrefix={arXiv},
primaryClass={cs.CV},
url={https://arxiv.org/abs/2510.14528},
}
@misc{cui2026paddleocrvl15multitask09bvlm,
title={PaddleOCR-VL-1.5: Towards a Multi-Task 0.9B VLM for Robust In-the-Wild Document Parsing},
author={Cheng Cui and Ting Sun and Suyin Liang and Tingquan Gao and Zelun Zhang and Jiaxuan Liu and Xueqing Wang and Changda Zhou and Hongen Liu and Manhui Lin and Yue Zhang and Yubo Zhang and Yi Liu and Dianhai Yu and Yanjun Ma},
year={2026},
eprint={2601.21957},
archivePrefix={arXiv},
primaryClass={cs.CV},
url={https://arxiv.org/abs/2601.21957},
}
@misc{zhang2026paddleocrvl16expandingfrontierdocument,
title={PaddleOCR-VL-1.6: Expanding the Frontier of Document Parsing with Under-Optimized Region Refinement and Progressive Post-Training},
author={Zelun Zhang and Hongen Liu and Suyin Liang and Yubo Zhang and Yiqing Xiang and Jiaxuan Liu and Ting Sun and Manhui Lin and Yue Zhang and Changda Zhou and Tingquan Gao and Cheng Cui and Yi Liu and Dianhai Yu and Yanjun Ma},
year={2026},
eprint={2606.03264},
archivePrefix={arXiv},
primaryClass={cs.CV},
url={https://arxiv.org/abs/2606.03264},
}
Introduction
飞桨多语言OCR工具包(一款实用的超轻量OCR系统,能够识别80余种语言,提供数据标注与合成工具,支持在服务器、移动端、嵌入式及IoT设备上进行训练与部署。) 令人赞叹的基于飞桨的多语言OCR工具包(一款实用的超轻量OCR系统,支持识别80多种语言,提供数据标注与合成工具,适用于服务器、移动端、嵌入式及IoT设备上的训练与部署。)【此简介由AI生成】
paddlepaddle.github.io/PaddleOCR/Customize your domain

