可用于 PDF 等文档的数据提取、分析、转换及操作。它为 MuPDF 提供 Python 绑定和抽象,性能高效,无强制外部依赖,支持可选功能扩展如 OCR 和字体子集创建。【此简介由AI生成】
| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
| 1 年前 | ||
| 1 年前 | ||
| 1 年前 | ||
| 1 年前 | ||
| 1 年前 | ||
| 1 年前 | ||
| 1 年前 | ||
| 1 年前 | ||
| 1 年前 | ||
| 1 年前 | ||
| 1 年前 | ||
| 1 年前 | ||
| 1 年前 | ||
| 1 年前 | ||
| 1 年前 | ||
| 1 年前 | ||
| 1 年前 | ||
| 1 年前 | ||
| 1 年前 | ||
| 1 年前 | ||
| 1 年前 | ||
| 1 年前 | ||
| 1 年前 |
以下内容由 AI 翻译,如有问题请 点此提交 issue 反馈
PyMuPDF
PyMuPDF 是一个高性能的 Python 库,用于 PDF 及其他文档 的数据提取、分析、转换和操作。
安装
PyMuPDF 需要 Python 3.8 或更高版本,使用 pip 安装:
pip install PyMuPDF
该库没有强制性的外部依赖。但部分可选功能需安装额外软件包后才能使用。
您也可以访问 PyMuPDF.io 在线试用,无需安装。
用法
基本用法如下:
import fitz # imports the pymupdf library
doc = fitz.open("example.pdf") # open a document
for page in doc: # iterate the document pages
text = page.get_text() # get plain text encoded as UTF-8
文档
完整文档可在 pymupdf.readthedocs.io 查看。
可选功能
- fontTools 用于创建字体子集。
- pymupdf-fonts 包含一些适用于文本输出的优质字体。
- Tesseract-OCR 用于图像和文档页面中的光学字符识别。
关于
PyMuPDF 为 MuPDF 添加了 Python 绑定和抽象层,MuPDF 是一款轻量级的 PDF、XPS 和 电子书 查看器、渲染器及工具包。PyMuPDF 和 MuPDF 均由 Artifex Software, Inc 维护和开发。
PyMuPDF 最初由 Jorj X. McKie 编写。
许可与版权
PyMuPDF 基于 开源 AGPL 协议发布,并提供商业许可协议。如果您确定无法满足 AGPL 的要求,请联系 Artifex 了解有关商业许可的更多信息。
联系方式
加入我们的 Discord 社区:#pymupdf