pymupdf:基于 MuPDF 的 PDF 文档处理库项目

可用于 PDF 等文档的数据提取、分析、转换及操作。它为 MuPDF 提供 Python 绑定和抽象,性能高效,无强制外部依赖,支持可选功能扩展如 OCR 和字体子集创建。【此简介由AI生成】

分支1Tags0
文件最后提交记录最后更新时间
1 年前
1 年前
1 年前
1 年前
1 年前
1 年前
1 年前
1 年前
1 年前
1 年前
1 年前
1 年前
1 年前
1 年前
1 年前
1 年前
1 年前
1 年前
1 年前
1 年前
1 年前
1 年前
1 年前

PyMuPDF

PyMuPDF 是一个高性能的 Python 库,用于 PDF 及其他文档 的数据提取、分析、转换和操作。

安装

PyMuPDF 需要 Python 3.8 或更高版本,使用 pip 安装:

pip install PyMuPDF

该库没有强制性的外部依赖。但部分可选功能需安装额外软件包后才能使用。

您也可以访问 PyMuPDF.io 在线试用,无需安装。

用法

基本用法如下:

import fitz # imports the pymupdf library
doc = fitz.open("example.pdf") # open a document
for page in doc: # iterate the document pages
  text = page.get_text() # get plain text encoded as UTF-8

文档

完整文档可在 pymupdf.readthedocs.io 查看。

可选功能

关于

PyMuPDFMuPDF 添加了 Python 绑定和抽象层,MuPDF 是一款轻量级的 PDFXPS电子书 查看器、渲染器及工具包。PyMuPDFMuPDF 均由 Artifex Software, Inc 维护和开发。

PyMuPDF 最初由 Jorj X. McKie 编写。

许可与版权

PyMuPDF 基于 开源 AGPL 协议发布,并提供商业许可协议。如果您确定无法满足 AGPL 的要求,请联系 Artifex 了解有关商业许可的更多信息。

联系方式

加入我们的 Discord 社区:#pymupdf

项目介绍

可用于 PDF 等文档的数据提取、分析、转换及操作。它为 MuPDF 提供 Python 绑定和抽象,性能高效,无强制外部依赖,支持可选功能扩展如 OCR 和字体子集创建。【此简介由AI生成】

定制我的领域