文件最后提交记录最后更新时间
10 天前
1 个月前
2 个月前
1 个月前
2 个月前
README

ocr · 图片文字识别

从图片里提取文字(中英文),基于 Tesseract OCR 引擎。

前置依赖

需要系统里装有 tesseract 可执行文件:

# Debian/Ubuntu
apt install tesseract-ocr tesseract-ocr-chi-sim

中文识别需要 chi_sim 语言包;缺它时中文会识别成乱码而非报错。

工具

工具 说明
ocr_ocr_image 对图片做 OCR,返回识别文本

参数:

参数 说明
image_url 图片的 HTTP/HTTPS 地址(与 image_data 二选一)
image_data 图片的 base64 数据,不含 data:image/... 前缀(与 image_url 二选一)
language 识别语言,默认 chi_sim+eng;可选 chi_sim / eng / chi_sim+eng

实现要点

  • 传入的图先落到临时目录,OCR 完 defer os.RemoveAll 清掉,不残留。
  • 调用参数固定 --psm 3(全自动页面分割),适合截图与常规排版图片;对单行小图或竖排文本效果会下降。
  • Cleaner:工具返回的是 JSON(含 text、language 等字段),进记忆计算前只取 text 正文 —— 否则 JSON 结构本身会参与向量化。

构建

hmapdev build