夜雨聆风学习资料网

ARTICLE · 1087207

【开源 AI 软件】OCRmyPDF:扫描件文字识别

【开源 AI 软件】OCRmyPDF:扫描件文字识别

OCRmyPDF 是一个给扫描 PDF 添加文字层的开源工具。处理后,原本只能“看”的扫描件可以搜索关键词、复制识别出的文字,并可输出适合归档的 PDF/A 文件。

项目采用 MPL-2.0 开源协议,识别依赖 Tesseract 等组件。它在本机处理 PDF,适合个人资料整理、纸质文档电子化和自有扫描件检索。

它能做什么

  • 给扫描页面添加可搜索、可复制的 OCR 文字层。
  • 处理中文、英文及 100 多种语言,需安装对应 Tesseract 语言包。
  • 输出 PDF/A,支持页面纠偏、旋转、图像优化和并行处理。
  • 通过 --sidecar 导出识别出的纯文本文件,便于后续检索或整理。
  • 遇到已有文字层的 PDF,可选择跳过、强制重做或保留原始文字。

它保留原 PDF 的页面外观,并在页面上叠加文字层;因此适合“让扫描件可检索”,不等于把 PDF 转成可自由编辑的 Word。复杂表格、公式和低清文字仍需要人工抽查。

怎样把扫描件变成可搜索 PDF

以下使用 Ubuntu 安装路径;Windows 用户可在已配置的 WSL Ubuntu 中操作。准备有权处理的 scanned.pdf,放在当前目录,保留原件,不要把输入输出写成同一个文件名。

bash

sudo apt update sudo apt install ocrmypdf tesseract-ocr-chi-sim tesseract-ocr-eng ocrmypdf --version tesseract --list-langs ocrmypdf -l chi_sim+eng --deskew --sidecar searchable.txt scanned.pdf searchable.pdf

先确认语言列表中存在 chi_sim 与 eng,再运行最后一行。成功后会生成 searchable.pdf 和 searchable.txt:前者用于继续阅读和搜索,后者是本次 OCR 导出的纯文本。

--deskew 用于校正轻微倾斜;如果页面横放,可再考虑 --rotate-pages。第一次建议只处理少量页面,确认中文、数字和版面无误后再批量处理。

OCRmyPDF 官方命令行示例

使用时注意什么

生成后应打开新 PDF,搜索一个原稿中清楚可见的词,再复制一段中英混排文字;数字、表格、公式和印章要抽样核对。扫描模糊、背景复杂、字号过小或语言选错时,识别结果可能不可靠。

OCRmyPDF 不是恶意 PDF 清洗器。来自不可信来源的文件应在隔离环境处理;含数字签名的 PDF 不要直接覆盖原件,修改内容会影响签名有效性。

它适合把清晰的扫描资料变成可全文检索的 PDF。若目标是高保真恢复复杂表格、自动检查合同数字或编辑原始版式,还需要额外工具和人工确认。

官方入口

  • GitHub:https://github.com/ocrmypdf/OCRmyPDF
  • 官方文档:https://ocrmypdf.readthedocs.io/
  • 安装说明:https://ocrmypdf.readthedocs.io/en/latest/installation.html
  • 使用示例:https://ocrmypdf.readthedocs.io/en/latest/cookbook.html

相关学习资料