deepdoctection 是一个用于文档理解(Document AI)的 Python 库,能够编排扫描件与 PDF 的版面分析、表格识别、OCR 及文档/词元分类。
它本身不是从头造轮子,它更像一个"调度中心",把业界现有的成熟技术(如 Detectron2 做版面识别、Tesseract 做 OCR、LayoutLM 做文字分类)整合到一起,让你用几行代码就能搭起一条完整的文档处理流水线,而不必自己去研究每一个底层模型。
要点
智能版面分析与表格识别: 借助 Detectron2、 Transformers 等底层框架,它可以精准地切分和识别复杂文档中的段落、列表、标题、甚至带有边框或无边框的复杂表格结构。 多引擎 OCR 与 PDF 文本提取: 内置对 Tesseract、DocTr(支持 PyTorch 和 Tensorflow)以及 AWS Textract 的支持,专门对付扫描件和图片;对于原生 PDF,则可以直接调用 pdfplumber实现无损、高效的底层文本挖掘。文档/词元分类: 完美兼容当今公认最强悍的 LayoutLM 家族模型(v1、v2、v3、XLM)以及 LiLT 架构,并能无缝整合来自 Hugging Face Hub 的更多微调模型(如 Bert、RoBERTa 等),支持滑动窗口(sliding windows)等推理特征。此外,还内置了基于 Transformer 的多语言语种检测功能。 全生命周期流水线管控: 它的核心价值在于“串联”。不仅提供图像预处理组件(比如利用 jdeskew自动纠偏和旋转扫描图片),还能进行后处理(比如将离散的单词重新关联到对应的排版区域中)。私有化训练与精度评估: 除了直接使用预训练模型,它还内置了针对特定业务场景的微调(Fine-tuning)脚本和评估框架,允许你自己投喂数据来训练专属模型,并一键对比各种指标,完全满足企业级的定制需求。
场景
发票、合同、报销单的自动录入:财务人员不用手动抄数据,系统自动从扫描件里提取金额、日期、公司名。 纸质档案数字化:把大量历史扫描文档变成可搜索、可分析的电子资料。 表格数据提取:从 PDF 报表里把表格内容批量抓出来,导进数据库或 Excel。 文档信息抽取:从简历、证件、票据中自动识别关键字段。
项目由 deepdoctection 团队开发(12 位贡献者,核心维护者 JaMe76),采用 Apache 2.0 协议开源,当前 3.2k Stars,被约 1.9K 个项目依赖使用。
❝项目地址:https://github.com/deepdoctection/deepdoctection
夜雨聆风