编者按:企业知识库的建设,很多时候不是输在模型和框架,而是输在入库前的第一道工序——文档清洗。本合集将沿着"文档清洗 → 智能分块 → 向量化 → RAG 编排 → 部署落地"的链路,逐期拆解每个环节的解决方案。本期开篇,聊 PDF 清洗与 MinerU。
一、为什么你的知识库总"不好用"
先讲一个高频场景:某企业把几千份招标文件、技术文档、历史合同全部塞进知识库,接上大模型问答,结果业务部门反馈"问啥啥不准"——查一份合同条款,AI 给出的是另一份文档的内容;问一个技术参数,检索结果牛头不对马嘴。
技术团队的第一反应往往是换模型、调 RAG 参数、优化向量库。但很多人忽略了一个更基本的问题:进库的数据本身就是脏的。一份 PDF 被抽取成乱序文本、夹着页眉页脚、表格断成碎片、公式变成乱码,无论后面的模型多强,都不可能检索出好结果。数据科学的老话在这里同样成立:Garbage in, garbage out(垃圾进,垃圾出)。
所以这个合集的第一篇,我们不谈模型、不谈向量库,先解决最基础、也最容易被轻视的环节——文档清洗,主角是上海人工智能实验室开源的MinerU。
二、为什么 PDF 是知识库的第一道坎
PDF 的设计初衷是"跨平台排版固定",而不是"信息提取"。它天然是一份给人看的"成品",程序读起来却处处是坑。

企业里的 PDF 大致分三类:
文本型:有文字层,直接抽取即可,但版式可能很复杂; 扫描型:本质是图片,必须先 OCR 才能得到文字; 混合复杂型:多栏排版、跨页表格、公式、图片图表混排。技术白皮书、财务报告、行业研报大多是这种。
如果图省事,直接用 PyMuPDF、pypdf 这类轻量库抽取,很容易踩到四个典型的坑:
阅读顺序错乱——双栏排版的 PDF 被按坐标逐列读,两栏内容混成一锅粥; 页眉页脚污染——公司名、页码、版权声明混进正文,检索时全是噪音; 表格跨页断裂——一张大表跨两页,抽取后结构全乱; 公式乱码——公式符号变成一堆乱码或空白,技术文档直接废掉。
这些"脏数据"一旦进了向量库,检索命中率断崖式下跌,再好的 RAG 也救不回来。所以请记住这句话:解析质量决定 RAG 检索质量的上限,PDF 清洗是知识库的第一道闸门。
三、MinerU 是谁
MinerU 由上海人工智能实验室的开放数据平台 OpenDataLab 开源。它的诞生很"朴素":团队在 InternLM 大模型预训练期间,需要把海量科学文献转成高质量训练数据,却被 PDF 里的公式和复杂排版反复折磨,索性自己研发了一款通用文档解析引擎。
MinerU 的官方定位非常明确:把复杂文档(PDF、图片、DOCX、PPTX、XLSX、网页)转换成 LLM-ready 的结构化 Markdown 和 JSON,直接服务于检索增强生成(RAG)和智能体(Agent)工作流。
几个值得关注的事实:
版本迭代快:当前最新 3.4 版(2026 年 6 月发布),OCR 引擎升级为 PP-OCRv6,识别支持 109 种语言; 商用友好:许可证已从 AGPLv3 切换为基于 Apache 2.0 定制的"MinerU 开源协议",企业集成和商业化部署的门槛大幅降低; 社区热度高:GitHub 星标已超 6.9 万、逼近 7 万,多次登顶 GitHub Trending,是当前文档解析赛道最活跃的开源项目之一。
一句话总结:MinerU 就像一台文档"采矿机",把又脏又乱的 PDF 炼成干净、有序、机器可读的结构化数据。
四、MinerU 的"清洗"能力拆解
所谓 PDF 清洗,本质上要做四件事:去噪、排序、结构化、验收。MinerU 的能力恰好覆盖了全部四步。
1. 版面分析,还原人类阅读顺序
多栏排版、图文混排、复杂页眉页脚结构下,MinerU 会先做版面分析(Layout Analysis),再按人眼阅读顺序输出正文,而不是机械地按坐标读取。这是它和传统抽取工具最本质的差别。
2. 自动去噪
页眉、页脚、页码、脚注会被自动识别并清除,避免"某某公司内部资料 第 3 页"这类噪音污染正文,保证语义连贯。
3. 表格结构化
表格被还原为 HTML 结构化输出,跨页断裂的表格还能自动合并——处理财务报告、产品规格表时,这个能力直接决定检索质量。
4. 公式转 LaTeX
技术文档里的公式会被自动识别并转换为 LaTeX 语法,大模型终于能"看懂"公式,而不是面对一堆乱码或图片。
5. 图片与图表抽取
文档中的图片、图表会被单独抽取保存,配合视觉模型还能生成图注,为多模态检索留好接口。
6. 扫描件自动检测 + OCR
遇到扫描版 PDF 或文字层损坏的"乱码 PDF",MinerU 会自动启用 OCR,支持 109 种语言。3.4 版升级到 PP-OCRv6 后,OCR 精度在 OmniDocBench v1.6 上提升约 11%,处理速度提升约 100%。
7. 双引擎可选
pipeline 引擎快速稳定、纯 CPU 即可运行,在 OmniDocBench v1.6 基准上整体精度 86+;VLM 引擎精度更高(95+),适合超复杂文档,但需要 GPU(推荐 8GB+ 显存);hybrid 引擎兼顾两者,还提供 medium / high 两档强度,让用户在速度与精度之间按需取舍。
8. 可视化验收
解析结果自带版面与结构可视化,哪一页解析错了、哪段文字顺序不对,肉眼一看便知。清洗质量"看得见、可验收",这正是企业落地最需要的特性。
五、快速上手:十分钟跑通一个 PDF
环境门槛并不高:需要 Python 3.10–3.13(Windows 上建议 3.10–3.12);纯 CPU 就能跑,有 Volta 架构及以上的 NVIDIA GPU 可加速,VLM 引擎建议 8GB+ 显存。
安装只需一行:
uv pip install -U ”mineru[all]”解析一个 PDF:
mineru -p ./企业文档.pdf -o ./output几秒到几十秒后,output 目录里就会出现结构化 Markdown、JSON 以及可视化中间产物。打开 Markdown 检查一下,就能直观感受到"清洗前"与"清洗后"的差别。
如果不想先折腾本地环境,官方还提供 mineru.net 在线解析服务,可以直接上传 PDF 体验解析效果,满意后再决定是否本地部署。
六、接入企业知识库的三种姿势
MinerU 不止是个命令行工具,它为企业场景提供了三条清晰的接入路径:

姿势 A:本地批处理(中小规模首选)
通过 CLI 或 mineru-api 的异步任务接口批量解析文档,适合文档量中等、希望架构简单的团队,解析结果落盘后直接进入切分与向量化流程。
姿势 B:私有化部署(数据敏感型企业的必选项)
支持 Docker 一键部署、完全离线运行,并兼容昇腾、寒武纪、燧原、摩尔线程等 10+ 家国产 AI 芯片——对数据合规和信创要求高的企业,可以做到全链路不出内网。
姿势 C:生态集成(嵌入现有 AI 工作流)
官方提供 LangChain、LlamaIndex、Dify、RAGFlow、FastGPT 等主流 RAG 框架的集成方式,同时提供 MCP Server,可以直接接入 Cursor、Claude Desktop 等 AI 工具链。
针对规模化场景,MinerU 3.x 还加入了 mineru-router(多机多卡任务路由与负载均衡)、滑动窗口机制(数万页超长文档无需手动切分)、流式写盘(边解析边输出)等能力。它已经从"单机解析工具"进化成"规模化文档解析基础设施"。
七、选型对照:MinerU 与同类方案怎么选

选型建议就一句话:文档以简单文本为主,用轻量库就够了;只要涉及多栏、扫描件、表格公式混排,MinerU 这类智能解析工具就是必选项。
客观说,MinerU 也不是万能:个别场景下脚注可能被删除、目录页可能被误判为标题,VLM 引擎对硬件有要求。好在社区迭代速度极快,遇到问题可以直接提 issue 并附上样本文件,官方会据此改进。
八、落地建议与避坑清单
先抽样验收,再全量入库。 批量解析前,先人工抽查一批代表性文档,确认版面、表格、公式的解析质量达标,再放开全量任务。 原始 PDF 必须留底。 Markdown 只是中间产物,不是"真源"。保留原始文件,便于回溯、审计和将来用新版本重新解析。 清洗产物与元数据一起入库。 解析结果要和文档分类、来源、部门、时间等元数据绑定,后续的检索过滤、权限控制、合规审计才能做起来。 提前规避环境坑。 Windows 上 Python 版本受限(3.10–3.12);模型权重首次下载依赖网络,可在内网预置模型缓存;超长文档注意内存规划。这些问题在官方 FAQ 里基本都有对应方案,部署前先翻一遍。
九、结语与下期预告
企业知识库建设的第一步,不是向量化,而是让数据"干干净净"地进来。MinerU 把 PDF 清洗这件事做到了开箱即用,也让企业落地知识库的门槛降到了普通团队能够承担的水平。
下一篇,我们进入第二道工序:《企业知识库(二):Markdown 智能分块》——清洗之后的文档,如何切分成检索友好、语义完整的文本块?敬请期待。
如果这篇文章对你有帮助,欢迎点赞、在看、转发;也欢迎在评论区聊聊,你们在知识库建设中都踩过哪些坑。
相关资源
MinerU GitHub 仓库与文档:https://github.com/opendatalab/MinerU MinerU 官方在线服务(在线体验解析效果):https://mineru.net
夜雨聆风