乐于分享
好东西不私藏

MinerU,PDF终于能喂给AI了

MinerU,PDF终于能喂给AI了

MinerU,PDF终于能喂给AI了

公司想做知识库,最常见的卡点不是模型不行,而是 PDF 太乱。

表格、双栏、扫描件、公式,直接扔给 AI,它可能真敢答,但不一定答得对。

MinerU 干的就是这件事:先把 PDF 拆清楚,转成 Markdown、JSON,再交给知识库。

它不是聊天机器人,更像是资料进 AI 之前的“整理工”。活不花哨,但很有用。

流程也别省:解析完先抽查,再清洗、切分,最后才进知识库。

如果准备试,先别一口气把公司文件全塞进去。

从员工经常问、业务经常查的资料开始:制度、产品手册、历史项目。这三类最容易看出效果。

我的建议很简单:挑 20 份典型 PDF 跑一遍,看看表格、标题和图片说明还在不在。别只看“解析成功”四个字。

敏感资料先别上传。真要用于生产,也记得确认部署方式和开源许可。

资料整理干净了,AI 才能少说胡话。

项目地址:GitHub `opendatalab/MinerU`

名称已清空
微信扫一扫赞赏作者
喜欢作者其它金额
作品
暂无作品
喜欢作者
其它金额
最低赞赏 ¥0
其它金额
赞赏金额
¥
最低赞赏 ¥0
1
2
3
4
5
6
7
8
9
0
.
辽宁,26分钟前,