乐于分享
好东西不私藏

PPT 是AI结构化解析的硬骨头:MinerU 和 Knowly 实测对比-系列1

PPT 是AI结构化解析的硬骨头:MinerU 和 Knowly 实测对比-系列1
随着 AI 越来越深入我们的工作和生活,让 AI 理解我们日常生产出来的各种 PDF、Word、PPT、扫描件的内容,就变得越来越受重视。我们定义了一个指标:内容语义还原度(CSF,Content Semantic Fidelity),值越高效果越好。
最近 MinerU 很火,我看到不少人在推荐,也看到很多朋友开始讨论:文档解析是不是直接用 MinerU 就够了?
因为 Knowly 的核心底座能力之一,就是帮助用户构建个人 AI 知识库,自然也有一套独有的文档结构化识别能力。作为一名技术人,一时技痒是在所难免的。
今天我们就跟 MinerU(直接用其官网的) 来做一下实战对比,看看它是不是真的如传说中的那般强!
先说明一下,这组文章不聊部署、不聊开源生态,也不聊模型参数,就看一个最直接的问题:
同一份文档解析出来以后,结构还在不在,对应的CSF有多少分。
对知识库来说,识别出文字只是第一步。真正影响后面搜索、问答和总结效果的,是标题、层级、模块、图片、表格、阅读顺序这些结构有没有保住。
这一篇先拿 PPT 开刀。
PPT 很适合做第一篇,因为它本来就不是按自然段写出来的。它更像一页页信息图:有纵向层级,有横向流程,有图片,有图标,有箭头,有说明文字。人眼看起来很自然,机器解析时就不一定了。
这次我选了一份《2026 开发计划》PPT,从里面拿三页做案例:
第一页:纵向结构,看层级和功能树;
第二页:横向结构,看阅读顺序和模块关系;
第三页:带图片页面,看图文关系和图片内容处理。
接下来我们就一页一页根据结果来做对比,看同一页 PPT 经过结构化以后,究竟谁的
我们就盯着页面结构看:同一页 PPT 经过结构化以后,究竟谁的内容语义还原度分数更高。

先说判断标准

为了避免只凭感觉,我这次主要看 5 个点。
第一,标题有没有被识别成标题。
PPT 里经常有页面标题、模块标题、小标签。如果这些全部变成普通文本,后续知识库就很难知道一页 PPT 的主题是什么。
第二,层级有没有保住。
尤其是功能树、目录、列表这种内容,缩进和父子关系很重要。少了层级,看起来字没丢,但意思已经变了。
第三,阅读顺序是否符合人眼习惯。
PPT 不一定是从左上角一路读到右下角。有些页面是从上到下,有些页面是从左到右,有些页面是围绕中心展开。顺序一乱,后面切片和问答都会受影响。
第四,图文关系有没有断。
图片、图标、流程图旁边的文字,往往是在解释它。结构化结果不能只把文字拿出来,还要尽量保留“这段话在解释哪个对象”。
第五,关联元素有没有识别
我们人的视角去看的,PPT里是没有无用元素的,哪怕一个小图标、小箭头,都是带有明确的含义的,这种要能识别出来那就厉害了。

案例一:纵向结构页,看层级能不能保住

第一页是一个典型的纵向结构页
内部区分三个子标题,每个子标题下各自有一个content内容区,有最多4个层级的无序+有序列表;同时整个页面还有批注、演讲者备注、以及工作台后面还加了一个小人的图标。
MinerU 结果
这一页的效果比较差,主要三个问题:
  1. 标题和内容之间的关联关系错乱,工作台、体验台 都放一起了
  2. 多层级的列表关系没有体现,结构完全错乱
  3. 批注、备注、还有图标这些信息都丢失了
综合得分:40分
Knowly 结果
我们看一下Knowly识别出来的结果:
  1. 一个二级标题,下面带三个三级标题,
  2. 每一个三级标题下,内容区的多个层级关系、有序、无序列表都100%还原
  3. 批注、备注,还有那个图标及对应位置也还原了出来(这个图标挺重要哦,它也是一种重要的语义)
这个效果可以说非常好,基本上人视角里看到的东西和关系,它全部都还原了,已经找不到进步空间了!
综合得分:100分

案例二:横向结构页,看阅读顺序会不会乱

第二页是横向结构页。 主要有两个主模块:量化平台 和 减排平台。每个主模块内部又各自有5个小模块。人看这页,会自然理解成:
围绕量化平台,有项目管理、活动数据管理、指标图表、报告等能力,再进一步支撑多场景、多指标、多分析。
但机器如果按坐标或文本框顺序读,就会出现文字都在,但逻辑顺序就散了。
MinerU 结果
这一页minerU又崩了,文字是全部读出来了,但结构、顺序、语义已经完全乱套了,基本上一个都没有还原出来,比上一页的结构性还差一点。
综合得分:30分
Knowly 结果
这个结果里,
  1. 一个页面级别的二级标题,下面带两个三级标题分别是量化平台和减排平台
  2. 各自下面有对应5个4级别标题,以及具体的内容
  3. 还有演讲者备注
这个结果简直完美!试想一下,比如用户问:

这页里量化平台还有哪些待解决问题?

用minerU输出的结果,是不是100%会出现幻觉?
最终得分:100分

案例三:带图片页面,看图文关系有没有断

第三页是“平台展望”。这一页有一段文字,但重点不只是这段文字,还有图片和整体表达。
带图片的 PPT 很常见,尤其是产品方案、规划方案、汇报材料。很多时候,核心信息就在图里。旁边的文字只是概括,图片才是展开。
所以这一页主要看两件事:
  1. 图片有没有被当成有效信息处理;
  2. 图片和页面文字之间的关系有没有保留。
MinerU 结果
这一页在minerU里被原模原样的返回来了。我上传docx测试都是支持OCR的,不知道是不是PPT文件它没有开?
因为PPT里有各种图形、图标、小图、大图等,究竟哪些该OCR、哪些不该,还是非常考验技术的,可能因此没有对PPT打开OCR(猜测)。
最终得分:30分
Knowly 结果
首先识别出了二级标题下,有一个图片,对图片进行OCR并输出了全部的文字
但图里要表达的关系,在这里是错误的。
这张图确实比前两页难很多。它不是简单的文字识别,而是要理解一张图里的业务关系、流向和组织方式。距离“真正读懂图”还有提升空间,OCR的局限性也体现了。
其余文字是正常提取出来的了
综合得分:70分

结果总结

三页最终评分汇总

页面

核心难点

MinerU CSF

Knowly CSF

第一页:纵向结构

标题、模块、多级列表、批注备注、图标语义

40 分

100 分

第二页:横向结构

阅读顺序、中心关系、模块归属

30 分

100 分

第三页:带图片页面

图片 OCR、图文关系、图内语义

30 分

70 分

如果只看这三页样本,MinerU 的平均 CSF 是33.3 分,Knowly 的平均 CSF 是90 分
当然,这不是说 MinerU 在所有文档上都只有这个水平。不同格式、不同转换链路、不同配置,结果都会变。但至少在这份 PPT 上,差距是非常明显的。
这也是我做完这轮实测以后最深的感受:
PPT 解析真的不能只看“文字有没有出来”。
文字出来了,但层级没了、模块散了、图片丢了、阅读顺序乱了,那它对知识库来说依然是不够用的。因为用户后面问的不是“这页里有哪些字”,而是“这页到底表达了什么”。
MinerU 是一个非常火的开源项目,GitHub 上已经有数万 Star,这说明它确实踩中了很多人的痛点,也说明文档解析这件事被越来越多人重视。
但实际测下来,我觉得我们也需要对这类工具稍微“去魅”。不是说它不好,更不是否定开源项目的价值。恰恰相反,能把这么多人重新拉回到文档解析这个问题上,本身就是一件很有意义的事。
这些事情都不轻松,也不是一个通用工具一上来就能全部解决。
这里面还有大量真实问题没有被彻底解决,还有很多工程细节、产品判断和场景优化可以继续做。
文档结构化不是一个已经结束的赛道。它才刚刚开始变得重要。

小结

这一篇先看 PPT。三页测下来,我的结论很明确:
PPT 是结构化解析的硬骨头。
纵向页面考层级,横向页面考顺序,带图片页面考图文关系。只要其中一个环节没处理好,后续知识库问答就很容易出问题。
下一期我们继续做 DOCX 文件的对比。
DOCX 看起来比 PPT 规整,但企业知识库里最常见的制度、方案、合同、说明文档,恰恰都依赖标题层级、编号列表、表格、图片说明这些结构。它不像 PPT 这么“花”,但它更贴近日常办公,也更能看出一个工具的基本功。
下一期,我们一起来看看minerU对docx的表现怎么样吧(应该会不错)

相关学习资料