乐于分享
好东西不私藏

文档结构化抽取这块,终于有篇综述把整个Pipeline扒了个底朝天!上海AI Lab+北大联合万字硬核Survey

文档结构化抽取这块,终于有篇综述把整个Pipeline扒了个底朝天!上海AI Lab+北大联合万字硬核Survey

做RAG的兄弟们都有一个共识:垃圾进,垃圾出。你喂给LLM的文档如果没洗干净,后面再强的模型也救不回来。

合同里的表格错位、发票里的数字串行、论文里的公式乱码……这些坑,每一个做过结构化抽取的打工人,都被折磨过。

市面上的"文档解析"工具吹得震天响,但底层到底是怎么运作的?模块化Pipeline、端到端大模型、可组合(Composable)方案——这三条技术路线,到底谁才是未来?

最近翻到一篇2025年挂arXiv的硬核综述,《Document Parsing Unveiled: Techniques, Challenges, and Prospects for Structured Information Extraction》,作者阵容非常顶:上海AI实验室+北大+清华联合出品,第一作者Qintong Zhang,通讯是Conghui He和Wentao Zhang。

整篇Survey把文档解析这个赛道,从传统模块化流水线到当代的多模态大模型,从Layout Analysis、OCR、公式识别到端到端的VLM方案,扒得干干净净

丑话说在前面:有兄弟可能冲着"Composable IE部署教程、CompoSuite跑分对比GPT-4o/Claude、Reddit真实踩坑贴"这些内容来的——老实说,截至撰稿时,我在公开信息源里没扒到CompoSuite这套基准的完整跑分表、也没扒到它的官方GitHub仓库地址。涉及具体数据的地方我不会瞎编,下文会标出来。

👇 下面咱直接上硬货 👇

📖 这篇Survey到底扒出了什么真相?

整篇综述的核心观点就一句话:文档解析不是一个模型能搞定的事。无论你是用PaddleOCR、还是GPT-4V、还是最近冒出来的各种"Document AI"模型,本质上都逃不出下面三个核心模块的排列组合——

核心模块
干啥的
代表方法
Layout Analysis(版面分析)
把页面切分成"这块是标题、这块是表格、这块是图"的语义块
DiT、LayoutLM系列
OCR(文本识别)
检测+识别图片里的文字,包括TextBoxes等检测器
TextBoxes、PaddleOCR、CRAFT
公式 & 表格识别
把数学公式转LaTeX、把复杂表格还原成结构化单元格
Survey里有专项章节讨论

看到这个表格你就明白了,所谓的"Composable(可组合)"思路,并不是什么黑魔法,它的核心思想就是把上面这些模块像乐高一样拼起来,每个模块都可以单独替换升级。

🔥 三条技术路线硬核对线

Survey把业界主流的文档解析方案,划成了三大门派。

LLM在数据抽取场景的应用(来源:Nanonets)

门派路线
核心打法
优点
死穴
模块化Pipeline
版面分析 → OCR → 公式识别 → 表格识别 → 拼装
可控性强,每一步可插拔、可解释
误差累积,复杂版面容易崩
端到端VLM大模型
图像直接进,一个模型输出Markdown/JSON
部署简单,对通用版面强
高密度文字、复杂表格拉胯
可组合范式(Composable)
把任务拆解成原子能力,按需组合调用
灵活度高,适配业务多
需要调度器,工程复杂度高

Survey里没有给这三条路线做一个具体的"百分制"打分对比(毕竟这种东西受场景影响极大),但作者明确指出了一个核心痛点:端到端的大模型在"高密度文本"和"复杂多模块协作"这两件事上,目前依然拉胯

🧩 文档抽取的"乐高积木"长啥样?

吐槽归吐槽,做工程的兄弟更关心的是:到底有哪些模块可以拿来拼?

Survey的Section 3到Section 7基本上是一份"乐高说明书",把每个模块的算法流派都拆开讲了。这里挑几个对工程实战最有用的——

版面分析(Layout Analysis)这块:Survey把方法分成了两大类——基于视觉特征的(代表DiT)和融合语义的(代表LayoutLM)。前者只看好不好切,后者把文字内容也塞进去一起判断。在工业界,DiT那一脉吃显存少、跑得快,LayoutLM那一脉对复杂版面更鲁棒。

OCR这块:经典路线是 TextBoxes(检测)+ CRNN/Transformer(识别)。但Survey也提了Text Spotting这个端到端流派——检测识别一把梭哈,省去了中间拼接的麻烦。

多模态整合这块:Survey专门强调了表格识别和公式识别是整套Pipeline里最棘手的两个模块。表格涉及到单元格合并、跨页表格还原,公式涉及到数学符号的细粒度识别——这两个坑,Survey里都点了名。

⚠️ 行业现状:数据集和评测的"草台班子"问题

Survey用了一整个Section(Section 8)来扒当前评测体系的问题,结论非常刺耳:

📌 很多公开数据集严重过时,根本反映不了真实业务场景的复杂版面📌 评测指标不统一,你跑你的F1、我跑我的TED,横向对比基本扯淡📌 缺乏跨语言、跨行业的基准,中文合同场景的评估和英文论文场景完全是两码事

这种乱象直接催生了一个后果:各家厂商的"第一"含金量参差不齐,谁都能在自家精心挑选的测试集上刷出SOTA。

🛠️ 避坑指南:工程实战里的真实差距

Survey在最后给开发者写了Section 11的"未来方向",但我给你翻译成人话版踩坑清单:

🪤 坑1:别迷信"端到端GPT-4V一把梭"。看上去Demo很美,遇到扫描件糊一点、表格歪一点,立马翻车。

🪤 坑2:模块化Pipeline的"误差累积"是真实存在的——版面分析偏1个像素,OCR的识别率可能就掉了5%。

🪤 坑3:"可组合范式"听上去很美,但实际落地需要一个调度器——谁来决定该调哪个模块、什么时候调,这个调度器本身又是一个新坑。

🪤 坑4:高密度文本(比如密密麻麻的财务报告)是当前所有方案的"照妖镜",包括号称最强的VLM。

📚 资源指引 & 真相声明

📄 这篇Survey本身的arXiv链接(如果你想深挖):在arXiv搜索 "Document Parsing Unveiled",第一作者Qintong Zhang,2025年发布,作者单位涵盖上海人工智能实验室、北京大学、清华大学。

⚠️ 真相声明:不少冲着"Composable Information Extraction(可组合信息抽取)"专项来的兄弟,可能期望看到具体的方法对比表、部署代码、官方GitHub跑分。

但截至撰稿这次信息核查,我没能从用户提供的资料源中检索到CompoSuite这套基准的具体多模型跑分表、官方代码仓库地址、以及Reddit/X等社区的真实用户踩坑贴。我不会为了凑版面编造一个假GitHub链接或者编一张假的GPT-4o vs Claude对比分。

如果你手上有可信的Composable IE相关GitHub或者测评数据,欢迎在评论区扔出来,我看到了会继续扒。

说到底,文档结构化抽取这条路,离"开箱即用"还差得远。一边是端到端VLM放卫星,一边是模块化Pipeline死磕细节,中间那条"可组合"的路,听上去最性感,但工程复杂度也最高。

别再吹"AGI"了,先让你家的复杂版面文档跑通再说。

👇 评论区扔出你遇到的奇葩文档,看谁的更狠