做RAG的兄弟们都有一个共识:垃圾进,垃圾出。你喂给LLM的文档如果没洗干净,后面再强的模型也救不回来。
合同里的表格错位、发票里的数字串行、论文里的公式乱码……这些坑,每一个做过结构化抽取的打工人,都被折磨过。
市面上的"文档解析"工具吹得震天响,但底层到底是怎么运作的?模块化Pipeline、端到端大模型、可组合(Composable)方案——这三条技术路线,到底谁才是未来?
最近翻到一篇2025年挂arXiv的硬核综述,《Document Parsing Unveiled: Techniques, Challenges, and Prospects for Structured Information Extraction》,作者阵容非常顶:上海AI实验室+北大+清华联合出品,第一作者Qintong Zhang,通讯是Conghui He和Wentao Zhang。
整篇Survey把文档解析这个赛道,从传统模块化流水线到当代的多模态大模型,从Layout Analysis、OCR、公式识别到端到端的VLM方案,扒得干干净净。
丑话说在前面:有兄弟可能冲着"Composable IE部署教程、CompoSuite跑分对比GPT-4o/Claude、Reddit真实踩坑贴"这些内容来的——老实说,截至撰稿时,我在公开信息源里没扒到CompoSuite这套基准的完整跑分表、也没扒到它的官方GitHub仓库地址。涉及具体数据的地方我不会瞎编,下文会标出来。
👇 下面咱直接上硬货 👇
📖 这篇Survey到底扒出了什么真相?
整篇综述的核心观点就一句话:文档解析不是一个模型能搞定的事。无论你是用PaddleOCR、还是GPT-4V、还是最近冒出来的各种"Document AI"模型,本质上都逃不出下面三个核心模块的排列组合——
看到这个表格你就明白了,所谓的"Composable(可组合)"思路,并不是什么黑魔法,它的核心思想就是把上面这些模块像乐高一样拼起来,每个模块都可以单独替换升级。
🔥 三条技术路线硬核对线
Survey把业界主流的文档解析方案,划成了三大门派。
LLM在数据抽取场景的应用(来源:Nanonets)
Survey里没有给这三条路线做一个具体的"百分制"打分对比(毕竟这种东西受场景影响极大),但作者明确指出了一个核心痛点:端到端的大模型在"高密度文本"和"复杂多模块协作"这两件事上,目前依然拉胯。
🧩 文档抽取的"乐高积木"长啥样?
吐槽归吐槽,做工程的兄弟更关心的是:到底有哪些模块可以拿来拼?
Survey的Section 3到Section 7基本上是一份"乐高说明书",把每个模块的算法流派都拆开讲了。这里挑几个对工程实战最有用的——
版面分析(Layout Analysis)这块:Survey把方法分成了两大类——基于视觉特征的(代表DiT)和融合语义的(代表LayoutLM)。前者只看好不好切,后者把文字内容也塞进去一起判断。在工业界,DiT那一脉吃显存少、跑得快,LayoutLM那一脉对复杂版面更鲁棒。
OCR这块:经典路线是 TextBoxes(检测)+ CRNN/Transformer(识别)。但Survey也提了Text Spotting这个端到端流派——检测识别一把梭哈,省去了中间拼接的麻烦。
多模态整合这块:Survey专门强调了表格识别和公式识别是整套Pipeline里最棘手的两个模块。表格涉及到单元格合并、跨页表格还原,公式涉及到数学符号的细粒度识别——这两个坑,Survey里都点了名。
⚠️ 行业现状:数据集和评测的"草台班子"问题
Survey用了一整个Section(Section 8)来扒当前评测体系的问题,结论非常刺耳:
📌 很多公开数据集严重过时,根本反映不了真实业务场景的复杂版面📌 评测指标不统一,你跑你的F1、我跑我的TED,横向对比基本扯淡📌 缺乏跨语言、跨行业的基准,中文合同场景的评估和英文论文场景完全是两码事
这种乱象直接催生了一个后果:各家厂商的"第一"含金量参差不齐,谁都能在自家精心挑选的测试集上刷出SOTA。
🛠️ 避坑指南:工程实战里的真实差距
Survey在最后给开发者写了Section 11的"未来方向",但我给你翻译成人话版踩坑清单:
🪤 坑1:别迷信"端到端GPT-4V一把梭"。看上去Demo很美,遇到扫描件糊一点、表格歪一点,立马翻车。
🪤 坑2:模块化Pipeline的"误差累积"是真实存在的——版面分析偏1个像素,OCR的识别率可能就掉了5%。
🪤 坑3:"可组合范式"听上去很美,但实际落地需要一个调度器——谁来决定该调哪个模块、什么时候调,这个调度器本身又是一个新坑。
🪤 坑4:高密度文本(比如密密麻麻的财务报告)是当前所有方案的"照妖镜",包括号称最强的VLM。
📚 资源指引 & 真相声明
📄 这篇Survey本身的arXiv链接(如果你想深挖):在arXiv搜索 "Document Parsing Unveiled",第一作者Qintong Zhang,2025年发布,作者单位涵盖上海人工智能实验室、北京大学、清华大学。
⚠️ 真相声明:不少冲着"Composable Information Extraction(可组合信息抽取)"专项来的兄弟,可能期望看到具体的方法对比表、部署代码、官方GitHub跑分。
但截至撰稿这次信息核查,我没能从用户提供的资料源中检索到CompoSuite这套基准的具体多模型跑分表、官方代码仓库地址、以及Reddit/X等社区的真实用户踩坑贴。我不会为了凑版面编造一个假GitHub链接或者编一张假的GPT-4o vs Claude对比分。
如果你手上有可信的Composable IE相关GitHub或者测评数据,欢迎在评论区扔出来,我看到了会继续扒。
说到底,文档结构化抽取这条路,离"开箱即用"还差得远。一边是端到端VLM放卫星,一边是模块化Pipeline死磕细节,中间那条"可组合"的路,听上去最性感,但工程复杂度也最高。
别再吹"AGI"了,先让你家的复杂版面文档跑通再说。
👇 评论区扔出你遇到的奇葩文档,看谁的更狠
夜雨聆风