
如果一个企业要每月处理一百万页文档,ExtractBench 榜单第一名能不能直接替它选供应商?
答案是:它可以帮你发现以前没测过的失败,却不能替你完成采购判断。
LlamaIndex 发布的《Introducing ExtractBench》试图把企业文档抽取从“固定字段填得准不准”推进到更像生产现场的测试:长文档、扫描件、手写体、跨页表格、来源定位和每页成本,都被放进同一套公开 benchmark。这个方向是对的,但它同时把一个更难的问题带进来了:当 benchmark 的设计者也拥有榜单上的商业产品时,榜单第一名究竟证明了什么?
LlamaIndex
长期维护 LlamaIndex 和 LlamaExtract 等企业 AI 工具;本文将其作为 benchmark 的发布方和利益相关方阅读,而不是把发布方的排名当作独立裁判。
ExtractBench
一个由 LlamaIndex 发布的企业文档抽取公开 benchmark,提供数据集、评测 harness 和方法说明;它的价值在于暴露失败面,不在于自动产生采购结论。
这次 benchmark 确实测得更像工作
先把批评放在一边,ExtractBench 解决了一个真实的测量缺口。
旧一代文档抽取测试通常给定固定字段:发票号、日期、金额,模型把这些字段找出来就算完成。这样的任务当然有价值,但它很难回答企业真正会问的问题:一份 100 页的申报文件,系统是否读到了最后一页?一张 1950 年代的扫描表格,手写数字会不会被读错?一个跨页表格,值都识别出来了,行列关系是否仍然正确?
ExtractBench 把测试拆成几个相对独立的轴:任务本身的难度、页面是数字原生还是扫描/手写/旋转、表格结构、文档长度,以及业务领域覆盖。它的公开介绍包含 370 份企业文档、4,869 页、8 个业务领域和 67 种文档类型,还加入了 grounding 与成本。
这部分进步值得保留。benchmark 不再只问“平均准确率是多少”,而是开始追问“在哪类文档、哪种页面、哪种长度上失败”。
但“更真实”不等于“更独立”
ExtractBench 的方法说明也比普通榜单认真。它声称数据集、harness 和方法公开可复现;ground truth 通过三种方式建立:不同模型对真实文档的结果先形成候选,分歧处由人判断;超长重复记录使用合成数据,使每个值在渲染前就已知;169 份监管和税务表格由人工逐字段核验,并为 84% 的字段标注边界框。
这些设计可以提升可追溯性,却没有自动消除利益关系。发布方同时推出 Agentic Plus,并在自己的榜单上排名第一:整体 value F1 为 95.6%,每页 8.1 美分。这个结果可能完全是真的,也可能在公开方法下经得起复现;但在独立复现之前,它首先是“发布方对自己系统的测量结果”,不是无利益关系机构的裁决。
这里要分清两句话:
- 真实
:这个 benchmark 比只测固定字段的测试更接近企业可能遇到的失败。 - 尚未证明
:榜单第一名因此就普遍优于其他系统,或者适合你的文档分布。
把第二句话从第一句话里推出来,正是 benchmark 叙事最容易跨过的台阶。
榜单平均分会隐藏什么
ExtractBench 自己给出的细分结果,恰好说明为什么不能只看总榜。
短文档会让很多系统看起来都不错:在十页以内的密集多领域文档上,多个系统超过 90%。真正拉开差距的是长文档和重复记录。超过 50 页后,商业 VLM 的 recall 会明显下降:返回的值可能很准确,但大量页面根本没有进入结果。
感知问题也不是一个总分能解释的。有的 coding agent 能读扫描和手写,却在旋转页面上失误;另一个可能相反。表格结构还会产生另一种错误:每个数都读对了,却被组装进了错误的记录。Grounding 则要求系统不仅给出答案,还能指出答案来自哪一页、哪一个区域。
这些不是同一种“准确率”。如果你的工作是处理长周期监管文件,文档长度和完整召回比十页内的平均 value F1 更重要;如果你的流程需要审核员点击回原文,grounding 可能比榜单总分更接近真实成本。
价格不是脚注,而是结果的一部分
企业也不能把成本放到榜单下方再看。ExtractBench 的发布文章直接给了一个简单换算:每页增加 1 美分,每月处理一百万页就是多支出 10,000 美元。
这会改变“第一名”的含义。Agentic Plus 报告的质量最高,但每页 8.1 美分;另一些系统分数略低,成本可能只有 1 美分左右。对于小规模、高风险文件,最高质量或许值得;对于百万页流水线,少几个百分点的质量是否值得多出的数万美元,必须结合人工复核率、漏抽取代价和错误纠正成本来算。
更麻烦的是,价格与质量并不总是线性相关。一个更贵的系统不一定更准,一个便宜的系统也不一定只是“低配”。真正的采购问题不是“谁第一”,而是:
你的文档中有多少长文件、扫描件、手写页和跨页表格? 你需要的是值本身,还是值加可点击的证据位置? 漏掉一页、错一行和读错一个数字,哪一种错误最贵? 单页成本乘以你的月度规模后,人工复核会增加还是减少? 能否把自己的留出集交给至少两种不同架构的系统重复测量?
这五个问题比榜单第一名更接近生产。
更好的 benchmark,不是最终答案
ExtractBench 最值得肯定的地方,恰恰不是它把自己的产品排在第一,而是它把企业过去容易忽略的失败面公开化:长文档会截断,扫描件会改变感知难度,表格会破坏结构,答案需要 grounding,质量必须和每页成本一起看。
它最需要被保留的限制也同样清楚:benchmark 由产品公司发起,数据构造和评分定义仍需要外部检查,公开 harness 是否能被第三方顺利复现也需要时间验证。即使复现成功,benchmark 也只是地图,不是你公司文档分布的替代品。
所以更好的问题不是“谁在 ExtractBench 上赢了”,而是:这个 benchmark 的哪些维度,能够预测我们自己的失败?我们能否用独立留出集、真实成本和人工复核结果,把这张地图接到生产现场?
榜单可以帮你发现候选者。只有把它拆成失败面,再放回自己的文档、预算和责任链里,分数才开始变成判断。
延伸阅读

夜雨聆风