乐于分享
好东西不私藏

AI 处理企业文档,结果要能回到原文

AI 处理企业文档,结果要能回到原文

当我们用AI处理企业文档时,通常很快就能得到结果,比如ocr识别出订单号。但是进入业务流程后,问题会变得复杂,并不是处理完有结果就可以。我们还需要关注更具体的问题,比如:跨页明细有没有漏?原文没有填写的字段,会不会被填充一个错误值?一条结果能不能回到原文核对?

这些问题决定AI抽取的结果能不能在实际中被使用。

AI 处理企业文档,效果到底怎样

企业文档的难点往往不在一页干净的表单,而在重复记录、跨页表格、扫描件、手写内容和很长的材料。模型可能找对前几项,却在后面的明细里漏项、重项,或者把不该填的字段填上。

如果系统只给出一段看起来合理的 JSON,负责人仍然要逐条回去找原文。这样的结果还谈不上完成处理。

企业文档处理,不是把文字读出来

文字识别只是输入的一部分。企业真正要的是:给定一份文档和一份业务 JSON Schema,系统返回符合 Schema 的结构化数据,每一条重复记录都不能少,缺失字段要明确为 null,关键值还要给出来源证明。

ExtractBench 把“值有没有抽对”“记录有没有抽全”“出处能不能定位”和成本放在同一套评测里。它不只看一个金额或日期对不对,也看这套抽取方式能不能经得住复杂材料。

ExtractBench 把企业文档抽取放进同一套评测

LlamaIndex 团队为 ExtractBench 准备了 370 份企业文档,共 4,869 页,覆盖 67 个文档类型和 8 个业务领域。每一项评测任务都是:企业文档加上对应 JSON Schema,输出结构化 JSON 和出处。

在当前公开榜单已有 30 条 pipeline 结果。[1][2]

当前前五,先看 Value F1

前五结果如下。图中的 Unified Value F1 衡量抽取值与标注答案的接近程度,是主指标,但不代表全部能力。

这张表只比较抽取值与标注答案的接近程度,前五之间的差距很小,但它没有回答出处能否在原文中被定位到。

Qwen3.8 27B 进入前五,说明自部署开源权重配置已经能取得很高的值正确率。但它在长文档上的分数明显低于短、中等文档。

结果要放回自己的文档里看

再看看这张 Grounding F1 榜单。它看的不是值有没有抽对,而是结果能否定位到正确的词框或页面。有些系统的值正确率不低,却没有交付能被评测认可的词级或页级出处。值对了,不等于这条结果已经可以被审计。

从图中可以看出,词级和页级出处定位不会因为 Value F1 评分高 Grounding F1 评分也高。比如,Codex 和 Qwen3.8 27B在Value F1表中都进入了前五,但在Grounding F1表中却没有上榜。表中“All 24 other systems”为 0,说明当前公开结果里,能交付基准认可定位出处的系统并不多。

这次评测的意义不是哪个评分高就把哪个用到自己的流程里。更好的做法是拿自己的长文档、重复明细和业务 Schema 去问:值抽对了吗?记录漏了吗?能回到原文吗?跑到真实业务量后,成本能承受吗?

参考资料

[1] ExtractBench仓库:https://github.com/run-llama/ExtractBench

[2] 最新评测PR:https://github.com/run-llama/ExtractBench/pull/29