做 RAG 的朋友,应该都经历过这么一个时刻。
你兴冲冲地把一份几百页的行业报告塞进知识库,问它一个特别简单的问题,结果它给你吐出来一坨。表格里的数字跟正文混在一起,公式变成 a b c 三个孤零零的字母,页眉页脚反复横跳,chunk 切得稀碎。
你盯着屏幕,有那么一瞬间会怀疑人生,怀疑自己是不是该换个赛道。
我以前也踩过这个坑。其实吧,这个坑的根子不在 RAG,在 RAG 前面那一道工序,就是 OCR。
很长一段时间,我们对 OCR 的期待特别朴素,就是把图里的字变成能选中的文本。能识别对,就谢天谢地。表格能凑合还原,已经是惊喜。至于这一行字落在页面的哪个位置,它是个标题还是个脚注,模型有多确定,没人关心,也拿不到。
OCR 就是个清洗工,把脏数据洗成勉强能用的文本,然后扔给后面的 RAG 和大模型去擦屁股。
前阵子 Mistral 发了 OCR 4。我读完它的发布文档,第一反应不是「哇又快了多少」,是「哦,原来 OCR 可以返回这种东西」。
它返回的不是文本。是一份文档的结构化表示。
具体一点,它在抽出来的文字旁边,附了三样东西。
第一样,边界框,bounding box。每个字、每块内容,都有一个坐标,告诉你它落在页面的什么位置。听着很普通对吧。但你想,以前你让 Agent「把发票上的金额填到这个表单里」,它得先猜金额在哪。现在它知道金额就在页面这个框里。从「猜」到「指」,这是质变。
第二样,区块类型,block classification。它会告诉你这一块是标题、是表格、是公式、还是签名。一个签名,一个公式,在老 OCR 眼里跟正文没区别,都是一串字符。但现在 Agent 知道,这块是签名,不能拿去当事实检索,那块是公式,得原样还原成 LaTeX 去渲染。文档里每个元素,第一次有了自己的身份。
第三样,也是我觉得最骚的,逐词的置信度分数,inline confidence score。它对每个词、每一页,都会告诉你它有多确定。
这个太关键了。
文档智能最难的不是抽出来,是抽出来之后你敢不敢信。一份合规材料,抽错一个数字就是事故。以前你只能信不信由你,要么全信,要么人工全核。现在模型自己举手说,「这段我 99% 确定,那段我只 60% 确定」。那 60% 的,直接路由给人工复核就行。一个 confidence 字段,把「全自动」和「人工兜底」中间那条最难拿捏的线,给画清楚了。
把这三样拼起来你就明白了,OCR 4 返回的不是文本,是一棵树。一棵带坐标、带类型、带可信度的树。
文档从「一坨文本」,变成了「一个结构化对象」。
这个变化的下游冲击,比想象中大。
放到 RAG 里,干净的、带类型的 block,天然就是更好的检索单元。表格归表格,正文归正文,分开切,分开索引,召回质量直接上一个台阶。Mistral 自己也没藏着,OCR 4 是他们那个开源搜索框架 Search Toolkit 的摄入组件,结构化输出直接喂给后面的检索和评估流程。
放到 Agent 里,意义更大。Agent 第一次拿到了「操作」文档的原语。填表单、处理发票、跑合规检查,这些以前要人去干的事,现在 Agent 知道哪块是什么、在哪儿、能不能信,它就能动了。
我不是光听官方吹。Mistral 自己放了几个客户的话。一个叫 Rogo 的,做金融 QA,他们说拿 OCR 4 跟市面上的 agentic 文档解析器比,精度差不多,成本大概低 8 倍,延迟低 17 倍。一个叫 Anaqua 的,做知识产权流程,说每页比他们原来的供应商快 4 倍。微软那边也站台,说 OCR 4 进了 Microsoft Foundry。
客户证言这种东西,大家懂的,都有水分。但 8 倍成本、17 倍延迟这种具体数字,加上微软愿意把它接进 Foundry,至少说明这玩意儿在企业场景是真的能跑,不是 demo。
当然我也理解,很多人看到 OCR 这俩字就划走了。
你可能会想,我又不是做 RAG 的,我又不搞企业搜索,文档解析这种脏活累活,跟我有什么关系。
我特别理解。但我想说的是,OCR 4 真正值得留意的,不是它识别得有多准,是它代表的那种范式转变。
以前 AI 跟文档的关系,是「读」。识别文字,理解内容,回答问题。AI 是文档的读者。
OCR 4 往前推了一步。它把文档变成了一组带坐标、带类型、带置信度的结构化原语,等于给文档造了一个 API。AI 从「读文档」,开始走向「对文档采取行动」。
这事儿你往大了想,跟整个 Agent 浪潮是同频的。Agent 要做事,做事得有抓手。以前抓手是浏览器、是代码、是各种 SaaS 的接口。现在文档本身,也成了抓手。一份合同、一张发票、一份病历,在 Agent 眼里不再是一张要读的图,是一个可以查询、可以操作、可以自动流转的对象。
说说怎么用,免得大家觉得空。
它走 API,4 美元一千页。有批量接口,半价,2 美元一千页。嫌写代码麻烦的,Mistral Studio 里有个 Document AI 的 no-code 路径,5 美元一千页,你传一个 JSON schema 进去,它直接吐结构化结果。同一个 endpoint,纯抽取模式跟 Document AI 模式是叠加的关系,OCR 结果你永远拿得到,Document AI 只是在上面再盖一层结构化。还支持自托管,单容器就能跑,数据不出你自己的机房。这点对金融、医疗、政务那些对数据驻留特别敏感的场景,是真刚需。AWS SageMaker、微软 Foundry 都接了,Snowflake 那边也快上了。
它还支持 170 种语言,10 个语系,连印地语、孟加拉语、格鲁吉亚语这种低资源语言都覆盖。这块不是我关心的重点,就不展开了。
我自己还没在真实项目里跑过,说实话。但这个能力点的组合,bounding box 加 block type 加 confidence,再加上能自托管,我大概能想到三四个马上能落地的场景,发票流水自动入账、技术报告知识库、合同条款抽取校验。等我真上手了,再单写一篇实测。
还有一点我特别想讲,是 Mistral 自己对 benchmark 的态度。
他们报了个 OlmOCRBench 85.20,第一。OmniDocBench 93.07。但他们专门写了很长一段,说这些自动评测的分数「只能当方向性的参考,别当定论」。
为啥。因为他们去查那些被判错的样本,发现一大半不是模型错了,是评测本身错了。标准答案本身就抄错了字,等价的 LaTeX 写法被判成不一样,多栏文档的阅读顺序把正确的识别判成错。。。
这个姿态我挺喜欢的。不吹分数,主动说自己分数的水分在哪。在 AI 公司的发布里,这种诚实挺稀缺的。
不过也得说清楚它不能干嘛。Mistral 自己划了线,OCR 4 是个文档理解模型,不是决策者。不能拿来医疗诊断,不能做法律判断,不能上高风险金融决策,也不能指望它干实时低延迟的活儿,喂原始音视频也不行。它就是把文档变结构化这一件事,做到位。
回到开头那个场景。
你那几百页报告塞进知识库,表格乱码,公式稀碎。根子在 OCR 只返回了一坨文本。
现在 OCR 4 返回的,是一棵带坐标、带类型、带可信度的树。Agent 拿到的不再是文字,是结构。
那坨让你怀疑人生的乱码,可能真的有救了。
我一直觉得,AI 应用最有意思的地方,不在模型又大了几倍,在于它正在把那些原本只能「读」的东西,变成能「动」的东西。文档只是其中一个。
磨平一些信息差。
以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章,我们,下次再见。
夜雨聆风