乐于分享
好东西不私藏

Mistral OCR 4 发布:企业文档 AI 的门槛降了

Mistral OCR 4 发布:企业文档 AI 的门槛降了

很多团队做企业知识库时,最先遇到的麻烦并不是大模型不会回答,而是文档进系统之前就已经乱了。

PDF 里有表格、合同签名、页眉页脚、扫描件、截图、公式、双栏排版。它们被粗糙地变成一段段文本以后,RAG 再强也只能在噪声里找答案。最后产品经理看到的是“回答不稳定”,工程师看到的是“召回不准”,业务看到的是“这东西还不能放心用”。

所以今天 AIHOT 里我更关注 Mistral OCR 4,而不是另一个更热闹的视频或音频模型。

它的价值不在于“又多了一个 OCR”,而在于它把企业文档进入 AI 系统前的输入层做得更完整了。

这次更新的关键点

Mistral 在 2026 年 6 月 23 日发布 OCR 4,官方定位是面向 Document Intelligence 的 OCR 模型。

这次更新有几个值得中文开发者和产品团队留意的点:

  • • 支持 170 种语言、10 个语系
  • • 输出不只包含文本,还包含 bounding boxes、block classification 和 inline confidence scores。
  • • block classification 能识别标题、表格、方程式、签名等文档块。
  • • 支持单容器自托管,适合有数据驻留、合规和私有化要求的企业。
  • • 在 OlmOCRBench 上得分 85.20,官方称人工标注者平均偏好率 72%
  • • API 定价是 每 1000 页 4 美元,Batch API 享 50% 折扣。

这里真正重要的是“结构”。过去很多 OCR 只给你一堆文本,接下来还要自己判断哪些是标题、哪些是表格、哪些是脚注、哪些内容可信度不够。OCR 4 把这些信息作为输出的一部分交出来,后续系统就能更容易做高亮、引用、审校和检索。

对 RAG 来说,这比单纯提升识别率更实际。因为企业用户不会只问“这页写了什么”,他们会问“这份合同第 3 条和附件表格有没有冲突”“这张发票里哪一项需要人工复核”“这份英文报告里的关键数据来自哪一页”。

没有位置、块类型和置信度,这些问题很难做得可靠。

为什么它会影响企业知识库

现在很多知识库项目的失败,不是卡在模型能力,而是卡在入库质量。

如果一个 PDF 的表格被拆散,检索时就容易丢掉行列关系;如果签名页和正文混在一起,模型可能把流程性内容当成事实;如果置信度低的扫描件没有标记,系统就无法把风险交给人工复核。

OCR 4 的方向是让文档进入向量库之前,就保留更多上下文:

  • • 文字在哪里;
  • • 它属于哪类文档块;
  • • 模型对这段内容有多大把握;
  • • 哪些内容适合直接进入检索,哪些应该进入人工检查。

这会让企业搜索、RAG、审计、合同管理、保险理赔、金融档案、医疗文档等场景更容易产品化。

也就是说,OCR 4 解决的不是“能不能识字”,而是“文档能不能被系统可靠理解”。

怎么判断值不值得用

我会用五个问题来判断它是否适合进入团队选型清单。

第一,文档类型是不是复杂。纯文本 PDF 没必要过度设计;表格、扫描件、合同、论文、票据、手写签名越多,结构化 OCR 的价值越高。

第二,输出是否需要可追溯。如果产品要展示答案来自哪一页、哪一块、哪一张表,bounding boxes 和 block classification 会明显降低后续开发成本。

第三,是否有合规要求。OCR 4 支持单容器自托管,这对金融、政企、医疗、法务类文档很关键。

第四,成本能不能算清。每 1000 页 4 美元的公开价格,让团队可以先按页数估算入库成本;Batch API 折扣适合历史档案批处理。

第五,人工复核怎么接入。confidence scores 的意义,是让系统知道哪些结果需要人看,而不是把所有 OCR 输出都当成确定事实。

对产品团队的启发

如果你正在做 AI 知识库、文档问答、企业搜索或内部助手,Mistral OCR 4 值得被放进调研列表。

它提醒我们一件事:AI 产品的体验不只由大模型决定。真正影响可靠性的,常常是数据进入模型之前的那一步。

一个能保留版面、结构、位置和置信度的 OCR,会让后面的检索、引用、审计和复核流程更清楚。对开发团队来说,这是更少的清洗脚本;对产品团队来说,这是更容易解释的结果;对企业客户来说,这是更可控的风险。

当然,它也不是所有项目的默认答案。如果你的文档简单、页数很少、没有合规要求,用现有 OCR 或云厂商文档服务可能已经足够。真正适合关注 OCR 4 的,是那些“文档复杂、问答要可追溯、部署环境受限制”的团队。

这也是今天这个选题最有价值的地方:它不只是一个模型发布,而是把企业 AI 系统里经常被忽视的输入层,重新放到了台前。

资料来源

  • • AIHOT 日报,2026-06-24,模型发布/更新:Mistral OCR 4。
  • • Mistral AI 官方新闻:Mistral OCR 4: SOTA OCR for Document Intelligence[1]

引用链接

[1] Mistral OCR 4: SOTA OCR for Document Intelligence: https://mistral.ai/news/ocr-4