Mistral OCR 4 发布:企业文档智能开始从“识字”走向可引用、可定位、可审计
Mistral 发布 OCR 4,把文档解析从纯文本抽取推进到结构化输出:边界框、块类型、置信度和多语言能力一起进入企业搜索、RAG 和文档流程。

OCR 4 的重点不是只读出文字,而是让下游系统知道文字在页面哪里、属于什么结构。
OCR 4 更新了什么
Mistral OCR 4 支持 170 种语言、10 个语言组,并可作为单容器自托管部署。它面向的不是简单图片转文字,而是企业文档智能:PDF、DOC、PPT 和 OpenDocument 等格式进入系统后,需要被可靠拆成可检索、可引用、可检查的结构。
新版本返回的不只是 extracted text,还包括 bounding boxes、typed-block classification 和 inline confidence scores。换句话说,系统可以知道一段文字来自页面的哪个位置、它是标题、表格、公式还是签名,以及模型对这个区域有多大把握。
为什么结构化输出更关键
RAG 需要更好的切块:如果只把整页文本塞进向量库,检索结果很容易丢失表格、页眉、脚注和公式关系。OCR 4 的块分类和位置输出,可以让检索单元更贴近文档原结构。
Agent 需要可操作的文档:当 Agent 处理表单、发票、合规材料或合同审阅时,知道“字段在哪里”和“这个字段属于什么类型”比单纯读到字符串更重要。
审计需要置信度:企业工作流里,低置信度区域可以被交给人工复核,高置信度区域则进入自动化处理。OCR 不再是黑箱输出,而是可分层处理的管道。
性能和部署
Mistral 称 OCR 4 在公开 OlmOCRBench 上取得 85.20 的最高总分,并在由独立标注者参与的人类偏好评测中取得平均 72% 的胜率。Mistral 同时提醒,文档 OCR 基准存在标注、数学公式、分栏顺序和块类型归因等评分噪声,实际部署仍应在自有文档上评估。
定价方面,API 为每 1000 页 4 美元,Batch API 折扣后为每 1000 页 2 美元,Document AI 为每 1000 页 5 美元。对数据驻留和合规要求高的企业,Mistral 提供自托管部署路径。
结尾
文档智能的瓶颈正在从“能不能识别文字”转向“能不能把文档结构可靠交给检索和 Agent”。Mistral OCR 4 的价值就在这里:让 OCR 输出更像企业知识系统的一层基础设施。
参考来源
https://mistral.ai/news/ocr-4
夜雨聆风