
极市导读
面对大语言模型在文档解析中因过度依赖语言先验而产生的“幻觉”问题,MonkeyOCRv2 提出由“视觉压缩”向“视觉重建”演进的新路线,通过像素级重建确保模型保留精准的底层字符特征。并且,研发团队同步开源了规模达 100TB、包含超 1 亿样本的 MonkeyDoc v2 图像数据集,欢迎Star~>>加入极市CV技术交流群,走在计算机视觉的最前沿
从视觉压缩到视觉重建,为什么要为文档智能重新训练一个底座
“压缩解决的是装下多少,重建追问的是留下什么。”
DeepSeek-OCR火起来之后,有一个值得认真讨论的概念:视觉即文本。
过去,大模型把文字切成Token,再逐个送进上下文窗口;DeepSeek-OCR则把长文本和复杂页面映射进二维视觉空间,用更少的视觉Token承载更多内容。它把OCR从“识别工具”的讨论,推到了表示、压缩和长上下文的更大问题里。
这种探索很赞。它让大家第一次大规模意识到:文字不一定只能以文字Token的方式被模型记住。
但这面临另一个更基础的问题:当文字被压缩进视觉表示之后,模型到底记住了什么?它记住的是页面上真正出现的字符、数字和版面,还是只留下了一个足够让语言模型把答案补回来的模糊轮廓?
这不是在否定视觉压缩。恰恰相反,越是相信它可能成为长上下文的一条重要路线,我们越需要把“压缩效率”和“视觉保真”分开测量。

01 “视觉即文本”打开了一扇门,但压缩不是终点
DeepSeek-OCR的官方实验给出了很有冲击力的结果:当文本Token与视觉Token的压缩比低于10倍时,OCR解码精度可达到约97%;压缩到20倍时,仍保留约60%的准确率。它还把文档解析放进了“历史上下文压缩”和“模型记忆”的讨论中。
这样的数字很容易让人兴奋,因为它似乎给出了一个新的工程想象:一篇论文、一套档案、几十页财报,也许不必被拆成漫长的文字Token,而可以先被压缩成一组视觉表示,再交给语言模型处理。
但这里有一个容易被忽略的混合变量:最终输出来自“视觉编码器 + 语言模型解码器”。当视觉信号不完整时,一个强大的语言模型仍可能根据常见词语、句法和上下文,把缺失的内容补成一个非常流畅、甚至看起来完全正确的答案。
后续也有独立研究通过语义扰动指出:当正常语言上下文被破坏后,DeepSeek-OCR的表现会显著下降。这个结果并不能简单推出“视觉压缩无效”,但它提醒了整个领域:高压缩下的OCR准确率,往往同时包含视觉识别与语言补全两部分贡献。
“如果我们只看最终答案是否像真的,就很难知道模型究竟看到了多少,又猜回来了多少。”
因此,值得更关心的不是再做一条“谁压得更狠”的曲线,而是建立一组更严格的问题:语言上下文被拿走后,模型还能不能识别?页面上的错误与语言常识冲突时,模型相信页面还是相信常识?视觉表示能不能支撑模型把页面重新恢复出来?
02 OCR走到今天,真正缺的可能不是更大的LLM,而是一块为文档而生的视觉底座
过去十多年,OCR研究大体经历了三次重心迁移。
第一阶段解决“字能不能读出来”:单行文字、场景文字、手写体、公式,各自训练专门模型。 第二阶段解决“页面能不能还原”:文字、表格、图片、公式和阅读顺序被统一解析成结构化结果。 现在进入的第三阶段,则是“文档能不能成为大模型可靠的视觉输入”:模型不仅要识别,还要理解、问答、推理,并成为Agent读取现实世界知识的入口。
问题在于,许多文档系统的“眼睛”并不是为文档训练的。CLIP关心图像和文字的全局语义是否对齐,DINO关心跨视角稳定的语义特征,SAM关心物体和区域边界。这些能力在自然图像里非常强,但文档的要求几乎相反。
一只猫换了毛色、一个汽车换了角度,语义仍然不变;可在文档里,1和7、小数点有或没有、公式上下标的位置、两栏页面的阅读顺序,都可能改变整个答案。
“对自然图像来说,忽略细节是一种能力;对文档来说,忽略细节往往就是错误本身。” |

这也是为什么MonkeyOCRv2定位为“文档原生视觉编码器”,而不是再做一个更大的端到端OCR模型。所谓底座,不是一个口号,它至少要满足三件事:能被不同系统替换使用;换到不同任务上仍然带来稳定收益;即便把它冻结、把后端模型和训练流程固定,它的优势仍然存在。
03 做法很朴素:让模型不仅读出页面,还要把页面画回来
如果模型只需要把图片转成文字,它很容易找到一条“聪明的捷径”:看见几个模糊字符,再依靠语言规律把整句话补完整。对于普通阅读,这种能力有时很有用;可对于合同金额、实验数据、药品剂量和历史档案,它也可能制造一个语法正确、事实错误的答案。
所以给视觉编码器安排了两场考试。
第一场是“读出来”:根据图像生成页面文字,让视觉表示理解这页内容说了什么。
第二场是“画回来”:根据同一组视觉Token重建原始文档图像,让视觉表示必须保留这页到底长什么样。

这里的重建,并不是为了生成一张肉眼漂亮的图片。它更像一场闭卷考试:如果编码器真的把小数点、字符轮廓和表格边界忘了,后面的解码器就不可能凭空把原页面画回来。
可以用一句话概括这两个目标:文本生成负责学习意义,像素重建负责保存证据。
“视觉即文本,让页面可以被压缩;重建即记忆,要求模型证明它没有忘掉最重要的字。”
04 拿走语言上下文后,模型还剩下多少真正的视觉能力?
为了验证“重建保存证据”不是一个听起来合理的故事,研究者设计了一个有点反常识的实验:把文字打乱。
准备两组视觉形式对应的文本图像,一组是正常句子,另一组把字符随机打乱成没有意义的组合。对于后一组,语言模型无法再依靠常见词语和句法自动补全,只能老老实实识别图像里的每一个字符。随后,把输入分辨率从1288逐步降低到448,观察模型在视觉信息变弱时会发生什么。
最低分辨率下,不使用重建目标的MonkeyOCRv2-S-Parsing,对打乱文字的识别准确率只有55.4%;加入像素级重建后,准确率提高到72.1%,提升16.7个绝对百分点。正常文本和打乱文本之间的准确率差距,也从29.3个百分点缩小到15.3个百分点。

这个实验不能简单理解成“解决幻觉”。字符打乱本身会带来分布变化,也会受到分词和解码方式影响。它更像一把尺子,用来测量:当语言线索消失以后,视觉编码器留下的信息是否仍然足以支撑正确识别。
CHAOS-Bench又从另一个方向提出问题:它会故意把页面中的若干单词改错,使错误字符在视觉上清晰可见,却不符合语言常识。一个依赖语言先验的模型,可能会擅自把它“纠正”成正常单词;一个忠实于视觉证据的模型,则应该原样读出页面上的错误。
在这一测试中,MonkeyOCRv2-B-Parsing的页面平均召回率达到17.9;小模型加入重建目标后,也从12.1提高到14.7。数字本身并不意味着问题已经解决,但它让“模型是否相信页面”第一次成为可以被直接讨论的指标。

05 “底座”必须在不同系统里被反复验证
如果MonkeyOCRv2只在一个自建解析器里得到高分,我们不会把它称为底座。真正让我们重视这条路线的,是三组相互独立的事实。

第一,在一组受控文档理解实验中,固定同一个Qwen3-1.7B语言模型、同一批训练数据、同一套优化设置和解码流程,所有视觉编码器都保持冻结,唯一变化就是“眼睛”。MonkeyOCRv2-B在8个文档理解基准上的平均分为57.2,最强的非MonkeyOCRv2对照OpenVision-B为44.0。
第二,把编码器接入文字识别、公式识别、文本检测、文档篡改检测、重叠文本分割、文档解析和文档理解7类任务。它们的输出形式完全不同,有文字序列、LaTeX公式、检测框、像素掩码、结构化页面和问答答案。替换原有视觉骨干后,多个系统都获得持续增益。例如CRNN的综合识别准确率从58.7提高到67.3;110M参数的公式模型也超过了325M版本。
第三,把视觉编码器冻结,和一个0.6B轻量语言模型组合成总参数0.7B的文档解析器。它在覆盖电子原生与拍照文档、包含17种语言的MDPBench上达到83.3,超过此前3B开源基线2.8个绝对点,而视觉编码器约小11倍。

这些结果并不是为了证明“小模型永远比大模型好”。在OmniDocBench等趋近饱和、并高度依赖专门后训练和复杂工程管线的基准上,MonkeyOCRv2-Parsing仍落后于最新的专用解析系统。可以把它理解为一个更基础的信号:如果视觉入口足够可靠,后端语言模型不必用大量容量弥补前端已经丢失的信息。
06 比一次榜单领先更重要的,是让文档AI拥有共同的数据起点
在模型发布之外,值得一提的是,团队还开放了 MonkeyDoc v2。该数据集包含1.13亿个文档图像样本;据项目页面披露,完整原始数据的落盘规模超过100TB,覆盖17种语言,包括800万张完整页面和1.05亿个裁剪文档元素,其中6100万来自真实世界文档,5200万为合成数据。
数据规模当然重要,但更重要的是它的开源开放试图回应Document AI正在变得越来越现实的一个问题:模型越来越多,分数越来越高,可大家经常不知道究竟在比较什么。
有的系统依赖不可见的私有数据(几乎主流的解析器对训练数据完全不开放),有的系统在错误样本上持续补标,有的系统使用多阶段、强定向的后训练。它们都可能带来真实的工程进步,但如果数据、过滤流程和训练边界完全不可见,后来者很难判断提升来自新的模型思想,还是来自更多资源和更细致的定向优化。

在大模型时代下,不反对大厂做更强的系统,也不反对技术报告快速迭代。真正值得警惕的是,整个领域如果只剩下“谁又刷新了一个数字”,却没有积累更多人能够重复、替换和改进的公共基础设施,那么每一次领先都很容易随着下一次报告消失。
MonkeyDoc v2可以成为一个新的起点:有人可以用它训练新的视觉编码器,有人可以研究数据配比,有人可以做低资源语言,有人可以检验合成数据的边界,也有人可以发现结果的数据偏差和遗漏。
因此,数据开放并不是为了守住一个结果,而是希望把问题交给整个社区:欢迎公开失败案例,也欢迎任何更简单、更有效的方法在相同数据和协议下超过 MonkeyOCRv2。只有这样,文档 AI 的进步才不再只是追逐榜单上的数字,而是共同回答一个更根本的问题——什么样的视觉表示,才真正适合文档。
07 文档视觉底座的下一步会是什么
今天的文档已经远远不只是扫描PDF。AI Agent需要阅读科研论文,企业知识库需要理解合同和财报,医疗系统需要结构化检验报告,数字人文需要处理古籍与历史档案,遥感系统也要同时理解地图、图例、坐标和文字标注。
这些场景看起来分散,却共享一个前提:进入语言模型之前,视觉入口必须保留细粒度文字和结构证据。
MonkeyOCRv2目前已经在7类文档任务中得到验证。研究团队正在把视觉编码器整理成更容易替换的独立模块,也开始有更多研究者关注能否将其接进领域的YOLO检测头、VQA框架、分割系统或领域模型里。

结语:在模型开始思考之前,它到底有没有真正看到?
大模型时代,我们已经习惯讨论更大的参数、更长的上下文、更强的推理。DeepSeek-OCR让大家看到,视觉空间可能成为文本压缩和长期记忆的新媒介。这个方向值得继续向前。
但对文档智能而言,一个更基础的问题始终存在:当模型开始推理之前,它得到的究竟是完整的页面证据,还是一个已经被视觉编码器模糊过、再被语言模型补全过的版本?
MonkeyOCRv2提供的是另一块拼图:压缩让AI看得更多,重建让AI不轻易遗忘。
过去十多年,OCR一直在追求“把字读出来”。大模型时代下的OCR应该要向前再走一步:让文字成为一种真正被认真对待的视觉模态,让文档拥有自己的视觉底座,也让每一次模型输出,都能更清楚地回答一个朴素的问题,这个答案,究竟来自页面,还是来自猜想?
论文地址: https://arxiv.org/abs/2607.11562 项目地址: https://github.com/Yuliang-Liu/MonkeyOCRv2
公众号后台回复“数据集”获取100+深度学习各方向资源整理
极市干货

点击阅读原文进入CV社区
收获更多技术干货
夜雨聆风