乐于分享
好东西不私藏

阿里扔出一颗0.8B的“文档炸弹”:一个模型干掉一条流水线

阿里扔出一颗0.8B的“文档炸弹”:一个模型干掉一条流水线

点击下方“AIGC智汇局”,选择“加为星标

优质文章,第一时间送达!

最近阿里巴巴扔出一颗小模型——OvisOCR2。

参数只有0.8B,小到可以在普通显卡上跑。但它在权威文档解析基准OmniDocBench v1.6上拿了96.58分,直接登顶。

更关键的是——这是第一个全面超越传统流水线方法的端到端文档解析模型

什么意思?过去需要四五个模型接力才能干完的活儿,现在一个模型一步到位。

先搞清楚:文档解析到底在解决什么问题

你拍一张合同照片发给AI,让它帮你总结条款。AI能看懂吗?

能,但前提是得先把这张图里的文字、表格、公式全部“拆”出来,按正确顺序排列好,再喂给大模型。这个“拆”的过程,就是文档解析。

听起来简单,做起来极难。一份扫描版PDF里可能有正文、有表格、有公式、有页眉页脚,还可能有多栏排版。AI得先判断哪块是正文、哪块是表格、公式从哪里开始到哪里结束,然后再分别识别内容,最后按人类阅读的顺序拼回去。

过去行业怎么做?流水线——版面分析一个模型、文字识别一个模型、表格识别一个模型、公式识别一个模型,一个接一个串起来。

像工厂流水线,每个工位干一件事。问题是:前面工位出错,后面全歪。误差一层层累积。而且维护成本极高——每个模型都要单独调、单独更新,部署一套系统得伺候好几个模型。

OvisOCR2的做法:砍掉流水线,一个模型搞定所有

OvisOCR2走的是端到端路线。

输入一张文档图片,模型一次性输出Markdown格式的完整内容——文本、公式、表格、视觉区域全部按阅读顺序排好。

不需要多个模型接力,没有中间环节的误差传导。一个模型,一次生成,完事。

技术底子来自Qwen3.5-0.8B,阿里在这个基座上做了四件事:监督微调(SFT)、强化学习(RL)、在线策略蒸馏(OPD)和模型融合。

训练数据也下了功夫——真实文档提供自然的页面分布,合成文档专门补足表格公式交织、多栏版式、长输出这些复杂场景。真实加合成,两手都硬。

0.8B能干多大活儿?

0.8B参数是什么概念?GPT-3是175B,差了200多倍。

但OvisOCR2在OmniDocBench v1.6上拿了96.58分,登顶榜单。这个分数意味着它在文档解析的准确率上超过了所有前辈——包括那些参数大得多的模型。

而且它小。小就意味着便宜。显存占用低,算力要求低,普通消费级显卡就能跑。过去部署一套文档解析系统可能要上高性能服务器,现在一台普通机器就能搞定。

谁需要这东西?

三类人最直接受益。

第一,做RAG(检索增强生成)的团队。 RAG是目前企业把大模型接进自家知识库的主流方案。但RAG的第一步就是把企业内部的海量PDF、Word、扫描件解析成模型能读的格式。解析不准,后面检索和生成全歪。OvisOCR2直接把解析精度拉高一个档次,而且部署成本大幅降低。

第二,做智能问答的产品。 不管是客服机器人还是企业内部的知识问答,背后都依赖文档解析把资料库结构化。解析越快越准,问答体验就越顺。

第三,任何需要处理大量纸质文档或扫描件的企业。 金融、法律、医疗、教育——这些行业积压了海量非结构化文档。OvisOCR2让把这些文档“数字化”的门槛一下子低了很多。

行业正在发生什么变化

这次OvisOCR2登顶OmniDocBench,真正值得关注的不是分数,是技术路线的胜负。

文档解析这个赛道,过去一直由流水线方法统治。各家方案本质上都是拼凑多个模型,比拼的是谁把流水线搭得更稳。

OvisOCR2证明了端到端路线不仅能打,还能打赢。而且是用0.8B的小参数打赢的。

这意味着行业的技术竞争逻辑变了——不再是谁能堆更多模型、搭更复杂的流水线,而是谁能让单个模型更聪明、更高效地完成全流程。

另外值得注意的是,阿里选择开源,基于Apache 2.0协议,已经上架Hugging Face和魔搭社区。兼容vLLM等主流推理框架,可以无缝接入千问生态。

开源意味着什么?任何开发者、任何公司都可以直接下载使用,不用从零开始研发。文档解析这个基础设施级别的能力,正在从一个“大厂专利”变成“人人可用的工具”。

接下来会怎样

可以预见几个变化。

企业部署文档解析的成本会大幅下降。 0.8B的参数规模意味着不需要昂贵的GPU集群,中小企业也能负担得起高精度的文档解析能力。

RAG应用的门槛会进一步降低。 文档解析是RAG的“第一公里”。这公里跑通了,后面检索和生成的质量才有保障。OvisOCR2让这公里变得更便宜、更准、更容易铺开。

端到端会成为文档解析的主流方向。 OvisOCR2已经用96.58分证明了这条路走得通。接下来会有更多团队跟进端到端路线,流水线方法可能会逐步被替代。

阿里这次放出的是一颗0.8B的小模型,但撬动的是文档智能这个基础设施层的大变革。

从“多个模型串联”到“一个模型搞定”,从“重资产部署”到“轻量级接入”——这个转变,正在让AI读懂文档这件事,从一个复杂的系统工程,变成一个即插即用的能力。