今天企业圈和开发者社区都在转一条消息:阿里把一个小到能本地跑的模型,推上了文档解析领域的王座。
7月24日,阿里巴巴阿里云 ATH-MaaS 团队发布并开源了 OvisOCR2。这个参数规模仅 0.8B 的模型只专注一件事:把文档页面变成机器能读的结构化文本。它在权威基准 OmniDocBench v1.6 上拿到 96.58 分,把此前由多阶段流水线把持的榜首第一次抢到了端到端路线手里,在另一个基准 PureDocBench 上也拿了第一。模型以 Apache 2.0 协议放出,能直接接入千问生态。这背后是阿里基于 Qwen3.5-0.8B 做后训练,叠加真实与合成互补的数据引擎,以及监督微调、强化学习、在线偏好蒸馏和模型融合的多阶段配方。
要理解这件事的分量,得先说清楚文档解析以前是怎么干的。企业知识库、RAG 检索、智能问答,背后都得把 PDF、扫描件这些“非结构化文档”变成结构化文本。过去这个活儿靠“流水线”:一个模型认版面,一个模型认文字、公式、表格,最后拼起来。成熟是成熟,但模块多就意味着维护贵、误差会一层层累积、部署也复杂。OvisOCR2 走的是另一条更难的路——端到端:丢一张文档图进去,模型一次生成就直接吐出符合阅读顺序的 Markdown,正文、公式、表格、图区一口气覆盖。过去好几个模型接力,现在一个模型一步到位。
最让人意外的是它的“体型”——把 OvisOCR2 和几个大得多的模型放一起比,反差一目了然:同门的 Qwen3-VL-235B(2350 亿参数)综合分 89.78,Gemini 3 Pro 是 92.91,Ovis2.6-30B 是 93.70,而它拿到 96.58,高出 3 到 7 个百分点。换句话说,参数不是越大越好,关键看训法和数据:阿里用“小身板加精调配方加好数据”证明,紧凑模型在垂直任务上完全可以挑大梁。对企业来说这意味着真金白银——更低的显存、更快的推理、更简单的部署,不用堆昂贵算力也能拿到领先效果。
把视角拉远一点,OvisOCR2 真正的分量在“开源”二字。Apache 2.0 意味着能商用、能二开,开发者不需要额外适配就能接进千问生态,等于给大量中小团队和企业送了一把轻量、本地可部署的文档智能钥匙。当海外还在比谁的旗舰模型参数更吓人,国内的开源力量已经在用“小模型干重活”的路线悄悄卡位——把 AI 落地从“堆算力”扭向“拼工程”。当然,官方也坦承真实文档千变万化,关键场景仍需人工核验,它还不是终点。但一个 0.8B 模型能登顶权威榜,本身就说明文档解析这条赛道,天平正在从“大而全”倾向“小而精”。
夜雨聆风