AI导读
阿里云开源0.8B文档解析模型OvisOCR2,以96.58分登顶OmniDocBench,端到端方案首超传统流水线。
独家
正文
7月24日,阿里云正式开源发布文档解析模型OvisOCR2。该模型以综合得分96.58刷新OmniDocBench v1.6榜单纪录,成为首个超越传统流水线方法并登顶该榜单的端到端模型,文档解析领域由此迎来一次技术路线层面的突破。

过去该领域由"流水线方法"主导,需串联版面分析、文字识别等多个模型,维护成本高且误差层层累积。OvisOCR2改走端到端路线:输入一张文档图像,一次生成即输出符合自然阅读顺序的Markdown结果,覆盖文本、公式、表格和视觉区域,一个模型替代过去多模型协作。模型由Qwen3.5-0.8B后训练得到,仅0.8B参数(约1.7GB)即实现SOTA,经监督微调、强化学习、在线策略蒸馏与模型融合四阶段训练,并借助真实与合成文档互补的数据引擎释放紧凑模型潜力。
OvisOCR2以Apache 2.0许可证开源,已上线Hugging Face与魔搭平台,兼容vLLM等主流推理框架,可无缝融入Qwen3.5生态。凭借小参数与低部署门槛,它能在单张甚至受限显卡上运行,为金融、政企、医疗机构在内网处理敏感文档提供了轻量选择。文档解析是大模型落地企业知识库、RAG与智能问答的关键基础设施,阿里以开源方式把这条端到端新范式直接推向了开发者。
参考来源:IT之家(2026/07/24)、虎嗅(2026/07/24)、DoNews(2026/07/24)、和讯/凤凰网科技(2026/07/24)

End
完结-
夜雨聆风