乐于分享
好东西不私藏

单前传搞定几十页文档!百度提出Unlimited OCR:破解长文档OCR内存瓶颈

单前传搞定几十页文档!百度提出Unlimited OCR:破解长文档OCR内存瓶颈

单前传搞定几十页文档!百度提出Unlimited OCR:破解长文档OCR内存瓶颈,性能反超DeepSeek OCR

AI前沿 | 顶会论文解读

论文标题:Unlimited OCR Works: Welcome the Era of One-shot Long-horizon Parsing

作者团队:百度公司(Baidu Inc.),核心贡献者包括Youyang Yin、Huanhuan Liu等

发表会议:arXiv预印本(cs.CV),2026年6月

核心结论:提出参考滑动窗口注意力R-SWA,解决长序列解码KV cache线性增长问题,构建Unlimited OCR实现单前传解析几十页文档,OmniDocBench v1.5综合得分93.23%,较DeepSeek OCR基线提升6.22%,长序列推理速度保持恒定,最高较基线提速35%。

📄 论文摘要

近年来以DeepSeek OCR为代表的端到端OCR模型,利用大语言模型作为解码器大幅提升识别性能,但这类模型随着输出序列长度增加,KV cache会线性增长,导致内存占用飙升、推理速度持续下降,无法一次性处理长文档,只能采用逐页循环处理的工程折中方案,和人类长文档抄写的工作记忆模式存在本质差异。百度提出Unlimited OCR模型,模仿人类长程抄写的记忆机制,设计参考滑动窗口注意力(R-SWA)替换解码器标准注意力,在保留完整视觉全局信息的同时将KV cache维持恒定,结合高压缩视觉编码器,在32K上下文下单次前向传播即可解析几十页文档,同时在标准OCR基准上实现性能反超,该机制还可泛化到ASR、翻译等长序列任务,代码和模型权重已开源。

🏗️ 总架构设计

Unlimited OCR以DeepSeek OCR为基线构建端到端架构,整体由两大核心模块组成:第一是继承优化的DeepEncoder视觉编码器,通过级联窗口注意力ViT和全局注意力实现16倍视觉token压缩,单张1024×1024分辨率文档仅需256个token表征,大幅降低视觉侧显存占用,且视觉token编码完成后全程保持静态,不参与解码状态更新,避免视觉特征模糊。第二是搭载R-SWA注意力的MoE大语言模型解码器,将KV cache设计为固定容量队列结构:一部分是全局固定的参考缓存,存储所有视觉token和任务prompt,所有解码步骤都可全局访问;另一部分是固定宽度n(默认128)的滑动窗口缓存,仅存储最近n个已生成输出token,新token生成时自动淘汰队列最旧的输出缓存,从根源上避免KV cache随生成长度增长。

图1:Unlimited OCR整体架构:模仿人类抄写的工作记忆机制

💡 核心创新点

双段式参考滑动窗口注意力:区别于标准全注意力缓存所有历史token导致显存线性增长,也区别于普通滑动窗口注意力丢失全局视觉信息,R-SWA将注意力范围拆分为全局参考段和局部滑动段:所有视觉、prompt类前缀token对所有解码步骤全程可见,保证模型始终看到完整文档信息;仅输出序列采用固定宽度因果滑动窗口,只关注最近128个已生成token追踪解析进度,同时避免视觉特征在状态递推中被模糊。

恒定显存的长程解码机制:传统多头注意力KV cache大小随生成长度T线性增长,长文档生成时显存会很快耗尽;而R-SWA的KV cache被严格限制在$L_m + n$的固定上限,当生成长度远大于窗口大小时,额外显存占比趋近于0,实现无论生成多长文档,显存占用和单步推理延迟都保持恒定,彻底解决“越生成越慢”的行业痛点。

无精度损失的注意力替换:R-SWA没有为效率牺牲识别精度,反而通过限制注意力范围让模型更聚焦于密集OCR任务,在单页基准中性能显著超越基线;实验证明128宽度的滑动窗口足够让模型追踪解析进度、传递局部上下文,不会出现位置丢失或上下文断裂,实现“效率提升同时精度上涨”的无损失优化。

图2:R-SWA与标准注意力的KV cache对比:R-SWA实现缓存大小恒定

🔬 关键方法与实验结果

团队构建约200万文档OCR样本,单页与多页数据比例为9:1,多页数据随机拼接2-50页文档,统一打包为32K长度序列,基于DeepSeek OCR预训练权重续训4000步,训练过程冻结视觉编码器仅优化LLM参数。基准测试选用OmniDocBench v1.5/v1.6作为核心评测集,同时构建2页到40+页不等的长文档测试集,评测编辑距离、Distinct-n、推理TPS等核心指标。

图3:解码延迟对比:Unlimited OCR每步解码延迟恒定,基线随解码步数增长

单页基准测试中,Unlimited OCR在OmniDocBench v1.5上取得93.23%综合得分,相比DeepSeek OCR基线提升6.22%,文本编辑距离降低51.4%,表格TEDS提升5.96%;v1.6版本基准上取得93.92%综合得分,达到端到端OCR SOTA水平。推理效率上,512并发下Unlimited OCR速度达5580 TPS,相比基线提升12.7%;生成长度达6000token时基线速度下降35%,而Unlimited OCR速度始终恒定。长文档测试中,即使处理40+页文档,文本编辑距离仍低于0.11,Distinct-35达96.90%,性能保持稳定。

模型名称 综合得分(↑) 文本编辑距离(↓) 表格TEDS(↑) 推理TPS(↑)
DeepSeek-OCR 87.01 0.073 84.97 4951
Unlimited-OCR 93.23 0.035 90.93 5580

🚀 应用价值与展望

Unlimited OCR打破了传统OCR系统逐页处理的工程范式,首次实现单次前向传播解析几十页文档,大幅降低长文档处理的工程复杂度,在书籍数字化、档案留存、长合同审阅、多页报表识别等场景具备极高落地价值,相比分页处理方案延迟更低、上下文一致性更好。同时R-SWA是通用长序列注意力机制,并不局限于OCR任务,对于语音识别、长文本翻译、长视频字幕生成等“固定参考前缀+长序列输出”类任务都适用,可广泛解决这类任务的长序列推理内存瓶颈。未来团队计划将上下文窗口扩展到128K支持上百页文档解析,长期将研发prefill动态调度机制,模拟人类翻书的记忆换入换出过程,实现真正无长度限制的文档解析,同时将R-SWA适配到更多生成任务中。

📚 论文原文:https://arxiv.org/abs/2606.23050v1

💻 相关资源:https://github.com/baidu/Unlimited-OCR

🎯 核心亮点:模仿人类工作记忆设计R-SWA注意力,实现KV cache恒定不增长,单前传解析几十页长文档,精度反超DeepSeek OCR达SOTA,长序列推理速度无衰减,通用机制可扩展至ASR、翻译等多类任务。

⭐ 觉得文章有用?欢迎分享给更多朋友! 💡 关注公众号,获取更多顶会论文深度分析 🔥 每日精选AI论文,解读最新技术进展