本周 GitHub 热门项目推荐第六期,Unlimited-OCR
一份四十多页的财报,传统 OCR 往往要拆页、识别、拼接,再祈祷跨页表格别在中途散架。
最新开源的 Unlimited-OCR 把长文档解析做成一次连续任务,多页 PDF 可以在单次前向推理中一路读下去,少了反复清空上下文和手工拼接的折腾。
▌连续长文档解析
项目支持单张图片、多页图片和 PDF 的推理方式。PDF 会先转换为页面图像,再交给模型连续解析;合同、财报、论文、图书这类几十页文件,可以保持统一的解析进度,避免每翻一页就“失忆”一次。

这项能力的传播点很直观:过去常见的 OCR 流程像流水线,每页单独处理,最后再把结果缝起来;Unlimited-OCR 尝试让模型从第一页一路读到最后一页。官方论文展示了 40 页以上文档的长序列测试,长文档终于不必先切成一地碎片。
▌R-SWA 工作记忆机制
它的核心叫 R-SWA,即“参考滑动窗口注意力”。模型始终关注原始文档中的视觉信息,同时只保留最近一段输出作为工作记忆。可以把它理解成抄书:眼睛一直看着原文,脑子记住刚写到哪里,早先抄过的内容逐渐淡出。
这种设计让解码阶段的 KV Cache 保持固定规模。KV Cache 可以理解为模型生成文字时的临时记忆;常规模型写得越长,临时记忆越膨胀,速度也会逐渐下降。R-SWA 用滑动窗口控制这部分开销,长输出时更加稳定。

▌基准表现与长输出效率
官方论文在 OmniDocBench v1.6 上给出 93.92 的综合成绩;在理论吞吐对比中,当输出长度接近 6000 tokens 时,Unlimited-OCR 相比基线 DeepSeek OCR 的速度优势约为 35%。这个优势很贴合它的任务:文档越长,传统全量注意力的负担越明显。
模型总参数量为 3B,推理时激活参数约 570M。开源仓库已经提供 Transformers、vLLM 和 SGLang 的调用方案,百度智能云也上线了可返回 Markdown 或 JSON 的 API 服务,项目从研究代码走向实际接入的速度很快。
▌运行条件
本地推理目前以 NVIDIA GPU 为主,官方给出的 Transformers 环境基于 CUDA,部署门槛依然存在。它也没有真的做到“无限”:论文明确说明,32K 上下文仍会限制可处理页数,页面越多,前置视觉信息同样会持续增长,团队计划继续探索 128K 上下文和更灵活的预填充机制。
复杂扫描件、旋转文字、跨页表格和不同硬件环境下的稳定性,还需要更多真实场景检验。Unlimited-OCR 已经把 OCR 最磨人的拆页与拼接向模型内部推进了一大步,接下来就看这套“工作记忆”能否在更多长文档里一直保持清醒。
夜雨聆风