OCR 这事,大家都不陌生了。
但凡是做过文档结构化提取的,都卡过同一个坑:一页能搞,十页就崩。市面主流 OCR 工具,面对长 PDF、多页扫描件、复杂排版,要么丢结构,要么只给你纯文本不带坐标。
百度 PaddlePaddle 团队 6/22 开源了一个新东西——Unlimited-OCR,GitHub 上 6 天拿到 6.3K star,MIT 协议。核心卖点一句话:把 OCR 从"单页识别"推到"长文档一次性解析"。

01 跟以前的 OCR 有啥不一样
先说个反常识——OCR 这行,过去 5 年基本没大进步。Tesseract / PaddleOCR / 各大云厂商 API,核心架构还是"检测 + 识别"两段式,处理单页行/段是 OK 的,碰到多页文档就拉垮。
原因不复杂。两段式架构在"页与页之间"没有上下文——第 2 页的标题、表格的延续、章节的层级,全靠后处理脚本硬拼,拼错了往往没人发现。
Unlimited-OCR 的突破点不是"识别更准",而是"一次性看完整文档"——模型直接把 100+ 页 PDF 当成 1 个输入,内部用 attention 跨页追踪结构(标题-段落-表格-图表-脚注的归属关系),最后给你一份完整的结构化输出。
这一步,跟之前 DeepSeek-OCR (10 月) 的"上下文光学压缩"思路一脉相承,百度等于把这条路往前推了一大步。

02 真实场景里,这事省了谁的时间
先说最反常识的——
律师/审计/学术这 3 个行业,长文档处理是命根子。
一个 200 页并购合同,以前要 3-4 个律师花一周做 due diligence (看条款、摘关键风险、归类到事项清单)。AI 介入后,结构化提取本身是 30 分钟的事,人只需要做"AI 给的清单对不对"这个二次校验。
学术场景更直接——一篇 50 页的综述论文,Unlimited-OCR 可以一次性输出"作者-方法-实验-结论"的层级结构,研究者在 5 分钟内决定要不要精读。以前这个判断要 30-60 分钟。
03 技术上,有几个硬骨头啃下来了
PaddlePaddle 团队这次没藏招,关键工程细节 README 里全给了。
多页处理:用 infer_multi 接口,一次性传 N 张图片 (从 PDF 转的),内部走 image_size=1024 的 base config,保持分辨率不下采样。这一步是关键——下采样意味着小字 / 脚注 / 边栏注释会丢。
去重机制:no_repeat_ngram_size=35 + ngram_window=128/1024——长文本生成时的"循环复读"问题被这一对参数压住了。OCR 转结构化文本最容易出"同一行重复"问题,这参数是给生产环境调过的。
依赖精简:pymupdf 走 PDF 解析,transformers 走推理,没有引入大模型蒸馏/量化那些花活——你能直接用 GPU 跑,不需要专门的推理框架。
HuggingFace Spaces 已经搭好 demo,6/24 上线,直接上传 PDF 试,不用本地装环境。
04 但有个问题,得泼盆冷水
长文档 ≠ 复杂文档。
Unlimited-OCR 现在的"长"是页数维度的长(100+ 页),但如果文档里有手写批注 + 嵌入图表 + 多语种混排——目前版本还得手动后处理。
另一个工程上的坑:显存。README 里给的示例是单卡推理,200 页 PDF 转 1024×1024 图片,实测 A100 (80G) 跑 1 份就要 30G+。消费级显卡 (24G) 跑 50 页就吃力。
下一步,看他们能不能把"长文档" + "复杂版式" + "消费级硬件" 这三件事一起搞定——能做到的话,这个工具会真正成为法律/审计/学术的标配。
懂行的朋友看到这儿,应该会心一笑。
我的判断
OCR 这个赛道,大部分人觉得"已经成熟"了,但实际上结构化提取这一层,从来没人真正搞定。
Unlimited-OCR 的思路对路——"一次性看完整文档"比"一页一页拼"省的不是 10%,是 90%。百度这次开源时机选得也准,卡在 DeepSeek-OCR 之后,把"上下文光学压缩"这条路推到产品级。
但还得说一句:工具再好,关键还是用的人。OCR 不会替代律师和审计的专业判断,它替代的是"把 200 页 PDF 读一遍"这个机械动作。专业判断 + 工具提效,才是 2026 年 AI 落地的真正解法。
项目地址:https://github.com/baidu/Unlimited-OCR (MIT 协议,商用免费)
你怎么看?评论区聊。
夜雨聆风