乐于分享
好东西不私藏

【AI工具推荐】百度甩出王炸!22000星OCR神器,百页合同一次扫完,DeepSeek都得叫前辈

【AI工具推荐】百度甩出王炸!22000星OCR神器,百页合同一次扫完,DeepSeek都得叫前辈
百度甩出王炸!22000星OCR神器,百页合同一次扫完,DeepSeek都得叫前辈
你可能不知道,AI圈最近被一份"百页PDF"搞得鸡飞狗跳。
不是谁的论文泄露了,而是一个叫 Unlimited-OCR 的开源项目,直接把"文档识别"这件事的天花板掀了——一次性输入,不限页数,不限长度,整份PDF从头吃到尾,结构化输出。
6月22日上线,不到两个月 GitHub 狂揽 22,900+ Star,日均涨星 400+,直接冲上 GitHub Python 语言 Trending 榜 Top 7。更猛的是,连 DeepSeek-OCR 的作者都被它"推了一步"——项目 README 里写得明明白白:"push DeepSeek-OCR one step further"
出自百度,MIT 协议,论文同步挂 arXiv。
这不是又一个"调包OCR",而是一场文档解析的范式革命。
🔥 它到底解决了什么问题?
做过程序员、法务、财务、咨询的朋友都知道:长文档解析是AI管线的噩梦。
传统OCR工具面对一份100页的合同,你得做什么?
• 逐页切片送进去识别
• 每页单独处理,上下文断裂
• 跨页表格?直接崩
• 多栏排版?字序乱飞
• 一页一页拼回去?人工成本直接拉满
这就是所谓的 "碎片化OCR" —— 你能识别每一页,但你理解不了整份文档。
Unlimited-OCR 的解法很暴力:One-shot Long-horizon Parsing(一次性长程解析)
翻译成人话就是:你把整份PDF丢给它,它从第一页吃到最后一页,中间不断、不乱、不丢上下文。
不是RAG切片检索,不是分页拼接,而是真正的端到端长文档理解
💡 核心技术拆解:它凭什么能做到?
🔹 1. "高达模式"(Gundam Mode):单图精细化识别
Unlimited-OCR 提供了两种识别配置:
模式base_sizeimage_sizecrop_mode适用场景
Gundam1024640裁剪增强单图高精度识别
Base10241024全图输入多页/PDF长程解析
Gundam 模式是它的杀手锏之一:对单张图片进行智能裁剪(crop_mode=True),把高分辨率细节"放大再认",专门对付密集表格、小字体、多栏排版这种硬骨头。
🔹 2. 多页联合推理:不是拼,是"读"
传统工具逐页OCR,每页是独立的。Unlimited-OCR 的 infer_multi 方法会把所有页面作为一个整体送入模型推理——它不是"认字",而是"读文档"
这意味着:
• 跨页表格自动对齐
• 连续段落自动衔接
• 章节层级关系自动识别
• 页眉页脚智能过滤
🔹 3. 三大推理后端全覆盖
一个开源项目能不能落地,看部署生态。Unlimited-OCR 直接打通了三个主流推理框架:
Transformers(Hugging Face):开发调试首选,代码最简洁
vLLM:生产级高吞吐部署,官方 Docker 镜像直接拉
SGLang:批量推理利器,自动启动服务器+并发请求
三个后端,同一套模型权重,零改代码切换。这不是"demo级开源",是"生产级交付"。
🔹 4. 结构化输出 + 溯源
输出不是纯文本,而是带结构标记的解析结果:文本块、表格、图片区域、标题层级全部标注。每条内容可以追溯到原文档的具体位置——这在法律、审计、合规场景下极其关键。
🛠️ 上手指南:10分钟跑通第一个Demo
环境要求:Python 3.12+、CUDA 12.9+、torch 2.10+
单图识别(Gundam模式):使用 Transformers 后端,加载 baidu/Unlimited-OCR 模型权重,指定参数 base_size=1024, image_size=640, crop_mode=True,设置 max_length=32768,即可对单张图片进行高精度结构化识别。
PDF多页解析:先用 PyMuPDF 将 PDF 按 300 DPI 转为图片序列,然后调用 infer_multi 方法,所有页面作为一个整体送入推理,image_size=1024,输出完整的结构化解析结果。
批量推理(SGLang后端):一行命令搞定:
python infer.py --pdf ./docs/contract.pdf --output_dir ./results --concurrency 8
自动启动 SGLang 服务器,并发处理请求,适合生产环境部署。
📊 对比竞品:OCR 赛道谁更强?
维度Unlimited-OCRPaddleOCRDeepSeek-OCR商用API
长文档支持一次性全解析逐页处理有限长度按页计费
开源协议MITApache 2.0Apache 2.0闭源
多部署后端Transformers+vLLM+SGLang自有推理有限N/A
结构化输出带溯源标记基础基础
多页联合推理端到端不支持不支持不支持
GitHub Star22.9K87K--
核心差异:PaddleOCR 是"工具箱",功能全面但长文档仍是逐页处理;DeepSeek-OCR 开了个好头但长度受限;Unlimited-OCR 直接解决"长文档"这个最痛的点。
🎯 谁最该关注这个项目?
1. 法律/合规团队
合同审查、法规检索,动辄几百页。一次性解析+溯源定位,直接替代人工逐页标注。
2. 财务/审计人员
年报、财报、审计底稿,跨页表格是常态。结构化输出直接对接下游数据分析。
3. AI应用开发者
做RAG管线的朋友应该深有体会:文档解析质量直接决定检索质量。Unlimited-OCR 可以显著提升你的"知识入库"质量。
4. 学术研究/论文处理
批量解析论文PDF,提取结构化内容用于文献综述、知识图谱构建。
💭 雷子说两句
说个真实感受:AI工具的"最后一公里",往往不是模型能力,而是数据接入质量
你用的RAG再牛,如果文档解析就是碎的,出来的结果也是碎的。Unlimited-OCR 解决的就是这个"地基"问题——它不性感,但极其关键。
百度的开源策略这两年明显提速了。从 PaddleOCR 的 87K Star 到 Unlimited-OCR 的两个月 23K,节奏越来越快。MIT 协议 + 生产级部署 + 论文支撑,这不是"秀肌肉",是真正在抢开发者心智。
如果你正在做文档处理相关的AI应用,这个项目值得立刻加入技术栈评估清单
📎 项目地址:https://github.com/baidu/Unlimited-OCR
📎 论文:https://arxiv.org/abs/2606.23050
📎 在线体验:https://huggingface.co/spaces/baidu/Unlimited-OCR
今日互动:你平时是怎么处理长文档OCR的?逐页切片还是有什么黑科技?评论区聊聊 👇
#百度 #UnlimitedOCR #OCR #开源AI #文档识别 #AI工具 #GitHub #深度学习 #RAG #PDF解析