乐于分享
好东西不私藏

百度开源了这款一次吃下40页文档的OCR神器,完全本地运行!

百度开源了这款一次吃下40页文档的OCR神器,完全本地运行!

我发现了一个颠覆文档处理的开源神器:Baidu Unlimited-OCR,一次吃下40页文档!

最近刷到百度刚刚开源的Unlimited-OCR,直接让我眼前一亮——这可能是今年文档处理领域最值得关注的开源项目之一。

传统OCR工具一直让我头疼:必须一页页切开处理,跨页的表格经常断裂,阅读顺序乱套,上下文也丢失。遇到长文档、复杂表格、公式混杂的论文或报告,处理完还得手动拼凑,效率低到让人抓狂。

Unlimited-OCR完全不一样。它能把整份文档(最多40页以上)一次性丢进去处理!

它采用3B参数的MoE架构,推理时仅激活500M参数,却拥有32K的超长上下文窗口。核心创新是Reference Sliding Window Attention(R-SWA),让KV Cache保持恒定,真正实现“一口气”解析整篇文档。文本、公式、表格、阅读顺序全部完美保留,最后直接输出干净结构化的Markdown。

实测表现也亮眼:

  • 在标准基准上达到93%准确率,比基线高出6个百分点
  • 超过40页后,错误率依然控制在0.11以下
  • 原生支持多语言,开箱即用
  • 完全本地运行,零成本、无需上传云端

已关注

关注

重播 分享

目前Hugging Face上单月下载量已超212万,GitHub也有1.46万星,热度可见一斑。

对比之下,Amazon Textract、Google Cloud Vision、Azure Document Intelligence这些云服务都是按页收费,敏感文档还得担心隐私问题。Unlimited-OCR直接本地免费跑,性价比直接拉满。

我自己试了试,处理长报告或学术论文时,效率提升不是一点半点。尤其是需要提取结构化数据喂给大模型训练的场景,这工具简直是生产力神器。

感兴趣的朋友可以去Hugging Face搜 baidu/Unlimited-OCR 直接体验。开源项目,MIT协议,欢迎大家玩起来、改起来。

AI工具越来越“懂”文档了,你最近在用什么OCR工具处理长文档?欢迎评论区分享你的经验,一起交流~

(欢迎点赞、转发,让更多人看到这个好工具!)