夜雨聆风学习资料网

ARTICLE · 1131174

pdf-inspector:先看清 PDF 里有没有字,再

pdf-inspector:先看清 PDF 里有没有字,再

pdf-inspector:先看清 PDF 里有没有字,再

刚下好的 PDF 想复制一段,结果粘出来全是错行。表格进笔记变成一列孤零零的数字。很多人碰到这种排版,第一反应就是送去做 OCR。

但有个常被忽略的事实:多数 PDF 本身带着完整的文字层。把它们一律送去识别,等于为同一件事付两次钱,还要多等十几秒。

Firecrawl 新出的 pdf-inspector 把这一步拆开了。它先分类,再决定怎么处理。十来毫秒就能判断整份文件要不要 OCR,甚至能精确到具体哪一页。

更绝的是它的速度。官方跑 200 份文档只要 0.47 秒,全程不上传文件。表格和分栏也能尽量还原,不会把左右两栏读成一坨乱码。

不过它也不是万能的。纯扫描件还是得走 OCR 老路,Intel 版 Mac 还得自己折腾兼容环境。但它确实适合那些天天批量处理合同、发票的后端开发者。

原文pdf-inspector:先看清 PDF 里有没有字,再决定要不要花钱做 OCR
四川,1小时前,

相关学习资料