夜雨聆风学习资料网

ARTICLE · 1094066

一半的PDF根本不用OCR:这个Rust库20ms就能

一半的PDF根本不用OCR:这个Rust库20ms就能

一半的PDF根本不用OCR:这个Rust库20ms就能

Firecrawl 开源的 pdf-inspector,专给 PDF 做“体检”。
它先用 20 毫秒判断要不要 OCR,免得你花冤枉钱。

先筛再治:一半以上的 PDF 本来就有文字层。全丢给 OCR 又慢又容易错。这库直接采样扫几页,毫秒级就能分出纯文字、扫描件或混合文档。
逐页路由:遇到前后不一的合同,它能精准揪出缺文字的页面。只把那两页送去 OCR,剩下的本地秒抽。
提取够细:抽出来的文本自带坐标和字体。多栏排版不乱,中日韩文也不易变乱码。还能直接转成干净的 Markdown,连目录点线都能折叠省 token。
表格是强项:靠画线和文本对齐双管齐下。跑分比同类工具高一倍,处理 200 份文档只要 0.47 秒。

不过它也有边界:如果全是扫描件,它就只剩“催你 OCR”的命了。复杂杂志排版也搞不定。

说白了,它不是来替代解析库的。它是流水线最前面的闸门。

原文一半的PDF根本不用OCR:这个Rust库20ms就能判断
广东,44分钟前,

相关学习资料