夜雨聆风学习资料网

ARTICLE · 1118116

PDF页面净化:PDF免费转Word之前,先给扫描件洗个澡

PDF页面净化:PDF免费转Word之前,先给扫描件洗个澡

先说一个很常见的抱怨

"扫描件转 Word,转出来一塌糊涂。"

遇到这种情况,多数人第一反应是"转换工具不行"。但把原件摊开看一眼就会发现,问题常常不在转换,而在那张扫描件本身——

纸张泛黄、整片发灰、边缘有扫描留下的黑条、空白处散着密密麻麻的噪点。人眼看着还行,可机器去认字的时候,这些灰底和噪点全都是"可能的笔画"。识别结果自然就乱。

所以这次单独把工具箱里的「页面净化」拎出来讲一讲。它的作用一句话说得完:把扫描件洗成干净白纸,同时保住该保的东西。


它到底在处理什么

扫描件上的"脏",大致就三类:

类型
长什么样
危害
底灰
整页泛灰、泛黄,像隔着一层雾
最要命——它让"纸"和"字"的边界整个糊掉
噪点 / 脏斑
空白处零散的灰点、扫描灰尘、复印黑点
被当成标点或笔画,直接污染识别结果
大面积污渍
装订阴影、指纹、水渍
局部糊成一片脏块

「页面净化」做的就是:把这三类抹掉,把文字、表格线、图形留下。

关于效果,功能说明里有一句原话:打印前或送 OCR 识别前先跑一遍,效果提升很明显。


为什么它不会"啃掉你的字"

这才是关键。去除背景这件事,很多工具都做,但常见做法是"把浅色的都变白"——结果就是标点没了、细线断了、小字缺胳膊少腿。

「页面净化」用了三个设计来避免这件事:

1️⃣ 按"纸张本底"归一化,而不是按绝对颜色

它会先估算这一页的纸张本底是什么颜色(只要附近有一小片干净纸,就能取到),再拿每个像素跟这个本底比。

判定标准不是"够不够黑",而是"比纸色暗得多不多"。比纸色暗得多的一律当主体原样保留,纸张本身的起伏、渐变、泛黄则被拉平。

2️⃣ 跳过"最深的地方"去估纸色

这是它做得比较讲究的一处:估纸色时,会特意把大面积深色区域的内部排除在外。

否则靠近大片深色内容的纸色会被拉低,附近的文字笔画就会被误判成"背景"抹掉——那正是很多工具一转就丢字的原因。

3️⃣ 只去"孤立"的斑点

默认开启「仅去除孤立斑点」:只有四周没有更大墨迹的小斑点才算污点,才被抹掉。

于是标点、小字、细线条都安全——因为它们紧挨着别的墨迹,不会被判成孤立噪声。实测的结果是:在这个默认设置下,文字计数可以做到完全不变。

另外还有一道「深色保护阈值」:本身就很暗的像素一律当主体,所以实心 logo、表格底色、深色印章不会被洗白。

一句话总结:它洗的是"纸",不是"字"。


用起来是什么样

参数就只有两个是核心的

  • 净化强度:污垢阈值。越大抹得越狠——底灰重的扫描件往大调;
  • 文字加深:对比增益。0 表示文字保持原样,越大字越黑,打印更清晰。

不确定该给多少?点一下「🎯 自动分析阈值」,它会按当前页自动算好一个值。

其余三个是微调:背景估计半径、深色保护阈值、去斑面积。这三个都按 216dpi 标定,所以你把渲染倍率从 2× 调到 4×,效果不会跟着漂移——所见即所得。

顽固污点,直接用鼠标涂

有些脏斑(比如装订阴影)光靠阈值不一定干净。这时直接在右侧预览里用鼠标涂:涂到哪修到哪,它会自动按周围的干净纸色填充。涂错了切到"擦除"改回来就行。

红色竖线,左右对照

预览上有一条可拖动的红竖线:左边是原图、右边是净化后。效果好不好,一眼就能看出来,不用反复导出比对。

黑白还是彩色

  • 黑白:去底灰最彻底,推荐用于文档扫描件;
  • 彩色:保留彩图、印章、手写标注的颜色。

它最该待的位置:净化 → 转 Word

这是这次最想强调的一点:页面净化不是一个孤立的修图功能,它是"转 Word"这条流水线的第一道工序。

正确的顺序是:

① 页面净化(先把底灰和噪点洗掉)② PDF转Word(再提取文字与表格)

第一步做完,第二步的准确率是另一个量级——这不是玄学,就是前面那张表讲的原因:底灰和噪点本来就该在识别之前清掉。

顺带把「PDF转Word」也说清楚,它现在能做到:

  • 文字:字号、行距、粗斜体、大致版式都尽量还原;
  • 表格:识别成 Word 里的表格,不是一坨文字;
  • 图片:文档里的图片会嵌进 Word;
  • 段落:跨页的续段会自动接上,不会把一段拆成好几段;
  • 双栏排版:分栏文档也能按正确顺序还原;
  • 可选开关:自动剔除重复的页眉/页脚/页码、每页强制分页。

两条路按文档类型选:

  • 文字型 PDF(能选中文字的)→ 用离线版的 PDF转Word,本地转、不上传、不用装 Word;
  • 扫描型 PDF(整页都是图)→ 用在线版,它内置 OCR,能把图里的字读出来再生成 Word。

提示:离线版不含 OCR(OCR 需要额外约 29 MB 模型),打开扫描版 PDF 时它会主动提醒你走在线版。


几个典型场景

扫描合同转 Word 前

底灰洗掉 → 噪点清掉 → 再转 Word。转出来的稿子干净得多,改起来才顺手。

老档案、复印件归档

泛黄发灰的复印件洗成干净白纸,再打印或归档,观感完全不同。

送 OCR 之前的预处理

整批扫描件先跑一遍净化,再交给识别。这一步的收益,用过就知道。

盖过章的扫描件

切到彩色模式,印章和手写批注的颜色留着,底灰照样洗掉。


有两点要提前知道

  1. 输出是图像——净化本质上是"重新渲染成一张干净的图",所以处理完的页面文字不能再选中或搜索。如果后面还要转 Word、要抠字,记得先转再净化,或者按需调高渲染倍率(1.5× / 2× / 3× / 4×,默认 3×=216dpi)。
  2. 同一份文档、同一套参数,只会净化一次——因为反复"洗"会越洗越白、颜色越来越淡。所以它记着上次的参数:参数没变、文档没换,再点会直接提示"无需重复处理";改了参数或重新涂抹,就又能再净化一次。

它只是 43 项功能里的一个

页面净化在「格式与图像」这一组,旁边还有:

🖼️ 格式与图像(9)PDF转图片 · 图片转PDF · PDF扁平化 · 提取图片 · 页面滤镜 · 工程蓝图 · 模拟扫描件 ·页面净化·PDF转Word

其中和它搭档最顺的,就是「模拟扫描件」(反过来的操作)和「PDF转Word」。

整个工具箱现在有43 项功能,全部内置在一个约 3 MB 的 HTML 文件里——不联网、不上传、不用安装。国产系统(银河麒麟、统信 UOS 这类)上也能直接双击使用:缺 emoji 字形时它会自动退回中文文字图标,不会出现满屏"豆腐块"。


怎么用

方式一 · 在线使用(扫描版 OCR 只有这里能用)打开网页 → 点"在线体验"。

方式二 · 下载到本地(长期用、内网用、信创环境推荐)拿到 HTML 文件,双击用 Chrome / Edge 88+、Firefox 91+ 或新版国产浏览器打开即可。

操作路径:打开 PDF → 左侧选「🧽 页面净化」→ 调参数或直接点「🎯 自动分析阈值」→ 顽固污点用鼠标涂 → 点「🧽 净化并保存」;接着可以继续用「📝 PDF转Word」把结果转成 Word。

(获取方式:【关注公众号「梧录娃」,发消息「PDF」即可获取最新版,在线版和离线版都在里面】)


最后

这个功能是从"转 Word 转不好"这件事里长出来的——最开始我也以为是转换算法的问题,直到把扫描件放大看了半天,才发现罪魁祸首是底灰和噪点。后来就顺着"怎么把纸洗干净、又不碰字"这个方向一点点磨,才有了现在这几道保护。

如果你在用的时候遇到问题,或者手上有一类扫描件怎么都洗不干净,欢迎把情况留言告诉我——把样本描述清楚一点,我基本都能找到办法。🙂如果这个工具帮你省下了几次上传文件的时间,欢迎点个「推荐」,或者转给同样天天跟 PDF 打交道的同事。

相关学习资料