ARTICLE · 1118116
PDF页面净化:PDF免费转Word之前,先给扫描件洗个澡
先说一个很常见的抱怨
"扫描件转 Word,转出来一塌糊涂。"
遇到这种情况,多数人第一反应是"转换工具不行"。但把原件摊开看一眼就会发现,问题常常不在转换,而在那张扫描件本身——
纸张泛黄、整片发灰、边缘有扫描留下的黑条、空白处散着密密麻麻的噪点。人眼看着还行,可机器去认字的时候,这些灰底和噪点全都是"可能的笔画"。识别结果自然就乱。
所以这次单独把工具箱里的「页面净化」拎出来讲一讲。它的作用一句话说得完:把扫描件洗成干净白纸,同时保住该保的东西。

它到底在处理什么
扫描件上的"脏",大致就三类:
「页面净化」做的就是:把这三类抹掉,把文字、表格线、图形留下。
关于效果,功能说明里有一句原话:打印前或送 OCR 识别前先跑一遍,效果提升很明显。
为什么它不会"啃掉你的字"
这才是关键。去除背景这件事,很多工具都做,但常见做法是"把浅色的都变白"——结果就是标点没了、细线断了、小字缺胳膊少腿。
「页面净化」用了三个设计来避免这件事:
1️⃣ 按"纸张本底"归一化,而不是按绝对颜色
它会先估算这一页的纸张本底是什么颜色(只要附近有一小片干净纸,就能取到),再拿每个像素跟这个本底比。
判定标准不是"够不够黑",而是"比纸色暗得多不多"。比纸色暗得多的一律当主体原样保留,纸张本身的起伏、渐变、泛黄则被拉平。
2️⃣ 跳过"最深的地方"去估纸色
这是它做得比较讲究的一处:估纸色时,会特意把大面积深色区域的内部排除在外。
否则靠近大片深色内容的纸色会被拉低,附近的文字笔画就会被误判成"背景"抹掉——那正是很多工具一转就丢字的原因。
3️⃣ 只去"孤立"的斑点
默认开启「仅去除孤立斑点」:只有四周没有更大墨迹的小斑点才算污点,才被抹掉。
于是标点、小字、细线条都安全——因为它们紧挨着别的墨迹,不会被判成孤立噪声。实测的结果是:在这个默认设置下,文字计数可以做到完全不变。
另外还有一道「深色保护阈值」:本身就很暗的像素一律当主体,所以实心 logo、表格底色、深色印章不会被洗白。
一句话总结:它洗的是"纸",不是"字"。
用起来是什么样
参数就只有两个是核心的
净化强度:污垢阈值。越大抹得越狠——底灰重的扫描件往大调; 文字加深:对比增益。0 表示文字保持原样,越大字越黑,打印更清晰。
不确定该给多少?点一下「🎯 自动分析阈值」,它会按当前页自动算好一个值。
其余三个是微调:背景估计半径、深色保护阈值、去斑面积。这三个都按 216dpi 标定,所以你把渲染倍率从 2× 调到 4×,效果不会跟着漂移——所见即所得。
顽固污点,直接用鼠标涂
有些脏斑(比如装订阴影)光靠阈值不一定干净。这时直接在右侧预览里用鼠标涂:涂到哪修到哪,它会自动按周围的干净纸色填充。涂错了切到"擦除"改回来就行。
红色竖线,左右对照
预览上有一条可拖动的红竖线:左边是原图、右边是净化后。效果好不好,一眼就能看出来,不用反复导出比对。
黑白还是彩色
黑白:去底灰最彻底,推荐用于文档扫描件; 彩色:保留彩图、印章、手写标注的颜色。
它最该待的位置:净化 → 转 Word
这是这次最想强调的一点:页面净化不是一个孤立的修图功能,它是"转 Word"这条流水线的第一道工序。
正确的顺序是:
① 页面净化(先把底灰和噪点洗掉)② PDF转Word(再提取文字与表格)
第一步做完,第二步的准确率是另一个量级——这不是玄学,就是前面那张表讲的原因:底灰和噪点本来就该在识别之前清掉。
顺带把「PDF转Word」也说清楚,它现在能做到:
文字:字号、行距、粗斜体、大致版式都尽量还原; 表格:识别成 Word 里的表格,不是一坨文字; 图片:文档里的图片会嵌进 Word; 段落:跨页的续段会自动接上,不会把一段拆成好几段; 双栏排版:分栏文档也能按正确顺序还原; 可选开关:自动剔除重复的页眉/页脚/页码、每页强制分页。
两条路按文档类型选:
文字型 PDF(能选中文字的)→ 用离线版的 PDF转Word,本地转、不上传、不用装 Word; 扫描型 PDF(整页都是图)→ 用在线版,它内置 OCR,能把图里的字读出来再生成 Word。
提示:离线版不含 OCR(OCR 需要额外约 29 MB 模型),打开扫描版 PDF 时它会主动提醒你走在线版。
几个典型场景
扫描合同转 Word 前
底灰洗掉 → 噪点清掉 → 再转 Word。转出来的稿子干净得多,改起来才顺手。
老档案、复印件归档
泛黄发灰的复印件洗成干净白纸,再打印或归档,观感完全不同。
送 OCR 之前的预处理
整批扫描件先跑一遍净化,再交给识别。这一步的收益,用过就知道。
盖过章的扫描件
切到彩色模式,印章和手写批注的颜色留着,底灰照样洗掉。
有两点要提前知道
输出是图像——净化本质上是"重新渲染成一张干净的图",所以处理完的页面文字不能再选中或搜索。如果后面还要转 Word、要抠字,记得先转再净化,或者按需调高渲染倍率(1.5× / 2× / 3× / 4×,默认 3×=216dpi)。 同一份文档、同一套参数,只会净化一次——因为反复"洗"会越洗越白、颜色越来越淡。所以它记着上次的参数:参数没变、文档没换,再点会直接提示"无需重复处理";改了参数或重新涂抹,就又能再净化一次。
它只是 43 项功能里的一个
页面净化在「格式与图像」这一组,旁边还有:
🖼️ 格式与图像(9)PDF转图片 · 图片转PDF · PDF扁平化 · 提取图片 · 页面滤镜 · 工程蓝图 · 模拟扫描件 ·页面净化·PDF转Word
其中和它搭档最顺的,就是「模拟扫描件」(反过来的操作)和「PDF转Word」。
整个工具箱现在有43 项功能,全部内置在一个约 3 MB 的 HTML 文件里——不联网、不上传、不用安装。国产系统(银河麒麟、统信 UOS 这类)上也能直接双击使用:缺 emoji 字形时它会自动退回中文文字图标,不会出现满屏"豆腐块"。
怎么用
方式一 · 在线使用(扫描版 OCR 只有这里能用)打开网页 → 点"在线体验"。
方式二 · 下载到本地(长期用、内网用、信创环境推荐)拿到 HTML 文件,双击用 Chrome / Edge 88+、Firefox 91+ 或新版国产浏览器打开即可。
操作路径:打开 PDF → 左侧选「🧽 页面净化」→ 调参数或直接点「🎯 自动分析阈值」→ 顽固污点用鼠标涂 → 点「🧽 净化并保存」;接着可以继续用「📝 PDF转Word」把结果转成 Word。
(获取方式:【关注公众号「梧录娃」,发消息「PDF」即可获取最新版,在线版和离线版都在里面】)
最后
这个功能是从"转 Word 转不好"这件事里长出来的——最开始我也以为是转换算法的问题,直到把扫描件放大看了半天,才发现罪魁祸首是底灰和噪点。后来就顺着"怎么把纸洗干净、又不碰字"这个方向一点点磨,才有了现在这几道保护。
如果你在用的时候遇到问题,或者手上有一类扫描件怎么都洗不干净,欢迎把情况留言告诉我——把样本描述清楚一点,我基本都能找到办法。🙂如果这个工具帮你省下了几次上传文件的时间,欢迎点个「推荐」,或者转给同样天天跟 PDF 打交道的同事。