夜雨聆风学习资料网

ARTICLE · 1076561

(中秋发)PDF扫描件文本的优化 -1 切边 模糊 加粗

(中秋发)PDF扫描件文本的优化 -1 切边 模糊 加粗
本篇是扫描PDF优化系列第1篇,其他几篇分别讲了拆包、裁边、调色。想看完整的流程,可以翻看合集。
用4个步骤,实现结果可控
我试过把所有流程堆到1个步骤完成,
结果不理想。
所以手动分为4个步骤,结果可控。
取消坚持黑白1位 TIFF 的图像,获得比较圆润的文字边缘观感。
代价是文件体积变大到 40 MB 级别。
我把步骤都做好,变成4步。
处理完4步,就得到4位灰度的 PNG 文字扫描稿。
第5步是处理图像的,用256色足够应对扫描图了。
毕竟,不是做盗版。
现在的流程是:
  • 切边 + 模糊:先把边缘和噪点处理掉。

  • 加粗 4:把浅、虚的文字轮廓撑起来。

  • 曲线调整 + 加粗 1:提纯背景、微调笔画厚度。

  • 锐化(62, 1.0, 4):增强边缘对比度,让文字更“挺”。

  • 灰度4级:量化为4个灰阶,保留轻微过渡。

  • IrfanView 缩到短边 1200,不重采样:体积压缩。

切边 + 模糊:
先把边缘和噪点处理掉。
常规切边动作,
纠斜:自动-横排,内容框+页边空0.3,手动选择范围自动选择,
表面模糊,
用【选择性高斯模糊】,
遍数1,半径2,阈值20,
先应用,得到第一批成果物
用 1 表示第一批成果物,依次类推,有4次,
虽然繁琐点,但是,结果可控。
使用 PNG ,无损处理,默认就是 PNG ,所以不担心。
275张图,大概 3分钟。
加粗 4:
把浅、虚的文字轮廓撑起来。
目录换到 1,对象是1下的文件,
期待获得目录2的第二批文件。
应用到全部图像,只有1个动作,加粗。
这里要看实际效果,如果太粗,就换成02.
对于不同的扫描稿,效果不一样,04是针对那种非常模糊的处理。
一般用加粗01 其实很足够了。这里,用眼睛验货。
批量转换,得到第二批文件。

相关学习资料