夜雨聆风学习资料网

ARTICLE · 1000650

FawnPress v1.6.8:让 PDF 转换对异常字形更有判断力

FawnPress v1.6.8:让 PDF 转换对异常字形更有判断力

PDF 转换最难处理的,往往不是普通文本,而是那些“看起来像文本、实际无法可靠解码”的页面。部分方正排版 PDF 使用了自定义字形编码:提取结果可能带有乱码,但仍被判断为有效文本。转换流程因此跳过 OCR,最终得到的文档既不完整,也不容易第一时间发现问题。

FawnPress v1.6.8 针对这一类情况调整了判断与处理方式,让正常页面继续保持快速,风险页面则获得更明确的识别路径和结果提示。

你可能遇到的问题

在处理排版复杂、来源较老或经过特殊字体处理的 PDF 时,常见情况包括:

  • • 页面视觉上有清晰文字,但导出的文字出现乱码;
  • • 转换结果没有触发 OCR,导致乱码被直接保留下来;
  • • 某些页面提取结果为空,用户难以判断是原文件没有文字,还是识别过程没有产出;
  • • 开启 OCR 后,仍希望普通页面不要全部走慢速识别,以免增加不必要的处理时间。

这类问题尤其容易出现在扫描资料与文字型 PDF 混排、方正排版文件、论文和评价手册等文档中。它们不一定表现为“整份文件转换失败”,更常见的是少数页面悄悄失真。

这次做了什么

1. 重新识别“疑似有效文本”

v1.6.8 修复了部分方正排版 PDF 自定义字形编码导致乱码、却被误判为有效文本的问题。转换流程会对提取结果做更严格的异常检查,不再只根据“是否提取到字符”判断内容是否可用。

2. 增强异常控制字符检查

除了明显的乱码迹象,流程也会检查异常控制字符等不适合作为正文的内容。这样可以把更多“有输出但不可读”的页面识别为风险页。

3. 自动 OCR 仅处理风险页

开启自动 OCR 后,风险页面会转为图片并进入 OCR 识别;正常页面仍然使用快速文字提取路径。对于大多数文字结构正常的 PDF,这意味着处理方式不变,同时为异常页面补上了识别兜底。

为保护客户隐私,截图中的敏感资料已做模糊处理。

4. 识别为空时保留原页图片并提示

如果图片识别最终没有得到文字,FawnPress 会保留原页面图片,并在结果中提示该页没有产出可用文本。相比直接生成空白页,这种处理能保留原始信息,也方便用户定位后续需要人工确认的页面。

5. 未开启 OCR 时给出明确提示

如果检测到风险页但用户没有开启 OCR,FawnPress 会明确提示需要重试,并说明可以通过开启 OCR 重新处理。用户不必仅凭乱码或空页自行猜测下一步怎么做。

回归验证

本次修复使用了一份客户本地的 Founder PDF Library 生成的 245 页评价手册进行完整回归。测试使用生产资源 FawnPoppler 1.0.24 与本地 eco OCR 完成转换,耗时 624.25 秒,输出 120479 个汉字。

这份结果中:

  • • 未发现 U+FFFD 替换字符;
  • • 未发现异常控制字符;
  • • 没有出现空结果警告。

另外,一份 8 页论文走快速文字提取路径,输出 10220 个汉字,用于确认正常页面仍可保持原有的快速处理方式。

这些结果说明,本次调整覆盖了异常字形页面的判断和兜底流程,同时没有把所有页面一律切换到 OCR。实际耗时会受到页数、页面复杂度、OCR 资源和本地设备性能影响,以上数据仅代表对应样本与环境下的回归结果。

用户如何使用

  1. 1. 使用 FawnPress v1.6.8 转换 PDF。
  2. 2. 对包含自定义字体、复杂排版或疑似乱码的文件,在转换设置中开启“自动 OCR”。
  3. 3. 转换完成后查看任务结果提示,重点关注风险页、OCR 结果和图片保留提示。
  4. 4. 如果提示检测到风险页但未开启 OCR,请开启“自动 OCR”后重试。
  5. 5. 对重要资料,建议抽查目录、表格、公式和跨页内容,不要只根据“任务完成”判断内容已完整还原。

能力边界

这次更新主要解决的是:部分 PDF 文字提取结果看似有效、实际乱码,导致 OCR 被跳过的问题。它不能改变 PDF 本身的内容,也不意味着所有版式都能被完全还原。

目前,复杂公式、合并表格、多栏结构的还原仍然有限。对于这些内容,文字提取和 OCR 都可能无法完整保留原始版式、阅读顺序或语义关系。若文档用于正式出版、法律存档或高精度数据录入,建议对关键页面进行人工复核,并保留原始 PDF 作为对照。

结语

FawnPress v1.6.8 的重点不是让所有页面都走更重的处理流程,而是更准确地区分“正常文本”和“需要进一步识别的风险页”。正常页面继续走快速文字提取;异常页面在开启自动 OCR 后转图片识别;无法识别时保留原页并给出提示。

对于经常处理排版复杂 PDF、评价手册、论文或扫描混排资料的用户,建议升级后优先开启自动 OCR,并结合结果提示检查关键页面。

相关学习资料

返回首页浏览学习资料