ARTICLE · 1000650
FawnPress v1.6.8:让 PDF 转换对异常字形更有判断力

PDF 转换最难处理的,往往不是普通文本,而是那些“看起来像文本、实际无法可靠解码”的页面。部分方正排版 PDF 使用了自定义字形编码:提取结果可能带有乱码,但仍被判断为有效文本。转换流程因此跳过 OCR,最终得到的文档既不完整,也不容易第一时间发现问题。
FawnPress v1.6.8 针对这一类情况调整了判断与处理方式,让正常页面继续保持快速,风险页面则获得更明确的识别路径和结果提示。
你可能遇到的问题
在处理排版复杂、来源较老或经过特殊字体处理的 PDF 时,常见情况包括:
• 页面视觉上有清晰文字,但导出的文字出现乱码; • 转换结果没有触发 OCR,导致乱码被直接保留下来; • 某些页面提取结果为空,用户难以判断是原文件没有文字,还是识别过程没有产出; • 开启 OCR 后,仍希望普通页面不要全部走慢速识别,以免增加不必要的处理时间。
这类问题尤其容易出现在扫描资料与文字型 PDF 混排、方正排版文件、论文和评价手册等文档中。它们不一定表现为“整份文件转换失败”,更常见的是少数页面悄悄失真。
这次做了什么
1. 重新识别“疑似有效文本”
v1.6.8 修复了部分方正排版 PDF 自定义字形编码导致乱码、却被误判为有效文本的问题。转换流程会对提取结果做更严格的异常检查,不再只根据“是否提取到字符”判断内容是否可用。
2. 增强异常控制字符检查
除了明显的乱码迹象,流程也会检查异常控制字符等不适合作为正文的内容。这样可以把更多“有输出但不可读”的页面识别为风险页。
3. 自动 OCR 仅处理风险页
开启自动 OCR 后,风险页面会转为图片并进入 OCR 识别;正常页面仍然使用快速文字提取路径。对于大多数文字结构正常的 PDF,这意味着处理方式不变,同时为异常页面补上了识别兜底。


为保护客户隐私,截图中的敏感资料已做模糊处理。

4. 识别为空时保留原页图片并提示
如果图片识别最终没有得到文字,FawnPress 会保留原页面图片,并在结果中提示该页没有产出可用文本。相比直接生成空白页,这种处理能保留原始信息,也方便用户定位后续需要人工确认的页面。
5. 未开启 OCR 时给出明确提示
如果检测到风险页但用户没有开启 OCR,FawnPress 会明确提示需要重试,并说明可以通过开启 OCR 重新处理。用户不必仅凭乱码或空页自行猜测下一步怎么做。
回归验证
本次修复使用了一份客户本地的 Founder PDF Library 生成的 245 页评价手册进行完整回归。测试使用生产资源 FawnPoppler 1.0.24 与本地 eco OCR 完成转换,耗时 624.25 秒,输出 120479 个汉字。
这份结果中:
• 未发现 U+FFFD 替换字符; • 未发现异常控制字符; • 没有出现空结果警告。
另外,一份 8 页论文走快速文字提取路径,输出 10220 个汉字,用于确认正常页面仍可保持原有的快速处理方式。
这些结果说明,本次调整覆盖了异常字形页面的判断和兜底流程,同时没有把所有页面一律切换到 OCR。实际耗时会受到页数、页面复杂度、OCR 资源和本地设备性能影响,以上数据仅代表对应样本与环境下的回归结果。

用户如何使用
1. 使用 FawnPress v1.6.8 转换 PDF。 2. 对包含自定义字体、复杂排版或疑似乱码的文件,在转换设置中开启“自动 OCR”。 3. 转换完成后查看任务结果提示,重点关注风险页、OCR 结果和图片保留提示。 4. 如果提示检测到风险页但未开启 OCR,请开启“自动 OCR”后重试。 5. 对重要资料,建议抽查目录、表格、公式和跨页内容,不要只根据“任务完成”判断内容已完整还原。
能力边界
这次更新主要解决的是:部分 PDF 文字提取结果看似有效、实际乱码,导致 OCR 被跳过的问题。它不能改变 PDF 本身的内容,也不意味着所有版式都能被完全还原。
目前,复杂公式、合并表格、多栏结构的还原仍然有限。对于这些内容,文字提取和 OCR 都可能无法完整保留原始版式、阅读顺序或语义关系。若文档用于正式出版、法律存档或高精度数据录入,建议对关键页面进行人工复核,并保留原始 PDF 作为对照。
结语
FawnPress v1.6.8 的重点不是让所有页面都走更重的处理流程,而是更准确地区分“正常文本”和“需要进一步识别的风险页”。正常页面继续走快速文字提取;异常页面在开启自动 OCR 后转图片识别;无法识别时保留原页并给出提示。
对于经常处理排版复杂 PDF、评价手册、论文或扫描混排资料的用户,建议升级后优先开启自动 OCR,并结合结果提示检查关键页面。