乐于分享
好东西不私藏

扫描 PDF 为什么不能直接当作可翻译文档?

扫描 PDF 为什么不能直接当作可翻译文档?

TRANSLATION DECISION LAB

扫描 PDF 为什么不能直接当作可翻译文档?

扫描页本质上是图片;在翻译之前,还要先解决识别、结构、关键数据和版式问题。

一份扫描 PDF 在屏幕上看得很清楚,却无法选中文字。客户看到的是“文件”,翻译系统看到的却是一组像素;两者之间还隔着 OCR、结构恢复和人工核验。

先给结论

扫描 PDF 不是普通文本文件。正确路径是先判断图像质量和结构风险,再做 OCR、原图核对、翻译与版式恢复。

判断一份文件的翻译路径,至少要同时看内容风险与文件工程。前者回答“译错会造成什么后果”,后者回答“文字能否被可靠提取、保持结构并形成可用文件”。只评估其中一项,结论都不完整。

AI 的价值通常体现在重复内容处理、初稿生成和一致性辅助;人工的价值则体现在不确定信息判断、专业责任、例外处理和最终批准。成熟方案不是把二者对立,而是把每一步的责任写清楚。

WHY IT MATTERS

为什么要这样判断?

01

先确认清晰度、倾斜、遮挡和缺页

这一项决定了文件能否进入自动化流程,也决定了后续需要抽检、逐项复核还是专业双审。如果项目启动时没有写清,团队只能在交付后用返工补偿。

02

表格行列、上下标和脚注必须重新建立关系

这一项决定了文件能否进入自动化流程,也决定了后续需要抽检、逐项复核还是专业双审。如果项目启动时没有写清,团队只能在交付后用返工补偿。

03

数字、单位、日期和否定词要回看原图

这一项决定了文件能否进入自动化流程,也决定了后续需要抽检、逐项复核还是专业双审。如果项目启动时没有写清,团队只能在交付后用返工补偿。

04

译文完成后还要逐页做视觉 QA

这一项决定了文件能否进入自动化流程,也决定了后续需要抽检、逐项复核还是专业双审。如果项目启动时没有写清,团队只能在交付后用返工补偿。

把这四项写进项目要求,才能让 AI、人工审校、项目管理和最终验收使用同一套标准。它也能帮助采购比较真正的交付能力,而不是只比较速度或单价。

CASE WATCH · 脱敏案例

某检测报告经过 OCR 后,“1.0”被识别为“10”,参考范围又因列错位连接到相邻项目。译员忠实翻译了 OCR 文本,却把源数据错误完整带入译文。回看原图后团队才发现:问题并不发生在翻译阶段,而发生在翻译之前。

案例为同类项目常见问题的脱敏归纳,不指向特定客户。外部依据请查看下方官方原始页面。

参考:AHRQ PSNet:手写检验申请的数据质量风险NIST:AI 风险管理框架

COMMON MISTAKE

最常见的误区

最常见的错误,是先问工具能不能做,再补用途、风险和验收标准。这样看似启动很快,实际会把本应在项目开始前解决的问题推迟到交付之后。

正确做法不是把所有文件都塞进最昂贵的人工流程,也不是默认交给模型,而是先定义用途、错误后果、文件结构和交付责任,再选择匹配的处理路径。

ACTION CHECKLIST

拿到同类文件,先检查这三项

  先确认清晰度、倾斜、遮挡和缺页

  表格行列、上下标和脚注必须重新建立关系

  数字、单位、日期和否定词要回看原图

不确定该选哪种翻译方案?

回复关键词「体检」领取《企业翻译需求诊断表》