TRANSLATION DECISION LAB
扫描 PDF 为什么不能直接当作可翻译文档?
扫描页本质上是图片;在翻译之前,还要先解决识别、结构、关键数据和版式问题。
一份扫描 PDF 在屏幕上看得很清楚,却无法选中文字。客户看到的是“文件”,翻译系统看到的却是一组像素;两者之间还隔着 OCR、结构恢复和人工核验。
先给结论
扫描 PDF 不是普通文本文件。正确路径是先判断图像质量和结构风险,再做 OCR、原图核对、翻译与版式恢复。
判断一份文件的翻译路径,至少要同时看内容风险与文件工程。前者回答“译错会造成什么后果”,后者回答“文字能否被可靠提取、保持结构并形成可用文件”。只评估其中一项,结论都不完整。
AI 的价值通常体现在重复内容处理、初稿生成和一致性辅助;人工的价值则体现在不确定信息判断、专业责任、例外处理和最终批准。成熟方案不是把二者对立,而是把每一步的责任写清楚。
WHY IT MATTERS
为什么要这样判断?
01
先确认清晰度、倾斜、遮挡和缺页
这一项决定了文件能否进入自动化流程,也决定了后续需要抽检、逐项复核还是专业双审。如果项目启动时没有写清,团队只能在交付后用返工补偿。
02
表格行列、上下标和脚注必须重新建立关系
这一项决定了文件能否进入自动化流程,也决定了后续需要抽检、逐项复核还是专业双审。如果项目启动时没有写清,团队只能在交付后用返工补偿。
03
数字、单位、日期和否定词要回看原图
这一项决定了文件能否进入自动化流程,也决定了后续需要抽检、逐项复核还是专业双审。如果项目启动时没有写清,团队只能在交付后用返工补偿。
04
译文完成后还要逐页做视觉 QA
这一项决定了文件能否进入自动化流程,也决定了后续需要抽检、逐项复核还是专业双审。如果项目启动时没有写清,团队只能在交付后用返工补偿。
把这四项写进项目要求,才能让 AI、人工审校、项目管理和最终验收使用同一套标准。它也能帮助采购比较真正的交付能力,而不是只比较速度或单价。
CASE WATCH · 脱敏案例
某检测报告经过 OCR 后,“1.0”被识别为“10”,参考范围又因列错位连接到相邻项目。译员忠实翻译了 OCR 文本,却把源数据错误完整带入译文。回看原图后团队才发现:问题并不发生在翻译阶段,而发生在翻译之前。
案例为同类项目常见问题的脱敏归纳,不指向特定客户。外部依据请查看下方官方原始页面。
参考:AHRQ PSNet:手写检验申请的数据质量风险NIST:AI 风险管理框架
COMMON MISTAKE
最常见的误区
最常见的错误,是先问工具能不能做,再补用途、风险和验收标准。这样看似启动很快,实际会把本应在项目开始前解决的问题推迟到交付之后。
正确做法不是把所有文件都塞进最昂贵的人工流程,也不是默认交给模型,而是先定义用途、错误后果、文件结构和交付责任,再选择匹配的处理路径。
ACTION CHECKLIST
拿到同类文件,先检查这三项
✓ 先确认清晰度、倾斜、遮挡和缺页
✓ 表格行列、上下标和脚注必须重新建立关系
✓ 数字、单位、日期和否定词要回看原图
不确定该选哪种翻译方案?
回复关键词「体检」领取《企业翻译需求诊断表》
夜雨聆风