很多人第一次碰到扫描版PDF,都会以为它只是“不能编辑”。真正动手才发现,连复制一段话都不行,搜索姓名和金额也搜不到,直接另存为Word后,页面里仍然是一张张图片。问题不在Word,而在这份PDF根本没有文字层。它更像一本被拍下来的相册,每一页都是图。要把它变成能修改的文档,必须先做OCR,也就是把图片里的字识别出来。
先用十秒钟判断文件类型。打开PDF,按住鼠标拖过一句话;能选中单个字,说明它本来就有文字层,直接用转换工具即可。只能框住整页图片,或者按Ctrl+A没有出现逐字选中效果,才是扫描版。这个判断很重要,因为普通“PDF转Word”只能搬运已有文字,遇到扫描件时,往往只会把图片原样塞进Word。
下面三种免费路线解决的不是同一个问题。PDF24更适合先得到可搜索的PDF;Google Drive适合页数少、版式简单、想快速拿到可编辑文字的文件;OneNote桌面版适合电脑里已经装有Office、需要把多页打印输出中的文字一次复制出来。不要只问哪个工具最准,先问自己最终要交付什么。
路线一:PDF24,先把扫描件变成可搜索PDF
PDF24的官方OCR页面可以直接在浏览器中使用,不要求安装,也不要求注册。操作顺序很短:选择扫描版PDF,设置识别语言,必要时打开页面纠偏、清理背景,再启动OCR。处理完成后下载的新文件仍然是PDF,但里面多了一层可搜索、可复制的文字。之后再用PDF转Word,成功率通常比直接转换原扫描件高。
这条路线适合存档、查关键词和处理页数较多的资料。比如一份几十页的旧合同,你并不打算重新排版,只需要搜索公司名、日期和金额,那么“可搜索PDF”比“版式混乱的Word”更实用。PDF24官方页面还提供旋转、纠偏、清理页面和强制OCR等选项。扫描歪斜、纸张发灰、原文件已经带有错误文字层时,这些选项才有价值,不必看到开关就全部打开。
它的边界也要说清楚。文件会上传到在线服务器处理。官方说明传输使用SSL,并会在短时间后删除服务器上的文件,但工资表、身份证、未公开合同、病历等敏感资料,不应只因为“免费”就随手上传。涉及隐私、商业秘密或单位保密要求时,先确认授权,优先使用单位批准的本地工具。

路线二:Google Drive,直接得到可编辑文字
Google Drive的官方帮助给出的做法是:把PDF上传到云端硬盘,右键选择“打开方式”,再选择Google文档。系统会识别图片中的文字,并生成一份可编辑文档。整理完成后,可以从Google文档下载为Word格式。这条路线最大的优点是文字出来后就能直接改,不必在两个工具之间来回转换。
但它对原文件质量有明确要求。Google建议文件不超过2MB,文字高度至少约10个像素,页面方向要正,画面要清晰、光线均匀、对比明显。粗体、斜体、字号和换行较可能保留,列表、表格、分栏、脚注和尾注则不容易准确还原。换句话说,它擅长“把字读出来”,不擅长“把原稿一比一复刻”。
如果原件有复杂表格,先不要追求整页恢复。把每页校正方向,裁掉黑边和无关背景,再分成较小的文件处理。识别完成后,先校对数字、姓名、日期和单位名称,再重做表格。直接拿识别结果交差,最容易出错的往往不是长句,而是小数点、负号、括号、序号和容易混淆的数字。
路线三:OneNote桌面版,把多页文字一次复制出来
电脑里装有OneNote桌面版,可以把PDF作为“文件打印输出”插入笔记。等页面变成一张张图片后,右键其中一页,选择复制这一页的文字,或者复制打印输出所有页面的文字,再粘贴到Word中。微软官方说明,识别结果可以粘贴到OneNote以外的程序,包括Word。

这里有两个容易踩的坑。第一,网页版本并不等于桌面版,OCR复制功能应在Windows或Mac桌面应用中使用。第二,右键菜单里的复制文字有时不会立刻出现。微软说明,复杂度、清晰度和文字量都会影响处理时间,个别结果可能需要更久。看不到菜单时,先确认插入的是图片或文件打印输出,再等识别完成,而不是重复导入同一个文件。
OneNote适合把资料里的大段文字快速捞出来,不适合保留原版式。它把内容粘贴到Word后,段落、页眉、页脚和页码可能混在一起,表格也可能变成连续文本。因此,拿到文字只是第一步,后面仍要做结构整理。若最终交付物要求和原稿几乎一致,就应把OCR结果当校对底稿,而不是直接当成终稿。
三种工具怎么选
只想在PDF里搜索和复制,优先用PDF24做OCR,保留原页面外观;文件较小、正文为单栏、需要迅速改字,优先用Google Drive转成Google文档再下载Word;已经使用Office,材料以连续文字为主,优先用OneNote桌面版复制全部页面文字。三条路线都不适合承诺百分之百还原复杂表格和多栏排版。
还有一种情况不要硬转:原件本身模糊、歪斜、阴影重,或者手机拍摄时页面弯曲。OCR不是“修复模糊照片”的魔法。先旋转、裁边、纠偏、提高对比度,再做识别,往往比换五个工具更有效。中文简繁体、英文和数字混排时,也要检查识别语言设置。语言选错后,工具可能把看似相近的字符强行拼成错误词语。
转成Word后,按这张清单验收

第一遍只查关键事实:姓名、身份证后四位、账号、金额、百分比、日期、电话和合同编号。第二遍查结构:标题层级是否正确,段落有没有串行,页眉页脚是否被塞进正文,页码是否重复。第三遍查容易混淆的字符,例如数字0和字母O、数字1和字母l、负号和破折号、中文括号和英文括号。
表格单独验收。不要看到横竖线还在就以为内容正确,要逐行核对列是否错位、金额是否串列、合计是否一致。印章、手写签名、批注和盖章日期通常不能只靠OCR处理,应保留原页截图,并在Word中标注对应位置。对外提交前,至少抽查首页、末页、每个表格页和所有含金额的页面。
如果你用这项能力帮别人整理资料,交付物不要只有一个Word。更稳妥的做法是同时交四样:原始扫描件、加了文字层的可搜索PDF、整理后的Word、需要人工确认的差异清单。差异清单里只写无法确认的字、数字和版式,不替客户猜。这样既方便对方复核,也能把“识别错误是谁造成的”说清楚。
报价也不要只按“转一个文件”来算。真正消耗时间的是页数、清晰度、表格数量、手写内容、排版恢复和校对责任。十页清晰单栏文字,与十页发票、表格和盖章合同,工作量完全不同。先看三页样张,再确定交付标准,比接单后反复返工更省时间。
最后记住一个顺序:先判断有没有文字层,再改善图片质量,然后选择合适的OCR路线,最后人工验收关键事实。工具负责把字捞出来,人负责确认这些字能不能用于工作。扫描版PDF转Word并不难,难的是别把“能打开”误当成“能交付”。
本文依据Google Drive官方帮助、PDF24官方OCR说明和Microsoft OneNote支持文档整理。不同地区、账号和版本的界面可能调整,具体功能以使用时的官方页面为准。
夜雨聆风