夜雨聆风学习资料网

ARTICLE · 1128513

PDF转Excel表格来了!PDF转Word、拆分、合并、删除、Bates编页等功能全免费,内网信创系统非常好用的离线、安全的工具箱

PDF转Excel表格来了!PDF转Word、拆分、合并、删除、Bates编页等功能全免费,内网信创系统非常好用的离线、安全的工具箱

转 Word 之后,被催得最多的是另一件事

上一篇讲了「PDF 转 Word」。发出去没几天,后台又冒出同一句话:"能不能把 PDF 里的表格转成 Excel?"
这个需求比转 Word 更"疼"。原因很现实——表格转出来是要拿来算的。
发票明细、收费清单、报销台账、成绩单、招标附表……这些东西一旦落在 PDF 里,就只能一行一行手敲回 Excel。敲一列数字不难,难的是表格结构:合并的单元格、跨行的标题、哪一格有边框哪一格没有——手敲十有八九对不上。
所以这次更新的重点就一个:把「PDF 转 Excel」真正做出来。虽然目前刚上线,可能在遇到更多表格的时候会出现这样那样的状况,但是我知道只有在不断的发现问题,改正错误,功能才会不断的完善,所以我希望大家在使用时遇到什么问题都可以给我留言反馈,这样才可以不断修正提升转换的能力。先看票据的转换前后效果:
转换之前的pdf:
转换之后的表格:
效果还是非常不错的!☺️

为什么"转表格"比"转文字"难得多

转文字,是一行一行往下搬;转表格,得先回答三个问题:
哪里是列、哪里是行?表格不一定画了线——很多发票、清单是"靠对齐"排出来的;
哪些格是合并的?一个横跨三列的标题、一个竖跨四行的"单位",复原错了整张表就散;
哪条边真有线?原表可能只有外框,也可能每条边都有线;画多了是脏,画少了是错。
这三个问题只要有一个糊弄过去,导出 Excel 打开就是"看着像、但用不了"。

它到底还原到什么程度

不吹,直接报能力:
原生合并单元格——跨行、跨列的合并导出成 Excel 真正的 mergeCells,不是"把文字拼一格然后画白框";
逐条边框——按每一格的每一条边单独判断,只画原件真有的线。Excel 自带的网格线也关掉了,打开就是原件的样式,不会满屏都是灰格子;
行高列宽——列宽按原表框线间距换算,行高按点值;
对齐与字号——数字右对齐、表头居中这类横向对齐会跟着还原,字号按原表缩放;
表外的图和表里的图——标题条、图表、印章按原位置浮动插入,不会丢;
跨页长表——一份 PDF 里跨了页的同一张表,合并到同一张工作表里,不会断成两张;
批量转换——一次丢多个 PDF 进去,导出一个 ZIP,里面是每个文件各自的 .xlsx。

一句话:它不是"截图塞进 Excel",是把你那张表的结构重新搭起来。


扫描件怎么办?两条路,别走错

先说清楚概念:
文字型 PDF:能选中文字的电子版;
扫描型 PDF:整页都是图片,文字选不中。
文字型→ 用离线版(下载到本地那个 HTML 文件),转 Excel、转 Word 都能正常做,全程不联网、不上传。
扫描型→ 需要 OCR 把图里的字读出来,请用在线版或OCR 增强版——它们内置了识别模型,扫描件也能转成可编辑的文字和表格。
这里这次还专门改了一处,很多用户都踩过:

离线版打开扫描件时,不再"假装成功"了。

以前在离线版里转扫描件,Excel 会报一句"没有可导出的内容",转 Word 更迷惑——它会"成功"导出一份整页图片的 docx,看着像转好了,其实一个字都改不了。
现在离线版会在生成前先认一下文件类型:是扫描件就直接拦下来,明确提示——
❌ 转换失败:您上传的文件为扫描型PDF,没有识别到可导出的内容,建议使用在线OCR版
不再让你白等、也不再给你一份用不了的成品。

顺便把「PDF 转 Word」也说清楚

两个功能是同一套分析引擎,能力是配套的,一起讲更好记:
转 Word 现在能做到:
文字:字号、行距、粗体斜体、大致版式都尽量还原;
表格:识别成 Word 里真正的表格,不是一坨文字;
图片:文档里的图片会嵌进 Word;
段落:被排到下一页的续段自动接上,不会把一段话拆成好几段;
双栏排版:分栏文档也能按正确顺序还原;
印章与彩色线条:红头文件的红线、公章按原坐标浮动保留,盖在落款上;压在印章下的落款会先"去章"再重新识别,仍然是可编辑文字;
中文标点规范化:半角括号、逗号在中文里补成全角,纯英文与数字上下文保持原样;
两个小开关:自动剔除重复的页眉/页脚/页码、每页强制分页。
什么时候用哪个:
你的目的
用哪个
要改文字、改措辞、拿原文二次排版
PDF转Word
要算数、排序、做透视表、合并到别的台账
PDF转Excel
整页都是图的扫描件
两个都走在线版(内置 OCR)

几个典型场景

财务:发票 / 收费清单汇总
一批 PDF 发票要汇总金额。以前是一张张打开、一行行敲;现在转成 Excel,筛选、求和、对账都在表里做。
行政 / 内勤:报表台账
每月收到的 PDF 报表,转成 Excel 直接并入汇总表,不用重复录入。
招投标 / 合同:附表整理
招标文件里的参数表、报价表要拿来比对,转成 Excel 才能排序筛选。
学校 / 教务:成绩单、名单
PDF 成绩单转 Excel,排名、统计、发通知都在一张表上完成。

工具箱现在是 44 项功能

加上这次的PDF转Excel,「格式与图像」这一组凑齐了 10 项:
📄 页面管理(10)常规合并 · 交替合并 · 常规拆分 · 按书签拆分 · 按书签炸开 · 页面重排 · 页面倒序 · 补齐空白页 · 删除页面 · 自动删除空白页
📐 页面调整(10)页面旋转·批量 · 页面旋转·逐页 · 页面拼版 · 小册子排版 · 小册子拆分 · 统一页面大小 · 拆分对开页 · 倾斜校正 · 裁剪白边 · 生成空白PDF
🖼️ 格式与图像(10)PDF转图片 · 图片转PDF · PDF扁平化 · 提取图片 · 页面滤镜 · 工程蓝图 · 模拟扫描件 · 页面净化 ·PDF转Word·PDF转Excel(新)
🏷️ 标注与编号(8)添加页码 · Bates编页 · 文字水印 · 图片水印 · 添加图章 · 扇形骑缝章 · 批注 · 插入文本
🔒 安全与信息(6)文档信息 · 删除书签 · CA签章查看 · PDF压缩 · PDF解密 · PDF加密
全部内置在一个约 3 MB 的 HTML 文件里——不联网、不上传、不用安装,支持连续操作(转换结果自动变成"当前文件",可以接着用下一个功能继续处理,不用下载再上传)。

怎么用

方式一 · 在线使用(扫描版 OCR 只有这里能用)打开网页 → 点"在线体验"。处理仍然在你自己的浏览器里完成,但涉及敏感材料,建议还是用下面的离线方式。
方式二 · 下载到本地(长期用、内网用、信创环境推荐)拿到 HTML 文件,双击用 Chrome / Edge 88+、Firefox 91+ 或新版国产浏览器打开即可。
操作路径:打开 PDF → 左侧选「📊 PDF转Excel」→ 点「生成并下载 Excel(.xlsx)」;要转文字就选「📝 PDF转Word」。

提示:离线版不含 OCR(识别模型约 17 MB,离线版以"单文件精简"为先)。扫描件请走在线版;离线版打开扫描件时也会主动拦下并提醒,不会让你白转一场。

(获取方式:【关注公众号「梧录娃」,发消息「PDF」即可获取最新版,在线版和离线版都在里面】)

最后

「转表格」这个功能,是从一堆"手敲表格"的抱怨里长出来的。
做的过程中最费劲的不是写字,是"猜"——猜哪条边该画、哪个格子该合并、跨页的表要不要接起来。这些没有标准答案,只能拿真实的发票、报表、收费清单一张张试,试到"打开 Excel 一看就是原样"为止。
如果你手上有某类表格怎么转都不对(比如特别复杂的合并表、竖排的表头、没有框线只有对齐的清单),欢迎把样本描述清楚留言给我——大概率能改。🙂如果这个工具帮你少敲了几百行数字,欢迎点个「推荐」,或者转给同样天天跟 PDF 打交道的同事。

相关学习资料