前面两篇聊了两个 PDF 工具,一个解锁、一个拆合,都是现成的软件。这次换个路子——聊一个自己写的小工具:智能拆分 PDF。
为什么要自己写?因为现成的拆分工具再好用,也解决不了一个问题:它不认识你的文件内容。
你告诉 PDFsam "在第 38 页和第 95 页切一刀",它能切。但如果你不知道该在哪切呢?
先说场景
场景一:标书太厚,要按章节分发给不同的人。
一份招标文件 300 多页,商务部分归经营部,技术部分归工程部,报价部分归成本部。你得先翻目录,找到每部分从第几页开始、到第几页结束,然后手动设置拆分页码。更要命的是,每个项目的目录结构都不一样——有的商务标在前面,有的技术标在前面,页码每次都得重新找。一份文件拆三回,五份文件就是十五回。
场景二:扫描件没有书签,只能靠肉眼翻。
设计院发来的图纸合订本、各项目部提交的扫描件报告,往往是几十甚至上百个文件合成的一个大 PDF,没有书签、没有目录。你需要把它们按每个独立文件拆开,但拆分点在哪?只能一页一页翻,看到一个新的标题就记一个页码,翻完一整份再回到工具里输入。
场景三:周期性报告,每个月都要拆一遍。
每月各部门提交的汇报材料合成一个 PDF 送领导审阅,领导看完批了意见,你又要把合订本按部门拆回去分别落实。每个月的页码可能都不一样,固定页码拆分根本没法复用。
这些场景的核心痛点是什么?是拆分规则跟内容有关,但工具只能听懂页码。
你脑子里想的是"把'第一章'到'第三章'拆成一个文件",工具问你的却是"从第几页到第几页"。中间差了一步——你得先把内容翻译成页码。每次都要人工翻、人工找、人工记,然后工具才能干活。
那能不能让工具自己翻、自己找、自己拆?
这就是智能拆分 PDF 这个小工具要做的事。
这是什么
一个自己写的 PDF 智能拆分工具。核心能力就一句话:你告诉它按什么规则拆,它自己扫描 PDF 内容,找到位置,自动切开。
不用你提前翻页码,不用你手动设拆分点。选好文件、设好规则,点一下,它自己搞定。
能干什么
一、按关键词拆分
这是最常用的模式。你输入一个或一组关键词,工具会扫描 PDF 的每一页文字,检测到包含关键词的页面,就在那一页之前切开,每个关键词开始的位置生成一个独立文件。
比如招标文件里每个大章节都以"第一章""第二章""第三章"开头,你把这些标题作为关键词输进去,工具自动找到每个章节的起始页,按章节拆开。不需要你知道"第三章在第几页",它自己找。
关键词支持多个,每个关键词对应一个拆分点。你可以设"第一章、第二章、第三章、第四章、第五章",也可以设"商务标、技术标、报价文件"这种语义化的标识。工具按关键词在文档中出现的顺序依次拆分。
适用场景: 按章节拆标书、按部门拆汇报材料、按标段拆合订本、按独立文件名拆扫描合订件。
二、按书签拆分
如果 PDF 本身带书签目录(很多正式发布的电子文档都有),可以直接按书签层级拆分。选择书签级别——一级书签、二级书签——工具会在每个书签标记的位置自动切开,还能用书签名称自动给输出文件命名。
跟 PDFsam 的按书签拆分功能类似,但集成在同一个工具里,不用在多个软件之间倒腾。
适用场景: 带目录的正式文档、电子手册、制度汇编、规范合集。
三、按固定页数拆分
这个最简单:每隔 N 页切一刀。比如一份 100 页的文件,每 10 页拆一个,出来 10 个文件。
虽然简单,但特定场景下特别好用。比如扫描仪连续扫了 50 份表单(每份 2 页),设个每 2 页拆一份,一秒搞定。
适用场景: 批量扫描的表单、票据、身份证复印件等固定页数文档。
四、按页码范围拆分
最传统的模式,手动指定从第几页到第几页拆成一个文件。支持同时设置多个范围,比如"1-15、16-40、41-80",一次拆出多个文件。
当智能识别搞不定的时候,用这个兜底。
适用场景: 结构不规则的文件、需要精确控制拆分范围的场景。
五、自动识别标题页拆分(智能模式)
这是最"聪明"的一种模式。工具会分析每页的文字特征——字号较大、居中、独占一行、出现在页面顶部——自动判断哪些页可能是章节标题页,然后在这些位置拆分。
不需要你提供关键词,也不需要书签。它自己"看"文档结构,找到看起来像标题的页面,作为拆分依据。
当然,这种模式不保证 100% 准确——有些正文的小标题也可能被误判,有些标题的格式不够"典型"也可能漏掉。但对于格式规整的正式文档(标书、制度、报告),识别率相当不错。拆完之后扫一眼结果,个别不对的手动微调就行,比从头翻一遍省太多了。
适用场景: 没有关键词清单但格式规整的文档、标题格式统一的报告和制度文件。
怎么用
操作流程很简单,四步:
第一步:选文件。 把要拆的 PDF 拖进去,或者点"浏览"选择。支持一次选多个文件批量处理。
第二步:选模式。 根据你的文件特点选一种拆分方式——知道章节标题的用关键词拆分,有书签的用书签拆分,格式规整的可以试试智能模式,实在不行就手动指定页码范围。
第三步:设规则。 不同模式设置不同的内容:关键词模式输入关键词列表,书签模式选择书签层级,固定页数模式输入每页数,页码范围模式输入起止页。还可以设置输出文件夹和文件命名规则——支持用关键词、页码、序号等作为文件名的一部分自动命名。
第四步:点拆分。 工具开始扫描和拆分,进度条实时显示。拆完后自动打开输出文件夹,每个独立文件整齐排列。
补充几点实用建议
关键词尽量用完整的标题文本。 比如用"第三章 技术标准和要求"而不是只用"第三章"。因为"第三章"可能在目录里出现一次、正文里又出现一次,导致多拆。用完整标题能更精确地匹配到正文起始页,避开目录页的干扰。如果不确定标题的完整文字,先在 PDF 阅读器里 Ctrl+F 搜一下,确认真实文本再填。
注意目录页的干扰。 这是关键词拆分最常见的坑——文档前面有目录页,目录里也列了"第一章""第二章",工具可能把目录页当成了章节首页来切。解决办法有两个:一是设置"跳过前 N 页",把目录页排除在扫描范围之外;二是关键词用正文中才出现的完整标题格式,目录里通常只有简短标题。
智能模式先预览再确认。 智能识别标题页后,工具会先列出检测到的拆分位置(第几页、识别到的标题文字),让你确认。这时候花十秒钟扫一眼,把误判的勾掉、漏掉的手动加上,再点确认拆分。比拆完了发现不对、重来一遍要快。
扫描件用不了关键词和智能模式。 关键词搜索和标题识别都依赖 PDF 的文字层。如果 PDF 是纯扫描图片(没有文字层),这两种模式无法工作——工具"看"不到文字。这种情况要么先用 OCR 工具识别一层文字,要么改用书签或固定页数模式拆分。
文件命名规则提前设好。 拆几十个文件如果都叫"拆分_1.pdf""拆分_2.pdf",回头找起来要命。建议用"关键词+序号"或者"原文件名_页码范围"的命名方式,拆完一目了然。关键词模式下直接用匹配到的关键词命名最方便——拆出来的文件就叫"第一章 招标公告.pdf""第二章 投标人须知.pdf",不用再重命名。
大文件耐心等。 智能模式需要逐页分析文字特征,几百页的文件扫描需要一点时间。关键词模式快一些,因为只做文字匹配。工具界面有进度条,没跑完别关。
原文件不动。 不管怎么拆,原始 PDF 不会被修改,拆分结果全部另存到你指定的输出文件夹。放心操作,拆错了重新来就行。
跟现成工具比有什么不一样
PDFsam Basic 也能拆分,而且功能很全。那为什么还需要自己写一个?
区别在于 "谁来找拆分点" 。
PDFsam 的逻辑是:你告诉它页码,它负责切。它是一把锋利的刀,但切哪里得你自己量好、画好线。
这个小工具的逻辑是:你告诉它规则,它自己找位置自己切。它不仅是刀,还带了眼睛——能看文档内容、能识别标题、能匹配关键词。
日常简单的拆分——"把第 1-10 页拆出来"——用 PDFsam 完全够,也更快。但遇到"这份 300 页的标书,帮我按章节拆成五个文件"这种需求,现成工具要求你先翻完整份标书、记下每章页码,而智能拆分工具只要你给章节标题,剩下的它自己干。

说白了,现成工具解决"怎么切"的问题,这个小工具多解决了一步"在哪切"的问题。
文件无法上传,需要的小伙伴给我留言吧
懒人方案系列往期回顾
DOS篇:有选择地复制文件 VBA篇:快速清除Excel公式和链接 VBA篇:快速清除打印区域以外的内容 VBA篇:快速对比两个表格的内容 VBA篇:跨表查找输出到「查找结果」工作表 VBA篇:多工作表信息汇总查找 VBA篇:按替换清单批量替换内容 PDF篇:懒人工具-PDF解除编辑 PDF篇:懒人工具-PDFsam Basic VBA篇:将选定区域快速进行文本和数值的转换 VBA篇:将选定区域数值快速转换为文本 工具篇:懒人工具-HiBit Uninstaller
关注本系列,每周一个实用小技巧,让搬砖更轻松一点。
夜雨聆风