夜雨聆风学习资料网

ARTICLE · 1143827

TeleAgent学习使用第52天:PDF处理

TeleAgent学习使用第52天:PDF处理

第52天:PDF处理

PDF的读写、改,也能"一句话搞定"

PDF大概是办公里最"拧巴"的格式:传出去稳定、看起来规范、别人改不了,可一旦轮到你自己要改内容,立刻血压上升。想复制一段文字,出来一堆乱码;想提取表格,对得七零八落;想合并几份材料,还得先找个专门软件;想在合同上加个"仅供内部使用"的水印,折腾半天。今天这一篇,我们把 PDF 的"读、写、改"全部交给 TeleAgent,让它变成"说句话就办"的事。

这篇还是"工具书级"的写法:三个实战覆盖"合同提取登记""标书整合打包""扫描件转Word"三种最高频的场景,每个提示词都按"复制即用"的标准写,文末还有12条 PDF 提示词速查和一条铁律。看完这篇,你手里那些"打不开、改不了、转不动"的 PDF,都能重新听你指挥。

一、PDF处理的"时间黑洞"在哪里

1. 复制文字出来全是乱码

从 PDF 里复制一段话,粘贴到 Word 里,结果不是全挤在一行,就是冒出一堆乱码和多余空格,尤其盖章扫描件、加密过的 PDF,复制出来的东西根本没法用。更气人的是,有些 PDF 复制出来连顺序都是乱的,把颠倒的段落重新拼回去,比直接打字还费劲。为了抄一段 200 字的条款,你得对着屏幕一个字一个字地敲,敲完还得校对一遍,一页纸能磨半小时。

2. 表格提取后七零八落

PDF 里的表格看着工整,提取出来就全散架:列对不齐、行串位、合并单元格变成一堆"空格"。财务和法务的人最清楚,从 PDF 里抠一张报表、一张发票明细,抠出来的 Excel 根本不能直接用,还得手工重排半小时,排完又得逐格核对数字。发票、对账单这种要从 PDF 里抠图做账的,尤其遭罪。

3. 合并拆分要专门找软件

要把 5 份 PDF 合成 1 份,或者把 60 页的大报告按章节拆开,一般人的第一反应是上网找软件。找来的要么收费、要么有水印、要么要注册,折腾半天还不一定能用;就算免费能用,合并顺序一乱、拆分页数算错,又得从头再来。有时候工具好不容易下载好,又发现文件太大传不上去,来回折腾半小时起步。

4. 改数字、改名称只能重做

PDF 最气人的地方:里面的文字看着能选,但改不了。合同金额要改、报告日期要改、单位名称写错了要改,唯一的办法是重新做一份。重新排版、重新配图、重新校对,改一个数字搭进去两小时,改完还得跟原版比来比去怕漏。所以很多人干脆养成了习惯:PDF 一律"一版 Word 留底稿、一版 PDF 发出去",就为了给自己留后路。

5. 防泄密靠手工加,效率低还容易漏

内部资料要加水印、合同要设密码、报告要限制打印,靠人工一份一份处理,几十份材料就是一个下午。更怕的是加完这周忘了下周,漏一份没加印的,发出去才知道泄露,那时候说什么都晚了。批量防泄密,靠手确实靠不住,最稳的是让 AI 一次处理完、不落死角。

6. 格式转换后排版全乱

把 PDF 转成 Word、转成 Excel、转成图片,转换软件用的是,但转出来的排版一言难尽:标题掉档、表格散架、图片乱跑。转完还得花比转更多的时间去修版式。更坑的是有的 PDF 自带加密,转都转不了,还有的转出来标题层级、页码、页眉页脚全乱,修起来比重新做一份还累。

二、TeleAgent 能做什么

1. 提取内容

从 PDF 里提取文字、表格、关键信息,输出成可编辑、可整理的文本和表格。扫描件、图文混排的复杂版式也能识别,提取出来的内容按你的要求结构化,直接可复用。你还可以指定"只要哪几类字段",它就不会把整份长文全倒给你。

2. 合并与拆分

把多份 PDF 按顺序合并成一个文件,或按页、按章拆分成几份,也可以只提取其中的指定页。合并顺序、拆分页数,你在提示词里说清楚,它按你的要求精确执行,比如"第5页到第10页单独输出"这种精确页数,说一遍就行。

3. 编辑改写

对 PDF 里的文字做修改替换,比如把合同里的公司名、金额、日期改掉,保留原有排版,输出一份新文件。原文件不动,新文件按你的要求生成,改动内容一目了然,它还会把改过哪些字段列个清单给你对照。

4. 水印、加密与转换

批量加"内部资料"水印、设置打开密码、限制打印,或者把 PDF 转成 Word、图片,满足"要可编辑、要防泄露、要能展示"各种使用场景。整批处理一次完成,不逐个操作。

边界也说清楚:对纯图片扫描件,AI 要先做 OCR 识别才能"看懂"文字,所以扫描件要专门跟它说一句"这是扫描件,先识别再提取";非常复杂的版式(双层表格、旋转页、加密文档),先让它试提取,不行再拆页处理。提前知道边界,用起来就不慌。再补一条纪律:含身份证、合同、财报等敏感信息的 PDF,交给 AI 前先做脱敏处理,中间几位打码,确认安全后再处理。

三、实战示例一:8页采购合同,2分钟提取关键信息

第一步:把任务讲清楚

法务部的小赵收到一份 8 页的采购合同 PDF,要做合同登记。以前他要把 8 页从头到尾读一遍,用笔把合同编号、金额、付款方式抄到 Excel 里,抄完还要复核,一上午就搭进去。这次他直接把 PDF 和需求一起丢给 TeleAgent,还特意加了一句"找不到就标注待确认"——因为他吃过亏:以前用别的工具提取,字段缺了它就悄悄空着,你根本分不清是"没有"还是"没提取"。

我有一份8页的采购合同PDF,请帮我:

1. 提取合同编号、甲方、乙方、签订日期、合同金额、付款方式、交货期这几个字段;

2. 把提取的信息整理成一张合同登记表(字段名+内容);

3. 单独提取"违约责任"和"争议解决"两段的原文,逐字照抄,供我审阅;

4. 如果有的字段原文里找不到,明确标注"待确认",不要猜;

5. 提取完先让我核对一遍,确认无误再输出最终版。

第二步:TeleAgent 怎么思考

它先"读结构"。解析这份 8 页 PDF 的章节位置,搞清楚"第一条""第二条""违约责任""争议解决"各在哪儿,不跳页不串段。这一步相当于先把书翻了一遍目录,还专门区分页眉里的抬头和正文里的字段,不会把页眉当成正文内容提取。

它再"定位字段"。通过关键词匹配锁定 7 个目标字段:合同编号、双方名称、日期、金额、付款方式、交货期,一一从正文里找出来。找到的,原样摘录;找不到的,标注"待确认",绝不自己编一个填上——这一点对合同类文件尤其重要。

最后"组织输出"。把 7 个字段排成一张登记表,同时把"违约责任""争议解决"两段原样照抄,一个字不改。它把整张表和两段原文一起交给小赵,并提示"金额请与盖章版核对"。

这里还有个小细节:AI 在通读全文时,如果发现合同页眉里出现"修订版""V2"这类字样,它会主动提醒小赵确认是不是最新版本,避免拿旧版合同做了登记。这种"多留个心眼"的动作,是它处理法务文件多了之后自动养成的习惯。

第三步:拿到成果

【合同信息登记表】

合同编号:HT-2026-0312

甲方:滑县XX电力工程有限公司

乙方:华通科技有限公司

签订日期:2026年3月12日

合同金额:人民币壹佰贰拾捌万元整(¥1,280,000.00)

付款方式:预付30%、验收合格后7日内付清70%

交货期:合同签订后45日内

【原文摘录】

违约责任:……(原文段落逐字照抄,共3条)

争议解决:……(原文段落逐字照抄,共2条)

提示:合同金额建议与财务登记的原件复核一遍。

以前这份活要通读 8 页、手抄要点,少说 30 分钟;这次 2 分钟拿到结构化登记表和原文摘录,审阅直接从"看完全文"变成"看两段重点"。小赵把登记表拷进台账,两段原文贴进审阅记录,剩下的时间拿去核对金额,心里踏实多了。

第四步:核对清单

① 金额核对:登记表里的 1,280,000 和合同原件一致,多一个零少一个零都是大事;② 名称核对:甲乙双方名称一字不差,尤其是括号里的分公司抬头;③ 字段完整性:7 个字段是否都有,标"待确认"的是不是真没找到;④ 原文对照:摘录的两段和 PDF 里的原文逐句比对,有没有漏掉"但书";⑤ 期限核对:交货期"30日内"、验收期这些关键时间点,有没有抄错或算错。

四、实战示例二:投标前夜,把5份材料整合成一份标书

第一步:一次性说清"合并+目录+水印+加密"

这次是复杂场景:小赵要帮部门赶一份投标标书,手里有 5 份 PDF——营业执照扫描件、资质证书、技术方案、业绩证明、报价单,加起来 120 多页,要按固定顺序合并成一份,加上目录页,统一加水印,再设置密码,限制别人打印。一步没做对,投标作废。他把约束全部写进一条提示词。

请帮我制作一份投标文件,材料如下:

1. 资格审查表(5页)

2. 资质证书扫描件(8页)

3. 技术方案(65页)

4. 业绩证明(30页)

5. 报价单(3页)

合计约111页。要求:

1. 按上述顺序合并成一个PDF文件;

2. 在第一页加封面目录页(列出各材料名称和起始页);

3. 每页右下角加"仅供投标使用"小字水印;

4. 设置打开密码为 HB2026#,并禁止打印和复制;

5. 合并后文件控制在50MB以内;

6. 合并完先列出目录页草稿让我确认,再执行后续步骤。

第二步:TeleAgent 怎么思考

它先"排序规划"。确认 5 份材料 1→5 的顺序,并计算每份的页数,从而算出目录里每个章节的起始页码。顺序不对是标书最致命的错误,这一环它优先核对。

它再"分步执行"。先合并、再生成目录页、再统一加水印、最后加密,一步一确认。水印统一打在右下角,字号小、不遮正文;密码按你给的设置好,加密后顺手验证一遍能不能正常打开。

最后"验收自检"。它把合并后的总页数、目录页码、文件大小都报告给你,大小超了 50MB 就自动压缩处理,完事后列出每步结果。

它还会盯着一个容易被忽略的点:营业执照、资质证书是扫描图片,合并时会原样保留、不做过度的图片压缩,避免评委看不清章。这种"该压的压、该留的留"的取舍,就是它能一次交付的原因。

第三步:拿到成果

【标书已完成】

合并页数:合计120页(第1页为封面,第2页起为目录,目录列6个章节及起始页码)

水印:每页右下角"仅供投标使用",半透明小字

加密:打开密码HB2026#,已设置禁止打印、禁止复制

文件大小:42MB(已压缩)

验证:用密码成功打开一次,页面显示正常

以前这套流程:找软件、合并、加目录、加水印、加密,一步步手工弄,至少折腾到后半夜,还提心吊胆怕顺序错了。这次从发需求到拿到成品不到 15 分钟,而且每一步都有交代,小赵只把目录的页号核对了一遍就传上去了。

还有个细节:AI 交付时把文件命名为"投标文件_终版_HB加密.pdf",一眼能看出是最终版。别小看这个命名习惯——多少加班,都是"最终版2""最终版最终版"这种命名害的,文件名规范,整个流程都清爽。

第四步:核对清单

① 顺序核对:封面→目录→资质→证书→技术方案→业绩→报价单,顺序错一页全废;② 目录页码核对:目录里标的是不是真实起始页,差一页评委直接扣分;③ 密码验证:用 HB2026# 实际打开一遍,确认密码、打印限制都生效;④ 水印抽查:随机翻 3 页,确认水印都在、不遮关键内容;⑤ 备份核对:原始 5 份材料原样保留,标书翻车能随时重来。

五、实战示例三:扫描件转Word,领导催着要

还有一种最"轻"也最高频的场景:领导发来一份纸质材料扫描的 PDF,说"明天要改里面的数据,你转成可编辑的 Word"。以前这种事,要么找 OCR 软件,要么干脆手敲一遍。现在一句话搞定,但有个前提必须说清楚——它是扫描件。建议把这条提示词存进收藏夹,下次领导再发扫描件,复制改个文件名就能用。

这份PDF是纸质文件扫描的,内容是一张表格带几段文字,请帮我:

1. 先用OCR把整份识别成文字,再转成可编辑的Word;

2. 表格要还原成可编辑表格,列、行、合并单元格尽量保持;

3. 转换完成后,把所有金额、编号、日期单列出来,逐项报给我核对;

4. 识别不确定的字,用红色标出来,不要悄悄"脑补"。

【转换完成】

识别结果:3页表格+2段文字,已转成Word,表格可编辑

金额项:¥86,500.00、¥32,000.00、¥1,250.00 等共7项,请核对

编号项:HT-2026-081、ZC-045 等共5项,请核对

红色标注:第2页第3行"材料费"可能识别不准,已标红,请人工确认

这里同样有一条"数据准确性铁律":扫描件 OCR 识别的是图像,最怕的就是把数字认错——"8"看成"0"、"5"看成"6",一字之差就是真金白银。所以务必让 AI 把"金额、编号、日期"单独列出来逐项核对,识别不清的标红,绝不默默"脑补"。领导催得再急,这条也绝不能省;要是金额对不上,直接翻原图那一页再看一眼,比瞎猜靠谱。

六、更多PDF场景提示词速查

下面 12 条 PDF 提示词全部"复制即用"。特别提醒:涉及合同、证件等敏感 PDF 前,先做脱敏处理(把身份证号、手机号中间的几位打码),敏感文件确认安全后再交给 AI。

1. 提取纯文字

把这份12页的报告PDF的文字全部提取出来,按原章节结构整理成Word,标题层级用1/2/3级。

2. 提取表格

把这份PDF里的表格都提取成Excel,一个sheet一个表,保留表头和合并单元格,列宽按内容自适应。

3. 提取关键字段

从这份合同中提取:合同编号、双方名称、金额、付款方式、交货期、违约金比例,整理成登记表,找不到的标注待确认。

4. 多份合并

把这5份PDF按我给的顺序合并成一个文件,并加一个目录页,合并后文件不要超过30MB。

5. 按章拆分

把这本60页的报告按3章拆成3个PDF,每章一个文件,文件名用章名。

6. 提取指定页

从这份50页的合同里提取第5页到第10页,单独输出成一个PDF,保留原排版。

7. 批量加水印

把"内部资料"文件夹里的15份PDF,统一在每页右上角加"内部资料-禁止外传"水印。

8. 设置密码

给这份报告设置打开密码123456,并限制打印和复制,加密后再验证一下能否正常打开。

9. 转成Word

把这份PDF转成可编辑的Word,尽量保持原排版,表格保留,转换完列一个可能失真的地方清单。

10. 转成Excel

把这份报表PDF转成Excel,保留所有列和数值格式,数值不能转成文本。

11. 扫描件识别

这是扫描件的PDF,先做OCR识别成文字,再按原文整理成文本,识别不确定的字标红。

12. 压缩PDF

把这个PDF压缩到5MB以内,保持清晰度,压缩后报告一下实际大小。

以上12条还能组合着用:先提取字段做登记,再统一加水印加密,最后转一份 Word 留底稿,一次跑完整个流程,文件处理就彻底闭环了。

七、提示词写法详解:PDF处理提示词的黄金结构

PDF 处理提示词,同样遵循五要素:背景身份、任务目标、格式要求、约束条件、输入材料。因为 PDF 处理常常涉及"安全、准确、排版"三个敏感点,所以这五条一条都不能省。

① 背景身份:开头说清"我是法务,做合同登记",AI 就知道提取时要把合同编号、金额、条款这些要素当重点,而不是把"法院名称"也当重点。

② 任务目标:一句话说清要什么,比如"提取7个字段""合并5份""转Word"。不要说"帮我处理这份PDF",那太模糊,AI 不知道你是想读、想改还是想转。

③ 格式要求:登记表、Word、Excel、还是重新生成的 PDF?表格保留列头还是重排?层级用几级?把这些"长什么样"写清楚,输出才不用二次加工。

④ 约束条件:"找不到就标待确认、别猜""识别不定的字标红""保留原排版""合并顺序固定"——这些是 PDF 处理里最值钱的约束,写上一条,安全一分。

⑤ 输入材料:PDF 的来源、页数、是不是扫描件、有没有加密,这些信息要主动交代,别让 AI 拿到文件才发现是图片版。

差的提示词:"把这份PDF转成Word。"——没说是扫描件、没要求保持排版、没提表格,AI 一转,八成要修版式。

好的提示词:"这份PDF是扫描件,先把文字识别出来,再转成可编辑Word,表格保持可编辑,金额、编号列出来让我核对,识别不定的标红。"——五要素齐活,一步到位。

心得一:先问一句"这PDF是扫描件还是文字版"。文字版直接提取,扫描版先 OCR,别搞混,搞混就是白忙。

心得二:涉及金额、编号、日期,永远单独核对。让 AI 把这三类数据单列一张表,你人眼再对一遍,是 PDF 处理里的"保命动作"。

心得三:敏感 PDF 先脱敏再交给 AI。身份证、合同、财报,先把中间几位打码,确认安全后再处理,这是职场人的自我保护。

八、PDF处理的价值在哪

提取快:结构化提取,不再手工誊抄。合同、报告、报表的字段从"手抄"变成"AI 抄",省下的是整个下午。法务、财务这种天天跟 PDF 打交道的岗位,一周能省出大半天。

处理稳:合并、拆分、加密不损伤原文档。原文件保留,新文件生成,条理清晰,错了随时能重来。

可复用:批量处理,一套提示词跑到底。15 份资料加水印、5 份标书合并,都是一句话的事,越用越顺。

更安全:加水印、设密码,防泄露、防转发。内部资料有"看护",发出去也放心。

九、进阶技巧:PDF处理更高效

1. 先看后动

大 PDF 先让 AI 提取目录、大纲,确认结构后再提取或拆分,避免顺序错乱、页数算错。拿到"地形图"再动手,一进一出都不慌。特别是那种上百页的标书、报告,先看结构永远是最省时间的动作。

2. 合并要排序

告诉 AI 合并顺序(按文件名、按页数、按指定清单),别让它自由发挥。顺序错了再拆再合,多费一倍时间。

3. 水印加密批量

内部资料统一加水印、加密码,让 AI 批量处理。发给外部人员之前加"禁止转发"水印,已成为很多部门的常规动作。

4. 扫描件先交代

扫描件就是图片,跟 AI 说清"这是扫描件,先识别",它才会走 OCR 流程。漏了这句,得到的是一堆乱码。

5. 转换后重点核对

PDF 转 Word/Excel 后,重点核对表格、数字、分页三处。这几处最容易出错,核完这三处,其余大面上没问题。

6. 反向核对法

转换、提取完成后,让 AI 当"复核员"挑自己毛病:"请你以最严格的审核视角,检查这次转换/提取:金额是否全对、编号是否漏、页数是否少、敏感信息是否处理干净,逐条列出问题。" PDF 处理错一个数字可能就是事故,多一轮反向核对,值得。

7. 扫描件的批量OCR整理,让档案从"能看"变"能查"

行政和档案岗还有一个大工程:纸质材料归档。一批供应商资质、验收单、老合同,扫描成40多个纯图片PDF,放在服务器里除了翻页浏览什么也干不了——不能搜索、不能复制,明年审计要找"华通科技那份验收单",只能凭记忆一个个翻文件夹。这种活可以让AI做一次批量OCR整理,把一堆"图片档案"变成"能搜能查的电子档案",一次整理、长期受益。

做法分三步。第一步试跑:先挑2份最典型的让AI识别,看清晰度能不能过关,拍糊的、反光的先重新扫描,别等40份全跑完才发现识别率不行。第二步批量识别:规则一次说死——"每份识别成Word,文件名按“单位_材料类型_日期”统一命名,金额、编号、日期三类关键数字单独汇总成一张核对表,识别不确定的字标红"。第三步验收:让AI输出一份"识别质量报告",把置信度低的页码全部列出来,你只复核这几页。40份材料里通常有七八页是斜着拍、带阴影的,这些页单独人工过一遍,其余放心归档,一下午收工。往后调档,输入关键词就能定位到具体哪一份哪一页。顺带提醒一句:这批扫描件里如果含身份证号、银行账号,按前面说过的规矩先脱敏再交给AI,归档效率要提,安全纪律一条也不能落下。

十、常见误区提醒

1. 扫描件当文字版处理

纯图片扫描件必须走 OCR,直接"提取文字"会得到乱码或空白。先告诉 AI"这是扫描件,先识别文字",再让它提取。特别是手机随手拍的模糊扫描件,识别难度更高,更要让 AI 把不确定的字标出来,别让它硬猜。

2. 转换后不检查排版

PDF 转 Word/Excel 后格式可能偏移,重点段落、表格、页眉页脚必须核对一遍。转完不查,发出去发现问题就晚了。尤其转 Excel 时,数值列有没有被转成文本,直接影响后续能不能直接算。

3. 随意传敏感 PDF

合同、证件、身份证等含敏感信息的 PDF,交给 AI 前先脱敏。你没做脱敏,等于把敏感信息"裸奔"了一遍。

4. 分页顺序想当然

合并、拆分的页数,别靠"大概",让 AI 先读一遍页数、目录确认。页数算错了,目录和正文就对不上,读者一眼就发现。

十一、今天的练习

入门:找一份 PDF,让 TeleAgent 帮你提取一次关键信息(比如合同编号、金额),并整理成登记表。做完顺手核对一遍,感受一下"抄写变提取"的差别。

进阶:把 3 份 PDF 合并成一个,加上水印和密码,再转成 Word 看看排版情况,练一遍完整流程。

挑战:找一份扫描件 PDF,做一次 OCR+转 Word+数字核对,把你提取的"金额/编号清单"与原文逐一对照,看有没有漏。

PDF 不必是"牢不可破"的文档,有了 AI,它能提取、能改、能合并,还能加密——随你安排。

—— 技能提升篇 · 第52天 —— 「TeleAgent 学习指南」——每天 5 分钟,从零掌握中国电信 AI 办公搭子。

AIGC标识: c0259739-66f5-4596-8c1a-2d684cf8f10e

相关学习资料