
上一篇我们讲的是 Word 排版,核心是把一次操作变成可复用的方法。今天换一个对象:PDF 处理,继续用同样的思路,把一次任务沉淀成 Skill。
PDF 处理的难点不是打开文件,而是把不可编辑、版式复杂的内容提取成可核对、可复用的结构化结果。所以今天不要只把它当成一次“帮我处理文件”的操作,而是把整个过程跑成一套以后能重复调用的方法。
一、先把任务说具体
准备材料:一份包含正文、表格和关键信息的 PDF。
对龙虾U盘可以这样说:
```text
请帮我处理一份 PDF 文件。先判断材料类型,再按下面步骤处理:
1. 判断 PDF 是文字版还是扫描版
2. 提取正文并保留页码来源
3. 识别表格和关键字段
4. 生成摘要与重点清单
5. 导出结构化表格或文本
6. 记录无法识别的页码和原因
最后给我处理结果、来源说明和异常记录。
```
这一步的重点是把任务跑通,不急着谈 Skill。你要先看结果是否能用,特别检查:页码来源是否保留、表格列是否错位、扫描件 OCR 是否有误字、摘要是否遗漏关键结论。如果这些地方没有交代清楚,就让龙虾U盘补充说明,不要直接进入下一步。
二、把经验变成可复用规则
结果确认后,直接用自然语言告诉龙虾U盘:
```text
刚才这套流程以后我还会经常用,请帮我整理成一个 PDF 处理 Skill。
目标是:把 PDF 信息提取和整理流程沉淀成可复用 Skill。
```
然后让它反问你规则,而不是你自己写配置:
```text
请像助手一样追问我,这个 Skill 还缺哪些使用规则。
```
围绕今天的主题,建议至少让它问清楚:
- 遇到扫描件是否先 OCR?
- 表格识别不准时是否保留截图?
- 摘要要按页总结还是按主题总结?
- 输出需要 Markdown、Excel 还是 Word?
你只需要用日常表达回答。例如“识别不准的地方先标出来”“来源页码必须保留”“表格不确定时不要擅自合并”。龙虾U盘会把这些回答整理成 Skill 的执行规则。
三、生成并测试 Skill
最后对龙虾U盘说:
```text
请生成最终版 Skill,包含名称、适用场景、执行步骤、异常处理、输出要求、示例提示词和优化建议。语言要让普通用户看得懂。
```
生成后不要马上结束,要用新材料测试一次:换一份新的 PDF 测试提取准确率。如果发现问题,再补一句“请把这次问题加入 Skill 规则”。这样 Skill 才会越用越稳。
四、优化方向
这个 PDF 处理 Skill 后续可以继续优化:
1. 增加 OCR 质量检查;
2. 给表格识别设置人工复核点;
3. 按页码保留证据来源;
4. 为不同类型 PDF 建立输出模板;
这篇先把 PDF 处理 跑通。下一篇继续这个系列,进入 网页数据抓取,把数据来源从文件扩展到网页。
夜雨聆风