乐于分享
好东西不私藏

换新啦~:今天讲 PDF 处理沉淀

换新啦~:今天讲 PDF 处理沉淀

上一篇我们讲的是 Word 排版,核心是把一次操作变成可复用的方法。今天换一个对象:PDF 处理,继续用同样的思路,把一次任务沉淀成 Skill。

PDF 处理的难点不是打开文件,而是把不可编辑、版式复杂的内容提取成可核对、可复用的结构化结果。所以今天不要只把它当成一次“帮我处理文件”的操作,而是把整个过程跑成一套以后能重复调用的方法。

一、先把任务说具体

准备材料:一份包含正文、表格和关键信息的 PDF。

对龙虾U盘可以这样说:

```text

请帮我处理一份 PDF 文件。先判断材料类型,再按下面步骤处理:

1. 判断 PDF 是文字版还是扫描版

2. 提取正文并保留页码来源

3. 识别表格和关键字段

4. 生成摘要与重点清单

5. 导出结构化表格或文本

6. 记录无法识别的页码和原因

最后给我处理结果、来源说明和异常记录。

```

这一步的重点是把任务跑通,不急着谈 Skill。你要先看结果是否能用,特别检查:页码来源是否保留、表格列是否错位、扫描件 OCR 是否有误字、摘要是否遗漏关键结论。如果这些地方没有交代清楚,就让龙虾U盘补充说明,不要直接进入下一步。

二、把经验变成可复用规则

结果确认后,直接用自然语言告诉龙虾U盘:

```text

刚才这套流程以后我还会经常用,请帮我整理成一个 PDF 处理 Skill。

目标是:把 PDF 信息提取和整理流程沉淀成可复用 Skill。

```

然后让它反问你规则,而不是你自己写配置:

```text

请像助手一样追问我,这个 Skill 还缺哪些使用规则。

```

围绕今天的主题,建议至少让它问清楚:

- 遇到扫描件是否先 OCR?

- 表格识别不准时是否保留截图?

- 摘要要按页总结还是按主题总结?

- 输出需要 Markdown、Excel 还是 Word?

你只需要用日常表达回答。例如“识别不准的地方先标出来”“来源页码必须保留”“表格不确定时不要擅自合并”。龙虾U盘会把这些回答整理成 Skill 的执行规则。

三、生成并测试 Skill

最后对龙虾U盘说:

```text

请生成最终版 Skill,包含名称、适用场景、执行步骤、异常处理、输出要求、示例提示词和优化建议。语言要让普通用户看得懂。

```

生成后不要马上结束,要用新材料测试一次:换一份新的 PDF 测试提取准确率。如果发现问题,再补一句“请把这次问题加入 Skill 规则”。这样 Skill 才会越用越稳。

四、优化方向

这个 PDF 处理 Skill 后续可以继续优化:

1. 增加 OCR 质量检查;

2. 给表格识别设置人工复核点;

3. 按页码保留证据来源;

4. 为不同类型 PDF 建立输出模板;

这篇先把 PDF 处理 跑通。下一篇继续这个系列,进入 网页数据抓取,把数据来源从文件扩展到网页。