夜雨聆风学习资料网

ARTICLE · 1072364

把PDF丢进知识库前,先多做这一步

把PDF丢进知识库前,先多做这一步
书接上回~
上次那套本地知识库(LLM + Dify + Embedding)算是搭起来了,跑是能跑了。
我兴冲冲把一堆 PDF、Word、Excel,还有几张截图,一股脑全丢了进去。
然后它开始一本正经地胡说八道或者压根不回复。
我问一个特别明确的问题,它回我一段看着很眼熟、但压根答非所问的话。那一瞬间我很怀疑人生:是我选的模型不行吗?
后来才发现——不是模型的问题,是我喂给它的东西有问题。

一个我后来一直在用的比喻

做 RAG 有点像下厨。
模型是厨师,你给的资料是食材。
食材带泥、带根、烂叶子也不摘,直接下锅,菜能好吃吗?厨师再厉害也没救。
而大多数人做AI知识库的第一步,就是像我一样把资料往里一扔,然后期待它聪明。这一步恰恰是最容易偷懒、也最容易被忽略的一步——清洗

那"洗"到底洗什么?

得先说个概念:chunk。
你理解成"资料的小块"就行。系统不会一口气读完你整份 PDF,它会把资料切成一个个小块,就像把一本书撕成一张张纸条。你提问时,它去抽最像的那几张来回答。
问题就出在这刀口上。
我当时导进去那份 PDF,切完经常是这种效果:一张纸条上只有半句话,下一张是 Excel 的表头,再下一张是表格里孤零零三个数字。
你抽到这么一张纸条,你也不知道它在说啥对吧?AI 也一样。
它只能猜。所以看起来在回答你,实际上在编。

我后来总结出的三个注意点

1️⃣切之前先问自己:这段单独抽出来,还成立吗?

这是我现在每次导入前必做的自检,方法很笨但很有效:
随机抽几个块出来,假装自己只看得到这一小段,看能不能读懂、能不能据此回答一个问题。
读不懂,就说明资料还得再整理。
我自己的标准是:一块最好就是"一个完整的知识点"——背景 + 内容 + 结论都在一块里,别跨块。

2️⃣格式转换≠换个后缀

这点我踩得最深。
一开始我以为清洗就是把 PDF 转成 Word、把 Word 转成 txt。做完发现完全没用——容器是变了,内容还是原来那个鬼样子。
真正有用的是按语义重排。举几个我真实遇到的:
▫️ 表格:Excel 里一行是一条记录,但直接导进去,它可能被拦腰截断。我现在会先改成"字段名:值"这种一句话一条,比如"张三 / 销售部 / Q1业绩12万"。
▫️ PPT:一页 PPT 往往只有几个词。我会把它补成一句完整的话:"这一页讲的是××,结论是××"。
▫️ 图片和扫描件:最容易被忽略。图片里的字对系统来说可能压根不存在,得先转成文字,还得顺手把错别字改了。
这步一句话总结:不是让机器能读,是让机器读完之后能懂。

3️⃣重复的活,别自己一遍遍干

我一开始是真手动改的。改到第 3 份文档的时候我崩了。
后来换了个思路:我把自己的要求一条条跟千问说清楚——什么要保留、什么必须补写、表格怎么拆、一句话控制在多长,它改完我来挑毛病,它再改。
来回磨了好几轮之后,我干脆把整个过程整理成了一份固定的流程说明:我提了哪些要求、它最后怎么做的、哪些坑必须避开,全部写死在里面。
下次再来一份新资料,我不用重新想一遍,照着这份说明跑就行。
  1. 文档格式转换,不是简单转换格式,要按照语义转换,确保分割后的每个chunk都能正确解释文档;
  2. 为了解决这个问题,我通过跟千问对话帮我反复修改,来让它帮我转换我需要的文件,然后把整个过程总结成了一个skill方便复用。

说回咱们普通人

你可能会说:我又不用搭本地知识库,这跟我有啥关系?
最常见的场景,就是网店机器人,在人工下班后由ai来进行一部分常见的咨询,进行根据内部私有产品文档来给出对应的解答;
例如:
  1. 产品参数咨询“某设备有几个hdmi接口”
  2. 故障咨询“某某设备这个01003报错”是什么意思
如果你的本地ai有这些知识储备的话,就能做出解释,从而降低对人工客服要求;
这是我这段时间最大的收获。不管你用不用本地部署,感兴趣就互动下把。
有需要这个skill文件或者其它想法可以评论@我

相关学习资料