夜雨聆风学习资料网

ARTICLE · 1121479

爱学习I RAG 答不准,先改文档切分

爱学习I RAG 答不准,先改文档切分

爱学习

RAG 答不准,先改文档切分

别急着换模型——你花在换模型上的时间,可能不如花在切分上值。

# 文档切分# 检索质量# RAG 优化# AI 应用

爱学习,搞懂一个算一个。

写在前面

先给你一个数字:同一份知识库、同一个模型、同一批问题,只把文档的切分方式换掉,检索 F1 从 0.24 涨到 0.64。

这是 2025 年一项临床决策支持研究的实测。知识库、embedding 模型、top-k 全部锁死,只动切分。

这一期拆流水线的前两步:解析和切分。

换句话说:你花在换模型上的时间,可能不如花在切分上值。最差的固定长度字符窗口,捞回来的片段里不到五分之一是相关的;换成最好的自适应切分,差 2.7 倍。

01文档进屋,先被「读」一遍

RAG 的第一步不是切,是把文档变成干净的文字。这一步最容易被当成「格式转换」,找个库跑一下就算完,可它恰恰是整条链里最脏的一段。最常见的三种翻车:

1

表格被压成一行糊字。解析器不认识表格结构,会把「审批人|金额|时限」三列顺着读成一串连续文字。而合同、报价单、参数表,正是 RAG 最常被查的东西。

2

扫描件根本没被识别。图片型 PDF 解析出来是空白或乱码,得先上 OCR,OCR 又带进新的识别错误。

3

页眉页脚、页码、水印混进正文。每页重复的公司名和页码,切完之后每一块都带着。

建议只有一句:新文档进来,先随机抽十段人眼看一遍,再谈切分。

02切多碎才算对

检索的最小单位不是文档,是块(chunk)。模型看不见你的数据库,提问时它只能看到被捞出来的那几块。块切得对不对,决定它看到的是完整一句话,还是半截话。

这里有个默认值陷阱。主流切分器的默认参数是 1000 字符、重叠 200 字符,这套默认值是为英文调的。1000 个字符放进中文,往往是三四个不相干的主题挤在一起:每块都沾一点,检索时又什么都不像。

切太碎

一句话被拆成三段,命中了也答不全。

切太长

一块里塞五个主题,命中之后大半是噪声。

划重点

中文场景拿 256 到 512 个 token 起步,重叠 10% 到 20%。这不是标准答案,但比 1000 字符合理得多。

03四种切法,怎么选

— 四种切法对比:固定长度、递归切分、结构化切分、语义切分

四种切法各有各的适用面,代价图里都标了。其中两种值得单独说:通用文档和结构化文档,各有各的最优解。

递归切分

按段落、句子、字逐级往下切,通用文档首选。

结构化切分

按标题、章节、表格切,适合手册、合同、API 文档。剩下两种——固定长度和语义切分——各有各的适用面。

小贴士

得说句公道话:有研究对比过,语义切分并不总是赢过固定切分,embedding 模型选得对不对,影响比切分策略更大。先看你的文档长什么样,再挑切法。

真正零成本、收益最大的一招是:有结构就用结构。标题本身就是天然的分界,按标题切几乎不会出错,却最少人做。

04比调参数更管用的:把上下文补回去

切得再准,有个问题躲不掉:一块被单独拎出来的时候,常常看不懂。

比如某一块里写着「限额已上调至 1 万元」,可它没说清是哪个产品、哪类限额。人看得出缺了什么,向量看不出来——它的坐标从一开始就偏了。

— 补上下文前后对照:同一块内容,补一句位置说明,向量才看得懂

解法就是把切掉的东西补回去。Anthropic 2024 年的一组实验结论很干脆:给每块补一句它在原文里的位置说明,再去做向量,检索失败率降 35%;再加上关键词检索 BM25,降 49%;再叠一层重排 rerank,降 67%,把失败率从 5.7% 压到 1.9%。

−35%补上下文−49%+ BM25−67%+ rerank

这个动作还很便宜:每块加 50 到 100 字的上下文说明,一次性预处理,成本大约每百万 token 一美元出头。

父子切分

小块负责检索,命中后把大块交给模型。

适度重叠

相邻块留 10% 到 20% 的重叠区。都是用一点冗余,换一次不丢信息。

05今天就能做的一件事

别急着换模型。拿最常被问的那份文档,做一件事:

1写 20 个真实问题 · 量「正确答案有没有出现在前 5 块里」

2只改切分方式 · 同一个问题集再量一次

同一个问题集,只动切分,测两轮。这一下午的收益,通常比换一个更贵的模型大。

答案的质量,在检索开始之前就定了大半。

解析定型了文字,切分定型了检索的最小单位。这两步糊弄过去,后面换多少模型,都只是往一个被压死的上限上靠。

下期预告

下一期往上走:文字怎么变成坐标,中文该选哪个 embedding 模型,向量库该建什么索引。

如果你身边有人在搭知识库、做 AI 应用,把这篇转给他。

转发给需要的朋友

素材来源:MDPI《Bioengineering》12(11):1194,Comparative Evaluation of Advanced Chunking for Retrieval-Augmented Generation in LLMs for Clinical Decision Support(2025);Anthropic《Introducing Contextual Retrieval》(2024);LangChain 官方文档 RecursiveCharacterTextSplitter 参数说明。具体数据与结论以原始文献为准。

未来我会持续关注和汇报我在 OPC 创业过程遇到的一些问题和使用 AI 工具的感受。本人有十几年开发、架构和团队管理经验,主导千万级支付系统的实施和落地,也希望大家和我多交流,我相信:一个人走得快,一群人走得远。· · ·

扫码查看小程序

相关学习资料