RAG检索不准,问题往往不在模型,而在分块。从文档解析到知识增强,四步走通RAG全链路,每一步都有坑,踩中一个就全崩。

01 文档解析——把死文件变活数据
一份PDF丢进RAG系统,出来的可能是一堆乱码。
文档解析是RAG的第一道门槛,也是最容易被低估的环节。
Word文档结构清晰,转成DOCX后直接提取文本即可;PDF就复杂得多——扫描件要靠OCR识别文字,版面要靠DLR区分标题段落,表格要靠TSR还原行列关系。
两条路径殊途同归:最终都变成可检索的语义化文本块。
当前主流工具有两类——DeepDoc走视觉+语义混合路线,每种格式单独处理;MinerU走统一转换路线,所有格式先转MD/JSON再解析。
选哪条路,取决于你的文档类型有多杂。

02 分块策略——切错一刀,检索全崩
分块是RAG的精度天花板。切太大,噪声淹没信号;切太小,上下文碎片化。
七种策略各有战场:
固定大小切块是无结构文本的兜底方案,简单粗暴但语义常被截断;
滑动窗口靠重叠保上下文,代价是冗余翻倍;
基于句子切块粒度最细,适合语法完整的新闻和法条;
递归切块通用性最强,优先保大语义单元,是大多数场景的稳妥起点;
页面/结构化切块适合有明确标题章节的文档;
语义切块用向量计算找话题边界,最智能但计算成本最高;
Small2Big不切块但补上下文——检索用小块,生成用大块,命中后向邻居或父块回溯,拼接去重后再喂给大模型。

03 索引构建——给知识装上搜索引擎
分好块的知识还需要可搜。
两条索引路径并行:一条走文本分词到倒排索引,擅长关键词精确匹配;另一条走Embedding向量化到向量索引,擅长语义相似度检索。
向量检索常用HNSW(速度和精度的平衡选择)、IVF(大规模数据的分区策略)或Flat(小规模精确搜索)三种算法。
两条路最终汇聚成混合检索——先关键词粗筛,再语义精排,检索召回率显著提升。底层数据库选型看规模:小项目用FAISS够用,生产级推荐Milvus或Qdrant。
04 知识增强——检索不准的三味药
分块再精细,检索仍会断章取义。三种增强方案对症下药:
上下文增强索引——给每个原始块补上前后文(各50-200字),检索命中即可带回局部背景,解决断章问题;
块标题增强(CCH)——把文档标题、章节标题拼到块前面再嵌入,每个块自带层级信息,检索时语义对齐更精准,对无标题段落可用LLM自动生成小标题;
问题生成增强——用LLM为每个块生成2-5个相关问题,和块一起嵌入,用户提问直接匹配问题再定位到原文,解决问法与写法不对称的核心痛点。

05 价值闭环——分块决定RAG天花板
RAG四步走完,回看全链路:文档解析把死文件变活数据,智能分块定精度天花板,索引构建让知识可搜可达,知识增强弥补检索与生成的语义鸿沟。四步环环相扣,分块是基石,索引是骨架,增强是引擎。踩准每一步,RAG才能真正从能用走向好用。核心一句话:分块决定上限,增强决定下限。

【免责声明】1.本文所有信息仅供参考,不做任何商业交易或提供医疗服务的根据。2.我们致力于提供合理、准确、完整的资讯信息,但不保证信息的完整性、正确性和合理性,且不对因信息的不专业、不准确或关键信息缺失导致的所有损失承担责任。3.部分文章信息来源于其它渠道,对其观点或内容的真实性保留意见。如有侵权,请及时联系。
夜雨聆风