夜雨聆风学习资料网

ARTICLE · 1064359

Agent 的 RAG 遇到 PDF 翻车了?一文讲透 20

Agent 的 RAG 遇到 PDF 翻车了?一文讲透 20

「把 PDF 转成文本,切片入库就搞定。」这话只够跑个 demo,真上生产绝对翻车。

PDF 不是 Word,它更像一张画好的图。里面不记结构,只记“在哪画啥”。直接抽文本,合同会断行,财报数字对不上表头,扫描件一片空白,多栏排版左右乱串。

现在工业界的标准解法是四层处理加两条硬措施。
第一层:原生文本直接抽,扫描件丢给多模态大模型看图,混合的就逐页判断。中文场景首选 MinerU,跑分高且贴合中文排版。
第二层:接着还原结构,保留页码、章节和表格编号。
第三层:切片时带上元数据,再补一两句上下文说明。
第四层:最后让 Agent 按需调用工具,绝不一次性塞满上下文。

光有这四层还不够,两条硬措施卡死底线。
回答必须带页码引用,支持点击跳转;
而且每个事实都得能在检索结果里找到,找不到就老实说没查到。

这两年变化挺大。
以前扫描件靠传统 OCR,现在直接用大模型看图。
视觉文档检索也上了生产,彻底告别文字缺失和表格错位。不过代价是存储贵了不少。

原文Agent 的 RAG 遇到 PDF 翻车了?一文讲透 2026 解法
作者提示: 内容由AI生成
重庆,2小时前,

相关学习资料