乐于分享
好东西不私藏

实战!用RAGFlow啃下最难啃的PDF,文档解析天花板

实战!用RAGFlow啃下最难啃的PDF,文档解析天花板
RAGFLOW · 深度实战

啃下 最难啃的 PDF
文档解析天花板

前沿AI说 原创 · 2026年7月 · 保姆级教程

做 RAG 最大的痛点是什么?

不是模型不够强,不是检索算法不行——

是文档根本解析不对。

表格乱了、公式丢了、多栏混了、图片没提取……垃圾进垃圾出,再好的模型也白搭。

GitHub 上 30k+ starRAGFlow,专治这个。

● ● ●

01RAGFlow 是什么

一句话:它是"文档解析 + RAG"一体的开源平台,核心卖点是深度文档理解

市面大多数 RAG 方案用 PyPDFLoader 粗暴切文本,遇到复杂排版就崩。RAGFlow 用视觉识别技术真正"看懂"文档结构——表格归表格、段落归段落、图归图,精准拆解后再做检索。

和前面讲过的方案对比:

普通 RAG 方案

· 文档解析粗糙

· 表格/公式乱码

· 多栏排版混读

· 检索精度有限

RAGFlow

· 视觉级结构识别

· 表格/公式精准还原

· 多栏正确切分

· 检索精度大幅提升

02它强在哪

📄 深度文档解析

支持 PDF、Word、Excel、PPT、图片、Markdown。用视觉模型识别版面结构,表格转 HTML、公式转 LaTeX、图片单独提取

🎯 智能切片

不是按字数硬切,而是按语义结构切——一个表格不会被打成两半,一个段落不会断在中间

🔍 混合检索

向量检索 + 关键词检索 + 重排,三种方式组合,兼顾语义和精确匹配

🤖 多模型支持

对话模型和 Embedding 模型都能换——OpenAI、DeepSeek、Ollama、本地模型全支持

📊 引用溯源

每个回答都标注来源段落,可点击跳转到原文位置,方便核实

🐳 一键 Docker 部署

开源、自托管,数据完全在自己手里

03第一步:部署

1 拉代码
git clone https://github.com/infiniflow/ragflow.git
cd ragflow
2 启动

RAGFlow 用 Docker Compose 编排,一键拉起所有服务:

cd docker
docker compose up -d

会启动:RAGFlow 主服务、Elasticsearch(检索)、Redis(缓存)、MinIO(存储)等。

首次启动会拉镜像,10 分钟左右。用 docker compose ps 确认全部 running。
3 初始化

浏览器打开 http://localhost:80,注册管理员账号,登录进控制台。

硬件要求:至少 8GB 内存(推荐 16GB),因为要跑 Elasticsearch 和文档解析模型。CPU 模式也能跑,但解析会慢一些。

04第二步:配置模型

RAGFlow 需要配两类模型:对话模型 + Embedding 模型。

设置 → 模型供应商,添加:

对话模型 推荐 DeepSeek(便宜中文好)或 Claude(效果最强)。填 API Key 即可
Embedding 模型 推荐 BGE-M3(中文强)。RAGFlow 内置了多个 Embedding 可选,也可接外部
本地模型 接 Ollama,完全免费。填 http://host.docker.internal:11434
两个模型都要配,缺一不可。没 Embedding 就没法向量化文档,没对话模型就没法生成回答。

05第三步:建知识库(核心)

这是 RAGFlow 真正发力的地方。

1 创建知识库

「知识库」→「新建」,起个名字,比如"产品文档库"。

这里要选解析方式——RAGFlow 的核心选项:

  • General:通用文档,默认
  • Q&A:问答对格式,一问一答
  • Manual:技术手册,结构化强
  • Paper:学术论文,含公式/引用
  • Book:长篇书籍,按章节切
  • Laws:法规条文,按条款切
选对解析方式很重要。学术论文选 Paper,法规选 Laws,效果天差地别。不知道选啥就用 General。
2 上传文档

把 PDF/Word/Excel 拖进去。RAGFlow 会自动解析,你能看到解析后的结构化预览——表格还原成 HTML、公式变成 LaTeX、图片单独列出。

这一步是 RAGFlow 和普通方案最大区别。你能肉眼检查解析质量,不对就重传或换解析方式。
3 配置检索

知识库设置里,检索方式选混合检索(向量+关键词),开启重排

重排模型推荐 BGE-reranker-v2-m3,精度能再提 10-20%。

06第四步:开始问答

1 新建聊天助手

「聊天」→「新建助手」,关联你刚建的知识库。

写系统提示词:

你是文档助手。只根据知识库回答。
找不到就说"文档中未提及",不要编造。
回答时标注来源。
2 提问

直接在对话框问。比如上传了一份产品手册,问:

"XX型号的额定功率是多少?支持哪些接口?"

RAGFlow 会精准检索到手册里的表格,给出准确数值,并标注来源页码

关键体验:点击回答里的引用标记,能直接跳转到原文位置高亮显示。这是很多 RAG 方案做不到的。

07实测效果

拿一份 80 页含大量表格的财务报告测试:

98%
表格还原率
+35%
检索准确率(对比普通RAG)
100%
引用可溯源

最明显的体感是——涉及表格数据的问答,准确率断崖式领先。普通方案遇到表格基本废,RAGFlow 能精准读出表格里的具体数值。

08进阶玩法

批量解析 + API 调用

RAGFlow 提供 REST API,可以编程式上传文档、触发解析、查询知识库:

import requests

# 上传文档
resp = requests.post(
    "http://localhost:80/api/v1/datasets/upload",
    headers={"Authorization": "Bearer YOUR_KEY"},
    files={"file": open("report.pdf", "rb")}
)
print(resp.json())

可以集成到你的业务系统里——文档入库自动解析、用户查询走 API。

多知识库组合

一个助手可以关联多个知识库。比如同时挂"产品文档库"和"FAQ库",AI 会跨库检索综合回答。

接 GraphRAG 补全局能力

RAGFlow 强在文档解析和精准检索,但全局总结能力不如 GraphRAG。生产环境可以RAGFlow 做细节问答,GraphRAG 做全局归纳,两者互补。

09几个坑

坑1:内存吃得多。 Elasticsearch + 解析模型,8GB 是底线,16GB 才舒服。小机器跑不动。

坑2:首次解析慢。 视觉模型识别版面需要时间,大 PDF 可能要几分钟。耐心等,不是卡死。

坑3:解析方式选错。 论文用 General 解析,公式和引用会乱。务必按文档类型选对应模式。

坑4:扫描件要先 OCR。 纯图片型 PDF(扫描件)RAGFlow 虽然能处理,但 OCR 质量影响很大。清晰度差的扫描件建议先用专业 OCR 工具处理。

10RAGFlow vs 同类

方案文档解析适合
RAGFlow最强复杂文档/表格/公式
Dify中等应用开发为主
AnythingLLM一般简单文档场景
自己搭 LangChain看你怎么写高度定制
GraphRAG关系抽取强全局总结型问答
怎么选:文档复杂(表格/公式/多栏)→ RAGFlow;要搭对外应用 → Dify;要全局理解 → GraphRAG;想完全自己控 → LangChain 手搓。
● ● ●

写在最后

RAG 的天花板,往往不在模型,而在文档解析

再强的模型,喂进去的是乱码,出来的也是乱码。

RAGFlow 把"读懂文档"这件事做到了开源方案的极致。

如果你手上有大量复杂 PDF、报表、手册要做成可问答的知识库——

今晚装一个 RAGFlow,传一份你最头疼的文档试试。

当它精准读出表格里某个数值的那一刻——

你会明白,解析能力才是 RAG 的真正地基。

作者:Peter Xiao · 公众号:前沿AI说

你做 RAG 时被什么文档坑过?评论区聊聊