夜雨聆风学习资料网

ARTICLE · 1084600

PDF 一切就碎、引用对不上?RAGFlow 深度解析,答案追回原文

PDF 一切就碎、引用对不上?RAGFlow 深度解析,答案追回原文

点击下方【IT开源项目精选】

「关注」、选择「设为星标」

每天三分钟、打卡阅读

最快获取全网学习干货、行业资讯

前言

大家好,这里是 IT开源项目精选!

研报、合同、扫描件里图表和版式一多,普通切块就把表格切碎、引用对不上原文。企业要的不只是「能问答」,而是切片看得见、答案能回溯、工作流还能编排成 Agent。

本期拆解 InfiniFlow 开源的 RAGFlow。它以深度文档理解(DeepDoc)做解析,再用模板切片、多路召回与可视化 Agent 把 RAG 做成可自托管的引擎。若你要的是成熟的文档问答底座,而不是从零写检索链路,值得对照 v0.27.2 实测。

简介

RAGFlow 仓库:github.com/infiniflow/ragflow。截至 2026 年 9 月 20 日,约 91009 Star、10776 Fork。协议 Apache-2.0。最新正式发行版 v0.27.2(2026-09-10);主分支推送仍活跃(约 2026-09-20)。官网 ragflow.io;云体验 cloud.ragflow.io。

定位:把前沿 RAG 与 Agent 能力收成可适配企业规模的端到端工作流。核心是上下文引擎 + 预置 Agent 模板,强调「Quality in, quality out」——解析质量决定回答质量。默认文档引擎为 Elasticsearch,可切换为同团队的 Infinity;对象存储走 MinIO / S3;元数据可接 MySQL 等。

与上期 Ragent 不同:Ragent 偏 Java 全栈学习实现;RAGFlow 偏可上线的文档理解引擎,社区体量与解析能力都不在同一档。源码启动文档要求 Python ≥3.13;日常推荐 Docker,不要求本机先装 Python。

核心能力

一、深度文档理解

• DeepDoc 覆盖版面分析、OCR、表格识别,面向 PDF、扫描件、Word、PPT、Excel、图片等;

• 解析方法可接 MinerU、Docling(以当前版本文档为准);

• 图可用多模态模型生成描述,减少「只剩乱码表格」。

二、可控切片与可追溯回答

• 按模板切片,过程可视化,切片可手工改、可单独启用或停用;

• 回答附关键引用快照,能对回原文页;

• 检索侧支持多路召回与融合重排,模型与向量模型均可配置。

三、Agent 与数据接入

• 可视化 Agent 工作流:意图分流、检索、联网搜索、代码执行器等;

• 支持 MCP、Agent 记忆、可编排数据管道(以 v0.27 文档为准);

• 数据源可同步 Confluence、S3、Notion、Google Drive 等;聊天渠道含飞书、Discord、Telegram、Line 等。

四、集成方式

• UI / API / SDK;官方 Skill 可通过 OpenClaw 访问数据集;

• 模型侧兼容多家厂商(含 DeepSeek、Gemini、GPT 系列等,以当前发布说明为准)。

系统架构与界面

请求经 Nginx 进 API;入库走消息队列与 Ingestion,DeepDoc 负责解析;查询走检索服务与模型供应商。推荐路径:先云端或 Docker 起服务 → 建数据集等解析完成 → 对照原文改切片 → 再编排 Agent。

▲ 图1 系统架构:API · 入库 · 检索 · DeepDoc

▲ 图2 数据集:解析状态、切片数与启用开关

▲ 图3 切片与原文对照,可逐块启停

▲ 图4 问答引用可对回报告原文页

▲ 图5 Agent 画布:意图分流与专家节点

▲ 图6 运行日志:检索、反思与引用回答

技术栈与环境

版本: v0.27.2 · Apache-2.0

部署: Docker ≥24 · Compose ≥2.26.1 · 官方镜像为 x86

建议: CPU ≥4 核 · 内存 ≥16GB · 磁盘 ≥50GB

依赖: Elasticsearch(默认可切 Infinity)· MySQL · Redis · MinIO

默认访问: http://机器IP (HTTP 端口 80,可在 compose 里改映射)

快速开始

一、云端体验

浏览器打开 https://cloud.ragflow.io。适合先看切片与问答,不适合当私有数据环境。

二、Docker(官方推荐)

sysctl vm.max_map_count

注:小于 262144 时执行 sudo sysctl -w vm.max_map_count=262144

git clone https://github.com/infiniflow/ragflow.git

cd ragflow/docker

git checkout v0.27.2

注:让 entrypoint 与镜像版本一致;换版本改 docker/.env 的 RAGFLOW_IMAGE

docker compose -f docker-compose.yml up -d

浏览器访问机器 IP(默认端口 80)。GPU 加速 DeepDoc 需在 .env 写入 DEVICE=gpu 后再启动。官方镜像基于 x86;ARM64 需按文档自行构建。

三、源码开发要点

用 uv 按 Python 3.13 安装依赖,再用 docker compose -f docker/docker-compose-base.yml up -d 拉起 MinIO、Elasticsearch、Redis、MySQL,并在 hosts 中把 es01、mysql、minio、redis 等解析到 127.0.0.1。细节见仓库 README 与 ragflow.io 文档。代码执行器沙箱另需 gVisor,不用可先不装。

实操要点

先等解析完成再提问。数据集页会提示文件解析成功前不要开聊。大 PDF 切片数可能上百,机器内存不够时解析会拖死。

切片模板比换模型更先见效。通用模板不适合所有版式;表格、手册、论文应换对应模板,并在对照页里关掉噪声块。

切 Infinity 会清空卷数据。文档要求 down -v 再改 DOC_ENGINE。生产切换前先备份。

镜像与代码标签对齐。checkout 到 v0.27.2 再 compose,避免 entrypoint 与镜像不一致。外挂 LLM / Embedding 密钥放配置,不要写进镜像。

适用边界:什么情况别用它

① 只要几十行嵌入式检索。全家桶(ES/Infinity + MySQL + Redis + MinIO)过重。

② 机器内存明显低于 16GB,或不能改 vm.max_map_count。Elasticsearch 类引擎起不来或频繁崩溃。

③ 只有 ARM64,又不愿自建镜像。官方 Docker 不提供 ARM64 发行版。

④ 没有可用的 LLM 与 Embedding 服务。当前镜像依赖外部模型,空转不产生有效回答。

⑤ 把云体验当生产知识库。敏感文档应自托管,并自行加固端口与账号。

适合谁

适合要私有化文档问答、且材料里大量 PDF / 表格 / 扫描件的团队;能接受 Docker 与 16GB 级内存,并愿意调切片模板的知识库项目;需要 Agent 画布、引用溯源与 API 集成的产品组。

不适合:笔记本级资源演示;纯 ARM 且无构建能力;只想学 Java RAG 源码(那是 Ragent 一类项目的事)。

更新进度

100 期优质开源项目更新进度:024/100。欢迎在留言区交流你对 RAGFlow 切片模板与 Agent 编排的实践,或提名下一期想拆解的开源项目。

开源地址

GitHub:github.com/infiniflow/ragflow

官网:ragflow.io

云体验:cloud.ragflow.io

自托管默认:http://机器IP (端口 80)

获取更多精彩内容和优质开源项目

请关注微信公众号「IT开源项目精选」

每天早上 5 分钟,看懂一个值得收藏的开源项目

免责声明

1、本文所分享的软件、代码或资源,均来自开源社区,遵循其原始许可证(Apache-2.0)。仅供学习和研究使用,严禁用于任何违法行为。

2、使用者在下载、部署或使用本项目时,需自行判断其适用性与合法性,由此产生的一切风险与责任均由使用者自行承担。部署时请自行配置账号、网络与模型密钥。

3、本文数据(Star、Fork、版本号)来自 GitHub 公开信息,采集时间为 2026 年 9 月 20 日,项目迭代迅速,实际版本可能已更新。

4、本文配图来自项目仓库与官方文档素材,版权归原作者所有;本文不对开源软件的安全性、可用性或完整性做任何保证。

5、本文与项目作者无商业合作,所有观点基于公开资料得出;若您为相关资源的版权方并对内容有异议,请联系我们,我们将在第一时间处理。

相关学习资料