推荐阅读:
大家好!我是老码!
我电脑里堆了不少合同、财报、产品手册,还有一堆扫描件。想问它们点事,普通的那几个 RAG 工具基本都翻车:双栏排版的 PDF 读串行,合并单元格的表格直接丢,扫描合同更是当没看见。问出来的答案驴唇不对马嘴,还不如自己翻。
后来用了 RAGFlow,这情况才算解决。它主打的就是"深度文档理解",专门收拾这种复杂格式。

它底下有个叫 DeepDoc 的解析引擎,不是简单把文字抠出来就完事。它会自动分清标题、正文、表格、图片、脚注,把原版的版面逻辑还原出来。像财报、招投标文档里那些合并单元格、多行表头,它都能认对;扫描的合同、影印资料走 OCR 也能读;PPT、Word、图片、网页统统能吃进去。
我试过一份带大量表格的产品手册,别的工具吐出来的内容表格全乱,RAGFlow 还原得基本没跑偏,这点是真加分。

切片方式也很讲道理。它给了一二十种行业模板,合同、论文、简历、财报各自一套规则,上传时按文件类型套上就行。最让我舒服的是切片过程可视化,每一段边界都看得见,回答效果不行的时候能手动调,不用像黑盒那样瞎猜到底是分块错了还是检索错了。

回答不是干巴巴一段话。每条结论都带着原文引用的快照,点一下能跳回对应的文件、页码和段落。对法务、审计这种"说的每句话都得有出处"的场景,这几乎是刚需,也顺手把 AI 瞎编的风险压下去一大截。

检索是混合着的:向量检索加 BM25 关键词再加一层重排序,多路召回一起算。纯向量检索碰到专业名词和编号经常扑空,关键词补一刀就稳很多。它还能接联网搜索,凑成类似 Deep Research 的那种深究能力,问外头的事也行。

最合我意的是它能纯私有化。一条 docker compose 拉起来,所有数据留在自己内网,不外传。国产大模型也原生兼容,DeepSeek、通义千问、Kimi 直接接;还能嵌进钉钉、企业微信、飞书,同事在聊天框里就能问内部资料。
不过它比前面聊的工具吃资源。官方给的最低配置是 CPU 4 核以上、内存 16GB 起、磁盘 50GB 以上。家里那台小 NUC 跑着有点喘,我是丢在一台内存大点的机器上,倒是顺。
如果你也攒了一堆文档想随时问、又不想把内容交给别人家的云,RAGFlow 值得一试。免费、开源(Apache 2.0 协议,能商用),复杂格式这一关它确实比大多数开源 RAG 靠谱。
地址:github.com/infiniflow/ragflow
往期推荐:
夜雨聆风