ARTICLE · 1036521
别再只拿 AI“问 PDF”了:知识库开始自己整理自己
今天 WeKnora 在 GitHub Trending 上单日新增约 1201 Stars,仓库总 Star 已经在 2.5 万左右。它现在的官方定位也已经不只是 RAG,而是把原始文档变成可查询的 RAG、可自主推理的 Agent,以及可持续维护的 Wiki。 最近 GitHub 上有个项目涨得挺快,叫 WeKnora。它是腾讯开源的知识库项目。 如果只看名字和介绍,很容易把它理解成又一个 RAG:扔进去 PDF、Word、网页,然后问问题,AI 从资料里找答案。这套东西我们已经很熟了,所以刚看到 WeKnora 的时候,我其实没太在意。 直到我注意到它最近新加的一个模式:Wiki Mode。 这时候事情开始有点不一样了。 过去我们做知识库,核心问题一直是:“我问一个问题,它能不能从文档里把正确答案找出来?” WeKnora 现在往前多走了一步:能不能先让 Agent 把这一堆乱七八糟的资料,自己整理成一套结构化知识? 这可能比“再把 RAG 准确率提高一点”更值得聊。
传统 RAG 的思路其实不复杂。你扔进去一堆文件,系统先把文件拆成很多小段,也就是 Chunk,然后建立向量索引。你问问题的时候,它从这些片段里找出最相关的几段,再交给大模型回答。大概就是: TRADITIONAL RAG PDF / Word / 网页 ↓ 分块 ↓ 索引 ↓你问一个问题 ↓ 找几个相关片段 ↓ 大模型回答 WeKnora 本身当然也做这些。它支持向量检索、BM25 关键词检索、Rerank,还可以选 GraphRAG;文档侧则支持 PDF、Word、Markdown、Excel、PPT、网页等多种来源,官方现在还支持飞书、Notion、语雀、GitLab、RSS 等数据源同步。 但传统 RAG 有个问题:它很会“找”,但不一定会“整理”。 你扔进去 100 份资料,系统知道这些资料在哪,也能检索,但对人来说,它们依然可能是 100 个文件、3000 个 Chunk、一堆彼此之间没什么表面关系的片段。知识其实还没有真正被“组织起来”。
WeKnora 的 Wiki Mode 做的事情,就是把这一步补上。 Agent 会从原始文档里抽取主题、实体和概念,然后生成一组结构化的 Markdown Wiki 页面。这些页面不是完全独立的,它们之间还会互相链接。比如你丢进去的是公司内部资料,原本可能是产品说明.pdf、会议纪要.docx、销售手册.pdf、技术方案.md、客户案例.pptx,Wiki Mode 想把它重新变成: WIKI STRUCTURE 产品 A├─ 功能├─ 技术架构├─ 定价├─ 客户案例└─ 常见问题客户 B├─ 使用产品├─ 项目时间线└─ 历史会议记录 然后这些页面之间继续互相引用。WeKnora 还会把这些链接关系可视化成知识图谱。官方文档里,Wiki 页面本身有固定 slug,页面之间的入链、出链也会被维护;文档重新处理后,系统还会尽量复用已有页面,而不是每次重新生成一套。 这个变化看起来只是“多了一个 Wiki”,但我觉得它背后真正有意思的是:知识库开始从“搜索资料”,走向“维护知识结构”。
这里很容易混淆。现在很多 AI 工具已经可以上传 PDF、生成摘要、自动做笔记,甚至给你画脑图。那 WeKnora 有什么区别? 我觉得关键在两个字:持续。 一次性的 AI 总结更像这样:给我一篇论文,总结一下,生成结果,结束。Wiki 的思路不是做完就结束。页面可以继续被编辑,有版本历史,可以看 Diff,改坏了还能一键回滚。如果知识源发生变化,Wiki 也可以重新生成和维护相关页面。官方还给 Chunk 本身做了编辑和版本管理,也就是说不只是最终回答可以改,底层进入检索的数据也可以被人工修正。 这点其实很像软件工程。代码不是“生成一次就完事”,而是有版本、有历史、有变更、有回滚。现在知识库也开始往这个方向走了。
WeKnora 现在其实有两种很不一样的工作方式。一种叫 Quick Answer,这还是我们熟悉的 RAG:搜知识库,然后回答。另一种是 ReAct Agent,Agent 可以自己决定下一步干什么:查知识库、调用 MCP、使用 Skill、搜索网页,甚至进入沙箱执行任务。官方已经把这两种模式直接区分成 KNOWLEDGE BASE × AGENT 过去:知识库被人查询 现在:知识库被 Agent 使用 → 查资料 → 判断 → 调用工具 → 继续处理 所以你可以把它理解成:过去是知识库被人查询;现在知识库被 Agent 使用,Agent 查资料、判断、调用工具、继续处理。 这时候,知识库的角色就变了。以前它更像公司里的一个搜索框,以后它可能更像 Agent 的长期记忆和工作底座。
企业知识库当然是它最直接的场景,但我觉得学生和个人用户反而也挺容易理解。 比如一个研究生,电脑里可能有几百篇论文、导师发的 Word、自己的实验记录、组会 PPT、代码说明、之前整理过的 Markdown。如果只是 RAG,你可以问:“之前哪篇文章提到过这个方法?”这已经挺方便了。但如果 Wiki 做得足够好,你打开的可能直接就是: PERSONAL RESEARCH WIKI 我的研究方向├─ 动力松弛法│ ├─ 基本原理│ ├─ 经典论文│ ├─ 参数控制│ └─ 当前问题│├─ ADR│ ├─ 经典方法│ └─ 与 DRM 的区别│└─ 实验记录 ├─ R1 ├─ R2 └─ 当前结论 而这些内容不是你一个晚上手搓出来的,是 Agent 从资料里不断整理出来的。这时候“知识库”三个字才开始变得比较像知识库,而不是 一个装了很多 PDF 的聊天机器人。
这部分我觉得必须讲。WeKnora 现在的 Wiki Mode 还不能理解成:你把公司所有资料扔进去,它就自动生成一个百分百准确、永久不用管的知识图谱。没有这么简单。 最近 GitHub 上就有人反馈,混合搜索里 Wiki 链接有时候会缺失或者不稳定;还有用户发现,虽然 WeKnora 已经有 Wiki 图 API,但目前 MCP 暴露出来的 Wiki 工具还没有覆盖完整的图端点。也就是说,Wiki、RAG、Graph 和 Agent 之间的连接现在仍然在继续完善。 另外,知识图谱也不是免费来的。官方配置里明确写了,启用 Neo4j 图谱后,构建阶段需要调用大模型,耗时会更长。
所以我觉得更准确的说法应该是:AI 开始参与知识整理。 而不是:AI 已经彻底接管知识管理。 两者差得挺远。 FINAL NOTE 最后 前几年我们做个人知识库的时候,最流行的一句话是:“把所有资料放进去,然后和它聊天。”那个阶段解决的是:资料太多,我找不到。RAG 给出的答案是:我帮你找。 但当文件越来越多以后,下一个问题又出现了:找得到是一回事,这些东西到底是什么关系? WeKnora 现在给出的一个方向是:先让 Agent 把这些资料重新组织起来。 从文件,到 Chunk,到 Wiki 页面,到页面之间的关系,再到可以调用这些知识完成任务的 Agent。 仔细想想,这条路线其实和最近很多 Agent 产品是一样的。AI 不再只是等你提问,它开始参与整理环境。Hypit 在整理视频工作流,OpenResearch 在整理科研实验,WeKnora 开始整理知识。 所以我觉得 WeKnora 真正值得关注的,不只是它今天又涨了多少 Star,而是一个更长期的问题:以后我们还需要自己维护文件夹、笔记目录和知识分类吗? 还是只负责把资料不断丢进去,然后让 Agent 去维护那张不断生长的“知识地图”? 如果真走到这一步,RAG 可能就不再只是一个搜索技术了。它会慢慢变成:Agent 的知识操作系统。 这件事,我觉得值得继续看。 RAG 不再只是“帮你找” 它正在尝试成为 Agent 的知识操作系统 AI突围局 用 AI 破局学习与工作 |