ARTICLE · 1089229
腾讯开源的 WeKnora,把你吃灰的文档变成一个能问的"公司大脑"
先说个场景。你入职新公司第三天,想知道报销流程走哪个系统。问老同事,他说"文档里有的";你去翻,飞书一份、Confluence 一份、群里还有一份半年前的旧版。没人知道哪份是对的。
这就是知识管理平台想解决的事。腾讯去年开源了一个项目叫 WeKnora,GitHub 上现在有三万来颗星,Go 语言写的,MIT 协议。我花了一天把它 README 啃完,用大白话给你讲讲。
一句话:你把手头的文档都丢给它,它喂给大模型,之后你就能像聊天一样查资料、问问题,还能让它替你干活。
技术圈管这套东西叫 RAG(检索增强生成)。名字听着唬人,原理特别朴素:大模型本身没读过你们公司的内部文档,直接问它肯定瞎编。所以先去文档库里搜出相关的几段,塞给模型,让它"开卷作答"。WeKnora 就是把开卷这件事做了个完整的平台,而且答案会标注出处,方便你核查它有没有胡说。
不过 WeKnora 没打算只做一个问答框。它在同一套知识库上叠了三种用法。
① 问答模式
上传 PDF、Word、Excel、PPT 甚至 XMind 脑图,它会切片、建索引。你问一句"客户投诉的处理时限是多久",它检索原文后用自然语言回答,并附上引用了哪份文档第几段。
② 智能体模式
不只是回答,还会分步骤执行任务:查资料、读文档、上网搜、跑代码,甚至操纵你电脑上的 Chrome 浏览器帮你点页面。遇到登录验证码这类事,会停下来交还给人。
③ Wiki 模式
它自己读你的文档,生成一篇篇互相链接的维基页面,还能画出知识图谱。改错了可以回滚。等于给散乱的资料自动做了一次整理收纳。
整个链路画出来其实就五步:
检索那一步值得多说两句。纯语义搜索有个毛病:你搜一个精确的型号或者人名,它可能给你找一堆"意思接近但不是"的东西。WeKnora 用关键词和向量两路一起搜,再重排序,这是现在开源知识库的主流做法。它还支持父子分块,就是给模型看小片段保证精准,但回答时能带出上下文整段,两头兼顾。
数据源同步很全。飞书知识库、Confluence、GitLab、Notion、语雀、钉钉文档、RSS,配上自动同步。国内团队的资料基本都在这些地方躺过,这个清单明显是照着中国企业的习惯抄的。
什么模型、什么数据库都不锁死。内置对接 27 家模型厂商,OpenAI、DeepSeek、通义、混元、本地跑一个 Ollama 都行;向量库支持 pgvector、Milvus、Elasticsearch 等七八种。今天用 A 家模型,明天想换,不用推倒重来。Go 写的,可以打包成单个二进制文件在低配机器上跑。
权限是认真做的。多工作区、四种角色、按资源的归属控制、审计日志、API key 加密存储。这是奔着企业采购去的配置,不是玩具。
对了,它还有个内置 MCP 服务。听不懂没关系,你只要知道:接入之后,Cursor、Claude Desktop 这类 AI 编程工具可以直接把你的公司知识库当资料库查。程序员群体应该会喜欢这条。
适合:文档量大又没人管的团队;数据不能出境、不能给第三方 SaaS 的公司(它支持私有化部署,数据全留在自己环境里);以及想给客服机器人、内部助手找底座的技术团队。
不适合的也得说实话。它不是装完就能躺着用的东西:你得自备大模型的 key 或者本地算力,解析上千份旧文档要钱也要时间,效果好不好很大程度取决于你的文档本身质量。垃圾进去就是垃圾出来,这条对所有 RAG 产品都成立。还有,智能体模式能操作你浏览器、能在沙箱里执行代码,权限给多大需要提前想清楚。
目前版本 v0.8.2,迭代很快,几乎每个月都有大更新。项目主页在 github.com/Tencent/WeKnora,Docker 一条命令就能起个试用环境。
回到开头那个报销流程的问题。用 WeKnora 之后的世界应该是这样:新人在企业微信里问一句"报销走哪个系统",机器人把现行有效的那份文档翻出来,给出答案,顺便告诉你这是行政部 8 月更新的版本。就为这个,值得花半小时把它部署起来试试。