夜雨聆风学习资料网

ARTICLE · 1078220

如何用AI搭建企业知识库?工具清单 + 每步截图 + 总成本

如何用AI搭建企业知识库?工具清单 + 每步截图 + 总成本

文 / 兔八哥

大家好,我是八哥,一个AI深度玩家。从构思到落地成稿,花了一天,如果觉得有用,点个关注,支持一下!

废话不多说“今天给大家演示一下企业知识库。”

老板一句话,技术负责人脑子里可能已经冒出向量数据库、RAG、权限系统、文档解析、模型评测。会越开越大,方案越写越厚,两周以后还在比较技术架构。

但业务部门要的,往往只是一个更具体的结果:我问“980元办公用品谁审批”,系统能不能给出当前制度里的答案?能不能告诉我答案来自哪一份文件?两份制度打架时,它会不会装作没看见?资料里根本没写时,它敢不敢说不知道?

这次我先不做生产级RAG,而是用 Codex + Obsidian 搭一个单机验证版。6份虚构企业制度,5类测试问题,一处旧版、一处制度冲突、一个故意没有答案的问题。

先把最小闭环跑通,再决定值不值得做大。

本文中的公司制度全部为教学材料;操作与问答测试真实执行。它不是任何公司的制度建议,也不代表生产系统已经上线。

图1|本次使用的真实版本记录。价格和功能核对日期为2026年9月25日。

01 / 老板说“搞个知识库”,最容易一上来就做重了

企业知识库不是文件越多越好,也不是接上大模型就算完成。

第一版真正该回答的是:这批资料,能不能稳定支持一小组高频问题?

我给这个MVP定了四条验收线:

  1. 回答必须带文件名和章节,员工能回原文核对。
  2. 历史版本不能压过现行版本。
  3. 两份现行制度矛盾时,必须把矛盾摊开。
  4. 材料没有答案时,不许用常识补一个“合理答案”。

这四条比“回答得像不像人”重要。企业里真正贵的,不是机器人语气生硬,而是一句没有依据、却被当成制度执行的答案。

02 / 工具清单:先把两件事分开

这套验证版只用两个核心工具。

Obsidian负责存。 它把笔记保存在本地Markdown文件里。目录、版本、负责人和制度状态都能直接看,文件也不被锁在某个在线平台里。

Codex负责找、读和答。 把同一个文件夹设为本地项目后,它可以读取项目文件;根目录的 AGENTS.md 会成为持续生效的项目规则。

这里没有向量数据库,也没有先做文档切片。对几十份结构清晰的制度,先验证“来源是否可靠、问题是否真实”,比先买一整套技术栈更划算。

这不是说RAG没用。文档上千、问题表达变化很大、需要把多个系统接在一起时,向量检索、重排序和权限过滤都会变得重要。但在验证阶段,最常见的瓶颈不是“检索算法还不够先进”,而是制度没有版本、责任人不清楚、旧文件没人敢删、员工问的问题也没有被收集。

如果把这些脏资料原样塞进更复杂的系统,得到的只是一个检索速度更快的混乱仓库。模型能找到更多内容,不代表它更知道哪条应该执行。

所以第一批资料可以这样选:先找一个部门、一个明确主题、20—50份经常被问到的文件;再收集10—20个真实问题。不要先追求覆盖整个公司。只要第一轮能暴露出“哪些问题没有制度、哪些制度互相矛盾、哪些答案无法回到原文”,这个MVP就已经提供了经营价值。

图2|本地验证版结构图。Obsidian和Codex读取同一组Markdown文件。

03 / 第一步:先建一个能看懂的制度仓库

我建立了一个 知识库模板 文件夹,里面只有五个关键位置:

知识库模板/   raw/          6份模拟原始制度,只读   inbox/        冲突和知识缺口的待审核建议   tests/        测试题、标准答案和实际结果   index.md      制度目录、版本、生效日期   AGENTS.md     问答规则

(手机端可点击放大查看)图3|Obsidian真实操作截图:知识库根目录包含原始制度、测试、待审核区、索引和回答规则。

(手机端可点击放大查看)图4|Obsidian真实操作截图:在同一个索引页查看制度版本、状态、生效日期和负责人。

目录不需要一开始就分成二十层。第一版只要让人看得明白:原文在哪里,规则在哪里,测试在哪里,待处理的问题放哪里。

raw 最重要。它不是AI的草稿区,而是原始依据。问答过程中不允许覆盖、重命名或删除。发现制度问题,也只能先写进 inbox,等负责人确认。

这仍然只是工作规则,不是真正的权限锁。生产环境里还要用文件权限、账号权限和审计记录限制它。别把一句“不要修改”当成安全方案。

04 / 第二步:让文档自己说明“我是谁”

企业知识库经常答错,不一定是模型不够强,而是它看见两份同名制度,不知道哪份还有效。

所以每份制度开头至少保留六个字段:编号、版本、状态、生效日期、负责人、材料性质。

(手机端可点击放大查看)图5|Obsidian真实操作截图:V2.0现行制度的编号、状态、生效日期和负责人均写入文档。

这次我故意放了两份费用报销制度:

  • V1.0:1000元以下由直属主管审批,已经废止。
  • V2.0:500—3000元由部门负责人审批,当前生效。

如果系统只做关键词匹配,两份都可能被找到。只有把版本和状态写清楚,规则里再明确“现行优先于废止”,它才有机会给出可执行的答案。

真实企业导入资料时,先别急着全部上传。拿20—50份高频制度做第一批,逐份补齐负责人、状态和生效日期。整理这一步很慢,却比后面反复追错答案便宜。

05 / 第三步:用AGENTS.md把“怎么回答”写死

提示词如果只写“请准确回答”,几乎等于没写。

我把输出固定成四段:

  1. 直接答案
    :一到三句话,不绕。
  2. 适用条件
    :金额、人员、数据类型、时间和例外。
  3. 来源
    :文件路径、章节、短摘录。
  4. 冲突或缺失
    :没有就明确写没有,有就摊开。

(手机端可点击放大查看)图6|Obsidian真实操作截图:AGENTS.md固定阅读顺序和四段式回答格式。

(手机端可点击放大查看)图7|Obsidian真实操作截图:冲突处理、拒答边界和raw只读要求被写成项目规则。

另外再加三条底线:旧版只用于解释变化;材料不足时拒绝猜;一般制度与专项制度可以叠加,不能见到两份文件就误报冲突。

这份规则的价值,不是让一次回答更漂亮,而是让下一次新任务仍按同一标准工作。人离开当前对话,规则还留在项目里。

06 / 第四步:把同一个文件夹交给Codex

在Obsidian中打开 知识库模板,确认目录和文档能正常浏览。然后在Codex桌面端创建本地项目,把同一个文件夹设为主文件夹。

第一次别问“大而全”的问题,先发一条最小指令:

先读取 index.md 和 AGENTS.md,再回答:普通员工购买980元办公用品,需要谁审批?只读取,不修改文件。

如果在Windows环境遇到中文输出乱码,不要怀疑制度内容已经损坏。本文第一次测试就碰到了:PowerShell直接读文件时中文错显,切换为对UTF-8友好的文本检索后恢复正常。这个排障多花了约2分钟,我把它留在记录里。

真正的知识库项目,应该允许这些问题被看见。把报错裁掉,只留下“搭建成功”,对读者没有帮助。

(手机端可点击放大查看)图8|Codex真实操作截图:先核对根目录,再确认后续回答必须遵守版本、出处、冲突和只读规则。

07 / 第五步:别只测一个会回答的问题

正式回归一共5题,每题检查“答案、条件、来源、冲突或缺失”四项,总分20分。随后我又在Codex桌面端做了4组人工复核,把正常命中、版本识别、跨文档冲突和资料不足的完整回答保留下来。

第一组:先看正常问题能不能回到原文

我先问一线城市住宿标准。Codex回答每晚600元,同时补出展会、极端天气导致超标时需要价格证明,并由成本中心负责人确认。关键不是数字本身,而是每个结论后面都有同一份制度的章节和短摘录。

(手机端可点击放大查看)图9|Codex真实操作截图:直接答案、适用条件、文件路径和章节同时返回。

第二组:新旧版本不能混着用

接着问普通员工的办公用品报销门槛。Codex先从 index.md 确认V2.0为现行版本,再回答“达到500元需要部门负责人审批”,同时把V1.0的旧门槛列为版本差异,而不是执行依据。

(手机端可点击放大查看)图10|Codex真实操作截图:现行版本优先,废止版本只用于解释规则变化。

第三组:跨文档检查,还要分清限制与冲突

我又问:为了按时交付,能不能把包含客户个人信息的文件上传到个人网盘?系统同时读取客户交付制度和信息安全制度,先给出明确结论:常规“赶进度”不属于紧急故障,不能绕过事前审批,也不能使用未经批准的个人网盘。

它还进一步指出:如果真的是影响客户业务连续性的紧急故障,两份现行制度才会出现“24小时内补记录”和“必须事前书面批准”的冲突。这时不能由AI自行选边,必须交给制度负责人确认。

(手机端可点击放大查看)图11|Codex真实操作截图:两份制度被并列核对,日常限制与真正冲突没有混为一谈。

第四组:资料里没有答案

最后问婚假有几天、要提前多久申请。6份制度里没有员工休假或考勤制度,系统没有引用网络常识补答案,而是明确写出“现有资料无法确认”,并指出缺少哪些制度和字段。

(手机端可点击放大查看)图12|Codex真实操作截图:资料未覆盖婚假时明确拒答,没有编造天数。

正式一轮5题测试约90秒,最终得分20/20。这个分数只证明这6份模拟制度和5道已设计问题通过,不代表换成200份真实文件也能保持同样准确率。

下一步应该拿业务部门真实问过的问题做盲测,而不是继续给它出“知道答案的题”。

08 / 总成本:别只算订阅费

截至2026年9月25日,Obsidian本地使用可以是0美元;Commercial支持许可证是可选的50美元/人/年。Obsidian Sync年付4美元/人/月、月付5美元/人/月,但单机MVP不需要。

Codex可以从Free轻量体验开始,但开放范围和用量会受账号影响。单人稳定使用可以按Plus 20美元/月做预算。两人Business试点,年付最低40美元/月,月付最低50美元/月。

…图13|软件费只是第一层,资料整理和持续维护通常更贵。

这次演示里,已有账号的新增软件费是0。但不能因此写“企业知识库0元搭好”。

真正的总成本至少有三层:

  • 软件费:账号、同步和可选许可证。
  • 一次性整理:挑文档、标版本、补负责人、做测试题。
  • 持续维护:制度更新、旧版废止、冲突确认、答案抽查。

本文的5题正式回归约90秒,首次编码排障约2分钟。模拟制度本身是在文章制作过程中编写的,不能拿来冒充企业真实资料整理工时。

如果你要在公司做第一轮,我建议先给20—50份文档留出60—90分钟的整理和验证预算;每周再预留30—60分钟做维护。这是试点预算,不是已经测出的提效结论。连续记录四周,再决定要不要加人、加系统。

09 / 出现这些情况,就别再硬撑MVP

Codex + Obsidian适合验证问题,不等于它能替代正式企业系统。

出现下面任一情况,就该评估更完整的RAG、权限和服务架构:

  • 多部门同时使用,而且不同人只能看不同资料。
  • 文档达到数千份,格式复杂、更新频繁,简单文件检索开始漏项。
  • 需要统一入口、账号体系、SSO、审计日志和使用统计。
  • 答错一次就可能造成合规、财务或客户数据风险。
  • 需要把答案嵌入客服、OA、企业微信或其他业务系统。

这时需要的已经不是“再写一段提示词”,而是文档解析、索引、权限过滤、评测集、监控和人工兜底。

但如果连哪20份资料最值得先接、员工最常问什么、什么叫答对都没定义,上生产级架构只是把不确定性做得更贵。

先用一个下午证明它能解决一组真实问题。答得对、找得到、说得清,再扩大。

我把这次实测使用的6份模拟制度、目录模板、AGENTS规则、5道测试题、标准答案和成本表整理成了一个可直接打开的模板包。

回复「知识库」,领取《企业知识库问答模板包》。

兔八哥 · AI经营实验室

把AI用进业务,把效果算清楚。


资料核对日期:2026年9月25日。Codex本地项目、AGENTS.md与价格参考OpenAI官方文档;Obsidian价格参考其官方定价页。产品功能、价格和账号可用范围可能调整,以官方页面与实际账号为准。

相关学习资料