大模型不是魔法,它需要一个好的知识底座。结构化数据、文档知识库、向量库——这三者构成了企业AI的三大支柱。一个存数字、一个存文字、一个存语义。搞懂它们的区别和协作方式,你就搞懂了企业AI应用的地基。
一、同一个问题,三种存储方式
设想你的公司要上一个AI助手。员工会问它各种问题:
- "今年三季度的销售额是多少?"
- "公司的报销流程是什么?"
- "有没有什么办法能降低客户流失?"
这三个问题,背后需要三种完全不同的数据支撑。第一个是精确数字,第二个是制度文件,第三个是语义理解。而这三种需求,恰好对应了企业知识管理的三大支柱:结构化数据、文档知识库、向量库。
二、结构化数据:精确的数字世界
结构化数据,就是那些字段清晰、格式统一的数据——订单号、金额、日期、库存量。它们住在关系型数据库(如MySQL、PostgreSQL)或Excel表格里,遵循严格的表结构。
结构化数据的核心优势是精确。你问"3月的销售额",SQL一条查询语句就能返回一个精确到小数点后两位的数字,分毫不差。
但它也有致命的局限:它无法理解模糊的自然语言。你问"最近生意怎么样",结构化数据会茫然无措——因为它不知道"生意"指的是销售额、利润还是订单数,也不知道"最近"是三天、一周还是一个月。
一句话总结:结构化数据擅长回答"是什么",不擅长回答"像什么"。
三、文档知识库:自由的文字世界
文档知识库存储的是非结构化文本——PDF、Word、网页、会议纪要、产品手册。它们没有固定的字段,没有统一的格式,但承载了一个组织绝大部分的知识。
文档库的核心价值是知识沉淀。一家公司的制度、流程、经验、教训,大多以文档的形式存在。传统的文档库支持全文检索——输入关键词,找到包含这些词的文件。
但全文检索有个痛点:它匹配的是"字面",而不是"意思"。你搜"怎么退换货",它只会返回包含"退换货"三个字的文档;如果文档里写的是"无理由退货流程",关键词检索就抓瞎了。
四、向量库:理解语义的世界
这就引出了第三种存储——向量库(Vector Database)。
向量库的核心是Embedding(向量嵌入):把一段文字转换成一串数字(一个高维向量),这个向量编码了文字的"含义"。语义相近的句子,在向量空间里距离就近;语义无关的句子,距离就远。
于是"如何降低客户流失"和"怎样提高客户留存率",虽然字面完全不同,但在向量库里它们距离很近——因为意思一样。这就是语义搜索的威力:它找的是"意思",不是"关键词"。
向量库的局限也很明显:它不可解释(你无法知道为什么这两段文本被判定为相似),也无法做精确计算(你不可能用向量算出"3月销售额"这个具体数字)。

五、大模型时代:三者如何协同(RAG)
当大模型(LLM)加入进来,三者开始协同工作,这就是现在最火的RAG(检索增强生成,Retrieval-Augmented Generation)架构。
RAG的工作流程是:用户提问 → 向量检索找到最相关的内容 → 把检索结果拼接到提示词里 → 大模型基于这些"课本"生成回答。
在这个流程里,三者各司其职:
- 结构化数据是精确事实的提供者。大模型天生不擅长算术,把"销售额是多少"这类问题交给SQL精确查询,能有效防止大模型"一本正经地胡说八道"。
- 文档知识库是知识的原始载体。制度、报告、手册被切块、索引,成为大模型回答问题的"课本"。
- 向量库是语义检索的引擎。它把问题变成向量,从海量文档中找出语义最相关的段落,充当大模型的"记忆"。
没有RAG的大模型,只能靠训练时记住的知识回答,容易过时、容易幻觉;有了RAG,大模型可以实时检索企业自己的知识,回答更准确、更可信。

六、怎么选:一个实用决策指南
最后给一个实用的选型指南:
- 要精确数字、统计 → 用结构化数据 + SQL。比如"今年增长了多少""哪个产品销量最高"。
- 要找制度、文件、手册 → 用文档知识库 + 全文检索。比如"报销流程是什么""试用期怎么转正"。
- 要理解意图、语义相似 → 用向量库 + 语义搜索。比如"怎么解决客户投诉""有没有类似的成功案例"。
但请注意:三者不是竞争关系,而是互补关系。一个成熟的企业AI系统,往往三者都用。结构化数据保证精确,文档库保证知识全面,向量库保证语义理解。只有把它们组合起来,才能真正释放大模型的能力。
一句话记住今天的内容:结构化数据回答"是什么",文档库回答"有什么",向量库回答"像什么"。搞懂这三句话,你就掌握了大模型时代企业知识管理的地基。
小蜗牛Shaw
夜雨聆风