先不谈 AI,聊聊你身边的事。
你公司的 CRM 系统里存了一份客户数据,ERP 里也有一份,客服系统里还有一份。IT 部门做了 ETL,数据能跑了,报表能出了。看起来打通了,对吧?
问题是:CRM 里的「客户」是销售在跟的人,ERP 里的「客户」是收款的抬头,客服系统里的「客户」是提工单的人。三张表里的 customer_id 能关联起来,但「客户」这个概念本身,在三套系统里的含义不一样。
这导致什么?你拉一张报表,想算「客户的全生命周期价值」。开发写了两周的 SQL,最后发现 CRM 里的一个客户对应 ERP 里三个不同的账户,因为有个子公司走了不同的结算主体。没人提前告诉你这个——因为这条规则活在一个财务主管的脑子里。
数据打通了,知识没打通。而且随着系统越来越多、换的人越来越多,这种「隐藏规则」只会越积越多,越来越没人说得清。
人走了,理解也跟着走了
我认识一个做供应链的朋友,他们公司有个干了十二年的技术总监,去年离职了。
走之前,他把所有交接文档写得整整齐齐:架构图、接口说明、数据库 schema、运维手册。三周交接期,该讲的都讲了。
结果他走后第二个月,一个补货算法出了 bug。新团队翻了三天文档,找不到根因。最后还是在钉钉历史记录里翻到三年前的一条聊天记录,才发现那位总监当年手工修了一个数据映射——因为上游供应商的系统里「商品编码」和公司自己的「SKU」之间,有27个特例不是一一对应的,而是一个编码拆成两个 SKU,取决于入库批次。
这个规则从来没有被写进任何系统。它活在一个人的判断里。人一走,这个规则就消失了。
你说这是管理问题还是技术问题?都是。但关键在于:这些业务规则,我们有没有办法在它们还活着的时候,把它们从人脑中提取出来,变成系统自己能理解的东西?

本体论,到底是个什么东西
说实话,我第一次听到「本体论」这三个字的时候,也觉得这是哲学系的人在搞事情。后来才发现,计算机科学里的本体论其实是个特别接地气的想法——
它就是把业务中那些「默认大家都知道」的规则,写成计算机也能读懂的格式。
具体说三件事就够了:
1. 这世界上有哪些东西?(客户、订单、产品、合同、仓库……) 2. 每样东西有哪些特征?(客户有信用等级、订单有金额和时间、产品有库存阈值……) 3. 这些东西之间是什么关系?(客户下订单、订单包含产品、产品存放在仓库……)
听起来很像数据库设计?对,但比数据库多走一步。
数据库知道 orders.user_id 连接到了 users.id,但它不知道这层连接在现实世界里意味着什么——是「这个人下了这个单」还是「这个人审批了这个单」还是「这个人只是抄送了这个单」?对于计算机来说,这些都是一个外键约束,没有区别。
本体论就是要把这个区别说出来。而且不止说「是什么关系」,还要说「什么情况下可以创建、什么情况下不允许、什么情况下要触发什么动作」。

举个例子。你给系统定义了一条规则:「如果一个客户的信用等级是'黑名单',不能创建新订单。」
数据库不会自动帮你做这个。你得在代码里写——每个涉及订单创建的地方都要写。哪天换了一套下单系统,这条规则就漏掉了。
本体论的做法是:这条规则跟着「客户」和「订单」这两个概念走,不管上层是谁在调用,只要经过这一层,规则自动生效。
为什么偏偏是现在
你可能会问:这东西听起来挺有道理的,但也没见多少公司在用啊?
因为以前没有非要用的理由。
二十年前 Semantic Web 社区就在推 OWL、RDF 这套东西了,推了二十年,始终是「重要但不紧急」。就像你知道房子应该做抗震加固——应该,但不做也不会影响今天住。
但有两件事正在改变这个局面。
第一件事:LLM 让数据变「活」了,也变「乱」了
过去企业处理数据,重点是结构化数据——数据库里的表、接口字段、报表指标。那些躺在邮件、文档、聊天记录里的非结构化数据,基本是死的——你想用,但处理成本太高。
现在 LLM 让这些数据活过来了。机器真的能「读懂」一段合同条款、一封客服邮件、一条工单备注。
但问题来了:当机器开始大规模理解人类语言,语义不一致的代价就不是「报表对不上」了。
想象一个 Agent 从客服记录里提取了一个叫「张三」的客户,又从合同系统里提取了一个叫「张三」的客户。如果它不知道这是同一个人,可能就做出完全矛盾的决策——比如一边给这个人发催款通知,一边给他批新的授信额度。
这不是危言耸听,这是已经在发生的事情。
第二件事:Agent 不能靠「猜」
LLM 是回答问题,Agent 是做事情。区别很大。
你让一个 Agent「帮我把库存低于阈值的商品补货」,它需要知道的不是一段话,而是一个完整的动作模型:
• 什么算「商品」?什么算「库存」?阈值是谁定的? • 补货这个动作的前置条件有哪些?执行完以后,哪些系统的数据会变? • 什么情况下不能补货?比如供应商已经停止合作了,或者这个商品正在质检中?
这些信息如果不提前定义好,Agent 就是在猜。猜对了大家都开心,猜错了呢?
Palantir 的 AIP 平台干了一件事:把 Ontology 做成 Agent 的「世界模型」。Agent 不是凭空推理,而是在一个预定义好的语义世界里行动——知道什么东西存在、什么东西不能做、每一步会触发什么后果。
本质上就是给 Agent 装了一个「物理引擎」。
少了那一层
回到开头那三个问题:大模型幻觉、企业数据孤岛、知识无法沉淀。
它们的共同点是:我们缺少一层东西,让计算机不只是存储和传输数据,而是真正理解数据之间的关系和规则。
数据库给了存储。API 给了连接。LLM 给了对自然语言的理解。
但在数据和智能之间,有一层是空的。本体论就是填这一层的东西。
它不存数据,不传数据,也不做预测。它就是告诉上层:你面前这些东西是什么、它们之间怎么关联、什么能做、什么不能做。

以前这一层可以没有。以后,是不能没有。
夜雨聆风