乐于分享
好东西不私藏

AI数据治理,交通行业难在哪里?(华为新书解读续二)

AI数据治理,交通行业难在哪里?(华为新书解读续二)

最近读了一本书,叫《本体驱动的AI数据管理》。作者是华为搞数字化转型和AI实践的那拨人,讲的是AI时代企业数据治理该怎么做。书里有句话我看了很久没挪开眼。

它说,数据治理服务的主体,正在从人,变成AI。

这句话看着平淡,细想却有点心惊。因为它意味着,过去几十年我们搭起来那一整套管数据的思路,地基得重打。

我一边读一边想,这不就是交通行业这些年AI落地难的那个根子么。

智慧交通,智慧高速,车路云,喊了多少年了。大屏上数据在跳,AI的框框在闪,看起来AI早就用上了。可真问一句,这些AI有几个是真的在干活,而不是在当一块会说话的大屏?说不上来。

以前我以为,是AI不行。读完这本书我反应过来,不全是AI的事。是我们给数据的方式,还停留在给人看的时代。

【数据到底是给谁看的】

先问个最底层的问题。一份交通数据,一张图纸,以前是给谁看的?

给人看的。

人拿到一份流量数据,能看懂,能判断,能在此基础上做决策。数据治理做的,就是把数据管好,保证准确,保证完整,让人用的时候不掉链子。

这套逻辑,在人的世界里一直成立。因为它默认一件事,那就是看数据的人,自己脑子里装着业务逻辑。

数据只告诉你这条路今天的车流是多少。为什么是这样,是天气影响,是修路分流,是这个时段本来就这样,这些数据里没有。它们在人脑子里。

人没问题。人会脑补。会联想。能自动补全数据背后那套原因。

可AI不行。

AI拿到这份数据,看到的就是一串数字,一堆图层。它不会脑补,不会联想,不会想到数字背后还有一整套动态的业务逻辑。

问题就出在这。传统数据治理记的是事实,是给会思考的人看的。而AI要的,是能支撑它自己判断和行动的东西。

这个断层,作者打了个底,说本质就是数据消费的主体,从人搬到了AI身上。

对人,数据治理只需要确保数据准确可用。对AI,数据治理必须指导它正确认知业务本质。这是两码事。

交通的AI越做越觉得隔靴搔痒,根子多半在这。我们还在用给人看数据的方式,喂一个要自己干活的机器。

【AI要求数据治理干四件事】

既然服务对象变了,那数据治理要干的事,自然也就变了。作者掰着手指头,列了四件。

第一件,喂得进。

大模型很强,强在通识。可它不知道企业私有的那些知识,业务规则,隐性经验,动态数据,这些它一概内化不了。直接重新训练一个大模型,又贵又危险,尤其是有保密要求的。

交通行业这例子太好举了。就说设计院,手里一堆地形图,电子图,涉密等级高,谁敢拿去喂大模型。可这些又恰恰是最值钱的资产。

解法不是硬喂,是外挂。把大模型的通用能力,和设计院本地的专属知识,拆开。模型不动,让通用大模型专心干语言的活。把设计院的图纸、规范、历史方案,做成一个本院的知识层,从外面接进去,实时注入。

这么干,每一张图纸都不用离开设计院,保密问题从根上解决了。模型从来就没碰过你的原始图纸。而且项目做完一个,更新一下知识层就行,不用重新折腾模型。

这个模式,作者说得特别妙。数据不入模型,模型反而更懂你。放到保密要求高的交通工程上,简直是量身定做的解法。

第二件,读得懂。

喂得进去还不行,还得让AI读得懂。这句话背后,是交通行业一个特别真实的坑。

搞AI落地的设计院都会碰到一件事,AI读不懂CAD的图层。每个画图的人,图层怎么起名,标识什么含义,基本是个人习惯。同一个道路中线,有人放在DL层,有人放进ZX层。图层名不叫标准,叫人名。

图纸是给人看的,人看到图层名会心领神会,就算乱成一锅粥,工程师也能凭经验猜个八九不离十。可AI没这本事。对AI来说,DL和ZX没有任何区别,就是两个没人告诉它含义的字母。

这就是书里说的双重割裂。一层是物理孤岛,数据散在各专业各系统,道路归道路,桥涵归桥涵,从没想过打通。一层是语义孤岛,同一个概念,不同专业理解都不一样。同一个边坡,道路专业一个说法,岩土专业又另一个说法。

对人,经验能自动补缝。对AI,这就是一个被切碎、缺逻辑的世界。它不是在理解,是在一堆它不理解的图层里机械复制。

AI画出来的东西看着像那么回事,实际一塌糊涂。不是AI笨,是没人把图纸翻译成AI听得懂的语言。图纸可读,但不可计算。这是交通的AI落地,最容易被忽略的一步。

第三件,守规矩。

就算AI看懂了,还有个更关键的事,得让它守规矩。

交通是个容错率极低的行业。一座桥,一条路,一个信号方案,承载的是人的安全。错一个数字可能就是大事故。所以每个方案都要过一套硬规矩,设计规范,安全系数,审查红线,一条条全是硬杠杠。

可AI天生是自由奔放的。它擅长自主规划,自己想办法,这是优点也是隐患。它可能觉得某个方案在逻辑上很合理,但放到交通的业务规则里,早就越界了。

能力越强的AI,在错误方向上造成的破坏就越大。这话听着吓人,但从事交通的人心里都清楚,这就是实情。

那怎么办。不是把AI手脚绑起来。而是要把交通这套守了几十年的规矩,变成AI的行动边界。把设计规范,安全红线,变成机器能理解的规则,在AI做决策之前就告诉它哪些能做,哪些不能做。让它的每一次自主,都发生在这套规矩的框架内。

交通要的,不是一个能自由发挥的天才,是一个懂规矩又有个性的工程师。

第四件,靠得住。

最后这件,讲的就是AI的可靠。

很多AI看着聪明,其实靠不住。它给一个方案,逻辑好像对,数字好像也合理,挺像那么回事。可实际上,可能早就偏离了真实状态和规范约束。

这种看似正确的错误最危险。因为不容易被发现。人一看觉得有道理就采纳了,一深入,全盘皆输。

根源在于,AI天生追求最可能的回答,而不是最正确的回答。它擅长编出一个听起来合理的答案,但交通要的,是那个真正正确的答案。这两者,是两回事。

怎么治。不是去堆更强大的模型,而是给AI配一把现实标尺。AI出一个方案,马上拿真实数据,拿规范,拿业务流程,去做对比。一旦不对,立刻叫停重来。从机制上约束它,不让它自由发挥。

数据治理的价值,从来不是让AI更聪明,而是让AI更可靠。交通敢不敢把核心工作交给AI,就看它靠不靠得住。

【数据治理自己也在变】

服务对象变了,AI要干的事变了,那数据治理这一套东西,也得跟着变。

作者把这种变化,总结成四次转变。

第一,从面向人,转向面向AI。以前数据是给人做分析决策的,现在是给AI做判断执行的。第二,从堆功能,转向融合认知。以前是多装点系统多堆点功能,现在得让AI和业务真正拧成一股绳。第三,从管事实,转向管事理和行动。以前记结果就行,现在得管逻辑,管为什么这么做,管下一步怎么走。第四,从管数据,转向像管数据一样管知识。设计规范,专家经验,这些以前没人当数据管,现在得管起来了。

这四转,说白了就是一件事。数据治理,从围着人转,变成围着AI转,围着业务本身转。

过去数据部门守着机房的服务器,守着报表,觉得数据治理就是管数据。现在不行了,得管到设计规范、专家经验这些以前够不着的角落去。

【难在哪】

道理都通了,可为什么推不动。作者也说了,难,而且特别难。

第一,静态变动态。数据是死的,业务是活的决策。让AI面对不断变化的实况,而不是背一份静态报表,这一步难。

第二,确定性和创造力打架。既要AI敢创新,敢提新方案,又不许它破规矩。这个边界,划紧了扼杀创造力,划松了出事故,难。

第三,规模异构。交通的数据最杂,视频,传感器,GPS,票务,地形图,格式五花八门。数据越多,AI能用的高质量东西反而越少,难。

第四,也是压箱底的最难,知识体系。交通的规范,应急预案,标准图集,都是写给工程师看的,AI可读不可用。而那些老专家脑子里最值钱的经验,为什么这条路要避开这片地,为什么这个节点这么定,压根没人写下来。AI想学,也无处可学。

图纸能数字化,但经验很难。而交通的看家本领,恰恰就藏在这些说不太清楚的老专家经验里。

【交通为什么是最典型的样本】

这本书讲的虽然是企业数据治理,但我越读越觉得,交通简直是它那个道理最典型的样本。

因为交通占齐了所有hard模式的点。容错率极低,错了就是人命。数据极度异构,从传感器到地形图什么都有。知识高度依赖老专家经验,一代一代靠师徒传下来。保密要求高,涉密数据一堆。

别的行业或许还能用AI凑合着锦上添花,交通不行。交通的AI要么真正顶上去,要么别碰。

反过来,正因为这么难,交通才最值得啃。要是能把交通这块硬骨头啃下来,让AI真正进了交通的核心业务,那一套数据治理的功夫,放到什么行业都降维打击。

【回到开头】

开头我问,智慧交通喊了这么多年,为什么AI看起来用上了,真正干活的没几个。

读完这本书,我有个初步的答案了。

缺的不是算力,不是算法,不是那几块会闪数据的大屏。缺的是想明白一件事,数据到底给谁看。

如果还停留在给人看,那AI就永远是个会说话的显示终端。只有把思路转到给机器用,让数据真的能支撑AI自己去理解、去推理、去行动,智慧交通这四个字,才真正轮得到AI登场。

这本书叫《本体驱动的AI数据管理》。作者想讲的,其实就一句话。

数据治理的地基,该换一块了。

华为出了本讲AI的新书,高速公路能用它干什么?(华为新书核心内容解读)

从比特到Token:交通行业正在被AI重写游戏规则(华为新书解读续一)