乐于分享
好东西不私藏

AI语境下的数据治理

AI语境下的数据治理

数据治理这件事,被AI逼到了墙角

做了十几年数据治理咨询,我一直跟客户说同一句话:数据治理不是项目,是习惯。以前这套话术挺好用的,客户点点头,签合同,做三年规划,大家皆大欢喜。

但AI来了之后,这套话术不够用了。

不是说它错了,而是AI把数据治理的矛盾放大了十倍。以前脏数据顶多让一张报表难看,现在脏数据会让一个大模型输出偏见。以前数据权限管不好是合规问题,现在管不好是安全事件。以前数据治理是“锦上添花”,现在它成了AI落地的生死线

这篇文章不谈概念框架——那些东西网上铺天盖地。我想聊聊,当AI真的进入企业,数据治理实际面临什么变化,以及该怎么办。

📌 本文看点

01

数据质量门槛被抬高

02

安全从防泄露到防投毒

03

传统框架的三个短板

01

THE NEW CHALLENGE

AI给数据治理出了什么新题

数据质量的门槛被抬高了

以前做数据质量,标准很朴素:字段不空、格式对得上、口径一致。能做到这三条,客户的数据团队就能松口气。

AI场景下,这些只是及格线

大模型训练对数据质量的要求不是“不出错”,而是“能教会模型正确的模式”。一份客户数据,字段格式都对,但如果某个性别字段里“男”出现了99%、“女”只有1%,模型就会学到性别偏见,输出结果会出问题。这种偏差,传统的完整性检查根本抓不到。

再比如数据标注。AI需要的标注数据,质量取决于标注人理解任务的程度。我见过一个项目,标注团队把“客户投诉”标成了“客户咨询”,就因为投诉里带了句“请问什么时候解决”。模型学到的就是错的,后面再怎么调参都是白费

「数据质量的定义,从“数据本身没问题”变成了“数据能正确地训练模型”。」

数据安全从防泄露变成了防投毒

传统的数据安全,核心是权限管控和脱敏脱密。谁能看、谁能改、出了事能追溯——做好这三件事,基本就到位了。

AI时代多了一个维度:数据投毒。攻击者不需要窃取你的数据,只需要在训练数据里混入精心构造的样本,就能让模型在特定场景下产生特定输出。2023年已经有研究证明,只需要在训练集里混入0.1%的污染数据,就能让模型在特定prompt下输出攻击者想要的内容。

企业内部的威胁更大。一个对组织不满的员工,在数据管道里稍微做点手脚——比如把某些分类标签系统性错标——模型的表现就会在特定群体上变差。这种攻击隐蔽到什么程度?模型上线半年都不一定有人发现

权限管控和脱敏依然要做,但现在还得加上数据血缘追溯训练数据完整性校验。也就是说,不只是管“谁能碰数据”,还要管“数据从哪来、中间被谁碰过、进模型之前被改过没有”。

数据权属的边界变模糊了

这个问题以前不突出。企业内部数据,归IT部门管;外部数据,按合同约定用。结构清晰,权属明确。

AI打乱了这个秩序。

第一,训练数据的来源变复杂了。你用公开数据训练了模型,模型产出的内容又喂给下一轮训练,几轮迭代之后,原始数据的权属痕迹几乎不可追溯

第二,AI生成的数据算谁的?客服AI跟客户对话产生的对话记录,算企业的业务数据,还是算AI供应商的数据?这个问题目前在法律层面还没有明确答案,但企业层面必须先有自己的立场。

第三,个人数据在AI场景下的合规边界。GDPR和《个人信息保护法》对自动化决策有明确约束,但“自动化决策”和“AI辅助决策”的界限在哪?企业用AI分析客户行为并推送,算不算自动化决策?这些都需要数据治理团队提前介入。

02

THE GAP

传统治理框架为什么不够用了

市面上数据治理框架不少,DAMA-DMBOK是经典,DCMM是国内标准。这些框架本身的逻辑没问题,但它们设计时的假设是:数据主要服务于BI报表和业务系统,治理的核心是“标准化”和“质量管控”。

AI场景下,数据的服务对象变了。它不再只是给人看报表,而是要喂养模型、支撑自动化决策。服务对象变了,治理的要求自然也要变。

具体来说,传统框架有三个短板:

!短板一

缺少AI特定的质量维度。传统框架谈数据质量,讲的是准确性、完整性、一致性。AI还需要一个维度:代表性。数据能不能代表真实的业务分布?有没有系统性的偏差?这些问题在传统框架里基本没人提。

!短板二

安全模型没有覆盖AI攻击面。传统数据安全聚焦“防泄露”,对“防投毒”和“防模型逆向”几乎是一片空白。权限管控做得再好,如果训练管道本身不可审计,数据被篡改了你都不知道

!短板三

数据血缘的粒度不够。传统血缘追踪到表和字段级别。AI需要追踪到样本级别——这条数据是哪个来源、标注人是谁、标注标准是什么版本、有没有被修改过。粒度差了一个数量级。

不是说这些框架要推倒重来。框架是骨架,AI是新环境,骨架不变,但上面长出来的肉得变。

03

ACTION PLAN

怎么做:从框架到落地

讲了这么多问题,落到操作层面,我建议分三步走。

第一步:先做数据资产盘点,但要换个视角

传统盘点看的是数据在哪、有多少、什么格式。AI语境下的盘点要多看一层:这些数据能不能用于模型训练

具体来说,每张表、每个数据流都要标三个属性:数据来源是否合规、数据质量是否满足训练要求、数据是否包含敏感信息需要脱敏。

我帮一个金融客户做过这个事,之前他们数据目录有三千多张表,盘完之后发现,真正能直接用于模型训练的不到20%。剩下的要么合规风险没清,要么质量不达标。这个数字让业务方吃了一惊,但早知道比晚知道好。

第二步:建AI数据管道的治理卡点

不是所有数据都需要进AI管道,但进了管道的数据必须过几道关。

数据入模前要有三道检查:来源合规检查(数据来源有没有授权)、质量检查(偏差、标注一致性)、安全检查(有没有被篡改的痕迹)。

这三道检查不是靠人盯,要做成自动化的pipeline卡点。数据进了训练管道,自动跑检查规则,不过关的数据被拦下来,附带一份问题报告。

这需要IT和数据科学团队配合。治理团队定规则,工程团队建pipeline。别指望靠流程文档解决——AI场景下,人盯不住的,必须靠系统卡

第三步:把治理从“项目”变成“运营”

这话说烂了,但AI场景下它比任何时候都重要。

模型会持续学习,数据会持续流入。如果治理只在项目上线前做一次,上线后模型就处于“裸奔”状态——数据偏移了没人管,标注标准变了没人知道,新数据来源进了管道没人审。

所以治理团队需要持续的运营能力:数据质量监控(自动化仪表盘)、数据血缘实时追溯、定期的模型偏见审计。这些不是一次性项目,是长期运营。

成本不低。但如果你的企业认真做AI,这笔钱省不掉。模型上线后才出问题,代价远大于前期治理投入。

AI场景下,治理只有两种状态:在做,或者在出事

THE END

治理不是刹车,是方向盘

很多企业把数据治理当成AI的刹车——觉得AI跑太快,需要治理来踩一脚。这个理解是反的。

数据治理不是要让AI慢下来,而是要让AI跑在正确的方向上。没有治理的AI,跑得越快,偏得越远。有治理的AI,才能在正确的赛道上持续加速。

我见过太多企业,AI项目启动时风风火火,三个月后发现模型效果不稳定,回头一看,全是数据的问题。早花三个月做数据治理,能省掉后面一年的反复调优

所以回到开头那句话——数据治理不是项目,是习惯。只不过在AI语境下,这个习惯从“锦上添花”变成了不可省略

END

我是寿阳,数字化转型与数据治理领域的咨询顾问,专注于企业AI战略与落地实施。

如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。