夜雨聆风学习资料网

ARTICLE · 1112807

AI做数据治理,改变的不止是效率,还有工作方式

AI做数据治理,改变的不止是效率,还有工作方式

洛箐知行

把复杂的问题想明白,把想明白的事情做下去

一、数据治理里的“体力活”

过去我们容易把数据治理的“体力活”理解成整理Excel、写文档、写SQL,慢慢发现这个定义还是太窄。经过这几年的数据治理实践,总结来看,数据治理真正消耗大量人力的,是四类工作:

  • 识别:比如几万字段里识别哪些可能属于客户信息;

  • 理解:根据表名、字段名、注释、上下游关系判断字段业务含义;

  • 比对:把现有字段和数据标准逐项匹配;

  • 汇总:根据业务要求形成字段描述、质量规则、标准建议。

这些工作有一个共同特点: 单项难度可能并不高,但数量巨大,而且需要读取上下文以后进行语义判断。这恰恰是大模型比较适合介入的地方。IBM也在实践AI数据目录,开始支持自动元数据增强和自然语言检索。

这也是AI对数据治理的第一层影响,大量原来依靠人工逐项处理的工作,开始具备机器批量处理的条件。

二、AI更大的价值,是让大规模数据治理成为可能

如果以前数据治理顾问一天整理100个字段,现在借助AI可以整理1000个字段,这当然是效率提升。但如果只是把原来十天的工作压缩到一天,本质上还是:人决定做什么,AI帮人做得更快。

我觉得AI对数据治理更值得关注的影响,是它可能开始改变数据治理长期存在的一个现实约束:治理成本与数据规模高度相关。

做过实际项目就会发现,很多治理工作并不是方法不知道,而是规模一上来,人工就撑不住了。几百个字段,可以逐个理解含义、确认标准;几万甚至几十万个字段,很难再靠人工逐项梳理。少量异常,可以由人逐条分析原因;当异常每天持续产生时,人工分析很快就会成为瓶颈。

这也是为什么现实中的数据治理很少真正做到“所有数据用同样的治理强度全面治理”。更多时候,我们会先划定治理范围,识别核心系统、核心对象、核心数据和关键指标,再按照业务价值和问题严重程度分批推进。找重点、定范围、分优先级,本身没有问题,它是有限治理资源下非常现实的选择。

但这里一直存在一个矛盾:那些没有进入重点治理范围的数据,并不意味着没有问题,只是我们没有足够的成本持续去看。过去很多事情之所以没有做到足够细、足够广、足够持续,并不完全是治理理念的问题,而是**人工治理存在天然的规模上限。

AI可能改变的,恰恰是这个上限。

过去需要人逐字段阅读、理解、归类和比对的工作,未来可以先由AI对更大范围的数据进行扫描和初步识别;过去没有精力逐一分析的异常,可以先由AI发现模式、聚类问题、分析可能原因;过去只能对核心数据重点维护的元数据和标准关系,也可能先通过机器完成大范围的初步补全和匹配,再把真正需要专业判断的问题交给人。

AI带来的变化不只是同样的治理工作,可以做得更快。更多的是过去因为成本太高而无法持续开展的治理工作,开始有机会做得更广、更细、更持续。

也就是说AI改变的的数据治理的规模边界。

传统的“人先确定范围、人逐项开展治理”也可能随之发生变化。AI辅助的数据治理,不一定要求人在一开始就把所有问题找出来,而可能先让AI面对更大范围的数据进行扫描、识别和初步判断,再由人把有限的专业精力集中到真正需要业务判断和治理决策的问题上。

三、治理方式开始改变:从“人找问题”到“机器找问题、人做判断”

AI一个很重要的变化,是让过去受限于人工成本的大规模数据治理开始变得可能。但规模扩大以后,带来的不只是“治理更多数据”,数据治理原来的工作方式也可能随之改变。

传统的数据治理,大部分工作其实都是从“人已经知道问题是什么”开始的。

做数据质量,要先由人定义完整性、准确性、一致性等检查规则,再交给系统执行;做数据标准,要先由人逐个梳理字段、理解业务含义,再判断应该对应哪项标准;做分类分级,也要先制定识别规则,再按照规则识别和打标。

这种模式有一个共同特点:人先知道要治理什么、怎么治理,再把确定好的规则交给系统执行。它真正受到限制的地方在于:人的认知始终是整个治理链条的起点。

只有人提前想到的问题,才会进入治理范围;只有人提前定义好的规则,系统才知道应该检查什么。

比如我们给一张表配置了10条质量规则,系统可以每天自动检查这10条规则。但如果第11种异常从来没有被人发现、也没有被定义成规则,传统系统通常不会主动告诉我们:“这里可能还有一种你没有想到的问题。”

这也是传统数据治理中一个很现实的边界,规则可以自动执行,但“发现应该建立什么规则”这件事,过去主要还是依赖人。

AI正在尝试改变的,恰恰是这一环。Databricks在2026年介绍的 Agentic Data Quality Monitoring 提供了一个值得观察的方向:传统质量监控依赖人工预先配置规则,而新的方式尝试让Agent学习数据的正常模式,结合数据画像、历史变化和血缘等上下文主动发现异常,再辅助分析异常可能来自哪里。

这时候工作顺序就发生了变化。

从之前的人发现问题、定义规则,系统按照规则检查数据。开拓一个新的路径让智能体来扫描数据、识别异常、提出问题,人判断问题是否成立,再决定是否沉淀为治理规则。让AI开始参与“发现问题”这个过去高度依赖人的环节。

而且这种变化并不只发生在数据质量领域。比如做数据标准时,不一定再从人逐字段阅读开始。AI可以先扫描字段名称、注释、数据内容和上下文,识别大量相似字段、定义冲突和潜在标准映射关系,再把存在歧义的部分交给人确认。

现在市场上也已经有数据治理产品已经在数据扫描、元数据汇聚、数据质量、数据发现等环节持续引入AI能力。AI正在从单纯帮助人“执行治理任务”,逐渐进入数据发现、理解、识别和建议这些治理前置环节。

AI智能体正在改变数据治理一个很基础的工作逻辑:过去更多是“人找问题,机器执行规则”;未来可能逐渐增加“机器找问题,人判断问题”。

这两种模式不会简单地相互替代。像是那些已经明确、稳定、经过业务确认的治理规则,仍然适合由系统持续自动执行;而面对大量未知异常、潜在冲突和没有被提前定义的问题,AI可以先扩大“发现问题”的范围,再把真正需要业务判断的问题交给人。

AI不是让数据治理从“规则驱动”变成“不要规则”,而是在规则治理之前,增加了一层机器发现和机器建议。

四、人的工作不会消失,而是从“处理数据”转向“判断和决策”

随着AI开始参与数据扫描、问题识别、标准匹配和异常发现,一个很自然的问题就出现了:如果这些过去需要数据治理人员大量参与的工作都可以交给AI,人以后还要做什么?

AI在改变的是数据治理过程中人与机器的分工边界。过去一个数据治理人员可能需要花大量时间找数据、看字段、做比对、写规则、查异常,真正用于理解业务和判断问题的时间反而有限。当这些基础工作逐渐可以由AI承担以后,人并不是从治理链条中消失了,而是从大量具体的数据处理工作中抽出来,把精力放到那些必须结合企业实际才能做出的判断上。

因为数据治理中有一类问题,本质上就不是“算出来”的,而是“定出来”的。像是我们借助AI发现“供应商名称”“供应商编码”“统一社会信用代码”之间存在大量重复和冲突,也可以判断两个供应商有很高概率属于同一主体。但这两个主体在企业管理上是否应该合并、合并以后采用哪个编码、历史业务如何处理、哪些系统需要同步调整,背后涉及采购管理、财务核算、风险管理甚至组织责任,这些后续的处置都需要人来协同处置。

AI擅长从大量数据中发现“可能存在什么问题”,人负责判断“这到底是不是问题,以及企业应该怎么处理”。数据治理工程师和AI之间解决的不是同一类问题。

随着Ai在数据数据治理中的不断深入分工也会慢慢更加清楚AI智能体负责扩大“看见问题”的范围,工程师负责提高“判断问题”的质量。AI降低的是数据治理的执行成本,但不会自动消除治理中的决策成本。

过去一个优秀的数据治理人员,可能首先要会盘数据、整理Excel、理解表结构、写SQL、配置质量规则;这些能力以后依然需要,因为不懂数据就无法判断AI给出的结果。但仅仅擅长这些执行工作,价值可能会越来越有限。

更重要的能力会逐渐向上移动:能不能理解业务对象和业务过程,能不能判断一个数据问题背后的业务原因,能不能处理不同部门之间的口径冲突,能不能把业务要求转化成治理规则,能不能判断AI给出的建议到底适不适合这家企业。

字段可以自动识别,标准可以自动推荐,异常可以自动发现,元数据可以自动生成,但企业最终仍然需要有人回答:这个定义对不对?这个问题要不要管?这两个对象要不要合并?发生冲突听谁的?这条规则要不要成为企业规则?

而且随着AI一次能够发现的问题越来越多,人的判断甚至可能变得比以前更加重要。过去人工只能发现100个问题,也许只需要判断100次;未来AI一次扫描出来10000个潜在问题,如果没有好的业务判断、优先级和治理决策能力,反而可能制造出新的“治理噪声”。

AI时代的数据治理并不是简单地把工作从“人”交给“机器”,也在尝试重新划分工程师和智能体的责任边界:AI负责扫描、识别、分析和建议,人负责定义、确认、取舍和决策;AI提高治理的覆盖范围,人保证治理的业务正确性。

#AI数据治理 #数据治理工具 #数据治理

相关学习资料