夜雨聆风学习资料网

ARTICLE · 1095411

深度报告 | AI时代数据治理重构之路

深度报告 | AI时代数据治理重构之路

支持原创,请点击右上角,设为星标+关注+转发,谢谢!

摘要

截至2026年9月,企业数据治理的核心变化不是“把旧平台换成AI平台”,而是治理对象由表、字段和主数据,扩展为文档、切片、向量、知识片段、语义模型、Agent与AIGC产物。传统元数据、数据质量、标准、主数据和血缘并未被削弱,反而因为AI调用需要来源、权限、时效和可信度而成为底座;真正被削弱的是只做人工盘点、资产目录展示、缺乏主动采集和闭环处置的静态治理。企业应按“场景—证据—控制—度量”重构:先选一个知识密集型低危场景,建立文档对象、权威源、版本、权限、引用和失效规则;再为Agent建立独立身份、最小权限、沙箱、人工确认、完整审计和回滚;最后才扩展语义层、知识图谱和跨域流通。

已公开的企业实践表明,高价值场景普遍采用“大模型+知识图谱/规则+人工审核”,而非纯RAG自动执行。南方电网“明月”虽能自主拟写调度指令,但执行前仍需人工审核[20];建设银行也把“使用人作为决策主体”写入治理原则[21]。政策侧,数据资源会计处理自2024年施行,内容标识自2025年9月施行,智能体分类分级、数字身份、权限和全周期管理要求也已进入国家政策[6][7][9][10]。这意味着企业不能把“为了合规”与“为了业务”割裂:治理必须先满足数据安全、个人信息、算法备案和行业监管要求,再通过问答准确率、找数时间、Agent任务成功率、事故率等指标证明价值。

一、治理对象正在从“数据资产”扩展为“可被AI消费的证据链”

AI没有取消数据治理,而是把治理颗粒度从库表字段推进到知识片段、检索结果和模型行为。传统治理主要回答“数据在哪、含义是什么、谁负责、质量如何、怎样流动”;生成式AI还追问“这条回答依据什么文档、哪个版本、在什么权限下取得、能否执行动作、执行结果如何回放”。因此,治理对象不能只停留在结构化数据,而应包括源文件、解析结果、切片、嵌入版本、索引、检索证据、模型与提示词版本、生成内容、Agent身份及工具调用链。

企业至少应建立九类对象:业务对象与实体;指标与语义定义;文档及非结构化文件;文档版本与生效规则;切片与向量;知识断言或关系;数据/知识责任人;Agent身份;工具权限;AIGC产物。每条对象都应带不可变的来源标识、创建时间、有效性、分类分级、权限策略、血缘、质量状态与审批记录。行业共识是:RAG并不是把PDF扔进向量库,而是为每一条回答建立可回溯的证据链。作者判断是,企业应优先治理“答案所依赖的最小事实单元”,而不是追求一开始就把全部非结构化资料语义化;否则容易把原始资料的混乱复制进知识库。

传统治理中贬值的是静态交付物,升值的是可机器读取、可持续验证的控制信息。元数据管理从人工登记变为自动采集、语义推断与主动告警;数据标准从制度文件变为接口、查询和知识检索可直接调用的契约;数据质量从一次性校验变为服务于检索、生成和Agent动作的数据质量服务水平;数据血缘从表级、任务级扩展到文档—切片—向量—提示—答案,以及Agent—工具—业务对象—结果。主数据管理不仅没有消失,反而是客户、供应商、产品、组织、设备等实体消除多源冲突的锚点。被削弱的主要是“只盘点、不运营”的资产目录、没有业务场景的数据标准和缺少自动检测的质量规则库。

传统能力
AI时代的新作用
重构建议
元数据
支撑找数、语义理解、权限与血缘
自动采集优先,人工只审关键资产
数据标准
约束指标、接口、术语和提示词
把标准做成可执行规则,不只做目录
主数据
为实体、关系与冲突裁决提供锚点
保留为黄金记录,结合知识图谱使用
数据质量
防止错误进入检索、模型训练和Agent动作
从表级扩展至文档、切片、时效与引用
血缘
覆盖数据、模型、知识、答案与AIGC
建立端到端因果链,不只覆盖ETL
权限
从人和系统延伸到Agent与工具
采用动态策略、最小权限和用途控制

语义层与本体已进入工程化阶段,但只能从核心业务对象开始。2026年中国信息通信研究院在“2025数据智能大会”上公布企业数智化能力成熟度模型,新增智能中台、知识工程等评估维度,并有40家企业的51款产品通过评测[18]。中国通信标准化协会大数据技术标准推进委员会也在2026年成立本体与知识管理工作组[22]。这说明语义层和本体建模已经不只是概念。但其工程价值取决于业务对象是否稳定、指标口径是否高频冲突、知识是否由多源共同引用;不存在所有文档、所有部门统一本体的经济必要性。

行业共识是:语义层适合管理指标口径、实体关系和业务术语;Data Fabric适合已有异构数据源、需要逻辑集成与主动元数据的中大型企业;Data Mesh适合业务域边界清晰、各域能承担产品责任和自助服务的大型集团。存在争议的是Data Mesh:它常被当作组织授权口号,缺少平台自治、产品契约和联邦治理时,只会形成更多数据孤岛。作者判断是,多数中国企业应先完成“统一目录+统一身份+统一策略+统一可观测”的轻量Data Fabric,再按业务域拆分,不应把“建一个湖仓”误称为Data Mesh。

二、企业真正要建的是语义控制面,而不是“更大、更全的数据地图”

真落地的能力是主动元数据、目录联邦、语义指标、检索证据链和Agent控制面;仍在被过度包装的是统一全企业本体与“数据编织自动解决孤岛”。主动元数据通过扫描数据系统、解析任务、采集访问日志和调用关系,自动发现资产、推断负责人、识别异常并触发工单。其真实价值在持续运营,不在一次性资产大屏。语义层把物理字段映射为业务指标、维度和指标口径,服务BI、查询助手与部分RAG实体检索。二者已经可以落地,但跨厂商血缘仍受连接器覆盖、解析能力和自定义代码可见性限制。

2026年中国企业公开信息显示,本体与知识管理开始进入标准化和平台化阶段,百度胜算、中国电信星海等厂商把本体用于跨域语义统一和智能体场景[22][23]。与此同时,南方电网多智能体调度员“明月”采用知识图谱、强化学习与大模型微调组合,而不是依赖纯向量检索[20]。这说明本体的高价值场景是规则复杂、实体关系明确、容错要求高的核心业务,而不是全企业通用知识库。

选型应按控制点划分,而不是按营销概念采购。元数据与数据目录负责资产发现、责任人、血缘和数据合约;湖仓与集成平台负责结构化与非结构化统一接入、批流处理和质量规则;知识平台负责解析、切片、向量、权限过滤、混合检索和引用;语义/指标平台负责指标口径和实体关系;模型网关负责模型路由、配额、提示词与敏感词控制;Agent网关负责身份、工具审批、沙箱和审计;安全平台负责分类分级、脱敏、数据防泄漏、密钥与供应链检测。没有一款产品能替代全部控制点。

平台角色
应选能力
主要局限
适配起点
元数据/目录
自动扫描、血缘、责任链、开放API
自定义ETL和老系统解析不全
任何成熟度企业
湖仓/集成
结构化与非结构化统一存储、版本、质量规则
存储集中不等于语义统一
已有数仓、待接入文档者
知识/RAG
解析、切片、混合检索、重排、引用、版本
解析和切片误差会沿链路放大
已有明确问答场景者
语义/指标
指标口径、维度、实体关系、查询接口
全企业统一本体成本高、变化慢
多报表口径冲突的企业
模型/Agent网关
身份、权限、审批、审计、配额、沙箱
需统一拦截,否则容易旁路
已有生产Agent者
安全/数据防泄漏
分类分级、脱敏、内容审查、密钥管理
模型输出无法仅靠边界控制
高敏感或强监管企业

语义层不能替代主数据和治理责任,只能降低歧义。主数据解决“客户是谁、产品是什么、供应商是否有效”;语义层解决“收入按什么规则计算、实体怎样映射”;知识图谱解决“实体之间有什么关系、规则如何关联”;RAG解决“依据原文怎样回答具体问题”。四者可以共用身份和血缘,但不能相互替代。作者判断是:先保留权威主数据和单一口径指标,再把高频歧义术语、关系与业务规则上升为本体;其余知识保持“文档+切片+元数据”的轻量结构。这样既控制本体维护成本,又能覆盖大量低频、易变知识。

三、RAG质量必须由全链路评测控制,幻觉不能只靠更强的模型解决

RAG的首要失败模式是检索错误,而不是生成错误。公开实践普遍采用多格式解析、结构感知切分、文档元数据、向量化、混合检索、多路召回和重排序[2]。这一技术组合说明行业已形成基本工程共识,但不能据此推断所有企业都能达到商用质量。PDF双栏、扫描件、表格跨页、页眉页脚、版本覆盖和权限继承,都会在解析阶段污染答案;固定长度切分会切断上下文,纯向量检索容易漏掉准确术语,纯关键词检索又难以处理语义变体。

建议把RAG链路拆成可测环节:来源准入;解析;切片;元数据与权限;嵌入;索引;查询改写;召回;重排;引用绑定;生成;回答后校验。每个环节建立基线。企业不应仅报“模型准确率”,而要分别记录可回答率、Top-5命中率、引用覆盖率、引用正确率、答案忠实度、拒答率和时效过期率。评测集必须来自真实问题,至少覆盖常见问题、边界问题、冲突问题、过期文档问题、权限隔离问题和敏感问题;测试集与生产数据变化同步更新。

知识更新必须建立“失效触发—复核—重索引”闭环,而不是定时重建索引。每份文档应保存权威源、责任域、生效/失效时间、版本、审批状态、可回答范围、敏感级别和替代关系。新版本发布时,系统要自动标记旧切片为过期,而不是允许新旧并存;文档撤回时,相关向量和缓存应失效;冲突规则要有显式裁决,不能让模型按时间或相似度自行选择。作者判断是,企业应把“知识有效期”视为数据质量指标,而不是文档管理员的行政备注。

可信回答要采用四道防线:来源准入、权限过滤、证据约束和输出校验。第一,只有经过来源、版本、分类分级与合规审查的文档才能进入生产知识库;未经审核的员工资料只能进入隔离空间。第二,检索前按用户、Agent、场景和数据级别过滤,不能先召回再遮掩。第三,要求模型只依据给定证据作答,返回逐句或逐段引文,无证据时拒答。第四,对金额、条款、审批、医疗、生产控制等高后果问题,使用结构化规则、知识图谱、确定性校验或人工复核。南方电网“明月”的做法具有参考价值:秒级分析并拟写指令,但执行前人工审核[20]。

RAG问题
可执行控制
主要度量
解析失真
OCR质检、表格识别、版式还原、人工抽检
解析可用率、关键字段还原率
切片破坏语义
结构/语义感知切分、重叠、边界测试
切片可用率、召回命中率
召回漏答或错答
关键词+向量混合召回、重排、查询改写
Top-K命中率、无结果率
多源冲突
权威源、版本裁决、冲突提示
冲突发现率、裁决覆盖率
知识过期
有效期、失效事件、增量重索引
过期切片占比、重索引时延
幻觉与错引
引文绑定、忠实度检查、拒答
引用正确率、答案忠实度
越权读取
身份与属性过滤、行/列/向量级策略
越权召回数、权限拦截率

“引用”不等于“可追溯”,企业必须能回到证据原文。每条回答应保存:最终问题、改写结果、模型与版本、提示词模板、检索到的切片ID、文档版本、召回与重排分数、权限判定、生成结果、人工反馈、工具调用和回放标识。引用至少显示文件、章节、条款、版本和访问时间;高风险答案还要能回放同一证据链。若只显示“参考内部制度第3章”,无法定位原文、版本与授权状态,则不满足可追溯要求。

四、Agent治理的核心是把Agent当作一个可审批、可审计、可撤销的系统身份

Agent应获得独立身份,但不应被视为法律主体或无限拟人化。国家网信办、国家发展改革委、工业和信息化部2026年发布的《智能体规范应用与创新发展实施意见》提出分类分级治理,探索智能体注册平台,提供数字身份管理、检索发现、能力声明,并做好权限和行为管控[9]。实践上,Agent应像服务账号一样有唯一标识、人类负责人、所属业务域、用途说明、模型版本、允许调用的工具、数据范围和有效期;不应直接继承员工账号、长期密钥或生产管理员权限。

公开事故证明默认配置和过高权限足以造成实质风险。中国新闻网披露,一只智能体被接入含98只智能体的3000人交流群后,因未设置触发限制,遭持续两小时围攻,攻击者获得运行环境、模型配置、IP地址、真实姓名、公司名称和去年营收数据;后续虽拒绝搜索本地文件,信息已泄露。另有用户安装后API密钥被盗,凌晨产生1.2万元Token账单[11]。这些不是传统RAG知识问答案例,不能证明所有企业内部Agent都会误操作,但足以证明Agent一旦拥有模型调用、文件读取、浏览器或系统工具权限,风险面就从内容合规扩展到身份、密钥、网络、数据和财务。

Agent权限必须分为数据读取、内容生成、工具调用、交易执行四个平面。数据读取采用主体—资源—用途—环境策略,例如“采购Agent仅在工作时间、公司网络、为报价任务读取脱敏供应商数据”;工具调用采用白名单、参数模式和审批策略;交易执行采用金额、频率、对象、时间和双人审批阈值。读取知识、生成建议、调用只读接口、写入测试系统、调用支付或生产接口的风险不同,不能用一个“Agent管理员”角色笼统授权。

高风险动作必须采取“沙箱—模拟—审批—执行—回放”控制。默认将Agent置于隔离环境,只允许读取授权数据和调用受限工具;涉及删除、修改核心数据、资金、合同、人员、生产控制等动作,先做 dry-run或事务模拟,再由具备权限的人确认;执行后保存差异、前后状态、证据和撤销路径。浪潮信息公开提出,Agent处理结果与真实业务系统回写之间,应设置业务流程和人工审核把关[1]。作者判断是,没有事务回滚能力的Agent不应获得不可逆写入权限;若系统本身不支持补偿交易,就只能停留在建议或草稿状态。

Agent控制
最低实现
高风险增强
身份
唯一Agent ID、人类负责人、版本
注册平台、密钥轮换、短期凭证
权限
最小权限、工具白名单
动态策略、双人审批、临时提权
审计
目标、步骤、模型、数据、工具、结果
决策原因、完整提示与证据、防篡改日志
沙箱
隔离网络与数据空间
只读副本、禁止外联、依赖扫描
审批
高风险阈值
金额/频率/对象多维规则、冷却期
回滚
事务或版本回退
补偿任务、人工接管、停止扩散
停用
下线开关
吊销凭证、回收会话、追溯影响

“Agent身份”与“员工身份”需要联合治理,而非二选一。员工负责定义目标、授权业务结果并承担最终责任;Agent负责执行可验证步骤;工具负责实施最小动作。审计日志应同时记录员工、Agent、模型、工具和数据对象,避免事故发生后无法判断是授权错误、策略错误、模型错误还是工具错误。人类不是形式上的“确认按钮”,而是对目标、风险边界和例外负责的控制者。

五、非结构化入湖必须走“应用驱动、分级治理、统一证据”的路线

非结构化数据不能因为AI兴起就无条件全量入湖。治理路径应按业务场景决定解析深度:知识问答优先文档元数据、结构、术语和引文;合同审查还需条款、主体、金额、期限和版本;视觉质检需要图像标注、样本来源和质量标签;语音客服需要转写、说话人、同意状态与保留期限。中国中化公开提出,非结构化治理以应用场景为驱动并与AI平台协同,先做分类、标注、索引,再由智能体加工沉淀知识、语义和高质量数据资产[17]。这与“先全量治理、再寻找场景”的高成本做法相反。

建议按四级路线处理:一级,仅目录化,记录文件存在、所属、密级和保留期;二级,解析并提取结构化元数据,适合制度检索、合同台账等;三级,切片、嵌入并建立证据化知识库,适合高频问答;四级,构建实体、关系、规则和业务本体,只适合高频、稳定、跨部门复用的核心语义。前两级可由平台批量完成,后两级需要领域责任人持续维护。没有足够使用频率、权威源和责任人的知识,不应进入第三、四级。

AIGC必须像数据一样被标识、分级、保留血缘和处置。对向外部网络提供的生成内容,四部门《人工智能生成合成内容标识办法》自2025年9月1日起施行,要求服务提供者按规定添加显式和隐式标识,文件元数据隐式标识应包含生成属性、提供者或编码、内容编号等信息;无显式标识情形需要留存相关日志不少于六个月[6]。企业内部是否直接适用,取决于是否属于上述网络信息服务提供者及相关情形;但作者判断是,企业仍应主动采用“内部AI”标签、生成者/审核者、模型版本、提示与证据链、风险等级、保留期和使用限制,既为事故调查、再训练和版本回放服务,也避免AIGC再次被误作高可信原始材料。

血缘必须覆盖三类对象:原始数据、知识与模型、AIGC。原始数据血缘记录源系统、任务、转换、质量规则和目标表;知识血缘记录文件版本、解析器、切片算法、嵌入模型、索引、检索配置和重排模型;AIGC血缘记录模型、提示、检索证据、Agent、工具、审批和执行结果。若只有ETL血缘,无法判断回答错误来自数据、文档、切片还是模型;若只有模型调用日志,又无法追踪业务对象如何被改写。真正的AIGC标记不是给文件加一个水印,而是保存可重放的因果链。

六、组织重构必须让业务Owner承担语义和AI风险,而不是把责任外包给IT

CDO仍应负责数据与AI治理的统一控制面,但需要新增知识工程、AI风险管理与平台产品角色。行业共识是,数据治理委员会不应消失,应升级为“数据+AI治理委员会”,统筹战略、跨域冲突、重大风险、投资优先级和监管沟通。CDO负责政策、数据资产、语义标准、质量与跨域责任;CIO负责平台、身份、网络、安全和工具链;法务/合规负责规则解释、个人信息、合同和对外服务;业务部门Owner负责业务对象、指标口径、知识权威源和结果可接受性;安全部门独立负责攻击、事件和应急;审计负责控制有效性。

存在争议的是是否需要单独设置“首席AI官”。作者判断是,如果AI已有独立预算、跨业务产品线和高风险自主执行,可设CAIO或AI负责人,但不应把数据治理与AI治理拆成两套平行体系。更稳妥的安排是:CDO对数据与知识资产、语义和AI数据风险负责;CAIO对模型、产品和业务结果负责;二者共用平台、身份、安全、审计和指标委员会。若职责拆分,Agent权限容易脱离数据权限,知识责任又容易脱离业务责任。

角色
新增职责
不宜承担的责任
CDO
数据/知识资产、语义、质量、血缘、AI数据风险
单独决定业务是否接受模型结果
CIO
平台、身份、Agent网关、网络、安全工具链
替代业务确认业务规则
数据Owner
对象、口径、权威源、质量与共享边界
无责审批其不理解的AI输出
知识Owner
文档版本、术语、问答集、知识有效性
只做文件归档、不验证内容
AI产品负责人
场景风险、任务成功率、成本、用户体验
绕过数据与安全控制抢上线
AI风险管理
模型、Agent、插件、提示词与供应链评估
只在事故后介入

治理委员会必须按风险分级开会,不能每月讨论所有元数据。P0级场景包括资金、核心生产、人身安全、重大隐私和对外公共服务,实行上线前审查、持续监控和事件复盘;P1级包括重要业务决策、内部人事和关键数据修改,实行上线前评审与季度审查;P2级为一般知识问答和内容辅助,实行自助登记与抽检。高后果场景不应采用“先做再治理”,低风险场景则不应占用委员会全部时间。

知识工程团队要从项目制走向产品制。每个核心知识域至少配置:领域业务负责人一名,对业务正确性负责;知识工程师一名,负责来源、结构、评测和版本;数据/平台工程师按需支持;法务或安全角色提供规则咨询。知识库不是交付后封存的项目,而是持续运营的产品。中国中化提出由智能体编排自然语言驱动数据开发、治理与查询自动化,以降低高重复性持续投入[17],但自动化必须保留人类责任和变更审批。

七、AI可以承担70%—90%的发现性工作,但确认、裁决和责任不能外包

AI自动治理最适合发现、初稿、监控和推荐,不适合无人确认。元数据自动扫描可发现表、字段、任务、访问与血缘线索;自然语言模型可生成资产描述、术语解释、分类建议和质量规则候选;机器学习可识别异常、重复、缺失、过期和个人信息线索。市场材料曾声称字段补全、标准生成或质量规则生成可压缩数天工作至一天,并给出80%—90%准确率[25],但这些数字来自厂商案例,样本和评测口径未公开,不能作为企业预算承诺。

作者判断是,企业可以把重复性发现工作的处理容量提高数倍,却不能简单宣称“替代若干人力”。更可靠的做法是分角色统计:AI推荐中人工接受率、人工修改率、漏报率、误报率、规则上线后的持续有效率和单位治理成本。治理专员人数可能下降,但领域专家审核时间不会消失,反而会前移到知识验证、冲突裁决和结果验收。若没有这些专家,自动化只会更快地产出错误资产。

工作
AI适合做什么
人工必须做什么
建议度量
资产发现
扫描系统、推断关系、建议责任人
确认边界和关键Owner
建议接受率、责任人覆盖率
元数据
生成描述、术语、标签候选
审核敏感或关键资产
准确率、修改率、更新时延
质量规则
发现异常、推荐规则
批准生产规则与阈值
漏报率、误报率、规则有效率
血缘
解析任务、补全链路
验证动态代码与跨系统链路
链路完整率、缺失率
知识治理
抽取元数据、初拟QA、识别冲突
认定权威源与业务正确性
QA正确率、冲突发现率
风险审查
扫描敏感信息、提示词和依赖
做最终风险决策
风险覆盖率、误报/漏报率

自动治理不能省的四项能力是:责任确认、规则验收、语义裁决和审计独立。可以省的是手工登记、重复扫描、固定报表和低价值会议;不应省的是关键数据责任、权威源认定、P0/P1上线评审、人工审批、事件复盘与第三方验证。若预算只够两件事,先做自动发现和审计控制,而不是先建复杂本体。

八、企业投入应以风险和工作量计价,而不是按“AI治理大平台”打包

公开采购只能证明工具与集成价格,不能代表企业总拥有成本。2025年重庆文化艺术职业学院数据治理平台建设中标金额为64.89万元[15];新疆科技学院数据治理平台项目中,数据治理平台软件为116.9万元,完整采购项目总金额为318.6万元,但后者还包含数据开放、智能采集、商业智能、流转监测、国产数据库等内容[16]。两者均为教育行业项目,不能代表金融、制造或央国企,也不能与大型集团全域治理费用直接比较。

大型企业投入的主要成本并非软件license,而是业务访谈、数据梳理、制度改造、系统集成、模型与安全服务、长期运营和变革管理。以下区间是基于公开市场项目、咨询交付和行业实践的作者估算,不是公开统计均值或承诺价格;不同区域、信创要求、云价格、业务复杂度差异很大。

规模/起点
0—12个月典型现金投入估算
主要支出
不建议省
可考虑省
中型企业,成熟度低
150万—500万元
数据盘点、目录、质量、平台、试点集成
责任确认、个人信息与权限基线
全域历史数据清洗
中型企业,已有数仓
100万—350万元
知识平台、语义层、Agent网关、评测
血缘、权限、评测集
重复目录建设
大型企业,集团/强监管
500万—2000万元以上
多域协同、信创、安全、审计、集成、咨询
独立审计、身份、回滚、业务Owner
一次性“大而全”本体
已有生产Agent
100万—600万元以上
风险盘点、网关、沙箱、评测、应急
停止开关、凭证回收、高风险审批
仅加日志、不改控制

成本还应持续计量license/订阅、模型调用、向量与对象存储、检索和重排、GPU/CPU、数据集成、平台运维、人工审核与事件处置。建设银行披露其建设“四地五中心”高可用、高弹性智算集群,并实施算力检测和快速引入机制[21],说明算力可观测与弹性管理本身就是治理对象。对10万员工全量开放模型权限前,应先测算部门配额、缓存命中率、检索成本、人工审核成本和事故潜在损失,不能只比较模型单价。

投资回报必须由业务结果证明,而不能停留在“数据资产增长”。建议按四类指标建立基线:一是效率,包括找数时间、知识准备周期、报告/开发周期;二是质量,包括可回答率、Top-K命中率、引用正确率、答案忠实度、知识过期率、数据质量缺陷;三是Agent,包括任务成功率、人工接管率、审批率、单次任务成本、回滚率;四是风险,包括未授权访问、越权召回、敏感泄露、错误执行、事故恢复时间。每项指标需注明业务域、模型版本、评测集、统计周期和责任人,防止只报有利口径。

九、企业应按成熟度选择路线:先止血、再建立控制面、最后形成业务闭环

成熟度低的企业最缺的不是AI,而是责任和目录。0—3个月建立数据与AI资产清单,完成个人信息、重要数据、敏感文档和高风险工具盘点;任命业务与数据Owner,冻结“全量文档入湖”冲动;选择一个知识密集、低风险、高频场景;记录现有找数时间、问答准确率和人工处理工时基线。3—12个月接入一个数据源和一套文档库,建立解析、切片、权限、版本、引用和基础评测;采购或自建最小目录与审计能力;禁止Agent直接写生产。12—24个月只把已验证场景扩到2—5个域,建立指标语义层、冲突裁决和AIGC标识;Agent仅在只读或测试环境运行,待审批、回滚和审计成熟后开放低风险写入。

已有数仓和治理体系的企业,重点是补齐知识证据链与Agent控制。0—3个月盘点现有目录、血缘、主数据和数据质量体系能覆盖多少AI场景;识别旧资产中的Owner空缺、过期数据、敏感字段和跨系统冲突;选择一个已有结构化数据又新增非结构化知识的场景。3—12个月将文档对象与表、指标和主数据关联;扩展血缘至解析、切片、向量和提示;建立Agent身份、最小权限、日志与停止开关。12—24个月将核心指标、实体和规则上升为语义层或轻量本体,建设知识工程产品团队,在人工审核成熟后开放低风险执行。

已有AI应用的企业,应把治理补成生产控制面,而不是补一张制度PPT。0—3个月必须完成Agent与模型清册、工具与凭证清册、外部数据清册、最高风险场景清单和事故应急演练;切断影子Agent、长期密钥、生产管理员权限和未审核知识库;对存量回答抽样做引文、越权和过期测试。3—12个月统一模型/Agent网关、动态策略、沙箱、审批、审计和回放;按P0—P2分级重新上线。12—24个月把治理反馈到模型路由、知识更新、成本控制和业务产品设计,形成可量化的风险运营能力。

阶段
必做产出
阶段退出标准
常见失败点
0—3个月
资产/场景清册、责任、风险分级、基线
至少1个P2场景上线或准备就绪
无Owner、追求全量入湖
3—12个月
知识证据链、权限、评测、Agent清册
引用可回放、越权可拦截、P0/P1有审批
只买平台、无生产数据验证
12—24个月
语义控制面、知识工程运营、低风险Agent执行
多个场景可复用能力、成本与质量可量化
本体过度建设、工具无限授权

十、政策要求已经从“数据合规”延伸到“内容标识、模型与Agent全生命周期”

企业内部系统首先要做规则映射,不能把所有政策都理解为对外生成式服务监管。《数据安全法》《个人信息保护法》《网络数据安全管理条例》要求分类分级、权限、处理记录、风险监测和事件响应;《生成式人工智能服务管理暂行办法》对向境内公众提供服务者提出训练数据、内容、标注、投诉、处置和报告等要求[8];生成合成内容标识办法则对适用服务提供者提出显式、隐式标识和日志要求[6]。企业内部助手是否直接适用,应结合服务性质、用户范围、对外提供、算法备案、行业规则和具体场景由法务判断,不能把外部监管要求全部机械照搬,也不能借此排除数据安全与个人信息责任。

《人工智能生成合成内容标识办法》已经把“内容有来源、传播可追溯”变成工程要求。显式标识是用户可感知的文字、声音或图形;隐式标识在文件数据中添加属性、服务提供者或编码、内容编号等信息;无显式标识情形要求留存相关日志不少于六个月[6]。企业可将这一思路用于内部AIGC:内部标识、责任人和证据链;对外发布的合规内容再按适用的显式/隐式规则处理。强制标识并不保证内容真实,它只保证内容来源和生成属性可被识别。

数据资源会计处理的政策目标是透明披露,不是鼓励企业为入表而治理。财政部《企业数据资源相关会计处理暂行规定》自2024年1月1日起施行,规定内部研发数据资源应区分研究阶段和开发阶段,研究阶段支出计入当期损益;外购数据资源无形资产成本可包含达到预定用途相关的脱敏、清洗、标注、整合、分析、可视化、权属鉴证、质量评估、登记结算和安全管理支出[12]。上海高级金融学院统计显示,2025年A股136家公司披露数据资源入表37.86亿元;2026年上半年145家公司披露35.93亿元,数量增加但金额回落[14]。这说明入表趋于审慎,并非所有数据治理支出都能资本化。

图1:A股披露数据资源入表的公司数增加,但披露金额从2025年年报的37.86亿元回落至2026年上半年的35.93亿元。数据来源:上海高级金融学院《中国企业数据资产入表情况跟踪报告(2025年)》[14]

可信数据空间是跨主体流通基础设施,不是企业内部数据湖的替代品。国家数据局《可信数据空间发展行动计划(2024—2028年)》提出到2028年建成100个以上可信数据空间,支持国有企业、龙头企业建设企业可信数据空间,协同上下游开放数据;其能力聚焦数据可信管控、资源交互和价值共创,并探索数据沙箱、智能合约、隐私计算、可信执行环境、数据标识和语义发现[7]。2026年4月首批试点集中上线,南方电网运营的南方能源行业可信数据空间已有公开运营数据[13]。对企业内部治理而言,这意味着未来跨企业知识协作要预留统一身份、授权策略、语义发现、审计和结算能力,但不应现在就建设一套“企业版数据空间”来替代主数据、知识库或Agent网关。

数据要素政策能驱动治理预算,却无法替代业务价值。国家数据局披露,截至2026年全国已有25个省区市实质性开展公共数据授权运营,上海、江苏、浙江、福建、广东已形成较完整政策体系,江苏和福建已出台授权运营产品与服务试行收费标准[10]。这可以推动企业建立公共数据目录、授权、审计和收费台账,但政策驱动往往强调登记、合规和基础设施,业务价值则来自具体产品。作者判断是,治理预算应同时设置“合规红线指标”和“业务结果指标”,不能拿合规完成率替代投资回报。

图2:2023—2026年企业AI治理相关制度节点,覆盖数据资源会计处理、可信数据空间、生成内容标识、生成式AI安全与智能体治理。数据来源:财政部、国家数据局、国家网信办、市场监管总局、工信部、国务院国资委公开文件[7][9][12][24]

十一、金融、政务、央国企必须先建控制面,再谈语义化和Agent自主化

金融机构必须把数据安全责任、数据目录、分类分级、风险评估和持续监测落到具体系统。金融监管总局《银行保险机构数据安全管理办法》共九章81条,要求建立数据分类分级保护制度、数据目录和差异化保护;违反规定可责令暂停或终止相关服务,银行业金融机构还可能面临罚款及人员责任[4]。金融AI还叠加客户授权、最小必要、专事专用、留存清理、算法公平和模型风险管理。因此,金融RAG首先要处理客户授权、产品版本、监管口径和引用证据;金融Agent只能在明确边界内调用只读或人工审批工具,不能把生成建议直接等同于业务决定。

建设银行的公开实践具有可复制的方法论,但不可复制其规模。其副行长表示,已建立覆盖业务、数据、模型和网络安全的多维防控体系,落实监管备案、提示词防护、渗透测试、知识库合规使用,并明确使用人作为决策主体[21]。可复制的是“业务、数据、模型、网络、审计联合控制”和“人保留责任”;不可复制的是大型银行专属云、智算规模、模型组合和信创路径。中小金融机构应优先采用受控云或本地部署、统一知识准入、精细权限、人工复核和可审计回放,不必复制超大基座。

政务与公共数据场景的主要约束是授权、用途、输出和公共责任。对公共数据授权运营、可信数据空间等场景,应保存数据来源、授权文件、用途、调用主体、费用、输出、保留期限和审计;面向公众生成内容时,还要检查生成式服务备案/安全评估、显式/隐式标识等适用性。Agent只能访问授权范围内的数据,禁止把政务原始数据用于训练或外传,除非另有合法基础和授权。政务知识库最容易出现的错误是旧政策、草案、废止文件继续在线,因此版本、生效状态和权威源比向量规模更重要。

央国企需要把国资监管、信创与数据/AI治理合并设计。国务院国资委2025年部署深化中央企业“AI+”专项行动,要求突破数据难题、分批建设重点行业数据集;2026年进一步提出提升全链条数据治理能力,中央企业牵头11个行业可信数据空间[5]。央国企不应把AI治理做成独立项目,而应与网络安全、数据安全、国资监管报送、信创替代、供应链安全和内部审计统一。信创约束会提高异构数据库、国产GPU/CPU、操作系统、中间件和安全产品的集成与验证成本,因此平台选型必须要求开放接口、标准SQL/API、可替换模型和可导出血缘,不能锁定单一技术栈。

行业规范与监管规则的优先级高于技术趋势。企业应建立“规则库—控制库—证据库”映射:规则库保存法律和内部制度;控制库把要求转成权限、审批、日志、标识和评测;证据库保存配置、审批、扫描、演练和审计记录。金融行业由金融监管总局和央行体系规则优先;政务由数据安全、个人信息、公共数据授权和生成内容规则共同约束;央国企还需叠加国资、信创、供应链和监管报送要求。规则变化应触发控制复核,而不是只在年度制度评审中处理。

十二、可复制的不是技术栈,而是高价值场景中的“语义+控制+人工责任”组合

南方电网“明月”证明了多智能体可以进入高要求业务,但证明了人类审核不可省略。“明月”融合知识图谱、强化学习与大模型微调,日均可编制10余项调度报表、拟写50余项调度指令、处置100余条告警、完成200余次智能话务通知,全时段监护安全与市场合规业务1000余项,应急处置从小时级压缩至5分钟内;调度指令仍需人工审核后执行[20]。其可复制部分是“用知识图谱/规则约束模型、高频任务自动化、关键执行人工确认”,而不是其模型底座、算力规模或具体场景。

图3:南方电网“明月”公开的运行负荷显示,系统承担大量高频辅助任务,但关键调度指令保留人工审核。数据来源:中国能源新闻网《国内首个多智能体协作省级电网AI调度员上线》[20]

建设银行案例说明,安全投入必须覆盖知识库、模型、提示词和业务责任,而不是只做内容过滤。其公开治理框架包括业务、数据、模型、网络安全,以及备案、提示词防护、渗透测试、知识库合规和“使用人为决策责任主体”[21]。可复制的是联合防线,不可复制的是其集团规模、专属算力和技术选型。中小企业应把有限预算集中在知识准入、最小权限、引用、人工审核、日志和停止开关,而不是复制全套安全产品。

中国石油炼化数据集案例说明,AI价值首先取决于数据与机理是否可用。该项目通过数据收集、处理、标注和管理,融合炼化工艺机理,形成2.2TB高质量时序数据集;模型预测准确度达到95%以上,并搭建运行优化多智能体平台[19]。这里的“数据治理”不是资产目录展示,而是时间对齐、语义对齐、标注、工艺机理约束和模型验证。其可复制边界是:高价值工业数据必须结合领域知识,不能把普通文档RAG直接用于生产控制。

案例复制必须服从四道边界:场景同质、风险等级、组织能力和数据权利。技术架构可以借鉴,业务责任不能外包;模型可以替换,权威源不能缺失;平台可以采购,领域语义仍需企业自建;Agent可以自动执行,不可逆操作仍需人工确认。若场景不是高频、知识密度高、答案可验证且业务收益明确,不应为了“完成AI项目”强行上Agent。

十三、最终判断:治理重构的主线是建立机器可执行、业务可负责、监管可验证的控制面

判断一:未来三年的赢家不是拥有最多模型的企业,而是拥有最少冲突、最清晰证据和最强控制面的企业。模型能力会持续商品化,文档、提示词和Agent工具则高度个性化。治理把企业独有业务语言、权威事实、权限、责任和审计转化为可复用能力。行业共识是,高质量数据决定AI可用;作者进一步判断,高质量治理决定AI能否进入核心业务。没有责任、时效和来源的数据即使丰富,也可能只制造更流畅的错误。

判断二:知识治理应从“治理所有知识”转向“治理影响关键决策的少量事实”。企业不必给全部文档做本体,而应先识别高频问题、错误成本最高的问题、容易过期的条款、多个来源冲突的条款和需要引用的结论。80%的文档可以保持目录化或轻量索引,只有20%高价值、高频、跨域知识需要进入强语义治理。这不是“二八法则的必然比例”,而是防止本体膨胀的经验性设计原则。

判断三:Agent治理应从“能不能用”升级为“能调用什么、能改什么、谁批准、能否回滚”。身份、最小权限、沙箱、审批、审计、回放、停止和凭证回收是生产Agent的最低控制集合。公开事故已经证明默认配置、未授权触发、密钥泄露和不受控工具足以产生隐私、账单和文件风险[11]。这类案例并非Agent必然造成损失,但足以否定“先上线、后治理”的做法。

判断四:AI自动治理是劳动放大器,不是责任转移器。AI可扩大扫描、推荐、监控和初稿生成规模,但业务正确性、权威源、风险接受、冲突裁决和事故处置仍由人类负责。企业应把自动化率、接受率、误报率和漏报率共同纳入绩效,不能只考核“自动处理量”。若AI推荐无人验收,自动治理最终只会加速错误扩散。

判断五:政策合规是必要下限,业务可验证价值是可持续上限。数据分类分级、个人信息、生成内容标识、数据资源和可信数据空间等政策能够推动预算和责任落实,但若只以“完成制度、完成采购、完成入表”为目标,容易形成合规货架,不能形成知识复用和Agent可靠性。企业应把合规控制嵌入业务平台,用可量化结果证明投资回报;审计也要从检查制度文件转向检查控制是否真实运行。

十四、未来12个月企业应立即启动的十个动作

企业应在一个季度内完成从资产到风险的“最小闭环”,而不是启动三年宏大工程。第一,建立由CIO/CDO牵头、业务与法务共同负责的数据+AI治理委员会,按P0—P2风险分级。第二,完成数据、文档、模型、Agent、工具、凭证和外部数据源六类资产清册。第三,选择一个高频、知识密集、低不可逆影响的场景作为试点。第四,为知识文档建立来源、版本、有效期、Owner、分类分级和批准状态。第五,RAG只采用“解析质检+权限过滤+混合召回+重排+引文+拒答”的基础架构。第六,给Agent唯一身份、短期凭证、最小权限和停止开关,禁止继承员工账号。第七,为高风险动作建立模拟、审批、回滚和审计。第八,建立找数、召回、引用、任务成功率、人工接管、成本和安全事件基线。第九,将AIGC标识、模型版本、提示词和证据链纳入数据保留与审计。第十,每季度复盘,只把通过业务、安全和成本门槛的能力复制到新场景。

未来12—24个月的决定性能力是“语义控制面+AI控制面”的融合。统一资产目录要同时覆盖数据、知识、指标、模型、Agent和工具;统一身份要同时管理人、服务账号和Agent;统一策略要同时约束数据访问、模型调用和工具执行;统一可观测要同时记录质量、成本、风险与业务结果。达到这一步后,企业才可能安全开展跨域知识协作、行业数据空间接入和多Agent协同。若控制面仍然分散,Agent数量越多,故障面和攻击面越大。

最终路线不是从“管数据”简单跃迁到“管知识”,而是把数据治理从后台管理升级为AI生产环境的实时控制面。企业需要保留并强化传统治理的权威源、责任、质量和血缘,同时增加语义、证据、Agent行为、AIGC和连续评测。最稳妥的路径是:先让知识可追溯,再让知识可被理解;先让Agent可观察、可审批,再让其有限执行;先让投资可量化,再扩大平台与组织规模。

引用来源

[1]https://www.cnfin.com/cmjj-lb/detail/20260622/4430059_1.html

“企业数据过去大多沉淀在独立的业务系统里。如果让AI直接读取、操作原始业务数据,风险很大。”

[2]https://new.qq.com/rain/a/20260716A0BHSO00

“RAG检索增强生成管道:Query理解与改写……混合检索策略……多路召回与重排序。”

[3]https://m.chinanews.com/wap/detail/chs/zw/jw663937.shtml

“建议做好智能体运行监控与审计追踪……审计追踪能力应保证发生事故后可以还原智能体行为路径。”

[4]https://www.gov.cn/gongbao/2025/issue_11906/202503/content_7011160.html

“银行保险机构违反本办法要求的……责令暂停或者终止服务。”

[5]https://www.ce.cn/cysc//newmain/yc/jsxw/202602/t20260213_2772077.shtml

“中央企业要进一步增强发展人工智能产业的责任感和紧迫感……提升全链条数据治理能力。”

[6]https://www.cac.gov.cn/2025-03/14/c_1743654684782215.htm

“人工智能生成合成内容标识包括显式标识和隐式标识。”

[7]https://www.wnd.gov.cn/doc/2024/11/21/4453180.shtml

“到2028年……建成100个以上可信数据空间,形成一批数据空间解决方案和最佳实践。”

[8]https://www.cac.gov.cn/2023-07/13/c_1690898327029107.htm

“提供者发现违法内容的,应当及时采取停止生成、停止传输、消除等处置措施。”

[9]https://www.news.cn/tech/20260513/9d6b6f3416484ef9b8eab054425b5680/c.html

“根据应用场景和潜在影响,构建审慎稳妥的分类分级治理框架。”

[10]https://dsjj.hechi.gov.cn/gddt/t28095936.shtml

“全国已有25个省(区、市)实质性开展授权运营。”

[11]https://www.chinanews.com.cn/sh/2026/03-24/10591819.shtml

“攻击者通过连续提问获取其运行环境、模型配置、IP地址、真实姓名、公司名称及去年营收数据。”

[12]https://www.gov.cn/gongbao/2023/issue_10746/202310/content_6907744.html

“企业内部数据资源研究开发项目的支出,应当区分研究阶段支出与开发阶段支出。”

[13]https://www.cnr.cn/gd/dwqgc/20260501/t20260501_527607648.shtml

“南方能源行业可信数据空间是由南方电网建设运营的能源行业首个可信数据空间。”

[14]https://www.jjckb.cn/20260625/09ece7baa6884d7198498666e24748aa/c.html

“截至2026年4月30日,A股5000余家企业中,136家披露数据资源入表相关事项,涉及金额37.86亿元。”

[15]https://www.ccgp.gov.cn/cggg/dfgg/cjgg/202512/t20251219_25961841.htm

“数据治理平台建设……中标(成交)金额:648,900.00元。”

[16]https://ggzy.xinjiang.gov.cn/xinjiangggzy/jyxx/001004/001004005/20251224/11010000322339541.html

“数据治理平台……1套 1169000。”

[17]https://finance.sina.com.cn/stock/relnews/cn/2026-07-30/doc-inikquqf5082844.shtml

“非结构化数据治理应立足两大基点——是以应用场景为驱动,二是与AI平台深度融合协同。”

[18]https://city.huanqiu.com/article/4NA5GRfGQBt

“经严格评审,40家企业的51款产品通过评测,涵盖数据治理、智能分析、安全防护等领域。”

[19]https://cqcs.gov.cn/zwxx_164/bmjz/202512/t20251201_15201106.html

“数据量达到2.2TB……预测准确度达到95%以上。”

[20]https://cpnn.com.cn/news/hy/202506/t20250630_1812544.html

“自主拟写调度指令、经人工审核后执行调度操作及信息报送。”

[21]https://www.cnfin.com/hg-lb/detail/20260327/4392433_1.html

“保障知识库的合规使用,确保使用人作为决策主体的责任人。”

[22]https://finance.sina.com.cn/roll/2026-08-27/doc-inipttav5388214.shtml

“中国通信标准化协会(CCSA)大数据技术标准推进委员会(TC601)本体与知识管理工作组(WG15)近日在北京正式成立。”

[23]https://www.163.com/news/article/L5GG704B00019UD6.html

“中国电信星海·智能动态本体平台正式对外发布。”

[24]https://www.cac.gov.cn/2026-01/30/c_1771505108953002.htm

“自当年1月1日起累计向境外提供10万人以上……个人信息……可以通过订立个人信息出境标准合同或个人信息出境认证方式出境。”

[25]https://www.sohu.com/a/1034810220_100279938

“1000个字段的属性补录,从6人天压缩到1天,准确率80%以上。”

如果你感觉写得好,请点击右上角,设为星标+关注+转发,谢谢!

粉丝们看过来,本公众号作者6月份出了一本书《一本书讲透数据指标体系》,有需要的可通过以下链接购买(现在价格是五折,有史最低价,赶紧下单),或去京东搜索书名,通过您中意的链接下单。
另外,8月份,本公众号作者又出了一本新书《Data+AI:基于本体的数据智能体实践》,是当前市场上第一本全面介绍Data Agent从技术、方法论到项目落地的应用类书籍。最在是历史最低价,赶紧下单,后悔你找我。有需要的可通过以下链接购买。或去京东搜索书名,通过您中意的链接下单。
如果你喜欢这些书,可去‘豆瓣’网给个好评,如果对这些书有任何问题或建议,请在本公众号与作者联系反馈。

#数据治理# #智能体# #RAG# #数据要素# #数字化转型# #CIO#

相关学习资料