乐于分享
好东西不私藏

[AI Native转型 #40] 你的Agent治理到哪一级?30分钟测出来

[AI Native转型 #40] 你的Agent治理到哪一级?30分钟测出来

[AI Native转型 #40] 你的Agent治理到哪一级?30分钟测出来

这是"AI Native转型"系列第40篇。上一篇我们聊了Agent成为数字员工后的合规边界——六控制点、OWASP Top 10、五级分类。今天不再讲道理,给工具:一份30分钟能做完的Agent治理成熟度自评表,测完就知道你的治理短板在哪、下一步该做什么。


导语

79%的企业启动了Agent部署,仅11%规模化产出。前四篇我们拆解了中间的68个百分点——选型失误、组织断层、合规盲区。但讲完道理之后,每个读者都会问同一个问题:"道理我都懂,我的企业到底处于什么水平?下一步该做什么?"

这不是一个可以靠"感觉"回答的问题。你可能觉得自己做得不错,但一对照才发现——Agent没有注册、权限没有审计、行为漂移没人监控。诊断不是自我安慰,是发现问题。

今天这篇,就是一份30分钟Agent治理成熟度快速诊断。它基于2026年5月三部门《智能体规范应用与创新发展实施意见》的分类分级框架、信通院可信智能体评估体系、微软Agent Governance Toolkit的治理原则,以及对标国际最佳实践。你可以把它当作一份"Agent治理体检报告"——不需要外部顾问,不需要采购工具,现在就做。


一、成熟度诊断为什么是现在?

2026年5月8日,国家网信办、国家发改委、工信部联合印发《智能体规范应用与创新发展实施意见》(下称《实施意见》),这是中国首个针对AI Agent的顶层治理文件。它明确提出三个硬性要求:

  1. 1. 分类分级治理:根据应用场景和潜在影响,对Agent实施差异化管控。高风险领域(政务、金融、医疗)实行备案+检测+召回;低风险领域实行合规自测+行业自律。
  2. 2. 全链路可追溯:Agent的每次决策、每次工具调用,必须"行为可审计、决策可溯源、风险可处置"。
  3. 3. 编制成熟度报告:《实施意见》第12条明确要求"编制并发布智能体技术及应用成熟度报告"。

与此同时,2026年6月10日,新华网联合信通院发布了《智能助手类智能体安全分级规范与建设指南》,构建了L1到L5五级递进式安全分级体系。6月18日,七部门联合印发行动方案,要求加快智能体互联协议(AIP)标准研制。

政策信号已经非常清晰:Agent治理不是"最好有",是"必须有"。 但政策文件是框架,不是操作手册。企业需要的是一个能自己上手、30分钟做完、有明确结果和行动建议的诊断工具。

这就是本文的目标。


二、五维四级成熟度诊断模型

我们设计了一套"五维四级"成熟度诊断模型。五个维度对齐《实施意见》核心要求和国际最佳实践,四个等级覆盖从"没管"到"自优化"的完整演进路径。

五个诊断维度

维度
核心问题
对齐依据
D1 身份与权限
你知道企业里有多少Agent?每个Agent的权限有多大?
实施意见分类分级+三种决策权限;微软零信任身份+最小权限原则
D2 行为管控
你能实时知道Agent在做什么吗?异常行为能被自动拦截吗?
实施意见四层防护体系(规则内嵌+行为围栏);微软AGT策略引擎
D3 审计与追溯
出了事能追溯到是哪个Agent的哪次决策导致的吗?
实施意见全链路可追溯+区块链可验证;微软Merkle链防篡改审计日志
D4 组织与流程
谁对Agent负责?Agent的上线/变更/退役有流程吗?
实施意见责任体系(开发者+平台+用户三方);微软Agent生命周期管理
D5 持续监控
Agent上线后行为有变化吗?权限有没有悄悄膨胀?
实施意见成熟度报告要求;微软AGT SRE+行为漂移检测+Kill Switch

四个成熟度等级

等级
一句话描述
典型特征
L1 初始级
有Agent,没治理
没有Agent名册,权限靠口头约定,出了问题靠"问一下谁负责"
L2 管理级
有制度,未落地
有书面制度但执行靠人工,Agent数量≥5开始失控,做不到实时监控
L3 定义级
标准化,可重复
治理流程标准化,关键指标量化监控,审计日志可追溯,异常可自动告警
L4 优化级
自动化,自优化
策略引擎自动执行,行为漂移自动检测,权限自动审计,治理从"成本项"变成"组织能力"

行业基准参照:根据爱分析《2026央国企智能体实践报告》(2026-06-29),绝大多数央国企处于L1→L2过渡期,已完成统一底座搭建的头部企业处于L2→L3。L4为前瞻目标,目前国内外均无企业完全达到。


三、30分钟自评表(20题)

以下20道题,每题4个选项,分别对应L1-L4。请如实选择最接近你企业现状的选项。

D1:身份与权限(4题)

题1:你的企业有多少个Agent?你知道吗?

选项
等级
A. 不知道,没数过
L1
B. 大概知道,但靠人工记忆,没有统一登记
L2
C. 有Agent数字名册,记录了每个Agent的职责、权限、责任人
L3
D. 名册自动维护,Agent上线/变更/退役同步更新,且与IAM系统联动
L4

题2:你的Agent是怎么拿到权限的?

选项
等级
A. 开发时给了什么权限就什么权限,没管过
L1
B. 有权限申请流程,但审批靠人工,没有定期审计
L2
C. 每个Agent有最小权限定义,月度审计,权限变更有审批留痕
L3
D. 权限自动分配+自动审计+超限自动告警,支持OBO(替授权用户执行)模型
L4

题3:你的Agent有没有独立身份?

选项
等级
A. Agent共享系统账号,出了问题不知道是谁干的
L1
B. 部分Agent有独立账号,但身份管理不统一
L2
C. 每个Agent有独立身份标识,可注册、可禁用、可审计
L3
D. 采用零信任身份架构,Agent身份基于加密凭证,支持信任评分动态衰减
L4

题4:你的Agent是哪种决策权限模式?

选项
等级
A. 没区分过,Agent想做就做
L1
B. 大致知道哪些Agent可以自主决策,但边界模糊
L2
C. 明确区分了"仅限用户决策/需用户授权/Agent自主决策"三种模式,高风险操作强制人工审批
L3
D. 权限模式动态调整,基于Agent行为信用分和历史合规记录自动升降级
L4

D2:行为管控(4题)

题5:你能实时知道Agent在做什么吗?

选项
等级
A. 不知道,Agent在后台跑,没人看
L1
B. 有日志,但只有出了问题才去查
L2
C. 有实时监控仪表板,关键操作可追踪,异常可告警
L3
D. 全链路实时可视化,Agent思考链、工具调用、状态变更一目了然
L4

题6:你的Agent安全防线是什么?

选项
等级
A. 只在Prompt里写了"请遵守安全规则"
L1
B. 有Prompt约束+基础权限控制,但缺乏应用层策略
L2
C. 应用层策略引擎+架构控制+运行时监控,至少三层防护
L3
D. 多层防护+策略引擎自动执行(p99<0.1ms),覆盖OWASP Agentic Top 10全部风险
L4

题7:如果Agent行为异常,你能随时叫停吗?

选项
等级
A. 没有Kill Switch,出了问题只能手动关服务
L1
B. 有紧急停止机制,但需要人工判断和触发
L2
C. 有Kill Switch,一键熔断,测试响应时间<30秒,确认状态可回滚
L3
D. Kill Switch全自动:异常检测→自动熔断→根因分析→安全恢复,全流程无需人工介入
L4

题8:你的Agent运行在什么环境中?

选项
等级
A. 直接在服务器上跑,没有隔离
L1
B. 有基础容器隔离,但无分层权限控制
L2
C. 多级沙箱隔离,Agent在受限环境中执行,高风险操作在独立沙箱中运行
L3
D. 四层权限环隔离(Kernel→Supervisor→User→Untrusted),每层有独立安全边界
L4

D3:审计与追溯(4题)

题9:你的Agent操作记录可以追溯吗?

选项
等级
A. 基本没有审计日志
L1
B. 有操作日志,但只记录"做了什么",不记录"为什么这么做"
L2
C. 全链路审计:意图→规划→工具调用→中间结果→最终输出,完整可追溯
L3
D. 全链路审计+防篡改(如基于Merkle链),审计日志保留≥90天,支持合规导出
L4

题10:如果多个Agent协作出了错,能追溯到是谁的决策导致的吗?

选项
等级
A. 不能,多Agent协作是黑盒,不知道谁做了什么
L1
B. 大致知道每个Agent的任务范围,但无法精确追溯决策链
L2
C. 每个Agent的"意图→规划→工具调用→结果"都有独立记录,可以追溯级联故障的根因Agent
L3
D. 全链路因果图谱+跨Agent决策追溯,自动定位级联故障根因,支持一键回滚
L4

题11:你的审计日志会不会被篡改?

选项
等级
A. 日志是普通文本文件,理论上可以被修改
L1
B. 日志有访问控制,但没有防篡改机制
L2
C. 审计日志不可篡改,有完整性校验,删除/修改操作有独立记录
L3
D. 基于区块链或Merkle链的防篡改日志,任何修改尝试都会被检测并告警
L4

题12:你能回答"三个月前Agent A为什么做了操作X"吗?

选项
等级
A. 不能,日志早就被覆盖或没有记录
L1
B. 可能可以,但需要花大量时间翻日志
L2
C. 可以,审计日志结构化存储,支持按Agent/时间/操作类型快速检索
L3
D. 可以,且有AI辅助的审计分析工具,自动识别异常操作模式和合规风险
L4

D4:组织与流程(4题)

题13:谁对Agent的行为负责?

选项
等级
A. 不清楚,出了事再说
L1
B. 大致知道归IT部门管,但具体责任人未明确
L2
C. 每个Agent有明确的责任人(业务owner+技术owner),记录在数字员工名册中
L3
D. 责任人制度+责任矩阵+定期问责,Agent行为纳入绩效考核体系
L4

题14:Agent上线有流程吗?

选项
等级
A. 没有,开发做完了就直接上线
L1
B. 有简单的审批流程,但无安全评估环节
L2
C. 有标准上线流程:安全评估→权限审核→POC验证→生产审批→上线后30天监控
L3
D. 上线流程全自动化,含自动安全扫描+合规校验+灰度发布,不合格自动阻断
L4

题15:Agent退役有流程吗?

选项
等级
A. 不用了就关掉,没人管数据清理和权限回收
L1
B. 有退役通知,但数据清理和权限回收靠人工
L2
C. 有标准退役流程:通知→权限回收→数据清理→审计日志归档→名册更新
L3
D. 退役自动触发:连续N天未使用→自动降权→审核→清理→归档,全流程可追溯
L4

题16:你的团队有人懂Agent治理吗?

选项
等级
A. 没有专门的人,出了问题找IT
L1
B. 有IT人员兼任,但没有专业治理知识
L2
C. 有专职Agent治理角色(或明确职责),具备行业合规知识+技术治理能力
L3
D. 有Agent治理团队/委员会,覆盖安全、合规、业务、技术,定期培训+知识更新
L4

D5:持续监控(4题)

题17:Agent上线后,你还管它吗?

选项
等级
A. 上线就完了,不管了
L1
B. 出了问题才去看,没有主动监控
L2
C. 有持续监控,关键指标(准确率、响应时间、异常率)定期Review
L3
D. 全自动持续监控+行为漂移检测+预测性维护,问题在发生前就被发现
L4

题18:Agent的权限有没有"悄悄膨胀"?

选项
等级
A. 不知道,没查过
L1
B. 偶尔会检查,但不定期
L2
C. 月度权限审计,权限变更必须审批,发现超限自动告警
L3
D. 权限自动审计+超限自动降权,权限膨胀趋势可视化+预测
L4

题19:Agent的行为有没有"悄悄漂移"?

选项
等级
A. 不知道什么是行为漂移
L1
B. 知道这个概念,但没有监测手段
L2
C. 建立了行为基线,准确率/输出分布/工具调用频率定期对比,偏离基线自动告警
L3
D. 行为漂移自动检测+根因分析+自动修复,漂移超过阈值自动触发重新评估
L4

题20:你能用数据证明Agent的治理成效吗?

选项
等级
A. 没有数据,治理效果靠感觉
L1
B. 有一些基础数据,但没有系统化追踪
L2
C. 有KRI指标体系(安全、合规、效能、公平性),定期生成治理报告
L3
D. 治理ROI可量化,KRI指标自动采集+仪表板实时展示,治理成效与业务KPI挂钩
L4

四、计分与结果解读

计分规则

  • • 选A = 1分(L1)
  • • 选B = 2分(L2)
  • • 选C = 3分(L3)
  • • 选D = 4分(L4)
  • • 总分 = 20题得分之和(满分80分)

成熟度判定

总分
整体等级
解读
20-30
L1 初始级
有Agent,没治理。你的Agent基本处于"裸奔"状态
31-50
L2 管理级
有制度,未落地。治理靠人,Agent数量≥5就会失控
51-65
L3 定义级
标准化,可重复。治理体系已建立,关键指标可量化
66-80
L4 优化级
自动化,自优化。治理从成本变成竞争力

各维度诊断

算出每个维度的得分(4题×4分=满分16分),可以定位具体短板:

维度得分
等级
4-6
L1
7-10
L2
11-14
L3
15-16
L4

行业基准位置

等级
你的位置
行业参照
L1
你是大多数
爱分析2026报告显示,绝大多数企业Agent治理处于"试点阶段",缺乏体系化治理
L2
你在追赶
央国企中已启动统一底座建设的头部企业处于此阶段,治理制度已建立但执行靠人工
L3
你是领先者
少数头部企业完成标准化治理体系建设,具备全链路审计和量化监控能力
L4
你是前瞻者
目前国内外均无企业完全达到。部分能力(如策略引擎、防篡改审计)可参考微软AGT

每级的行动建议

如果你是L1初始级 → 优先做这3件事:

  1. 1. 建立Agent数字名册(本周完成):一张简单的表格,记录每个Agent的名称、职责、权限范围、责任人。这是治理的起点,也是《实施意见》分类分级的前提。
  2. 2. 配置Kill Switch(两周内完成):确保每个Agent都有紧急停止机制。不需要全自动,但必须保证"发现异常→一键停止"的链路畅通。
  3. 3. 做一次权限盘点(本月完成):梳理每个Agent当前拥有的权限,标记出"看起来不太需要"的权限,为后续最小权限改造做准备。

如果你是L2管理级 → 优先做这3件事:

  1. 1. 建立Agent上线/退役标准流程(本月完成):不能每个Agent的上线方式都不一样。标准流程至少包含:安全评估→权限审核→POC验证→生产审批→上线后30天监控。退役流程同样重要——权限回收、数据清理、日志归档。
  2. 2. 部署全链路审计(本季度完成):从"只记录操作"升级到"记录意图→规划→工具调用→中间结果→最终输出"。审计日志至少保留90天,不可篡改。
  3. 3. 建立Agent行为基线(本季度完成):定义每个Agent的"正常行为"——准确率、输出分布、工具调用频率。偏离基线自动告警。行为漂移是Agent治理中最容易被忽视但最致命的问题之一。

如果你是L3定义级 → 优先做这3件事:

  1. 1. 引入策略引擎(本季度完成):将安全规则从Prompt迁移到应用层策略引擎。微软AGT的实测数据:纯Prompt防护违规率26.67%,应用层策略引擎0.00%。这不是"锦上添花",是"从根上换防线"。
  2. 2. 建立KRI指标体系(本季度完成):关键风险指标(KRI)至少覆盖安全、合规、效能、公平性四个维度。每个指标有基线和告警阈值。治理没有量化,就等于没有治理。
  3. 3. 启动Agent治理成熟度年度复评(建立制度):治理不是一次性的。每半年或一年复评一次,追踪成熟度变化趋势。把自评结果纳入管理层汇报。

如果你是L4优化级:恭喜,你的Agent治理已经达到行业领先水平。但别松懈——Agent治理的终极挑战不是"达到L4",而是"保持L4":Agent数量在增长、模型在更新、攻击手段在进化、政策在变化。治理体系需要持续演进。


五、诊断不是终点,是起点

回到文章开头那个问题:79%的企业启动了Agent部署,但只有11%规模化产出。 中间的68个百分点,拆开了看,每一个百分点背后都是一个治理缺口。

有人说,Agent治理是"安全团队的事"。这是错的。Agent治理是组织设计的事——当你的企业里有数字员工在运行,你需要回答的问题和管人一样:它们是谁?权限多大?行为正常吗?谁对它们负责?做错了怎么办?

有人说,Agent治理是"有了Agent之后才需要做的事"。这也是错的。信通院2026年3月启动的智能体评估、5月出台的《实施意见》、6月发布的安全分级指南——政策节奏和产业节奏正在同步加速。治理不是Agent上线后的"补课",而是Agent上线前的"必修课"。

今天这份30分钟自评,不是为了给你一个分数,而是为了让你看到——你现在在哪、下一步该去哪。诊断不是终点,是起点。做完自评,把分数最低的维度作为下一个月的优先改进项,一个月后再测一次。

治理不是一次性工程,是持续进化的能力。从今天开始,从这20道题开始。


下一篇预告:我们将从"诊断"进入"行动"——做完自评发现自己处于L1/L2?从"拿一个Agent试试"到"跑通第一个POC",30天实操手册。


2026年7月7日 · 第40篇 · 系列"AI Native转型"