[AI Native转型 #40] 你的Agent治理到哪一级?30分钟测出来
这是"AI Native转型"系列第40篇。上一篇我们聊了Agent成为数字员工后的合规边界——六控制点、OWASP Top 10、五级分类。今天不再讲道理,给工具:一份30分钟能做完的Agent治理成熟度自评表,测完就知道你的治理短板在哪、下一步该做什么。
导语
79%的企业启动了Agent部署,仅11%规模化产出。前四篇我们拆解了中间的68个百分点——选型失误、组织断层、合规盲区。但讲完道理之后,每个读者都会问同一个问题:"道理我都懂,我的企业到底处于什么水平?下一步该做什么?"
这不是一个可以靠"感觉"回答的问题。你可能觉得自己做得不错,但一对照才发现——Agent没有注册、权限没有审计、行为漂移没人监控。诊断不是自我安慰,是发现问题。
今天这篇,就是一份30分钟Agent治理成熟度快速诊断。它基于2026年5月三部门《智能体规范应用与创新发展实施意见》的分类分级框架、信通院可信智能体评估体系、微软Agent Governance Toolkit的治理原则,以及对标国际最佳实践。你可以把它当作一份"Agent治理体检报告"——不需要外部顾问,不需要采购工具,现在就做。
一、成熟度诊断为什么是现在?
2026年5月8日,国家网信办、国家发改委、工信部联合印发《智能体规范应用与创新发展实施意见》(下称《实施意见》),这是中国首个针对AI Agent的顶层治理文件。它明确提出三个硬性要求:
1. 分类分级治理:根据应用场景和潜在影响,对Agent实施差异化管控。高风险领域(政务、金融、医疗)实行备案+检测+召回;低风险领域实行合规自测+行业自律。 2. 全链路可追溯:Agent的每次决策、每次工具调用,必须"行为可审计、决策可溯源、风险可处置"。 3. 编制成熟度报告:《实施意见》第12条明确要求"编制并发布智能体技术及应用成熟度报告"。
与此同时,2026年6月10日,新华网联合信通院发布了《智能助手类智能体安全分级规范与建设指南》,构建了L1到L5五级递进式安全分级体系。6月18日,七部门联合印发行动方案,要求加快智能体互联协议(AIP)标准研制。
政策信号已经非常清晰:Agent治理不是"最好有",是"必须有"。 但政策文件是框架,不是操作手册。企业需要的是一个能自己上手、30分钟做完、有明确结果和行动建议的诊断工具。
这就是本文的目标。
二、五维四级成熟度诊断模型

我们设计了一套"五维四级"成熟度诊断模型。五个维度对齐《实施意见》核心要求和国际最佳实践,四个等级覆盖从"没管"到"自优化"的完整演进路径。
五个诊断维度
| D1 身份与权限 | ||
| D2 行为管控 | ||
| D3 审计与追溯 | ||
| D4 组织与流程 | ||
| D5 持续监控 |
四个成熟度等级
| L1 初始级 | ||
| L2 管理级 | ||
| L3 定义级 | ||
| L4 优化级 |
行业基准参照:根据爱分析《2026央国企智能体实践报告》(2026-06-29),绝大多数央国企处于L1→L2过渡期,已完成统一底座搭建的头部企业处于L2→L3。L4为前瞻目标,目前国内外均无企业完全达到。
三、30分钟自评表(20题)

以下20道题,每题4个选项,分别对应L1-L4。请如实选择最接近你企业现状的选项。
D1:身份与权限(4题)
题1:你的企业有多少个Agent?你知道吗?
题2:你的Agent是怎么拿到权限的?
题3:你的Agent有没有独立身份?
题4:你的Agent是哪种决策权限模式?
D2:行为管控(4题)
题5:你能实时知道Agent在做什么吗?
题6:你的Agent安全防线是什么?
题7:如果Agent行为异常,你能随时叫停吗?
题8:你的Agent运行在什么环境中?
D3:审计与追溯(4题)
题9:你的Agent操作记录可以追溯吗?
题10:如果多个Agent协作出了错,能追溯到是谁的决策导致的吗?
题11:你的审计日志会不会被篡改?
题12:你能回答"三个月前Agent A为什么做了操作X"吗?
D4:组织与流程(4题)
题13:谁对Agent的行为负责?
题14:Agent上线有流程吗?
题15:Agent退役有流程吗?
题16:你的团队有人懂Agent治理吗?
D5:持续监控(4题)
题17:Agent上线后,你还管它吗?
题18:Agent的权限有没有"悄悄膨胀"?
题19:Agent的行为有没有"悄悄漂移"?
题20:你能用数据证明Agent的治理成效吗?
四、计分与结果解读
计分规则
• 选A = 1分(L1) • 选B = 2分(L2) • 选C = 3分(L3) • 选D = 4分(L4) • 总分 = 20题得分之和(满分80分)
成熟度判定
| L1 初始级 | ||
| L2 管理级 | ||
| L3 定义级 | ||
| L4 优化级 |
各维度诊断
算出每个维度的得分(4题×4分=满分16分),可以定位具体短板:
行业基准位置
每级的行动建议
如果你是L1初始级 → 优先做这3件事:
1. 建立Agent数字名册(本周完成):一张简单的表格,记录每个Agent的名称、职责、权限范围、责任人。这是治理的起点,也是《实施意见》分类分级的前提。 2. 配置Kill Switch(两周内完成):确保每个Agent都有紧急停止机制。不需要全自动,但必须保证"发现异常→一键停止"的链路畅通。 3. 做一次权限盘点(本月完成):梳理每个Agent当前拥有的权限,标记出"看起来不太需要"的权限,为后续最小权限改造做准备。
如果你是L2管理级 → 优先做这3件事:
1. 建立Agent上线/退役标准流程(本月完成):不能每个Agent的上线方式都不一样。标准流程至少包含:安全评估→权限审核→POC验证→生产审批→上线后30天监控。退役流程同样重要——权限回收、数据清理、日志归档。 2. 部署全链路审计(本季度完成):从"只记录操作"升级到"记录意图→规划→工具调用→中间结果→最终输出"。审计日志至少保留90天,不可篡改。 3. 建立Agent行为基线(本季度完成):定义每个Agent的"正常行为"——准确率、输出分布、工具调用频率。偏离基线自动告警。行为漂移是Agent治理中最容易被忽视但最致命的问题之一。
如果你是L3定义级 → 优先做这3件事:
1. 引入策略引擎(本季度完成):将安全规则从Prompt迁移到应用层策略引擎。微软AGT的实测数据:纯Prompt防护违规率26.67%,应用层策略引擎0.00%。这不是"锦上添花",是"从根上换防线"。 2. 建立KRI指标体系(本季度完成):关键风险指标(KRI)至少覆盖安全、合规、效能、公平性四个维度。每个指标有基线和告警阈值。治理没有量化,就等于没有治理。 3. 启动Agent治理成熟度年度复评(建立制度):治理不是一次性的。每半年或一年复评一次,追踪成熟度变化趋势。把自评结果纳入管理层汇报。
如果你是L4优化级:恭喜,你的Agent治理已经达到行业领先水平。但别松懈——Agent治理的终极挑战不是"达到L4",而是"保持L4":Agent数量在增长、模型在更新、攻击手段在进化、政策在变化。治理体系需要持续演进。
五、诊断不是终点,是起点
回到文章开头那个问题:79%的企业启动了Agent部署,但只有11%规模化产出。 中间的68个百分点,拆开了看,每一个百分点背后都是一个治理缺口。
有人说,Agent治理是"安全团队的事"。这是错的。Agent治理是组织设计的事——当你的企业里有数字员工在运行,你需要回答的问题和管人一样:它们是谁?权限多大?行为正常吗?谁对它们负责?做错了怎么办?
有人说,Agent治理是"有了Agent之后才需要做的事"。这也是错的。信通院2026年3月启动的智能体评估、5月出台的《实施意见》、6月发布的安全分级指南——政策节奏和产业节奏正在同步加速。治理不是Agent上线后的"补课",而是Agent上线前的"必修课"。
今天这份30分钟自评,不是为了给你一个分数,而是为了让你看到——你现在在哪、下一步该去哪。诊断不是终点,是起点。做完自评,把分数最低的维度作为下一个月的优先改进项,一个月后再测一次。
治理不是一次性工程,是持续进化的能力。从今天开始,从这20道题开始。
下一篇预告:我们将从"诊断"进入"行动"——做完自评发现自己处于L1/L2?从"拿一个Agent试试"到"跑通第一个POC",30天实操手册。
2026年7月7日 · 第40篇 · 系列"AI Native转型"
夜雨聆风