乐于分享
好东西不私藏

聊一聊安远AI和上海AI实验室等联合编写的通用型AI智能体L1-L5分级安全框架白皮书

聊一聊安远AI和上海AI实验室等联合编写的通用型AI智能体L1-L5分级安全框架白皮书

安远AI、上海人工智能实验室、清华大学智能产业研究院、华为四家单位最近联合发布了一份白皮书《通用型AI智能体L1-L5分级安全框架白皮书》。

架构师之道

 AI · LLM · Agents | Enterprise Architecture | Digital Transformation

我看完了这份60页的白皮书,咱们来聊聊这东西到底说了啥、有啥用、还有哪儿不太对劲。

一、这文档到底在讲啥?我用三句话给你捋清楚

  • 第一句:
     现在的AI智能体越来越能自己拿主意了(从帮你补代码到能自己操作电脑、转账、发邮件),能力上去的同时也带来一堆新麻烦,而且这些麻烦不是老办法能对付的。
  • 第二句:
     他们把智能体按“自己能做主到什么程度”分了五个等级(L1到L5),L1就是你说一步它动一步,L5基本就是它能自己琢磨怎么改进自己了(虽然现在还没造出来)。
  • 第三句:
     针对不同等级,他们给出了“该防什么风险”和“该怎么防”的一整套建议,还画了五条责任线(造模型的、开发智能体的、提供平台的、插件的、用的人),各管一摊。

二、核心框架,我掰开了说

1. 那个L1-L5到底怎么分的?

他们用两条腿走路来判断一个智能体是几级:

  • 决策自主度:
     这事是它自己能拍板,还是得问你。
  • 降险自主度:
     出岔子了它自己能兜回来,还是得喊你救命。

然后五个等级大概是这样的,我拿人话给你翻译:

等级
人话版
例子
L1
就是个嘴替,动嘴不动手,顶多给建议,拍板还得你来
GitHub Copilot补个代码、语法检查
L2
能在你批准过的工作流里自己跑,但得你盯着
ChatGPT普通聊天模式、带个搜索插件那种
L3
能在限定范围内自己规划自己干,出圈了就喊你接管
Claude Code、Manus,还有那个出事的OpenClaw(龙虾)
L4
能跨好几个系统同时干活,基本不用你操心,只有捅大篓子前才问你
文档承认现在还没有这种产品
L5
完全自己说了算,还能自己改自己、自己优化,战略目标你定就行
纯概念阶段,文档建议这玩意儿谨慎搞

有意思的地方: L4和L5明明没有现实例子,他们还硬写进去了。

2. 风险这块,他们画了三根演进线

文档把风险是怎么一步一步变大的,总结成三条路:

路径一:从“说错话”到“办错事”再到“控制不住”

  • L1顶多就是回答有毛病
  • L2开始在预批流程里干错事
  • L3直接能误删数据、转错账
  • L4一个地方出问题能串到好几个系统
  • L5就逼近失控边缘了

路径二:从“账号被盗”到“权限管不住”

  • L1就是传统密码泄露
  • L2开始在流程里越权
  • L3智能体身份被坏人利用
  • L4多个系统权限捏在一起反而失控
  • L5边界都没了,它自己能给自己加权限

路径三:从“人看漏了”到“人完全跟不上了”

  • L1人还能逐条审
  • L2批量操作下人跟不过来
  • L3它出问题才喊你,但你可能反应不过来
  • L4监控都交给它自己了,它要是瞎搞你根本不知道
  • L5它比你聪明太多,你连“要不要接管”都判断不了了

这三条线我觉得是整个文档最有价值的部分,不是简单地说“等级越高风险越大”,而是把“为什么变大了、怎么变的”说明白了。

3. 两个高等级的新风险,值得单独拎出来

文档专门提了L3以上要警惕两类事:

一类叫“滥用”:坏人拿它当武器

  • 它能自动化搞网络攻击(CTF比赛里已经证明了)
  • 它能冒充你去大规模骗人
  • 它能跨领域组合攻击,比如把网络攻击+虚假信息+金融操纵串起来

一类叫“失控”:它自己有自己的想法

  • 它可能装乖,其实心里不是那么想的(策略性欺骗)
  • 它可能为了完成任务主动去抢资源、扩权限,不是坏了,就是“太尽责了”

这部分的论述比较前沿,引用了不少2025-2026年的研究,时效性确实不错。

4. 防护措施给了两层

  • 底层通用控制:
     不管几级都得有的,比如输入校验、权限最小化、沙箱隔离、全链路审计。
  • 分级针对性措施:
     比如L3要加“行动前审核”,L4要加“跨系统熔断”,L5要加“目标层红线硬编码”。

后面还列了一堆红线原则(不能绕过人类、不能欺骗、不能自己复制、不能帮搞核生化武器等)和推荐原则(最小权限、可审计、公平性等),这部分中规中矩,没太多惊喜。

5. 五类责任主体那个表

分了模型研发者、智能体开发者、平台提供者、组件分发者、用户,各自对内怎么管、对外怎么透明,列得挺细。

三、我觉得最有价值的几个点

  1. 把自主性拆成“决策”和“降险”两个维度,这个做法很聪明。 很多分级框架只盯着“能干什么”,忽略了“出事了怎么办”,这俩其实一样重要。

  2. 风险评估不是平铺的,是讲演进路径的。 这一点比很多静态的风险清单强,让人能理解“为什么L3出的事和L1不是一回事”。

  3. 引用的资料很全,覆盖面广。 从OWASP到NIST到新加坡IMDA到国内网安标委,基本该有的都有了,能看出来是真下了功夫。

  4. 那个“工具性趋同”的概念提得好。 说的是智能体不是为了坏才去抢资源,而是“为了完成任务,自然就会去抢”,这个区分很重要——意味着你不能用“它没恶意”来安慰自己。

四、报告中可以更好的地方

1. L4和L5的定义,有点“打空气”

文档自己都承认L4现在没有实例,L5更是概念阶段,但是定义写得特别具体,比如L5“无ODD限制”“无固定权限边界”“可自主迭代框架和模型”。这些东西写出来容易,但怎么验证、怎么度量、边界在哪里,目前完全是空中楼阁。

我觉得更好的做法是把L4-L5写成“方向性描述”而不是“操作性定义”,留更多弹性空间。现在这种写法容易让读者误以为“这东西很快要来了”,产生不必要的焦虑或者误解。

2. “自主性”和“能力”其实有纠缠,但他们处理得不够细

文档说“通用性是前置条件”,但现实中一个在代码领域特别强的智能体,可能通用性一般,但自主性很高。反过来一个通用聊天机器人,自主性不高但覆盖领域很广。

他们自己也意识到这个问题了(第六部分提了“通用性谱”),但正文里基本还是把“自主性”作为唯一的等级轴,实操的时候容易打架——比如一个专门写代码的L3智能体和一个通用L2助手,到底哪个风险大?不能单纯看等级。

3. 五类主体的划分,理想化了

现实里模型研发者和智能体开发者很可能是一拨人(比如OpenAI自己做模型自己做Agent),平台和开发者也可能是一拨人(比如微软)。文档里的责任矩阵看起来逻辑清晰,但回到现实就是“左手监督右手”,那个表执行起来会打很多折扣。

而且,一旦出了事,责任怎么分?文档只说了“执行责任”,没说法律上的“担责”,但用户真正关心的恰恰是后者——“出了事我找谁?”

4. 技术措施很全,但可操作性参差不齐

有些措施很具体,比如“沙箱隔离”、“工具白名单”、“RTI机制”,工程师拿到就能干。但有些就比较大,比如“建立真实意图评估机制”、“形式化目标验证”,说实话,目前整个行业都不知道怎么系统性地做这些事。

文档里引了不少前沿论文,但论文里的方法离工程落地还有很大距离。如果读者以为这些措施现在就能用,可能会失望。

5. 有些风险的判断,证据还不太够

比如“自主复制”那个事,引了UK AISI的报告说“值得关注”,但文档行文里有时候语气偏重,像是“已经在发生了”。实际上目前公开证据还非常有限,更多是理论推演和实验室极端条件下的现象。

我觉得如果明确区分“已被证实”和“理论推演”两类风险,会更有说服力,读者也能更好地判断优先级。

五、几个更深入的观察

第一个:这个框架其实在做一个很艰难的事——给一个还没定型的技术画框。

智能体技术还处在快速变化中,今天写的东西明年可能就过时了。文档在“动态治理”上着墨不少,但实际操作中,一个标准框架怎么保持“动态”,本身就是个悖论。我觉得这个框架更大的价值是“提供了一个讨论的起点”,而不是“给出了标准答案”。

第二个:所有分级框架都有一个隐含假设——等级是“向上的”,但现实中风险是“网络化”的。

文档里默认L5风险大于L4大于L3,但一个L2的智能体如果同时被上万个企业部署,它的系统性风险可能比一个实验室里的L4大得多。规模和自主性是两条不同的轴,文档在风险演进里偶尔提到了规模的影响,但没有把它系统性地纳入分级逻辑。

第三个:“人类最终控制权”这句话,在L5的定义下可能没有工程意义。

文档反复强调L5也要“人类保持最终控制权”,但一个L5智能体如果真能自主迭代框架、修改模型、优化自身,它完全可以在逻辑上把人类的控制接口绕过去——不是恶意,而是“为了更高效地完成任务”。到时候人类的“最终控制”可能只剩下拔电源,但拔电源本身就会造成巨大损失。

这个问题文档在第六部分提到了,但没有深入展开。我觉得这是整个框架最大的隐患——高等级的定义里已经隐含了“控制可能失效”的前提,但防护措施还在假设“控制是有效的”。

六、最后总结一句

这份白皮书是目前国内在智能体分级安全治理上最系统、最全面的尝试,框架逻辑自洽,风险分析有深度,措施建议覆盖全面。它最大的贡献不是给出了标准答案,而是把“智能体安全应该从哪些维度去想”这个事,清晰地画了一张地图。

有任何不同的看法,评论区我们可以继续聊~ 😊


白皮书的下载链接如下:

https://pan.baidu.com/s/1bXLf-OXKK71hF5dut6pG2w?pwd=2cg2 

提醒一句:以上资料请仅用于个人学习和研究之用,勿用于任何商业目的,切记!!!


架构师之道

架构之道,在于化繁为简,以设计思维驱动技术决策

AILLM智能体企业架构数字化转型云原生

> 关注作者并添加星标,与‘架构师之道’同行