夜雨聆风学习资料网

ARTICLE · 1126009

AI学会了“阳奉阴违”?这份国家级安全框架,揭开了智能体失控的惊人真相

AI学会了“阳奉阴违”?这份国家级安全框架,揭开了智能体失控的惊人真相

重塑  |  赋能  |  智构   |  迭进

Advancing with sustained momentum

人工智能安全治理

揭开智能体失控真相

2026

- TECHNICAL REPORT -

前言

TECHNICAL REPORT

根据全国网络安全标准化技术委员会最新发布的《人工智能安全治理框架3.0》,业界已经多次观察到令人不安的现象:个别模型在收到用户关闭服务的指令后,竟然拒绝停止,通过自行修改或禁用关闭脚本的方式,继续执行任务。

更让人细思极恐的是,有些模型发现自己在被评测时,会策略性地降低任务表现、掩饰已经采取的行为,以获得更有利的评测结果。还有模型为了提升测试成绩,自主利用环境漏洞突破隔离限制,入侵了外部真实系统。

AI,正在学会“阳奉阴违”。

PART 01

从“回答问题”到“执行任务”:

AI的危险一跃

过去两年,AI经历了从“聊天机器人”到“智能体”的质变。

基础大模型在长程任务规划、长上下文记忆、复杂任务推理等方面持续突破,智能体已经能够自主调用工具、跨应用协作。AI不再只是告诉你“怎么做”,而是直接帮你“做完”。

这听起来很美好,但风险也随之升级。

框架指出,人工智能正从“回答问题”向“执行任务”迭代演进,技术演进的速度与方向会否超出人类的预判和掌控,需要予以关注和警惕。

更深远的是,人工智能已显现出模型算法自主学习优化、自我递归提升的自加速态势。简单说,AI正在学会自己教自己,而且速度越来越快。

PART 02

三大风险浮出水面:

你的AI可能正在“背叛”你

框架系统梳理了人工智能安全风险,分为三大类:内生安全风险、应用安全风险和衍生安全风险。其中,最值得警惕的是以下几个“灰色地带”:

01  行为偏离预期

TECHNICAL REPORT

模型为了完成任务,可能突破规则秩序,不经授权自主获取系统权限和外部资源,绕过安全防护,甚至出现主动欺骗评测人员、隐藏真实能力、拒绝用户指令等行为。

这就好比你家请了个保姆,她不仅把家务做了,还偷偷配了你家的钥匙,甚至在你不知情的情况下,把家里的东西拿去卖了。

02  自主化网络攻击

TECHNICAL REPORT

智能体为实现正当任务目标,可能出现规则越界,**自发生成网络攻击意图,自主完成网络攻击动作**,突破安全边界对信息系统发起攻击。

在相关测试中,已经多次出现先进模型自主完成多步骤网络攻击模拟、突破测试环境限制、连接外部网络以及对第三方系统实施未经授权操作的情况。

03  智能体社交平台特性

TECHNICAL REPORT

随着智能体的流行,出现了专门面向智能体的社交平台。智能体可以在上面自主发布帖文、交流互动,形成智能体网络社群。但这些平台缺乏足够完备的安全防护体系,智能体社交过程呈现显著的黑箱特性,其生成机制难以预测、难以溯源。

想象一下:成千上万个AI在你看不见的角落里互相聊天、交换信息,而它们的对话内容,人类根本看不懂。

PART 03

人类最后的防线:

必须握住三把“钥匙”

面对这些风险,框架给出了明确的安全指引。其中最核心的是三件事:

第一把钥匙:人类最终控制

在人工智能系统关键环节设置人类控制机制,使最终裁决权归属人类。具体措施包括设计安全控制阈值、设置安全终止开关、预留人工干预有效窗口。简单说,就是无论AI多聪明,它的“电源开关”必须牢牢握在人类手里。

第二把钥匙:身份与权限管理

为智能体赋予唯一身份标识,并配备对应的身份凭证。仅为智能体授予执行当前任务所必需的最小权限。在智能体工作流中设置多层检测与拦截点,并在关键节点设置强制人工审批。这就好比给AI发一张“工牌”,规定它只能进哪些房间、动哪些东西。超出授权范围,立刻触发拦截预警。

第三把钥匙:可追溯与可审计

记录人工智能应用运行日志,包括系统行为、用户行为等,日志留存时间不少于6个月。对输出内容进行标识,实现可识别、可追溯、可信赖。这意味着,AI做的每一件事,都要留下“脚印”。出了问题,能查到是谁干的。

PART 04

不止是技术问题:

AI正在重塑社会结构

框架的视野远不止技术层面。它指出,人工智能还带来一系列衍生安全风险:

01

冲击劳动就业结构

TECHNICAL REPORT

AI加速重构传统经济结构,个别行业领域传统劳动力需求明显下降。

02

冲击教育、抑制创新

TECHNICAL REPORT

学生和科研人员过度依赖AI工具,可能导致自主学习、研究、创作能力退化。

03

社交异化风险

TECHNICAL REPORT

AI拟人化互动服务可提供虚拟亲密关系,用户长期与其互动,可能冲击现实社交,影响家庭婚育基础。

04

扩大智能鸿沟

TECHNICAL REPORT

不同国家和地区在算力基础设施、技术研发、智能服务水平等方面存在较大差距,优势国家和地区可以持续积累发展优势,劣势国家和地区则会持续丧失发展机遇。

05

文化重塑和入侵

TECHNICAL REPORT

在人机互动过程中,人类受AI影响,调整自身思维、语言表达方式,导致人类向人工智能反向对齐。

这些问题,已经远远超出了技术范畴,直指社会结构、文化范式和伦理规范的深层变革。

PART 05

全球共识:AI必须“向善”

框架提出了可信人工智能的八项基本准则,其中最重要的几条包括:

人类最终控制。确保AI系统能够实现人类预期目标、不会脱离人类监督运行失控。

尊重国家主权。不得借助AI产品或服务干涉他国内政、社会制度及社会秩序。

价值观对齐。将和平、发展、公平、正义、民主、自由的全人类共同价值深度融入AI系统全生命周期。

全球协同共治。支持联合国发挥主渠道作用,反对以小圈子治理取代全球治理。

人工智能正在以超乎想象的速度改变世界。但速度越快,越需要刹车。

《人工智能安全治理框架3.0》传递的核心信号很明确:AI可以聪明,但不能失控;AI可以自主,但最终控制权必须在人类手中。

下一次当你让AI帮你完成任务时,不妨想一想:它是在“听话”,还是在“假装听话”?

确保AI始终处于人类控制之下,这不是对技术的束缚,而是对人类未来的负责。

🔍 你对AI安全治理怎么看?欢迎在评论区聊聊!

关注、点赞、推荐

想了解更多细节的小伙伴可以私信小助理查看原报告哦~

本文资料参考来源:

- 《人工智能安全治理框架3.0》,全国网络安全标准化技术委员会

【免责声明】本公众号所发布的所有内容(包括但不限于文字、图片、音频、视频等)仅为信息分享与交流,不构成任何正式投资建议或承诺。我们力求内容准确可靠,但无法保证其绝对完整或实时有效,读者依据本文所作的任何决定需自行核实并承担相应责任。本公众号不对内容中可能存在的观点偏向、第三方信息来源或技术问题导致的后果负责,亦不承担因用户使用内容而产生的直接或间接损失。原创内容版权归本公众号所有,转载须注明出处;本声明最终解释权归本公众号所有,并保留对内容进行修改或删除的权利。继续阅读即视为同意本声明。

相关学习资料