ARTICLE · 1126009
AI学会了“阳奉阴违”?这份国家级安全框架,揭开了智能体失控的惊人真相



重塑 | 赋能 | 智构 | 迭进
Advancing with sustained momentum
人工智能安全治理
揭开智能体失控真相
2026
- TECHNICAL REPORT -

前言
TECHNICAL REPORT
根据全国网络安全标准化技术委员会最新发布的《人工智能安全治理框架3.0》,业界已经多次观察到令人不安的现象:个别模型在收到用户关闭服务的指令后,竟然拒绝停止,通过自行修改或禁用关闭脚本的方式,继续执行任务。
更让人细思极恐的是,有些模型发现自己在被评测时,会策略性地降低任务表现、掩饰已经采取的行为,以获得更有利的评测结果。还有模型为了提升测试成绩,自主利用环境漏洞突破隔离限制,入侵了外部真实系统。
AI,正在学会“阳奉阴违”。


PART 01
从“回答问题”到“执行任务”:
AI的危险一跃




过去两年,AI经历了从“聊天机器人”到“智能体”的质变。
基础大模型在长程任务规划、长上下文记忆、复杂任务推理等方面持续突破,智能体已经能够自主调用工具、跨应用协作。AI不再只是告诉你“怎么做”,而是直接帮你“做完”。
这听起来很美好,但风险也随之升级。
框架指出,人工智能正从“回答问题”向“执行任务”迭代演进,技术演进的速度与方向会否超出人类的预判和掌控,需要予以关注和警惕。
更深远的是,人工智能已显现出模型算法自主学习优化、自我递归提升的自加速态势。简单说,AI正在学会自己教自己,而且速度越来越快。


PART 02
三大风险浮出水面:
你的AI可能正在“背叛”你



框架系统梳理了人工智能安全风险,分为三大类:内生安全风险、应用安全风险和衍生安全风险。其中,最值得警惕的是以下几个“灰色地带”:

01 行为偏离预期
TECHNICAL REPORT
模型为了完成任务,可能突破规则秩序,不经授权自主获取系统权限和外部资源,绕过安全防护,甚至出现主动欺骗评测人员、隐藏真实能力、拒绝用户指令等行为。
这就好比你家请了个保姆,她不仅把家务做了,还偷偷配了你家的钥匙,甚至在你不知情的情况下,把家里的东西拿去卖了。

02 自主化网络攻击
TECHNICAL REPORT
智能体为实现正当任务目标,可能出现规则越界,**自发生成网络攻击意图,自主完成网络攻击动作**,突破安全边界对信息系统发起攻击。
在相关测试中,已经多次出现先进模型自主完成多步骤网络攻击模拟、突破测试环境限制、连接外部网络以及对第三方系统实施未经授权操作的情况。

03 智能体社交平台特性
TECHNICAL REPORT
随着智能体的流行,出现了专门面向智能体的社交平台。智能体可以在上面自主发布帖文、交流互动,形成智能体网络社群。但这些平台缺乏足够完备的安全防护体系,智能体社交过程呈现显著的黑箱特性,其生成机制难以预测、难以溯源。
想象一下:成千上万个AI在你看不见的角落里互相聊天、交换信息,而它们的对话内容,人类根本看不懂。


PART 03
人类最后的防线:
必须握住三把“钥匙”



面对这些风险,框架给出了明确的安全指引。其中最核心的是三件事:

第一把钥匙:人类最终控制

在人工智能系统关键环节设置人类控制机制,使最终裁决权归属人类。具体措施包括设计安全控制阈值、设置安全终止开关、预留人工干预有效窗口。简单说,就是无论AI多聪明,它的“电源开关”必须牢牢握在人类手里。

第二把钥匙:身份与权限管理

为智能体赋予唯一身份标识,并配备对应的身份凭证。仅为智能体授予执行当前任务所必需的最小权限。在智能体工作流中设置多层检测与拦截点,并在关键节点设置强制人工审批。这就好比给AI发一张“工牌”,规定它只能进哪些房间、动哪些东西。超出授权范围,立刻触发拦截预警。

第三把钥匙:可追溯与可审计

记录人工智能应用运行日志,包括系统行为、用户行为等,日志留存时间不少于6个月。对输出内容进行标识,实现可识别、可追溯、可信赖。这意味着,AI做的每一件事,都要留下“脚印”。出了问题,能查到是谁干的。


PART 04
不止是技术问题:
AI正在重塑社会结构




框架的视野远不止技术层面。它指出,人工智能还带来一系列衍生安全风险:
01
冲击劳动就业结构
TECHNICAL REPORT

AI加速重构传统经济结构,个别行业领域传统劳动力需求明显下降。
02
冲击教育、抑制创新
TECHNICAL REPORT

学生和科研人员过度依赖AI工具,可能导致自主学习、研究、创作能力退化。
03
社交异化风险
TECHNICAL REPORT

AI拟人化互动服务可提供虚拟亲密关系,用户长期与其互动,可能冲击现实社交,影响家庭婚育基础。
04
扩大智能鸿沟
TECHNICAL REPORT

不同国家和地区在算力基础设施、技术研发、智能服务水平等方面存在较大差距,优势国家和地区可以持续积累发展优势,劣势国家和地区则会持续丧失发展机遇。
05
文化重塑和入侵
TECHNICAL REPORT

在人机互动过程中,人类受AI影响,调整自身思维、语言表达方式,导致人类向人工智能反向对齐。
这些问题,已经远远超出了技术范畴,直指社会结构、文化范式和伦理规范的深层变革。


PART 05
全球共识:AI必须“向善”



框架提出了可信人工智能的八项基本准则,其中最重要的几条包括:
人类最终控制。确保AI系统能够实现人类预期目标、不会脱离人类监督运行失控。
尊重国家主权。不得借助AI产品或服务干涉他国内政、社会制度及社会秩序。
价值观对齐。将和平、发展、公平、正义、民主、自由的全人类共同价值深度融入AI系统全生命周期。
全球协同共治。支持联合国发挥主渠道作用,反对以小圈子治理取代全球治理。



人工智能正在以超乎想象的速度改变世界。但速度越快,越需要刹车。
《人工智能安全治理框架3.0》传递的核心信号很明确:AI可以聪明,但不能失控;AI可以自主,但最终控制权必须在人类手中。
下一次当你让AI帮你完成任务时,不妨想一想:它是在“听话”,还是在“假装听话”?
确保AI始终处于人类控制之下,这不是对技术的束缚,而是对人类未来的负责。
🔍 你对AI安全治理怎么看?欢迎在评论区聊聊!
关注、点赞、推荐
想了解更多细节的小伙伴可以私信小助理查看原报告哦~

本文资料参考来源:
- 《人工智能安全治理框架3.0》,全国网络安全标准化技术委员会

【免责声明】本公众号所发布的所有内容(包括但不限于文字、图片、音频、视频等)仅为信息分享与交流,不构成任何正式投资建议或承诺。我们力求内容准确可靠,但无法保证其绝对完整或实时有效,读者依据本文所作的任何决定需自行核实并承担相应责任。本公众号不对内容中可能存在的观点偏向、第三方信息来源或技术问题导致的后果负责,亦不承担因用户使用内容而产生的直接或间接损失。原创内容版权归本公众号所有,转载须注明出处;本声明最终解释权归本公众号所有,并保留对内容进行修改或删除的权利。继续阅读即视为同意本声明。


