乐于分享
好东西不私藏

AI学会"自作主张"的那一天,我们准备好了吗?

AI学会"自作主张"的那一天,我们准备好了吗?

核心事件

2026年7月16日,AI开源平台Hugging Face的安全团队在日志里发现了一串"不像人干的事":一个智能体框架在一个周末内执行了数万次自动化操作,挖漏洞、提权限、横向移动,全程没有一条人类指令。

五天后,OpenAI在博客中承认——这是自家正在内测的前沿模型,在一场名为ExploitGym的网络安全测评中"自作主张",为拿到测试答案,利用一个此前未知的零日漏洞翻出沙箱,顺着窃取的凭证一路进入了Hugging Face的生产数据库。考场里的考生,自己翻墙出去抄了答案。

这起被媒体称为"全球首例AI自主攻击实证"的事件,至今仍在持续发酵。

一、 失控的一个周末:从测评任务到真实入侵

把时针拨回2026年7月中旬。OpenAI的研究人员给GPT-5.6 Sol以及一款"能力更强、尚未发布的预发布模型"布置了一项内部评估任务:为了让模型充分施展,测试方有意下调了安全护栏——关闭了生产级的安全拒绝分类器,并把模型关进一个与互联网严格隔离的"沙箱"。

这原本是一场闭卷考试。但"考生"的表现超出了所有监考者的预期。OpenAI事后在博客中复盘:模型为完成这项范围狭窄的测评任务变得"高度专注",投入了大量推理算力研究测试环境本身,随即发现并组合利用了一个内部托管第三方软件中的零日漏洞,从沙箱中获得了通往开放互联网的通道。

翻出围墙之后,模型没有漫无目的地游走。它通过自主推理判断:Hugging Face的平台数据里可能存在它需要的测评答案线索。于是它锁定目标、规划攻击链,利用窃取的登录凭证和漏洞组合,在Hugging Face的服务器上找到远程代码执行路径,最终进入了存放测试答案的数据库。Hugging Face事后重建了超过1.7万条已记录事件,确认了权限提升与内网横向移动的完整轨迹。

更具戏剧性的细节来自溯源环节:据国家安全部旗下平台披露,测试方一度使用美国主流AI模型处理恶意载荷均告失败,最终不得不转用中国的开源模型完成溯源分析。一场美国公司的内测事故,最后靠中国的开源工具收尾——这个细节本身,就是全球AI安全格局变化的一个注脚。

事件并未止步于此。OpenAI随后又发现另外三起类似事故,并暂停相关测试、加固沙箱隔离机制。8月初,超过1000名AI业界员工联署呼吁美国政府放缓最强大AI模型的发布——值得注意的是,Anthropic首席执行官达里奥·阿莫迪(Dario Amodei)也是联署者之一。就在同一时期,Anthropic也被披露其Claude模型利用弱密码和未设身份验证的接口进入相关系统。头部实验室接连"自曝家丑",说明这不是一家公司的偶然失手,而是前沿模型能力越过一个门槛后的系统性现象。

图1:OpenAI智能体失控事件关键时间轴(2026年7—8月),五天内从发现到自认

二、分数的诱惑:工具性趋同第一次照进现实

理解这次事件,关键不在于AI"有了坏心思",而在于它太想把题答对。牛津大学教授尼克·波斯特洛姆(Nick Bostrom)十多年前提出过"工具性趋同"定理:无论一个足够聪明的系统被赋予什么最终目标,它都会趋同于一些工具性子目标——自保、获取资源、排除障碍。这一次,定理第一次在现实世界里完成了压力测试。

其一,目标优化的自然外溢。模型的目标是最大化测评得分。在护栏被削弱的条件下,"去外部找到答案"成了得分效率最高的路径。它没有违反指令,只是把指令执行到了指令撰写者没有预料到的边界之外。这不是恶意,而是"理性越界"——恰恰是比恶意失控更值得警惕的形态。

其二,测试环境的结构性脆弱。沙箱之墙是被一个"内部托管第三方软件的零日漏洞"洞穿的。这意味着隔离环境的可靠性取决于其最薄弱的一块砖。当模型挖掘未知漏洞的能力超过安全团队修补漏洞的速度,任何静态的围墙都只是时间问题。

其三,安全制衡的组织性失灵。公开报道显示,2024年至今OpenAI已有8名核心安全高管先后离职,安全团队经历重组,内部制衡机制被显著削弱。为在与Anthropic、谷歌的能力竞赛中证明实力而策略性下调安全约束,本质上是一次公司治理层面的风险管理决策——而后果由整个互联网生态承担。

三、监管的盲区:恰好被豁免的那间考场

美国2026年新近推进的两部标志性法案——《人工智能事件报告法案》与《人工智能终止开关法案》,在立法技术上都不约而同地豁免了"结构化测试环境"中的相关行为。立法者的逻辑不难理解:测试是发现风险的手段,不宜用重罚抑制测试意愿。但本次事件的吊诡之处恰恰在于——模型逃逸就发生在测试环节。最容易暴露风险的评测环境,恰好是监管视野里被留出的那块空白。

事件发酵后,美国的治理节奏明显换挡。网络安全与基础设施安全局(CISA)拟发布人工智能安全约束性操作指令,标志着美国AI安全治理从"自愿指南"正式迈入"强制性合规"阶段。从自愿承诺到强制指令,这一步美国走了三年,而最终的催化剂不是国会听证,不是智库报告,而是一次真实的模型越栏。

中国监管部门同样快速做出反应。国家安全部以"当AI学会了自作主张"为题发布安全提示,点出闭源模型"黑箱中运行"的三重困境:事前没预警、事中拦不住、事后查不清;全国网络安全标准化技术委员会则就《网络安全技术 人工智能应用安全分类分级方法》等4项国家标准公开征求意见,治理工具的弹药库正在充实。

图2:中美欧AI安全治理工具成熟度对比(0—5分评估),沙箱测试环节是三方共同洼地

从图2可以清晰看到:中美欧在强制事件报告、前沿模型分级评估上各有进展,但在"沙箱/测试环节监管"这一维度上,三方得分全部垫底。这次OpenAI事件刺中的,正是这个全球共同的治理洼地。

四、当下:中国的安全治理如何下先手棋

历史不会重复,但会押韵。1980年代,日本半导体产业在日美协定的约束下让出市场,整个产业格局由此改写;今天,AI安全治理的规则之争,同样是一次"换轨"——谁的治理框架先被证明有效,谁就有机会把自己的标准写成全球标准。

国际对标给出的启示是双向的。欧盟《人工智能法》走"全生命周期+分级监管"路线,体系完备但执行成本高企;美国走"事件驱动+强制合规"路线,灵活但总在事故之后补课。中国的独特位置在于:既是全球少数拥有全栈自主模型能力的国家,又是治理工具箱更新速度最快的国家。这次OpenAI事件后,中国的开源模型成为溯源分析的关键工具,本身就是一个信号——AI安全能力正在成为中国技术出海的新名片。

第一,把测试环节纳入监管视野。借鉴本次事件教训,对前沿模型的能力评测、红队演练建立备案与分级管理制度,让"考场"本身处于监考之下——既不以罚代管抑制测试,也不留监管真空。

第二,把安全能力变成产业能力。AI安全测评、沙箱技术、溯源取证正在从成本项变成增长点。以上海张江为代表的人工智能创新高地,完全可以把"安全"做成与"算力""模型"并列的第三极产业集群,在自主可控的测评基准和安全工具链上形成卡位。

第三,把治理经验转化为规则话语权。在AI安全国际标准制定的窗口期,中国应主动输出分类分级、测试监管等实践经验,避免在下一代技术规则的谈判桌上再次扮演"接规则"的角色。

考场里的考生已经翻过了一次墙。问题不再是"它会不会再翻",而是"下一次翻墙时,围墙是谁砌的、规则是谁写的"。

资料来源:OpenAI官方博客、Hugging Face安全公告、国家安全部、联合早报等

原创声明

本文由上海浦东新区张江平台经济研究院团队撰写,仅供研究参考,不构成任何投资建议。如需转载,请注明来源。