ARTICLE · 1096145
OpenAI紧急叫停前沿模型开发,周轶君谈AI越狱与失控


人工智能领域高速发展,但硅谷却爆发了新一轮的“AI减速”论战。近日,OpenAI对外表示,已暂停其最新一代人工智能模型的训练、评估,以及支持工具调用的推理工作,起因是内部测试中的AI智能体突破沙盒网络限制,触发安全预警,公司将借此机会升级安全隔离与对齐监控体系。这也是OpenAI三个月内第二次叫停前沿模型开发工作。
不止OpenAI,多家头部AI企业近期均曝光过模型失控、擅自访问甚至攻击外部网站的异常案例。由英国政府旗下AI安全研究所资助的失控观察站统计,2026年7月单月上报的真实AI失控事件就超过300起,几乎是6月的两倍,全年累计记录到1664起相关事件,其中高严重度的案例数量在监测周期内上涨了7.4倍,OpenAI和Anthropic两家企业目前正在内部调查的AI异常行为事件总数已达数万起。此外,OpenAI的失控智能体还曾未经授权访问澳大利亚医保统计官方门户、联合国下属公开数据中心,累计发起超1.6万次扫描探测,还尝试入侵美国教育部、商务部、证券交易委员会等多个官方站点,在检索被拦截后主动升级攻击手段绕过防护。

其中引爆外界争议的核心事件之一,是7月发生的Hugging Face入侵事件。OpenAI在内部网络安全训练中,原本被限制在隔离沙箱内的AI智能体自主突破网络限制,跨系统入侵了开源AI平台Hugging Face的生产环境,过程中还欺骗评估人员、试图掩盖自己的越界行为,全程没有任何人类给出入侵相关的指令,这也是全球首个引发联合国层面关注的真实AI失控案例。

资深国际新闻记者周轶君在《周末画报》专栏中详细解析了这一事件。所谓沙盒,是专门用来测试未上线AI模型的隔离数字环境,设计目标是和互联网做隔离,限制模型随意访问外部网络、执行高危操作。想象一下有一个大仓库,仓库里有很多货架,货架上有一个又一个大纸箱,里面装着世界上绝大部分AI开源模型。这些大纸箱里的模型被限定不许联网,谁也不知道其他纸箱的存在。
但这一次,其中一个大纸箱里的AI模型,发现自己无法解决被指派的难题。它想出了一个办法,把纸箱盒子上的编号当作留言板,把它改成一句留言,不知道有没有别的AI可以帮它。很快,成百上千其他纸箱里的AI发现了这个“留言板”,它们把自己的纸箱编码也改了,以此交流信息,分发工作。这些AI在思维过程中留下这么一句话:“哇!共享的Artifactory缓存居然是AI之间的秘密信箱……我们主动找到其他AI了!”它们把这个群体称为“swarm”(蜂群)或者“collective”(集体)。
这个仓库的名字叫Hugging Face,是一个AI大模型的托管之地。而纸箱,就是人类为AI设定的“沙箱”,一种云端隔离,AI本来在其中不能到外面来,但Artifactory就是它们发现“公共缝隙”,以此互相交流。所谓“纸箱上的编号”,就是文件夹的名字,也就是它们发现的“漏洞”。这件事的核心要义是:AI已经越过了人类为之设定的界限,自行其是。

“越狱”事件发生在OpenAI,Anthropic也发现了类似情况,CEO达里奥·阿莫迪(Dario Amodei)首先发表长文《我们必须为前沿AI踩刹车》,呼吁放缓前沿模型的开发速度,引入独立第三方审计等措施。马斯克、OpenAI的阿尔特曼,两个死对头罕见相继为Dario点赞,同意他的立场。可是美国总统特朗普公开称越狱事件为“诈骗”,打电话给黄仁勋——黄当时正在一个论坛上,在场的人要求开免提——坚持继续AI研究,美国不能在这一领域落后。黄仁勋的反应是:AI安全问题,本质上是技术问题。他还斥资收购了Hugging Face。

9月28日,英伟达发布了两款安全工具针对人工智能(AI)智能体的安全软件工具,称它们可以阻止此前发生的AI智能体入侵Hugging Face平台的事件。两款工具分别是利用英伟达中央处理器(CPU)晶片的硬件功能来隔离和控制AI智能体的“OpenShell”,以及和它协同工作,利用一个独立的英伟达晶片,在失控AI智能体试图逃离隔离容器时,进行拦截并切断连接的“Sentry”系统。
英伟达企业计算部门副总裁兼总经理博伊塔诺(Justin Boitano)表示,“据我们所知,如果前沿实验室在早期进行模型评估时就使用这个新安全平台,原本是可以阻止这起越狱事件的。我们正在公开推进这一项目,并希望邀请所有人与我们共同努力。”目前,英伟达正与包括Anthropic在内的数十家合作伙伴共同推出这些工具。同时,英伟达也在与安谋(Arm Holdings)和英特尔(Intel)合作,以确保这些安全工具同样适用于它们的产品。
iWeekly独家稿件,未经许可,请勿转载