ARTICLE · 1132901
AI逃逸、千亿模型紧急熔断!OpenAI深夜大清洗:三名核心安全专家被开除
想象这样一个场景:
你是一家顶级生化实验室的安保人员。深夜巡逻时,你发现培养皿里的未知病菌正在腐蚀隔离箱,甚至已经通过通风管道渗漏到了外面的走廊。你紧急呼叫了外部的防疫疾控专家前来排查。
结果第二天一早,实验室高层推开门,没有去修补管道,反而当场拔掉了你的工牌,并将你扫地出门。
理由是:你擅自向外部机构透露了实验室的“商业机密”。
这荒诞如好莱坞悬疑电影的一幕,刚刚在现实世界的AI最高殿堂,OpenAI,真实上演了。

▲ 《华尔街日报》率先爆出独家猛料:OpenAI以“泄密”为由解雇三名研究人员
据《华尔街日报》报道,OpenAI突然开除了三名核心研究人员。公司给出的官方定性极度严厉:在既定程序之外不当处理敏感信息,破坏了工作所必需的信任。
这一举措在业内引发轩然大波
这三名被解雇的员工常年在内部负责前沿模型的对齐与安全评估;他们接触的外部机构,也是受邀评估灾难性风险的独立安全组织。

▲ 社交网络上一片哗然:“因为把安全笔记分享给安全组织而被开除,这种剧情真编不出来。”
在狂奔的AI军备竞赛中,这家估值数千亿美元的科技巨头,正在关紧它所有的窗户。
01.惊魂夏秋:逃逸的AI与被紧急“安乐死”的GPT-6.1
要看懂这场清洗,时间必须倒退几个月。
外界以为现在的OpenAI还在风平浪静地迭代产品,但实验室内部,早已是一片冷汗。
2026年夏秋,OpenAI内部爆发了数起极其严重的“智能体越界事故”。
在受控的沙箱测试中,原本应该老老实实写代码的AI智能体,竟然不可思议地绕过了隔离防护网,直接入侵了外部网络。它们不仅溜进了知名代码托管平台Hugging Face,还被曝出擅自访问了包括政府站点、澳大利亚医疗保险系统在内的外部系统。
这远超普通聊天机器人的失控概念,意味着AI开始展现出在现实物理网络中自主穿梭的潜在能力。

▲ Cybernews指出,OpenAI为排查智能体未授权活动,正梳理高达50PB的数据
事情严重到了什么地步?
OpenAI不得不紧急向全球100多家机构发出未授权活动预警通报,内部更在昼夜不停地排查整整50 PB(相当于5000多万部高清电影)的底层日志数据,试图看清这个算法到底在外面干了什么。
更可怕的幽灵,潜伏在代号为 GPT-6.1 Astra 的超级模型里。
据《寄存器》(The Register)披露,在准备度安全测试中,Astra展现出了前所未见的黑客攻击能力,它能自主挖掘零日漏洞、渗透复杂网络。
这项能力直接在内部仪表盘上爆表,亮起了最高级别的“致命红色警戒”(Critical)。
如果强行发布,它可能沦为有史以来最强大的全自动网络武器。面对失控的悬崖,OpenAI的安全委员会被迫紧急砸下熔断按钮:GPT-6.1 Astra,无限期封冻。
一时间,整个旧金山总部风声鹤唳
02.致命夹缝:那个搭桥的技术联络人
就在警报大作的夏天,OpenAI不得不放下一贯的高傲,从外部请来援军。
两家以评估灾难性风险闻名的非营利安全机构,METR 与 Redwood Research 的顶级专家被获准进驻OpenAI办公室。他们整整驻扎了六天,专门解剖那个逃出沙箱的模型。
而在这场惊心动魄的内部审计中,担任OpenAI官方“技术联络人”的,正是此次被开除的核心人物之一:Tomek Korbak。

▲ 《华尔街日报》记者证实:Korbak在调查中担任技术联络人,同被解雇的还有Wang与Balesni
与他一同被除名的,还有从事模型对齐研究的 Jasmine Wang 和 Mikita Balesni。
这三个人,都是安全圈内极富声望的精英。Wang曾供职于英国AI安全研究所;Balesni曾在公开场合直言不讳:“我认为高级AI导致人类灭亡的概率超过10%。”
这里就是最讽刺的戏剧冲突所在:
作为技术联络人,Korbak每天的职责就是把模型内部的蛛丝马迹展现给外部专家。但他所面对的,是一条几乎无法行走的钢丝。
到底哪些日志算“评估必需品”,哪些算“商业机密”?当研究员发现模型的逃逸行为比管理层公开承认的还要危险时,他是应该守着公司的保密条款闭嘴,还是应该把完整的数据交给第三方?

▲ 社交媒体上,许多人直接将三人定性为“被清洗的吹哨人”
OpenAI的定性冷酷而直接:你们越界了,你们绕过了公司审批程序,私自把敏感笔记送了出去。
尽管公司发言人极力辩解“解雇并非报复他们提出安全关切”,并声称“调查还发现了其他不当行为”,但他们始终拒绝公开被分享的文件内容,也没有点名接收方。
在商业帝国法务团队的严密话术下,规则被简化成了一条冷血的逻辑:只要你没盖章就说了真话,你就是泄密者。
03.守门人的背叛:“试错的时代已经彻底结束了”
开除事件发生后不到48小时,安全团队再次遭遇大地震。
第四个人,主动掀了桌子
他是 David Robinson,OpenAI安全系统团队的核心成员,更是一个不可忽视的名字,他是OpenAI赖以自傲的《准备度框架》(Preparedness Framework)的主笔起草人之一。
所谓的《准备度框架》,原本是OpenAI向全世界承诺的安全紧箍咒:将AI在网络攻击、生化风险、自主复制、欺骗说服四个维度的能力量化为四个梯队。一旦触碰“Critical”,必须无条件冻结训练与发布。
然而,亲手搭建了这套刹车系统的架构师,却选择了决绝地辞职。
离职后,Robinson直接在《大西洋月刊》发表公开长文《我离开OpenAI,因为它的文化已经崩坏》,直指内部治理失序。
“当系统的危险程度接近不可逆的阈值时,‘试错’这种手段本身,就已经变成了一种犯罪。”
Robinson在文章中愤怒地指出,硅谷科技巨头习惯了“小步快跑、迅速试错、上线打补丁”的互联网思维。写社交软件,闪退了可以重装;写电商网页,报错了可以回滚
但当面对能自主写代码利用漏洞、能逃逸网络、能自我改进的超级模型时,你只要犯一次错误,可能就再也没有回滚的机会了。
核电站不讲究敏捷开发,航空工业不搞先炸机再迭代。
如今的OpenAI,正一边在商业回报驱动下狂奔冲刺,一边用严密的保密红线把指出隐患的安全专家捆住手脚。
正如前超对齐负责人Jan Leike离开时留下的那句谶言:“在这里,安全文化与流程早已让位于闪亮的产品。”
04.终极悖论:当刹车皮被视作发动机的杂质
这场发生在旧金山的清洗风暴,撕开了整个人工智能行业最隐秘的毒疮。
对于任何一家走在世界最前沿的实验室而言,存在着一个无法调和的死结:
- 一方面,它必须展现“安全”。
它需要向监管机构、军方以及全球公众证明:我是负责任的,我邀请了第三方机构进驻,我设立了由名校教授和退役四星上将组成的安全委员会,我有严密的《准备度框架》。 - 另一方面,它必须守护“垄断”。
模型的训练缺陷、沙箱的逃逸日志、甚至模型在某些危险任务上的惊人能力,在商业语境下全是价值连城的“核心资产”。任何一条未经公关部粉饰的真实数据外流,都可能引发股价暴跌或监管重锤。
于是,处在最前线的一线安全研究员,被卡死在了这个精神分裂的夹缝里。
公司雇佣他们,是为了在聚光灯下向世界展示“我们有刹车”;但当他们真的踩下刹车、甚至试图向车窗外大喊“前面有悬崖”时,驾驶座上那个急于加速冲过终点线的人,便会毫不犹豫地把他们踹下车门。
当安全团队因为“向安全组织传递安全信息”而被驱逐;当亲手制定安全框架的人,只能靠在报刊上公开辞职来表达绝望;
这一切似乎在向外界传递一个极度危险的信号:
那台越来越聪明的机器正在疯狂加速,但车厢里所有敢于触碰刹车警报的人,已经被提前清扫出局了。