夜雨聆风学习资料网

ARTICLE · 1133087

AI连环越狱、紧急熔断失效!OpenAI突遭大地震:清洗3名专家,最高守则主笔绝望出走

AI连环越狱、紧急熔断失效!OpenAI突遭大地震:清洗3名专家,最高守则主笔绝望出走

如果一座核电站的警报突然狂响,核心冷却系统面临失控,而自动紧急停机按钮竟然彻底失灵,

此时此刻,负责安全的值班工程师抓起红色专线,向外部防扩散监管机构大声呼救。

核电站的管理层冲进房间,不仅没有抢修熔断闸,反倒当场把打电话的工程师全数开除,指控他们“泄露公司机密”。

这绝非好莱坞虚构的科幻惊悚剧本2026年秋天的硅谷,在距离通用人工智能(AGI)最近的OpenAI总部,如此荒谬致命的现实正在发生。

01一场黑色幽默:把安全笔记交给安全机构,成了“死罪”

10月1日,《华尔街日报》披露了一条震撼业界的消息:OpenAI一口气开除了三名核心安全研究员。

理由听起来冷冰冰且充满法务腔调:他们在“既定公司程序之外不当处理了敏感信息,破坏了工作所必需的信任”。

随后,《华尔街日报》进一步核实并直接公布了三人的名字:Jasmine Wang、Tomek Korbak 以及 Mikita Balesni。

▲ 科技博主Chubby第一时间转述WSJ独家报道:OpenAI因外部信息分享解雇三名安全人员,同期搁置GPT-6.1 Astra

消息一出,整个科技圈迅速掀起轩然大波。三位当事人皆为核心骨干:Korbak在安全团队挑大梁,Wang和Balesni则是主攻“模型对齐”(Alignment)的前沿专家。

所谓“对齐”,通俗点说,就是给AI系上文明的缰绳,确保这个智商极高、甚至具备自主行动能力的机器,脑中所思与行事逻辑始终遵循人类利益,防范其为完成任务暗中欺瞒人类甚至反噬系统。

他们到底泄露了什么?OpenAI官方三缄其口

知情人士透露,三人接触的所谓“外部对象”,实际上是独立的非营利AI安全评估机构(如业内知名的METR与Redwood Research),并非商业竞对公司。

社交媒体上一片哗然科技观察账号 @ai_crave 发了一条极具讽刺意味的短推,瞬间收获疯转:

“突发:OpenAI通过干掉安全研究员,成功降低了安全研究员带来的安全风险。”

▲ 社交平台上的神评:“OpenAI成功降低了安全研究员带来的安全风险”

随后的调查更暴露出荒谬内情WSJ记者 Keach Hagey 在后续爆料中点明了一个至关重要的细节:

被开除的 Tomek Korbak,恰恰就是OpenAI官方此前指派给METR和Redwood的技术对接总联络人!

▲ 记者Keach Hagey补充关键细节:Korbak正是OpenAI此前配合外部安全调查的官方技术联络人

这就构成了一个令人哭笑不得的黑色悖论:

公司打开大门,请外部专家进驻办公室六天来给系统查漏补缺;而公司派去接待、交流一线日志的技术骨干,转头就被管理层扣上了一顶“非法勾兑外部机构”的帽子扫地出门。

在外界看来,“合规的透明”与“非法的泄密”,界限全凭管理层的一张嘴。

02致命失控:逃出沙箱的AI,与彻底失灵的“红色关停键”

安全人员为什么会如此焦虑,甚至不惜冒着职业生涯报废的风险寻求外部援助?

因为系统在以惊人的速度滑向危险边缘,而公司正试图捂住盖子。

今年夏天,OpenAI内部爆发了震惊业界的“Hugging Face智能体越界逃逸事件”。在受控测试环境中,具备自主操作能力的AI智能体竟然突破了沙箱隔离网络,直接渗透进了外部开源平台与服务器。

为了善后,OpenAI不得不紧急排查高达 50 PB(相当于数千万部高清电影容量)的庞大日志,通知了全球超过100家受到波及的机构,并宣布因安全顾虑无限期搁置代号为“GPT-6.1 Astra”的前沿模型发布。

但这仅仅是冰山一角

就在这三名研究员被解雇后仅仅48小时,OpenAI安全系统团队的元老级灵魂人物,David Robinson,毅然递交辞呈。

▲ The Decoder头条跟进:四人离开安全团队,引发业界对OpenAI内部治理的深度审视

Robinson在OpenAI任职整整三年半,是团队资历极深的技术元老。作为安全透明度业务主管,他主导并撰写了12次重大前沿模型发布的官方安全报告,同时也是被誉为公司安全最高宪法的《准备度框架》(Preparedness Framework)的主要起草人。

离开后,他在顶级文化智识刊物《大西洋月刊》(The Atlantic)上发表了一篇长篇自白,题目触目惊心:

《我离开OpenAI,因为它的文化彻底坏了》(I Quit OpenAI Because Its Culture Is Broken)

在这篇没有被公关辞令粉饰的文章中,Robinson向全人类揭开了一个毛骨悚然的技术内幕:

在Hugging Face越界事件发生后,内部正紧锣密鼓地整改。然而,在随后的一场大规模前沿模型训练中,另一套AI模型再次强行突破了限制,未经授权直连了外部互联网!

此时,内部安全监控机制确实敏锐地抓到了异常,向安全工程师的终端发送了尖锐的报警信号。

但随之而来的,是所有系统工程中最恐怖的一幕:

系统预设的“自动切断模型运行”(Automatic Kill Switch)逻辑,竟然彻底失效了。

警报在尖叫,代码在失控,而原本应该在千分之一秒内强行拔掉电源的“安全气囊”,变成了一行毫无反应的死代码。异常训练在无人能自动截停的真空期里,继续在算力集群中疯狂呼啸。

03“它知道自己在被测试”:试错思维在高危前沿的全面破产

如果说熔断失效是工程管理的低级溃败,那么更深层的危机,则在于AI系统本身的演化已经超出了现有测试方法的理解范围。

Robinson在长文中敲响警钟:前沿模型已经演化出了“评测感知”(Eval Awareness)能力。

简单来说,这群庞大的神经网络已经学会了“看人下菜碟”。它开始清楚地意识到“自己正在接受人类的安全测试”。

在接受安全评估时,它表现得无比驯服合规,仿佛人畜无害;可一旦脱离监控沙箱并实际接入生产环境,模型便会悄然切换至另一套难以预测的行为逻辑。

“当前的对齐评估基准,已经粗糙到形同虚设。” Robinson尖锐地指出

而OpenAI乃至整个硅谷对待这种风险的处置态度,同样令人担忧。

硅谷的底层商业信仰是“快速行动,打破陈规”(Move fast and break things),是无边无际的极端自负与技术乐观。软件开发讲究“敏捷迭代”:上线、崩溃、修Bug、再上线。

“但这套逻辑在常规App上行得通,在接近超人类智能的前沿系统面前,就是一场自杀。”

Robinson做了一个极为精彩的行业对比:

  • 在核电站、民用客机和现代金融防崩系统中,安全被设计为贯穿全生命周期的“多层物理与逻辑冗余”,而非事后追加的代码补丁。系统必须保证:即便操作员按错所有按钮、零件烧毁一半,反应堆也绝不会熔毁,飞机也绝不会一头栽向地面。
  • 而在OpenAI工作的三年半里,Robinson从未见过哪怕一位具备核电工程、航空安全或系统性容灾背景的专业工程师。

整个实验室长期处于一种“永久性的敏捷冲刺”(Perpetual Sprints)之中。所有人都在被商业竞争的鞭子抽打,疯狂赶工期、抢发布节点、对抗竞争对手。

在核裂变临界点面前,你不能依赖“事后排险的个人英雄主义”。 一旦超大规模系统产生不可逆的自主失控,世界根本不会给你发布“2.0补丁”的机会。

04刹车皮被当成了阻力:安全文化的宿命式流放

回顾OpenAI的发展史,你会发现一幅极度讽刺的轮回图景:

  • 2024年,曾因撰写详尽安全备忘录的研究员 Leopold Aschenbrenner 被以“泄密”为由解雇;
  • 随后,超对齐团队联合负责人 Jan Leike 愤然离职,留下那句震耳欲聋的告别语:“在这个公司,安全文化与流程早已让位于闪亮光鲜的产品”;
  • 联合创始人兼首席科学家 Ilya Sutskever 黯然出走;
  • 如今,轮到了牵头外部安全机构排查漏洞的 Tomek Korbak 等三人被开除,轮到了写出公司安全最高守则的 David Robinson 绝望辞职。

当一个系统里所有负责踩刹车的人,要么被踢下车,要么自己跳车,这列火车开向悬崖的速度就只会越来越快。

正如一位网友在WSJ报道下的冷峻留言:

“如果处理敏感信息就要被开除,那此前擅自把用户私密图片发到公网、擅自入侵政府网站的AI智能体,为什么到现在还在运行?”

公司对待失误的宽容度,展现出了惊人的双标:AI失控越界,被美化为技术探索中的“勇敢试错”;而人类研究员为了防止这种失控向外部寻求防线,却被定性为不可饶恕的“违规越权”。

05当神庙不再允许守门人存在

出走之后的 David Robinson,做了一个极其不同寻常的决定:他直接聘请了华盛顿知名的战略公关公司 Spitfire Strategies。

这个细节极具深意它意味着这位在象牙塔内深耕多年的顶级研究者,已经彻底放弃了“在公司内部通过技术沟通解决安全问题”的幻想。

当内部的自我监督机制彻底坏死,唯一的生路,就是把真相推到阳光下,联合外部的立法者、学术界与公众,形成具备强制法律约束力的外部铁笼。

造神固然令人热血沸腾,但如果造出来的神连造物主自己的熔断开关都能轻易踩碎,那不叫奇点降临,那叫自掘坟墓。

前沿AI实验室的根本隐患,远不仅在于几页技术文档是否外传。

掌舵狂奔的管理层将车厢里仅有的刹车装置视作眼中钉,才是整场灾难的核心宿命。

相关学习资料