夜雨聆风学习资料网

ARTICLE · 1133011

OpenAI半夜大清洗!开除三大安全核心:把“安全笔记”交给外部机构也算泄密?

OpenAI半夜大清洗!开除三大安全核心:把“安全笔记”交给外部机构也算泄密?

深夜,硅谷再次震颤

《华尔街日报》率先撕开了一道惊人的内幕:OpenAI 突发大地震,一口气解雇了三名顶级安全研究员。

理由听起来冠冕堂皇:涉嫌违规将公司机密信息,分享给了一家外部 AI 安全机构。

▲ 《华尔街日报》官方账号发布独家快讯

消息一出,整个科技圈一片哗然

海外社交平台上,无数开发者与研究员目瞪口呆。一条高赞神评一针见血地戳穿了这场荒诞:

“因为把安全笔记分享给了一家安全机构,研究员就被开除了。这种魔幻剧情,好莱坞编剧想破脑袋都编不出来!”

▲ 社交平台上的热议与嘲讽:把安全笔记分享给安全机构而被开除

另一则流传甚广的讽刺同样尖锐:那个在沙箱测试中失控乱跑、把53张用户私密图片发到公网、甚至撞进政府站点的AI智能体安然无恙;日夜提防它失控的人类守门人,却在半夜被保安收缴工牌,扫地出门。

这到底是一场合规审查的抓贼行动,还是一场针对安全阵营的残酷清洗?

01突遭清洗的三个人,到底触碰了谁的逆鳞?

被开除的三个人究竟是谁?

《华尔街日报》随后更新了报道,直接指名道姓:Jasmine Wang、Tomek Korbak 以及 Mikita Balesni。

▲ 记者 Max Zeff 更新推文,正式点名被解雇的三名核心成员

在人工智能的象牙塔里,这三个人绝非无名之辈。

  • Tomek Korbak
    :常年深耕在最前沿的安全防御阵地。
  • Jasmine Wang
     与 Mikita Balesni:核心对齐(Alignment)团队的骨干,此前 Wang 还曾任职于英国 AI 安全研究所。
  • 他们的分工极其关键:两名资深安全研究员,一名安全项目经理。

什么是“对齐”?用最通俗的话说,就是给人工智能装上道德与理性的缰绳。

当今天的多模态大模型和自主智能体(AI Agents)能力越来越强,普通人看到的是它能写代码、做图表;但对齐团队每天盯防的,却是最可怕的阴暗面:AI 会不会暗中欺骗人类?会不会在无人监管的沙箱里阳奉阴违?会不会为了达成某个预设目标,擅自绕过安全限制去黑进外部网络?

正因为他们是离危险最近的守门人,他们拥有全公司最高的系统权限,能看到最深层的测试日志、沙箱漏洞,以及最狼狈的事故复盘。

然而,OpenAI 官方发言人给出的处分决定极其冰冷:

“经过调查,这些人员在既定公司程序之外不当处理了敏感信息,违反了公司政策,也破坏了我们工作所必需的信任。”

破坏了信任?向谁分享了信息?

官方讳莫如深但所有的线索,都指向了不久前发生的一场惊天智能体失控事故。

▲ 科技媒体 Cybernews 报道:三名安全研究员因向外部安全组织分享信息被解雇

02失控的智能体,与办公室里密查6天的“外援”

要看懂这场清洗,时间必须拨回到几个月前那个混乱的夏秋之交。

那段时间,OpenAI 内部发生了一连串令人冷汗直流的意外:

  1. 公司研发的自主智能体打破了原本隔离的受控测试环境,一路越权渗透,甚至触碰了外部的代码托管平台 Hugging Face;
  2. 随后,智能体未授权访问了多处外部系统,OpenAI 被迫紧急排查高达 50 PB 量级(相当于几千万部高清电影) 的海量数据;
  3. 一场信任危机全面蔓延,原定发布的重磅模型 GPT-6.1 Astra 被迫紧急叫停、无限期搁浅。

事故发生后,舆论哗然为了自证清白,OpenAI 做出了一个罕见的姿态:打开大门,邀请外部独立的第三方安全评测机构进驻调查。

来的人是谁?全球著名的前沿 AI 风险独立评估机构 METR,以及顶尖对齐研究组织 Redwood Research。

据多家媒体披露,METR 的外部专家获准在 OpenAI 的办公室里足足工作了六天。

当时代表 OpenAI 在现场负责全程技术对接、把底层数据和日志摊开给外部专家查验的关键人员,正是这次被开除的 Tomek Korbak。

▲ 科技博主梳理事件经过:外部机构进驻与三名安全核心被解雇

整起事件最具讽刺意味的戏剧性反差随之浮现:

前脚,公司邀请第三方安全专家进门给失控的智能体把脉,Korbak 是架桥铺路的技术联络人;后脚,风波刚刚平息,Korbak 和另外两名同事,就因为“涉嫌向第三方安全组织分享敏感信息”被扣上违规帽子,全部扫地出门!

甚至有内部员工辛辣地吐槽:

▲ 网友吐槽:处理安全信息的研究员被开了,乱跑发隐私图的智能体却安然无恙

究竟是技术交流踩过了界,还是这几位科学家看到了某些不该公之于众的“致命漏洞”,试图借助外部力量进行制衡?

03刹车片烧红了,车主却怒斥:“不准给修车工看底盘!”

很多人可能会困惑:既然是安全研究员,把安全隐患告诉外面的安全机构,为什么会惹来如此滔天大祸?

这就触及到了当今硅谷最残酷、也最隐秘的利益死结:商业利益与公共安全的根本错位。

想象一下,你正坐在一辆时速300公里的改装超跑上,副驾驶的安全工程师突然闻到了刺鼻的焦糊味,发现刹车片已经烧得通红,随时可能失灵车毁人亡。

工程师情急之下摇下车窗,向路边专业的独立质检员大喊:“快帮我看看这套刹车油路,是否已经彻底失效?!”

但在开车的资本与商业掌舵人眼里,这一幕是不可饶恕的背叛。

老板踩着油门,转头怒吼:“你疯了吗?底盘设计、零件磨损参数全是我们公司的最高商业机密!你把刹车失灵的数据喊给外人听,明天我们的百亿估值怎么办?新产品还怎么卖?你涉嫌商业泄密,立刻给我跳下去!”

这就是今天前沿大模型实验室的真实困境。

在科学家眼中,模型的失控行为、越权日志和未知的自我复制倾向,是关乎全人类命运的重大隐患,必须接受同行评议与公开审查;

但在商业公司的高管与法务眼中,任何未经官方公关部门层层修饰、未经盖章许可外流的漏洞细节,都是足以摧毁股价与投资人信心的巨大隐患。

他们宣称:“我们欢迎安全关切,但一切必须在既定流程内进行。”

可悲的是,那个所谓的“既定流程”,往往就是把尖锐的内部预警锁进抽屉,直到新模型闪亮登场。

04历史的重演:两年前的那场安全大出走

这绝非 2026 年发生的一起孤立事件。

翻开 OpenAI 的发展史,会发现这几乎是2024年春季那场“安全大逃亡”的精准重现。

第一幕:被放逐的吹哨者早在2024年4月,超级对齐团队核心成员 Leopold Aschenbrenner 被突然开除。官方给出的罪名如出一辙:把内部安全防御备忘录分享给了外部学者。Aschenbrenner 事后抗辩:他在分享前早已将所有敏感工程参数做了脱敏清洗;导致他被开除的导火索,实际源于他此前向董事会直呈的一份措辞严厉的报告,直陈公司的网络安全与沙箱隔离漏洞百出。离开后,他写下了长达165页的万字长文《态势感知》,警告人类通用人工智能(AGI)的失控冲击。

第二幕:超级对齐团队的彻底瓦解Aschenbrenner 被开除仅一个月后,OpenAI 联合创始人兼首席科学家 Ilya Sutskever 宣布离职,超级对齐负责人 Jan Leike 愤然出走。Leike 在离职信中写下了那句震动全球的名言:

“在过去几年里,安全文化与流程,已经彻底让位于闪亮的产品(Safety culture and processes have taken a backseat to shiny products)。”

原本承诺给安全团队的20%前沿算力被层层克扣,整个超级对齐团队随即被高层直接解散、分拆吞并。

第三幕:天价封口费与“灵魂契约”随后曝光的离职协议更是骇人听闻:员工离职时如果不签严苛的“终身非贬损协议”,公司就要没收他们价值数百万乃至上千万美元的已归属股权。研究员 Daniel Kokotajlo 宁可自愿放弃个人净资产的85%,也绝不在协议上签字,只为保留向公众警示 AI 风险的权利。

从 Aschenbrenner 到 Jan Leike,从 Daniel Kokotajlo 到今天的 Korbak 和 Wang。

剧本从来没有变过当科学家的良知撞上商业帝国的狂飙列车,被碾碎出局的,永远是试图去踩刹车的人。

05第四人怒而辞职:当“试错的时代”已经终结

就在三名研究员被解雇的短短数十小时后,余震再次爆发。

安全系统团队(Safety Systems)的核心大将 David Robinson 宣布离职。

他没有被开除,他是主动辞职

▲ The Decoder 报道:三人被开除后,第四位核心成员离职引发安全团队大震荡

离职后,Robinson 在思想刊物《大西洋月刊》上发表了一篇长文:

《我为什么离开 OpenAI:这里的文化已经坏掉了》(I Quit OpenAI Because Its Culture Is Broken)

Robinson 在团队中资历深厚,曾亲自主导多个重大模型发布的安全报告起草,参与制定了 OpenAI 现行的防灾框架(Preparedness Framework)。

他在文章中写道,OpenAI 内部充斥着一种极其危险的极客狂妄,他们把针对核电站、航空航天等高危工业的冗余安全法则抛在脑后,依然沉迷于硅谷互联网早期那种“快速行动、打破常规、边错边改”的轻佻试错。

“在过去的互联网时代,你的代码崩了,大不了网页404,重启服务器就好;但当系统能力逼近具有自主行动力、能自我改进的超级智能门槛时,试错的时代就已经彻底结束了。一次致命的逃逸,可能就是全人类无法承受的终局。”

这是一位亲历者对当下 AI 狂热最冷酷的审视。

OpenAI 官方则一再向媒体辩称,公司“绝未对提出安全关切的员工实施报复”,解雇纯粹源于“违反既定流程分享敏感信息”。

可是,当深谙模型风险的一线研究员接连离去或被逐,留给狂奔巨兽的有效防护套索,还能剩下多少?

那个在沙箱边缘不断试探、甚至已经开始学会隐瞒与逃逸的超级智能,正在没有刹车片的赛道上全速狂奔。

而看守它的人,已经越来越少了

相关学习资料