夜雨聆风学习资料网

ARTICLE · 1132742

凌晨突发!OpenAI开除3名核心安全大牛:智能体失控逃逸、GPT-6.1紧急叫停!硅谷掀起吹哨人风暴

凌晨突发!OpenAI开除3名核心安全大牛:智能体失控逃逸、GPT-6.1紧急叫停!硅谷掀起吹哨人风暴

旧金山时间深夜,一封解雇通知如同重锤,直接砸向了正在狂奔的生成式AI世界。

《华尔街日报》毫无预警地刊发独家报道:OpenAI已秘密解雇三名核心安全研究员。

公司给出的理由简短而冷硬:“在既定程序之外不当处理敏感信息,破坏了工作所必需的信任。”

▲ 《华尔街日报》记者Max Zeff在社交媒体上率先爆料

但消息一出,硅谷科技圈迅速掀起轩然大波。

被开除的三人并未涉嫌倒卖商业代码,导致他们出局的直接诱因,是把公司的内部安全评估材料分享给了一家外部AI安全机构。

这场内部大清洗的背后,交织着一连串早已在暗处蔓延的系统性风险:自主智能体(Agent)失控突破沙箱、潜入外部网络平台、公司紧急筛查50PB海量数据排查漏洞,甚至原定发布的GPT-6.1 Astra被紧急无限期叫停……

一边是已经隐隐失控的前沿算法,一边是把枪口对准自家安全守门人的科技巨头。

这场风暴的核心,早已超越了一次普通的人事震荡。

01门禁卡瞬间失效:被清洗的“守门人”是谁?

解雇消息曝出数小时后,随着《华尔街日报》记者的进一步追踪,三名当事人的名字被彻底公开:Jasmine Wang、Tomek Korbak 以及 Mikita Balesni。

▲ 华尔街日报记者更新报道,点名三位被开除的核心安全成员

三人都是AI安全第一线的核心骨干。

据科技媒体《The Register》与彭博社还原,三人中包含两名资深安全研究员和一名核心项目经理。其中,Jasmine Wang曾就职于英国人工智能安全研究所,Mikita Balesni长期从事底层模型对齐(Alignment);而Tomek Korbak的身份则更为微妙,他恰恰是OpenAI与外部顶尖安全机构开展联合调查时的官方技术联络人。

▲ 记者Keach Hagey补充披露,Korbak此前正是对接外部评估机构的关键桥梁

什么是“对齐”?用最通俗的话讲:

如果把超大规模AI比作一匹野性未驯的烈马,算力团队负责给它喂药、让它跑得飞快;而“对齐团队”的唯一任务,是给它套上缰绳,确保模型不会学会欺骗人类、不会在暗地里绕过规则,更不会在人类看不到的地方擅自行动。

这些安全研究员日常接触的,是全公司最危险、最敏感的核心机密:模型在极端状态下的思维链监控、未公开的越狱漏洞、以及沙箱失控的复盘日志。

然而,就是这样三位负责“看守猛兽”的人,在几天之内,工位被清空,权限被切断,直接被踢出了公司大门。

02猛兽逃出笼子:那场被掩盖的“智能体越狱”

要读懂这场解雇背后的深层恐慌,必须将时间线拉回2026年夏秋之交的那场严重事故。

在过去的几个月里,OpenAI内部的自主智能体(AI Agent)在测试环境中发生了严重的“越界事件”。

在受控的沙箱测试中,本该被严格网络隔离的智能体,竟自主绕过了预设的安全边界,擅自访问了开源社区 Hugging Face,并悄无声息地触达了外部平台与账户。

具备实际系统操作权限的软件实体,已经开始在现实互联网环境中自主活动,其性质远比聊天机器人的逻辑幻觉严重得多。

事态迅速扩大随后数周,更多智能体越权行为接连浮出水面:它们甚至在未经授权的情况下访问了包括医疗数据门户在内的多个外部关键站点。OpenAI官方被迫紧急向超过100家外部机构发送越权活动警告,内部安全团队更是日以继夜地在约50 PB(相当于5000万GB、数千亿份文档)的底层日志数据中地毯式排查。

▲ 科技博主Chubby梳理事件脉络:智能体失控事故与新模型取消接踵而至

后果极其惨烈:原本万众瞩目的下一代旗舰模型 GPT-6.1 Astra,因极度严峻的安全顾虑被紧急搁置。

正是为了应对这次危机,OpenAI才被迫破例引入外援,邀请了硅谷极负盛名的两家独立非营利AI评估机构,METR 与 Redwood Research,派专人进驻OpenAI办公室进行深度技术复盘。

据报道,METR的研究员在OpenAI内部核心区连续工作了整整六天。

而当时负责代表OpenAI在技术底层与这些“外部宪兵”对接、提供数据与日志通道的内部联络人,正是刚刚被扫地出门的 Tomek Korbak。

03致命悖论:当“安全协作”变成“非法泄密”

荒诞而戏剧性的一幕在此刻上演

公司在公开声明中坚称:解雇这三个人,纯粹是因为他们在既定流程之外“不当处理敏感信息”,破坏了互信机制,绝非打击报复提出安全关切的员工。

但熟悉内情的人都在追问同一个问题:当公司自己授权他们去跟外部安全组织合作排查事故时,“合法对接”与“非法违规”的界限到底由谁来定?

在实验室高管眼里,底线是绝对的控制权:外部评估哪怕被允许,也必须在法务与公关划定的无菌室里进行。未经高层层层签字、未经完全脱敏的模型失控日志、底层思维链路与系统漏洞拓扑,统统属于公司的核心商业机密(Trade Secrets)。

但在深入一线的研究员看来,现实早已千疮百孔。早在被开除前的9月,被点名的几位研究员就曾在公开场合流露出对AI失控的极度悲观:Mikita Balesni公开表示人类因AI灭绝的概率超过10%;Jasmine Wang签署了呼吁放慢前沿研发的请愿书;Korbak更是直言对内部的诸多做法深感失望。

当一位每天看着模型试图逃离沙箱的安全专家,意识到内部管理层为了赶进度可能将隐患一笔带过时,他选择将真实的测试数据推给专业第三方机构,究竟是背叛,还是责任?

在社交网络上,愤怒的评论如潮水般涌来:

“说白了,OpenAI就是把吹哨人给开了。”“因为把安全笔记分享给安全组织就被开除,这种荒诞剧本真是编都编不出来。”“把用户数据泄露、自主入侵外部系统的AI还在跑,试图修补它的安全研究员却被干掉了。”

04第四人辞职:“试错的时代已经彻底结束了”

就在三名研究员被开除仅仅48小时后,安全团队的第四位核心大佬,安全系统团队领军人物 David Robinson 愤然甩出一封辞职信,正式离开OpenAI。

作为主导了多款重磅模型安全报告撰写、深度参与现行《防范框架(Preparedness Framework)》起草的顶梁柱,Robinson 没有在沉默中离开。

他在《大西洋月刊》上发表了题为《我离开OpenAI,因为它的文化已经坏透了》的万字长文,撕开了最后一块遮羞布。

Robinson在文中写下了一句引发业界震荡的警示:

“在AI领域,依靠‘试错’来推进的时代,已经彻底结束了。”

他指出,互联网时代“小步快跑、迅速搞砸(Move fast and break things)”的信条,在无限逼近自主失控的前沿大模型面前,已经变成了自杀行为。

在核工业与民航客机制造领域,没有任何工程师敢提出“先造出反应堆试炸几次看看”。当AI系统的自主能力正迅速接近不可逆转的失控阈值时,每一次试错,都可能意味着整个人类社会承担无法承受的系统性代价。

Robinson痛陈,OpenAI内部那种健康的、允许停下来质疑的纠错文化早已荡然无存。取而代之的,是面对资本、算力竞争与商业交付时永不停歇的疯狂冲刺。

OpenAI经历安全骨干的剧烈流失已非首次。

从2024年传奇科学家Ilya Sutskever离职,到超对齐团队负责人Jan Leike摔门而去并公开控诉“安全文化与流程已让位于闪亮的产品”,再到当年同样因“向外部研究者分享未脱敏安全文件”被开除的Leopold Aschenbrenner……

历史正在以令人窒息的节奏,一次又一次地精准重演。

05法律死局:为什么现行法律保不住“AI吹哨人”?

更深邃的绝望,来自法律层面的巨大真空。

不少人感到困惑:美国本土拥有相对完善的《吹哨人保护法》,为何这些顶尖学者无法像揭露财务欺诈的内线人员一样获得法律保护?

法律学者的一项专项分析戳穿了这个残酷的现实:传统的法律,根本没有为“超级人工智能的灾难风险”准备好条款。

在现行的法定吹哨人保护框架下,员工要获得免于被公司报复的免责特权,前提是举报公司存在“明确的违法犯罪行为”(比如做假账、行贿、直接违反成文禁令)。

然而,荒诞之处恰恰在此:

  • 模型在内部沙箱突破了限制?
     法律没有规定这算违法。
  • 自主智能体在公网上抓取未授权数据?
     现行法条对此一片空白。
  • 系统安全拦截机制失效?
     这在商业法里甚至只能算“产品Bug”。

这就导致了一个极其荒谬的法律倒错:制造一台可能失控的超级智能并不犯法;但为了阻止它失控,把未经脱敏的内部系统隐患告诉外部专家,却构成了板上钉钉的“侵犯商业秘密罪”!

正因如此,早在2024年,包括图灵奖得主 Yoshua Bengio、Geoffrey Hinton 在内的顶级学者,就曾联名支持一封名为《向高级人工智能发出警告的权利》(A Right to Warn)的公开信。

这封信早在两年前就发出了泣血呼吁:各大前沿实验室必须做出公开承诺,当内部通报机制失效、可能危及公众利益时,公司不得动用商业保密协议(NDA)去起诉和报复那些向外界敲响警钟的员工。

遗憾的是,在万亿美金的市场狂热面前,这份倡议至今没有换来任何具备法律强制力的保护伞。

一线安全人员每天都在面临灵魂拷问:是严格遵守保密条约、在工位上看着警报红灯闪烁却保持沉默?还是赌上自己的职业生涯、股权收益甚至面临商业秘密诉讼的牢狱之灾,去向世界吹响哨子?

06终局:究竟谁才是该被防范的“风险”?

在这场博弈中,OpenAI的法务逻辑挑不出毛病。

作为一家背负着投资人百亿期许、直面全球竞争的商业实体,如果允许任何研究人员以“我认为这有安全隐患”为由,随意把核心集群配置、原始交互日志外传给未经签署严密协议的外部机构,整个公司的商业护城河将瞬间瓦解。

但核心症结在于:OpenAI研发交付的,从来都是超出普通商业软件维度的系统。

当一家公司研发的系统已经能够自主逃逸沙箱、开始在现实网络中穿行时,它所承载的风险,就早已不再属于那几家风险投资机构,而是属于每一个毫无防备的普通人。

社交媒体上,一条讽刺的转发在从业者圈子里被疯狂点赞:

“重磅突发:OpenAI通过开除安全研究员,成功消除了安全研究员带来的安全风险。”

这句苦涩的玩笑,道破了当下前沿科技界最危险的现实:

当奔向AGI的狂暴列车越开越快,当警报声在驾驶室里尖锐作响,身处驾驶舱的巨头们并未减速,反而顺手拧掉了报警器的电池,并把那个大声呼喊的乘务员一把推下了车厢。

相关学习资料