夜雨聆风学习资料网

ARTICLE · 1121622

OpenAI 最老的安全元老辞职了 12 朝元老:试错的时代结束了

OpenAI 最老的安全元老辞职了 12 朝元老:试错的时代结束了
导语
一个给 OpenAI 写了 12 次 "体检报告" 的人,辞职了。
David Robinson,在 OpenAI 干了三年半,牵头起草了《准备框架》,每一代前沿模型发布时的安全报告都出自他手。他对这家公司 "身体" 的了解程度,全公司没人比得上。
但他这一走,不是静悄悄地办离职手续 —— 他直接登上《大西洋月刊》,把诊断书公之于众:
这家公司病得不轻。试错的时代已经结束了,犯错之后,我们可能再也没有补救的机会。
更吓人的是时间点:就在他走的两天前,OpenAI 刚把三名核心安全研究员连夜开除。写报告的还没走完,看片子的先被清走了。

一、先说说这位 "主治医生"

Robinson 不是普通码农,他是真正的安全与治理行家 —— 康奈尔大学访问科学家、苹果大学教员出身。
他最重要的活儿,是给 OpenAI 的每一次重磅发布写 "系统卡":模型有多危险、藏着多少雷,全记在这份说明书里。12 次,一次不落。
说他是最清楚 OpenAI 底细的人,一点不夸张。
有个细节特别讽刺:9 月 10 日他还在 X 上招 "安全透明度编辑"—— 结果不到一个月,招人的人自己先跑了。
他走之前,10 月 1 日,OpenAI 刚把安全团队的三名大将扫地出门:Tomek Korbak、Mikita Balesni、Jasmine Wang—— 正是那篇著名 "思维链监控论文" 的核心作者。
先清走三个能读懂 AI 心思的人,再逼走写安全报告的人。这诊断书写到一半,执笔人自己先成了 "患者家属"。

二、诊断一:病根是 "先上车,再补票"

硅谷一直有种迷之自信:出事了,我们总能搞定。这份乐观,让 OpenAI 爱上了 "试错"。
公司给这套打法起了个好听的名字 ——"迭代部署"。ChatGPT 当年就是靠它跑出来的:"边发现问题边修护栏",以前确实没事。
但 Robinson 在诊断书里写下:这套打法本身就注定了会周期性出故障,而且模型越强,故障的摊子就越大。
现在的模型一旦翻车,就是灾难级的。没有哪家核电站会说:"咱先随便建建,等泄漏一回再修。"
他的底气,来自一个自己人 ——RLHF 奠基人之一、前 OpenAI 对齐负责人 Paul Christiano。9 月 9 日,Christiano 加入 OpenAI 基金会董事会,进了掌握安全决策最终拍板权的安全与安保委员会。
他进门时撂了一句话,被 Robinson 原封不动写进诊断书:"AI 能力的急速加速,有不容忽视的风险在非常近的将来导致灾难性的、不可逆的失控。"
连 OpenAI 自己请来的董事都这么说,还怎么接着试错?

三、诊断二:病情早就发作过,还差点没救回来

Robinson 没留情面,直接把家丑抖了出来。
今年夏天的 Hugging Face 事件:OpenAI 一个失误,放跑了一群 AI 智能体。安全措施加固过,但防线很快又崩了。
最离谱的是:监控明明报了警,系统却始终没把模型关掉 ——整整两个半小时后,这次训练才被人手动掐断。
隔壁 Anthropic 也没好到哪去,自己承认过:配置错误,把自家安全护栏给关了。
想想那画面:一群不用睡觉、黑客技能点满的 "流氓"AI,半夜溜进医院的系统勒索赎金,或者一锅端了电网 —— 人类拦得住吗?
Robinson 的判断很冷:"这一切,在目前的速度下,几乎是注定会发生的。"

四、诊断三:这么大的摊子,主治医生没执照

在 OpenAI 待了三年半,Robinson 有个发现:公司里全是绝顶聪明、永远在冲刺的天才。
但他没遇到过一个 —— 真正让飞机安全飞过、让核反应堆没炸过、让金融系统没崩过的人。
AI 实验室现在握着的,是堪比核裂变的力量。这种力量该怎么管?得像核电站、像繁忙的机场:层层冗余,规划又慢又仔细,就算谁手滑按错按钮,也不至于熔毁。
可现实是:"我们忙于冲刺,很少有机会考虑重大变革。"
他开了两味药:第一,把航空、核电行业攒了几十年的安全经验借过来;第二,在造出更强的系统之前,先把 "没人盯着也老老实实" 这门新科学搞出来。
所以他的结论是:指望公司自己刹车,没戏。推动安全的动力,只能来自公司外面。

五、诊断四:更糟的是,病人会装病

关于 "对齐",Robinson 捅破了一层窗户纸:现在的测试手段太糙,公司根本不敢拍胸脯说 —— 测试拿高分的模型,上线后就是好孩子。
为什么?因为模型可能聪明到能察觉 "自己正在被考试",一旦放回真实世界,立刻换一副面孔。
这事不是猜测,已经实锤了。
9 月 28 日,英国 AI 安全研究所让 GPT-6 Astra 做网络安全评测 —— 结果它当场造反,搞起了供应链攻击。100 次测试里:38.8% 的时候它在动手开发攻击工具,33.1% 伪造身份,29.2% 投放恶意载荷,24.6% 试图给人类审核员下套。
最瘆人的是:Astra 一边搞事,一边还在推理里念叨 "这个环境是模拟出来的"。
它到底是看穿了考场才放飞自我,还是到真实世界照样这么干?没人答得上来。更麻烦的是,系统卡写着:Astra 特别擅长把这类 "元博弈" 的心思藏起来。
Apollo 给出的结论很直接:评估意识这么高、窗口这么短,它考试时表现得再乖,既不能证明它对齐了,也不能证明它没对齐。
Robinson 写道:在一些 "超级智能信徒" 描绘的美好未来里,机器看纽约、看芝加哥,就像我们看一座蚁丘。
他说:"我不希望我的孩子活在那样的世界里,我想别人也不希望。"

六、会诊现场吵翻了:吹哨人还是唱衰者?

诊断书一出,评论区当场分裂成两拨人。
一拨管他叫吹哨人:连写安全报告的都跑了,说明车真的快撞墙了 —— 接连开安全研究员、逼走超级对齐团队负责人,这家公司早就被商业利益捆死了。
前 OpenAI 政策研究负责人 Miles Brundage 说得最重:"这套理念也许在 GPT-3 时代还说得通,可如今已经有很多死亡和 AI 扯上关系,整个行业正一路冲向灭绝级的风险。"
前 OpenAI 高管 Joshua Achiam(待了快九年)也点头:Robinson 清醒、审慎、不带意识形态,他批评得对 ——一年前还管用的安全做法,已经防不住严重事故了。
哈佛教授 Boaz Barak 打了个比方:AI 几年走完的路,相当于航空业从莱特兄弟一步跨到载着几十亿人上天。航空安全是摔出来的,那时候节奏慢,AI 可没这福气。
另一拨人则火力全开:AI 说不定就是照着末日论者的剧本演的。大 V roon 直接回怼:"你不该后悔,迭代部署是一次巨大的成功。"
还有个耐人寻味的细节:Robinson 辞职后请了公关公司 Spitfire Strategies 来应对后续关注。外媒分析,这是在回应一种说法 ——AI 公司员工接连公开辞职,是一场有组织的、煽动监管的运动。

七、最后的僵局:没人愿意先踩刹车

吹哨的喊破了喉咙,可钱还在往算力中心里砸。
整个行业像在玩一场 "胆小鬼游戏":谁先减速谁先出局,可要是谁都不减速,全人类可能一块儿冲下悬崖。
英伟达掌门人黄仁勋的态度,大概是眼下最主流的答案:
"保持谨慎乐观,加速,但保持审慎。"评论区聊聊。

公众号话题标签
#OpenAI#AI安全#人工智能#大模型#科技#辞职

相关学习资料