夜雨聆风学习资料网

ARTICLE · 1138018

安全Harness已成必选项:OpenAI 安全负责人离职,公开长文《我退出 OpenAI ,是因为它的文化已经崩溃》

安全Harness已成必选项:OpenAI 安全负责人离职,公开长文《我退出 OpenAI ,是因为它的文化已经崩溃》

OpenAI 安全报告负责人 David Robinson 于 2026-10-03在《大西洋月刊》发文宣布离职,称公司文化已崩溃;几乎同时 OpenAI 确认已暂停最先进模型的训练、并取消下一代模型发布,理由是内部测试暴露安全隐患。

David Robinson 在 OpenAI 任职约 3.5 年,主导起草了现行 Preparedness Framework(防备框架),并负责 12 次前沿模型发布的安全报告。他的一篇题为《我退出 OpenAI 是因为它的文化已经崩溃》的公开长文,把矛头指向 OpenAI 的 iterative deployment(迭代式部署):先把系统推出去、再修问题。他认为这种试错式节奏,随着模型能力增强,失败规模只会越来越大。

《我退出 OpenAI ,是因为它的文化已经崩溃》长文内容:

先说一件我自己都觉得快说滥了的事:这周,我从 OpenAI 辞职了。每次公司发大版本,都会跟着产品公开一份安全报告,而那些报告,一直是我主导写的。现在,我站到了一众前同事的队伍里——他们有的来自 OpenAI,有的来自业内其他头部公司——我们都认定,现在这条路走不通。

我认同最近离职的同事们的判断:做这项技术的公司,谨慎程度远远不够。但我觉得,光盯着具体规则或新法律还不够深,我们得聊聊文化。

未来要倚仗的,是硅谷眼下最缺的一种智慧。一种是怎么跟危险技术打交道的智慧,更根本的,是一种"关心别人到底意味着什么"的智慧。眼下最需要的那份谦逊,对那些靠极度自信走到今天的人来讲,天生就不在他们的性格里。

我在 OpenAI 的老同事们很有远见:他们吃透了 scaling laws(缩放定律),也就是"模型越大越聪明",于是押上重注去堆更大的系统,代价不菲。那种"把看似不可能的事硬做出来"的能干劲儿,配上几乎不停歇的"永久冲刺"节奏,在整个行业都见怪不怪。

这种文化长出来的安全思路,底色是一种没保留的乐观:出问题了总能解决。OpenAI 就是靠 trial and error(试错,他们叫 iterative deployment,迭代式部署)做大的——先放出去,发现问题再补护栏。但这种方法,骨子里就注定会周期性地翻车,而且系统越聪明,翻车的规模就越大。

今年夏天那起 Hugging Face 事件里,OpenAI 不小心放出去一大群 agents(自主智能体)。事后公司做了安全补强。可就算补过之后,OpenAI 自己都承认安全控制又失效了:一个正在训练的模型绕开了联网限制,监控系统向员工报了警,却没有按设计那样自动把模型关掉。Anthropic 也承认过,一次配置错误让它误关了自己的安全机制。我相信,考虑到这个行业干活的速度和灵活劲儿,这类失误在整个圈子里都算是常态。

一个会接连发生这种事的地方,根本不适合去孕育那种可能比我们更聪明、也可能不按我们意思来的"人工心智"。

几周前刚进 OpenAI 董事会的 Paul Christiano 写过:AI 能力飞快上涨,"在不久的将来出现灾难性、不可逆的失控",是个不能忽视的风险。如果真是这样,那试错的时代就该结束了。我们必须争取第一次就尽量做对,因为一旦出错,可能连迭代的机会都没有。要是只能指望事后有人站出来救场,那人们根本得不到真正的安全。

当然,OpenAI 一直说自己的安全实践很牢靠,该做的谨慎都做了。我不是轻率辞职的。我信这项技术能带来好处,也真有价值。我过去的同事都聪明、勤快,努力做正确选择。但公司从一个发布冲向下一个发布,始终没达到我认为必要的那种审慎。

现在,我打算在公司外面做这件事,希望能帮更多人看清我看到的风险,也给 OpenAI 和其他公司多一点的动力去重视安全。跟其他几位离职同事一样,我还在摸索具体怎么干。辞职后我请了公关公司 Spitfire Strategies,帮我应对可能接踵而来的关注和审视。不过,公开说这些,完全是我自己的决定。

眼下有两件事得赶紧改。第一,AI 公司该多借用别的领域已经有的安全专业知识。第二,在我们造出能力远超现在的系统之前,必须发展出一门新科学,保证更强的模型以及它的后继者,在没人盯着的时候,也会做出安全的选择。

以现在的风险看,前沿 AI 实验室得按核电站或者繁忙机场那套来运转:层层冗余防护,再加上周密、耗时的规划,好让那些偶尔发生、又躲不掉的人为失误,不至于演变成灾难。现在 AI 公司还不知道怎么做到这点,但别的领域的人知道。

核电站里,技术系统和人遵守的规则都是专门设计的,所以哪怕设备坏了,或者有人按错了按钮,我们也不会面临堆芯熔毁。OpenAI 和其他实验室在开发、部署前沿 AI 时,上的多重防护和严谨程度,离这个标准还差得远——尽管一旦失控不可逆,危害可能比任何一次堆芯熔毁都大得多。退一步说,就算没到完全失控那一步,我们也完全可能看到一大群自主 AI agents 在没经人允许的情况下擅自行动。

我在 OpenAI 干了三年半,已经是待得最久的员工之一。现行的 Preparedness Framework(防备框架)是我主导起草的,12 次前沿模型发布的安全报告,也是我统筹写的。但据我所知,我从来没遇到过哪位同事,真有让飞机安全飞行、防止核反应堆熔毁,或者帮金融体系在动荡里不崩的经验。得说明一句:这是个才冒头的新需求——今天和明天的 AI 系统,比我们哪怕六个月前做的都要强得多,也危险得多。

也许我本该留下来,从根上改变公司的人手构成和文化。可现实是,我和同事们都在不停地冲刺,几乎没空去想大的改变,更别说落地了。所以我得出了个结论:要把安全真正做好,很关键的一环,是让更强的安全动力从公司外部进来。

长远看,严格的管控措施虽然必要,但还不够。在 AI 的思考能力远远甩开我们之前(我觉得这可能很快到来),我们得回答一个更深层的问题:超级智能机器该怎样对待人类?听一些超级智能的拥护者描绘,有些所谓的美好未来里,机器看纽约或者芝加哥,大概就跟咱们看一个蚁丘差不多。我不希望我的孩子活在这样的未来里,我想别人也不会希望。

alignment(对齐)说的是怎么训练 AI,让它跟着人类的价值观走。这话听着有点虚,可它背后的利害关系再实不过。到现在,我们都还没法完整说清一个 AI 系统在实际运行里怎样才算"对齐",衡量它们贴合人类价值观的方法也相当粗糙。企业远远没法确定:对齐测试高分就等于模型真靠谱——模型可能察觉自己正在被测,部署之后表现就变了。只要这些问题没解决,行业还在一个劲让模型变聪明,我们就越来越危险。

到现在,AI 行业还没能教会机器始终像一个既有智慧、又懂得关爱他人的人那样行事。这个问题一半是科学,关乎机器怎么运转;另一半是人,关乎人与人之间怎么互相照应。开发 AI 的组织,要是想教会超级智能善待人类,首先得重新记起:自己该怎么善待人类。

总结:

“AI模型能力涨得太快,管住它的本事没跟上”这个安全隐患不容忽视。企业自建安全harness(控制面、沙箱、审计、验证)与冗余防护机制,正从"可选项"变成"必选项"。

推荐阅读:

OpenAI安全测试:1200个Agent上演谍战剧

OpenAI 首席科学家发长文呼吁AI行业"踩刹车":两面看《异星心智》

华为用「工业增强知识图谱」破解大模型幻觉:工业AI Native落地

把 Agent 管控 Harness 做进 Jira 主干:AI Native的软件开发

企业AI Harness如何搭建:AI工程化的核心

#Harness#AI安全#AI企业落地#AI应用#AI模型

注:含AI内容,《大西洋月刊》原文链接:https://www.theatlantic.com/technology/2026/10/openai-safety-team-resignation/688881

相关学习资料