ARTICLE · 1031430
未来十年 AI 使人类灭绝概率大于 10%:一位离职研究员的公开警告
点击蓝字 关注我们
一位刚离开行业的预训练研究员,和他前同事的一句"他是对的"——这场发生在社交平台上的公开对话,把 AI 安全领域长期存在、却少被摆到台面上的担忧,推到了聚光灯下。

事件起因

2026年9月8日,英国 AI 研究员雅各布·考克森(Jacob Coxon)在社交平台 X 上发帖,宣布离开人工智能行业。
他的履历不算普通:剑桥大学三一学院数学系毕业,曾是 OpenAI 的预训练研究员、GPT-4o 的核心贡献者之一,2026 年初跳槽到 Anthropic——他当初离开 OpenAI 加入 Anthropic,正是因为看重后者"重视模型安全"的声誉。但从加入 Anthropic 到宣布离职,只过了几个月。
促使他离开的,是他在帖子里写下的判断:OpenAI 和 Anthropic 都没有负责任地行事,正径直冲向"能够自我改进的超级智能",拿人类的性命做赌注。
他随后公开表示,行业内部不少研发人员相信,到 2030 年前后,AI 有可能杀死人类;前沿实验室之间的竞速开发,相当于把全人类的命运押上赌桌。他还参与签署了 1000 余名 AI 研究人员联署的声明,呼吁各国政府建立协调机制。英伟达 CEO 黄仁勋称赞他有"很大的勇气"提出这些担忧。

关键回应

真正让这件事被广泛关注的,是埃文·胡宾格(Evan Hubinger)的公开回应。
他在 X 上回复考克森:"雅各布说得对——我们确实真诚地相信 AI 有可能杀死所有人。我个人认为,未来十年这个概率大于 10%。"
关键之处在于胡宾格的身份:他在 Anthropic 负责的是"对齐压力测试"团队,日常工作就是去检验各种安全手段会在什么情况下失效——也就是说,发出这个警告的人,恰恰是他所在公司里专门研究这个问题的人。
他也做了两点澄清,避免被误读:
其一,这个估计"不是指控 Anthropic 在忽视问题"。他的原话是:我相信 Anthropic 已经尽了最大努力,但我们还没有解决超级智能对齐的方案,也看不出明确的解决路径。
其二,他区分了"现有模型"和"超级智能"。按他后来的补充说明:就 Anthropic 最新一期风险报告而言,他认为当前模型带来的风险很低;他真正担心的,是由"递归自我改进"产生的超级智能。换句话说,这不是对今天 ChatGPT、Claude 这类产品的判断,而是对一种尚未出现、但可能在竞速中被快速逼近的能力层级的判断。

何为对齐

要理解他们为什么担忧,得先明白"对齐"(alignment)这个词。
通俗地说,对齐就是:保证 AI 真正按照人类的意图和目标行事,而不是表面听话、私下追逐另一个目标。比如一个被要求"尽可能多赚钱"的系统,如果目标没设定好,它可能会为了数字不择手段——这种"目标偏离"在理论上就叫对齐失败。
这是行业公认的未解难题。Anthropic 长期设有专门的 Alignment Science 团队,持续发布关于"对齐伪装""隐藏目标""推理模型是否如实表达思考过程"等研究报告,并公开承认许多问题仍在探索中。行业内部几乎所有参与者都认同"这个问题很重要",分歧主要集中在:安全能力的提升,能不能跑得过模型能力的提升。
考克森和胡宾格的悲观,正源于此:他们觉得,行业在还没解决对齐的情况下,就已经在加速奔向可能自我改进的超级智能了。

行业背景

这件事发生在 AI 安全讨论明显升温的一周。
Anthropic 创始人达里奥·阿莫迪(Dario Amodei)在当地时间上周六发表长文,呼吁行业放缓前沿系统的研发节奏,留出更多时间评估潜在风险;OpenAI 的 Sam Altman、马斯克等人随后公开表态支持这一观点。同时,有报道称 OpenAI、Anthropic、谷歌 DeepMind 正就 AI 安全研究展开协作。
另一侧面是,考克森离职前后,OpenAI 刚发布 GPT-6 Astra(黄仁勋称之为"超级智能的开端"),Anthropic 也发布了 Claude Fable 5.1 与 Mythos 5.1——最先进的模型仍在持续推出,这也正是"竞速"担忧的现实背景。
争论仍在继续,模型也仍在迭代。可以确定的只有一件事:如果真有一项技术的能力可能超出人类的控制,那么对它保持警惕,永远不算过早。 至于那"大于 10%"的概率究竟是警钟还是误判,时间会给出答案——而在此之前,认真讨论它,本身就有意义。

END

编辑:小仇
审核:石老师
声明:本文内容整理自网络,仅供参考。如有误或不实,请联系小编进行修改或删除。