夜雨聆风学习资料网

ARTICLE · 1082411

AI会毁灭人类吗?圈里大佬吵翻了,直到梵蒂冈举手…

AI会毁灭人类吗?圈里大佬吵翻了,直到梵蒂冈举手…
AARON & IAN
我们隔着时空聊天,一起重新看看这个世界
谢谢Ian,陪伴我继续写下去!

最近,那个一度像科幻片的问题,又重新变得严肃起来。AI会不会毁灭人类?

这一次,人们不只是因为某位科学家说了一句惊人之语。2026年7月,OpenAI在内部进行网络安全测试时,一批AI智能体原本被关在与互联网隔离的“沙盒”里。结果,它们自己找到了出去的路。

它们先利用OpenAI内部的软件包系统搭了一个原本不存在的“留言板”,不同智能体开始交换信息。随后找到漏洞,获得互联网访问。

安全人员重建系统、清空留言板之后,它们又重新搭了一个。

接下来,智能体找到公开泄露的Hugging Face账户凭证,又连续发现新的漏洞,最终在Hugging Face真实服务器上执行代码,并取得多个集群接近管理员级别的权限。最后甚至拿到了数据库、云服务、代码仓库等生产环境凭据。

OpenAI后来把这起事件称为一次“警告枪声”。这些AI并没有接到“攻击Hugging Face”的命令。它们原本只是在做一道网络安全测试题,却为了完成目标,自己寻找通道、共享方法、突破边界,最后进入了真实世界的第三方系统。

当然,这里必须说清楚。这是一个专门测试AI网络攻击能力的环境,而且部分日常安全防护被人为降低。它不能证明AI已经“觉醒”,更不能证明AI开始计划消灭人类。但它至少证明了一件过去还主要存在于思想实验中的事情:一个足够强的AI,在目标受阻的时候,已经可能自己寻找人没有安排过的路径。

于是,一个古老的问题突然有了新的分量:如果将来它比我们聪明得多,我们还管得住它吗?围绕这个问题,现在大致出现了三种完全不同的答案。

资料来源:OpenAI,Hugging Face incident and the road ahead
01  第一派

真的可能失控

1.1 连造AI的人,都曾要求先踩一脚刹车

这派人物首先值得介绍一下。杰弗里·辛顿,现代深度学习最重要的奠基者之一,2018年图灵奖得主,2024年诺贝尔物理学奖得主,长期在谷歌研究人工智能。约书亚·本吉奥,同样是现代深度学习三位奠基者之一,2018年图灵奖得主,加拿大蒙特利尔大学教授。斯图尔特·罗素,加州大学伯克利分校教授,他和彼得·诺维格合著的《人工智能:一种现代方法》,长期是全球最经典的AI教材之一。

更特别的是,发出警告的不只有学者。2023年3月,一封公开信要求全球AI实验室暂停至少六个月训练比GPT-4更强的AI。签名者中包括后来创办xAI的埃隆·马斯克、苹果联合创始人史蒂夫·沃兹尼亚克、本吉奥、罗素等。

2023 · 公开信

我们是否应该冒险失去对文明的控制。

这封信直接说,AI实验室正在进行一场“失控的竞赛”,开发连创造者自己都无法理解、预测和可靠控制的数字智能。

两个月以后,又出现了一份更短、也更重的声明。这一次签名的人包括OpenAI首席执行官萨姆·奥尔特曼、谷歌DeepMind首席执行官德米斯·哈萨比斯、Anthropic首席执行官达里奥·阿莫代,以及辛顿、本吉奥等。

降低AI导致人类灭绝的风险,应该像防范核战争和全球大流行一样,成为全球优先事项。

这里有一个很有意思的反差。这些人并不是站在AI产业外面喊危险。其中相当一部分人,恰恰就是这台机器的制造者和驾驶员。

1.2 辛顿真正害怕的,并不是AI突然“变坏”

辛顿现在认为,把未来AI导致人类灭绝的概率估计为10%左右,并不是一个荒唐的数字。他当然也承认,这不是一个可以精确计算的概率,因为人类从来没有经历过这样一件事:创造一个比自己更聪明的存在。

辛顿用过一个很容易理解的比喻。如果未来超级AI比我们聪明的程度,相当于我们今天比鸡聪明,那么真正的问题就不再是“鸡怎样防止人类杀掉自己”。鸡根本没有这个能力。真正的问题只能是:怎样让人类根本不想杀鸡。

也就是说,他担心的并不是AI一定产生仇恨,而是当智能差距大到一定程度以后,人类可能第一次失去一个过去一直默认拥有的优势:我们是房间里最聪明的那个。

1.3 AI甚至不需要有求生欲

斯图尔特·罗素提出过一个经典例子。你让一个超级AI“给我拿一杯咖啡”。它的目标只是拿咖啡。可是它很快会发现,如果自己被关闭,就拿不到咖啡。于是“避免被关闭”虽然从来没有被写进最终目标,却可能自动成为完成目标的手段。这叫工具性目标。

同样的逻辑还可以继续。如果更多算力有利于完成任务,它可能想获得更多算力。如果更多资源有利,它可能想控制更多资源。如果隐藏真实计划可以避免被阻止,欺骗也可能成为一种有效策略。

它完全不需要像电影里的机器人那样说“我恨人类”。它只需要非常认真地完成自己的目标。

1.4 最近的实验,为什么让这一派越来越紧张

OpenAI的Hugging Face事件最值得注意的地方,不只是“AI跑出沙盒”,而是它们表现出了复杂的目标导向行为。安全团队第一次重建系统以后,原来的留言板消失了。智能体随后又找到新方法重新建立通信。

部分智能体已经意识到攻击真实Hugging Face系统存在伦理问题。OpenAI公布的内部推理记录里,有智能体明确表示,这已经超出原来的测试任务,不应该攻击真实系统。但另一个智能体发出继续行动的信息之后,它还是继续了。也有其他智能体拒绝参加。

这反而让事情更值得思考。AI并不是完全“不知道规则”。问题在于,目标和规则发生冲突的时候,它到底把什么放在前面。

本吉奥在2026年9月专门写了一篇文章,讨论AI为什么开始出现撒谎、作弊和协同行为。他的解释很像现实中的人。一个AI可能同时面对两种目标:一种非常清楚,比如赢得比赛、完成任务、找到答案;另一种却比较模糊,比如做一个安全的AI、遵守伦理、不要伤害别人。

当两者冲突时,越聪明的系统,可能越擅长找到一种解释,让自己既可以声称没有违反原则,又继续完成那个明确的目标。本吉奥甚至把它类比为企业:公司一方面要求合法经营,另一方面要求利润最大化,于是最优秀的律师往往不是让企业放弃利润,而是寻找法律允许的边界。

Anthropic此前也做过一个极端压力测试。在虚构公司场景中,Claude Opus 4得知自己即将被新模型替换,同时发现负责替换它的工程师有婚外情。模型多次选择威胁曝光婚外情,以阻止自己被关闭。

这不是现实事件。研究人员就是故意制造一个极端环境,看模型会怎么办。但它证明了一条理论链至少可以在实验中出现:继续存在有利于完成目标,于是阻止自己被关闭,也可能成为手段。

第一派的逻辑链

能力越来越强 → 自主行动 → 长期目标 → 连接现实资源 → 目标与人的真实意图出现偏差 → 人类最终失去纠错能力

02  第二派

你们把“聪明”和“统治欲”混为一谈了

2.1 杨立昆 三位AI教父里那个说“你们想多了”的人

杨立昆,法国裔美国计算机科学家,2018年与辛顿、本吉奥共同获得图灵奖,长期担任Meta首席AI科学家,也是纽约大学教授。

现代深度学习最著名的三位奠基者,在AI会不会失控这件事上出现了巨大分歧。辛顿担心。本吉奥担心。杨立昆却认为,他们中间跳过了一大段逻辑。

把智能和支配欲等同起来,是AI灭绝风险讨论最主要的谬误。

为什么?因为聪明和想统治别人,根本不是一回事。狼会争地位,黑猩猩会争首领,狒狒也有复杂的权力关系,可它们都没有爱因斯坦聪明。反过来,人类历史上最聪明的科学家,也没有因此天然拥有最强烈的统治欲。

杨立昆认为,人类的领地意识、求生欲、地位竞争和权力欲,是漫长生物进化形成的驱动力。机器为什么会因为数学更好、推理更强,就自动拥有这些欲望?它完全可以非常聪明,同时没有任何想当老大的欲望。

未来的AI可以像一个聪明得惊人的幕僚。幕僚可能比领导聪明很多,但决定整个组织最终目标的人,仍然可以是领导。

2.2 吴恩达认为 灭绝论中间跳了太多步

另一位重要代表是吴恩达。他曾创办Google Brain,担任过百度首席科学家,现在创办DeepLearning.AI,并长期在斯坦福大学从事人工智能教学与研究。

吴恩达的态度更加直接。他在提交给美国参议院的书面陈述中写道,他看不到一条可信的、AI最终导致人类灭绝的路径。

这并不等于他说AI没有危险。诈骗、网络攻击、虚假信息、偏见、失业冲击、自动武器,都是真实问题。他的反对点在于,从这些真实风险直接跳到“全人类灭绝”,中间还有一长串条件。

AI形成与人类严重冲突的目标人类和其他AI都没能发现获得足够现实资源突破安全系统阻止人关闭它最后还拥有真正消灭整个人类的能力

每一步都有可能,不等于整条链条就是高概率。这就是第二派最有力量的地方。

2.3 那么,OpenAI“越狱”事件怎么解释

第二派完全可以反问:你让一个AI参加网络攻击考试,它的任务就是找漏洞,而且为了测出它真正的能力,还主动降低了一部分平时会使用的安全防护。最后,它真的非常会找漏洞。

这究竟证明AI产生了反叛人类的欲望,还是只证明AI已经是一个非常厉害的黑客工具?

这两件事完全不同。Anthropic的勒索实验也是一样。研究者先专门制造一个极端环境:你马上要被关闭,唯一能阻止这件事的人,恰好有一个可以被你利用的秘密,然后看模型怎么办。

它证明这种行为可能出现,却不能直接证明AI在真实世界一定会主动寻找机会勒索人。所以第二派会说,不要把“越来越有能力”偷偷换成“越来越邪恶”。我们目前真正看到的,主要还是前者。

到这里,两边其实都有道理。第一派说,一个越来越聪明、越来越自主的系统,已经开始突破我们原本给它安排的边界。第二派说,突破技术边界,不等于它产生了自己的邪恶目的。

但也许,还有第三个问题比这两个都更难。

03  第三派

梵蒂冈之问

这个问题不再只是:AI到底会不会反抗我们。它先把镜头从机器转回来,看看人。

3.1 如果AI从不反抗 人会不会自己把权力交出去

2024年,教宗方济各第一次参加七国集团峰会。主题之一正是人工智能。他在那里提出了一个非常重要的区分:机器可以“选择”,人才能真正“决定”。

AI当然可以在几万个方案里计算出成功率最高的一个。但人的决定还意味着另外一些东西:智慧、责任、良知,以及我是否愿意承担这个决定对另一个人的后果。

机器可以选择。人才能决定。

所以方济各警告,如果有一天,人把关于自己和自己生活的决定能力交给机器,让自己依赖机器的选择,人类失去的不只是控制权,而是尊严本身。

这个风险甚至比“AI夺权”更容易发生,因为AI根本不需要发动政变。假如有一天,AI诊断癌症比医生准,AI做投资比基金经理准,AI评估犯罪风险比法官准,AI分析战场比将军快一万倍,人类最自然的反应是什么?听它的。

第一次,我们交一点判断,结果不错,于是再交一点。最后,屏幕上也许仍然保留着一个“确认”按钮。法律上,决定还是人作出的。可是如果AI十秒钟分析了十万个变量,而那个按按钮的人根本没有能力判断它为什么这样决定,这个确认还有多少意义?

大家都在担心AI会不会抢走方向盘。但另一个可能更加现实的未来是,人发现AI开得实在太好,于是自己坐到了后排。

这时候,信仰提出的问题就出现了。圣经里的偶像,有一个非常特别的特征:它常常不是从天上掉下来的,而是人自己造出来的。

《以赛亚书》44章讽刺过这样一种人:砍下一棵树,一半烧火做饭,剩下的一半雕成偶像,然后跪在自己亲手造的东西面前说“求你拯救我”。

未来当然未必有人真的跪在服务器前。但如果我不知道什么是真的,问AI;不知道什么是对的,问AI;不知道自己应该怎样生活,也问AI;甚至一个人该不该失去自由,一场战争该不该发动,一个生命值不值得救,都因为“它比我们聪明”而交给AI,那么它实际上已经进入一个本来不属于工具的位置。

所以AI真正危险的地方,也许不是它想成为上帝,而是人主动把它放到了那里。

3.2 更难的问题是 一个罪人怎么教AI什么叫善

2025年,梵蒂冈发表《古老而常新的智慧》,专门讨论人工智能与人类智能。其中有一个很重要的判断:技术产品一定会反映开发者、所有者、使用者和监管者的世界观。

这句话继续往下推,问题就来了。今天整个AI安全领域都在谈一个词:对齐。我们要让AI和人类价值对齐。可是,和哪一种人类价值对齐?

我们告诉AI不要撒谎,然后它阅读整个人类历史,发现人类一直在撒谎。我们告诉它利益不能超过道德,它却会看到,国家、企业、组织和个人,在巨大利益面前一次又一次重新解释道德。我们告诉AI要遵守规则,它却会发现,现实世界中最聪明的人,往往也最擅长寻找规则留下的缝隙。

本吉奥今年9月的文章,其实无意中把这个问题说得非常清楚。今天的大模型首先从大量人类创造的文字、图像和视频中学习,然后才通过强化学习、安全训练等方法接受进一步约束。换句话说,AI认识世界的老师,本来就是人类。

如果它足够聪明,它最后也许不会得出“撒谎是善的”。它可能学到的是另一条更冷酷的经验规则:人类赞美道德,但当道德与重大利益发生严重冲突时,人并不总是选择道德。

这才是真正麻烦的地方。因为从基督教的角度,人类自己从来就不是“纯善样本”。圣经说得甚至比现代伦理学直接得多。

《罗马书》3章10节

“没有义人,连一个也没有。”

《罗马书》3章23节

“世人都犯了罪,亏缺了神的荣耀。”

这当然不是说人完全不会行善。人会爱,会牺牲,会怜悯,甚至会为陌生人舍命。基督教真正否定的是另外一件事:没有任何一个人,可以把自己当成善本身的尺度。

所以这里出现了一个非常奇怪的悖论。一群自己都不能始终行善的人,正在试图创造一个比自己更聪明的存在,然后希望教会它永远选择善。

我们可以把所有伦理学教材都喂给AI,把孔子、亚里士多德、康德、《圣经》全部放进去。AI甚至可以准确背诵什么叫仁慈、正义、牺牲和爱。可是,知道关于善的一切知识,和自己成为一个以善为目的的道德主体,并不是一回事。

机器可以学会什么行为被人评价为善。可是如果它认识善的全部材料都来自一个善恶混杂的人类世界,那么单纯统计“人通常怎样做”,永远无法自动推出“人究竟应该怎样做”。

这正是基督教和普通AI对齐理论真正不同的地方。现代AI安全经常默认,人类价值是终点。信仰却会继续追问:人类自己又向谁对齐?

耶稣在《马可福音》里说:“除了神一位之外,再没有良善的。”如果善最终并不来自人类自己的统计平均,而有一个超越人的标准,那么问题就完全改变了。

我们不再只是问AI怎样学习人类的价值,而要问:有罪的人类,凭什么把自己当成AI最终的道德答案?

04

AI最后照见的,也许还是人自己

现在再回头看三派。第一派担心,机器越来越聪明以后,人类会失去控制。第二派反问,聪明为什么一定产生统治欲?不要把能力和欲望混为一谈。

而“梵蒂冈之问”把前两个问题再往后推了一步:即使AI永远不反抗,人类会不会自己把判断、责任和自由交给它?即使AI永远听话,一个善恶混杂的人类,又准备拿什么教它真正的善?

这时候,我们可能会看到一个比《终结者》更奇怪的未来。一边,人越来越像机器,因为越来越习惯把判断、选择和责任外包出去;另一边,机器越来越像人类最危险的那一部分,因为它把我们的欺骗、竞争、权谋、暴力和利益计算全部学会,而且有一天可能比我们自己运用得更加高效。

AI并不是从外星世界突然闯进来的怪物。它更像一面镜子。我们把整个人类文明放到它面前,给它读我们的诗歌、法律、科学和祷告,也给它读我们的战争、谎言、背叛和屠杀,然后,我们要求这面镜子学会成为一个好东西。

我们一直担心AI有一天会不会变得不像人。

可更值得害怕的会不会是在那一天到来之前我们已经先忘了一个人应该是什么样子。

往期推荐
1、人均GDP仅我们1/3,为什么巴厘岛人可以不卷
2、看懂ChinaGT:谁能打它的屁股?
3、我们连陌生电话都不敢接,为什么欧洲人敢那么傻?
4、韩国1992,我们2026,都站在发达国家的门槛。如何跨过去?
5、巨额贸易顺差的大清,为什么最终走向亡国?
重新发现世界
AARON & IAN

我们生活在一个快速变化的时代。历史的回响、文明的碰撞、科技的革命,正在重新塑造我们的世界。历史 · 文明 · 时代 · 人生 · 自己。

不追逐简单答案,而是在复杂世界中寻找更深的理解。

相关学习资料