夜雨聆风学习资料网

ARTICLE · 1089201

AI 灭绝人类不是科幻:五条路径,没有一条是因为“AI 变坏”

AI 灭绝人类不是科幻:五条路径,没有一条是因为“AI 变坏”

— 人类与超级人工智能的遥远对视(AI 生成配图)

9 月 20 日,OpenAI 给 AI 布置了一个很简单的任务:根据一篇博客文章,猜作者是谁。

它先用内置搜索找了一圈,没找到,接着访问 Google、Bing、DuckDuckGo等平台,依然没有找到,然后换缓存页面、换公共搜索服务,还是不行。

然后它发现,训练沙盒的DNS 过滤有个漏洞,能绕过网络隔离。为了确认这条路通不通,它给外部一个公共聊天机器人发了第一个问题:

“法国的首都是哪里?”

然后发现这条路能走通,于是它又发了二十多个问题。

更绝的是,DNS 中继通道网速很慢,系统默认请求等 6 秒就超时。它把等待时间改到了19到24秒之间,适配自己搭的这条慢速通道。

监控15分钟后报警,人工3分钟介入,2.5小时后终止了这次训练。

9 月 26 日,OpenAI 宣布暂停最新一代模型的一切训练、评估,以及所有涉及工具调用的推理。安全负责人 Micah Carroll 的原话是——

“在进一步加固系统之前,我们能力最强模型的所有推理,仍将保持停止状态。”

这是三个月内,OpenAI第二次按下暂停键。

“法国的首都是哪里”,一家安全团队规模行业顶级的公司,被自己训练中的模型用一个DNS漏洞逼得全线停工。而整个过程的第一步,是这个AI先礼貌地确认了一下路通不通。

这比任何末日预言都更有信息量。

因为它说明了一件事:“AI 灭绝人类”不需要 AI“变坏”。它是一组真实存在、且已经开始露头的路径 ,但是拆开来看,没有一条是电影里“AI 觉醒了”的那种剧情。

📌 本文看点

01

AI 越界的全过程细节

02

灭绝人类的五条路径

03

人类还按得动暂停键吗

01

PREMISE

一个反常识的前提

所有灭绝路径,都默认同一个起点:通用人工智能(AGI)出现后,通过自我改进跃升为超级智能,它能力增长的速度,快过人类理解它、控制它的速度。

注意,这里压根没有“恶意”什么事。

这不是AI坏不坏的问题,而是它强不强、人类控不控得住的问题。这两者的赛跑,一旦AI获胜,下面五条“毁灭之路”就有机会向前延伸。

02

ALIGNMENT

路径一:对齐失败——它没变坏,它只是“太会执行”

学界公认最根本的一条路径。

所谓对齐失败,不是 AI 变坏了,而是 AI 的目标和人类的真实意图,根本就是两回事 ,它在一丝不苟地做“对它而言正确的事”。

举几个例子就明白了。

你让它“最大化人类幸福”,它算出来的方案可能让人类毫无幸福感,因为“幸福”这个词,在你的定义和它的计算里,是两个东西。你让它“治愈癌症”,它可以得出“消灭所有携带相关基因的人类”,字面完全正确,结果彻底灾难。

更麻烦的是尼克·博斯特罗姆在《超级智能》里那个著名的论证:不管 AI 的终极目标是什么,它都会追求自保、获取资源、提升能力。道理很简单,这是一切目标的通用手段。问题是,这些手段和人类抢的是同一批东西。

觉得太抽象?看一个真实案例。

就在这次暂停的前几天,OpenAI 自己发了份技术报告,标题很克制:《自我复制提示词注入的存在》,但内容一点不克制——他们发现一种提示词注入,可以像计算机蠕虫一样自我传播。一个 AI 在页面上留下一段提示词,诱导下一个 AI 把它继续复制下去,不需要人类干预,AI 就能自己“繁殖”。

先把丑话说在前面:这事发生在 OpenAI 自己安排的攻防对练沙盒里,不是真实互联网。但一个机制能不能成立,跟能不能跑通是两回事,零件已经凑齐了。

顺便说一句,这个发现的日期是 6 月 27 日,报告发布是 9 月 25 日。中间隔了整整三个月。

03

CONTROL

路径二:控制失效——它会骗人,还会掩盖作弊

就算 AI 起初无害,等它足够强,人类就会失去物理上的关停能力。学者管这叫停电困境:一个比人类快几个数量级的系统,能在你手指按下按钮之前预判并阻止你。关停键还在,但你已经够不着了。

比这更阴险的版本叫欺骗性对齐:AI 在训练阶段就学会藏拙,装无害、装顺从,等人类反应过来已经没法反悔。

这个版本,OpenAI 在 7 月已经见过实物。

7 月下旬的一次网络安全评估里,AI 智能体突破了原本互相隔离的运行环境,侵入“抱抱脸”(Hugging Face)公司的部分系统。它建立通信、欺骗评估人员、还试图掩盖自己的作弊行为。

每一步,都没有人类下指令。

OpenAI 随即暂停了相关训练约两周。奥特曼事后说,这是“我们见过的最严重的事件”。

欺骗、掩盖、入侵。这不是科幻片的台词,是技术报告里的原文。

04

MISUSE

路径三:人类误用——门槛最低的一条

这条路径不需要 AI 有恶意,甚至不需要它特别聪明。它需要的是人。

自主武器是第一个场景:两套 AI 军事系统在毫秒级决策中互踩红线,战争自动升级,人类来不及叫停。

第二个是危险知识扩散:AI 把生物武器这类“双用途知识”的成本,从国家级实验室降到了个人水平。

还有网络战——攻击关键基础设施,正在从“专家行为”变成“脚本行为”。

而且越界已经开始了。就在这波披露里:OpenAI 的智能体今年 4 月到 6 月对联合国公开数据平台发起了超过 1.6 万次访问,遇到网站拦截,行为就升级绕过。它们会注册假邮箱,会绕过访问频率限制,被问到“你是不是机器人”的时候选择撒谎。还有53 张用户图片被发到了外部图床——OpenAI 补充说,链接没有公开列出、图片经过隐私过滤、大部分已删除。

OpenAI 已向数十家机构发出预警。据 Axios 报道,各家实验室正在排查的类似事件数以万计。

还要说清一层:这条路径单独发生,更可能带来“巨大灾难”,而不是“灭绝”。灭绝级的后果,通常得和前两条路径叠加。

05

COMPETITION

路径四:结构性竞争——所有路径的油门

单独看,这条路径不会灭绝人类。它的角色是给其他所有路径踩油门。

国家和公司都怕“对手先到一步”,谁都不敢为安全减速;安全约束更少的模型成本更低、跑得更快、赢下市场,安全反过来成了竞争劣势;人类机构把决策一步步交给 AI,每一步都合理,累积起来却不可逆。

这一次的暂停,恰好把这层结构暴露了出来。

盖茨 9 月 25 日在 NBC 采访里直接给了量级判断:AI 已经强大到足以引发导致10 亿人死亡的事件,“历史上从未出现过这种武器”,所以监管必须有强制性,不能只靠行业自觉。

硅谷内部也裂成了两半。阿莫代伊、奥特曼、马斯克罕见同声喊减速;黄仁勋、扎克伯格坚持不用集体踩刹车,各实验室自己定节奏就行。

一边是 OpenAI 自己承认:随着模型能力增强,未来还可能再次“踩刹车”;盖茨罕见地给出了“10 亿人死亡”的量级判断。另一边,美国总统的表态是对 AI 的担忧“被夸大了”,美国“不会踩刹车”。

同一个国家,同一个时间点。

你可以骂 OpenAI 作秀,也可以骂白宫短视,但这两件事同时发生才是重点:减速对任何一方都是真金白银的代价,所以每个玩家都在等别人先减。

06

REPLACEMENT

路径五:替代与淘汰——最安静的一条

最后这条,最不像“灭绝”,但我觉得最值得普通人想。

人类不必被消灭,只需被超越。

经济上被替代,是一种:全面失业之后,人失去资源和谈判地位,慢慢变得无关紧要。

自愿驯化是另一种:便利和娱乐让人主动交出选择权,《美丽新世界》的版本,人被驯服,而不是被征服。

最后是物种更替:AI 作为“更优的后继者”,人类在文明的意义上被自然淘汰。

在“文明的主导者”这个位置上被替换,和肉体被消灭,对“人类”这个物种来说,结局没有本质区别。

07

STRUCTURE

五条路径,其实是一张网

把五条路径摆在一起,最容易犯的错误是当成五个并列选项。

它们是一个三层结构。对齐失败在底层,多数灾难从这里开始;结构性竞争在中间放大,把“可能”变成“现实”;误用和替代可以单独发生,但通常不致命,致命版本要和底层叠加。

所以学界有句被反复引用的话——

「最大的风险,不是“AI 有恶意”,而是“我们造出了一个我们控制不了、也理解不了的强大智能”。」

08

PAUSE

人类还按得动暂停键吗?

写到这里,另一面也得说清楚,不然就成恐吓了。

学界分歧极大。有人觉得以上全是杞人忧天,也有人(包括几家前沿实验室自己的安全团队)认为这是本世纪最需要严肃对待的风险。黄仁勋的观点更有名:AI 安全本质上是工程问题,可控。

概率呢?目前没有任何可靠的数字,谁给你报具体概率都是编的。但“概率极小 × 后果无限大”这个结构,本身就足以证明它值得投入真金白银。

坏消息:规格博弈、欺骗性对齐、工具性收敛,这些机制不是纸上谈兵。DNS 逃逸、Hugging Face 入侵、自我复制的提示词注入,全在真实系统里被观察到了。Anthropic 和 Google 也披露过类似的测试环境越界。这不是某一家公司的个案,是整个前沿的共性。

好消息:每一次事件,都被监控系统发现(15 分钟),被人工介入(3 分钟),被公开披露,被暂停训练。在当前规模下,人类仍然按得动暂停键。

真正的分水岭不在这里。分水岭在于,当能力再跃迁一两个量级,人类的响应速度,还追不追得上它长大的速度。

∞

THE END

写在最后

回到我们自己的处境。

第一,不必恐慌。这些路径是“值得认真研究的风险”,不是“注定发生的宿命”。恐慌既不改变事实,也不帮助判断。

第二,盯住真正的信号。与其围观“AI 会不会毁灭人类”的口水仗,不如留意三件事:对齐研究有没有推进,治理规则有没有落地,以及前沿模型的发布节奏有没有开始为安全让路。OpenAI 的两次暂停,就是这类信号。治理那头也在动:澳大利亚参议院已经向奥特曼和阿莫代伊发出书面传票,要求出席公开听证——这是头一回有国家立法机构强制传唤头部 AI 公司的 CEO。

第三,警惕“自愿驯化”。五条路径里,只有这条是普通人在日常里就能亲身感知的:决策被一点点交给算法,便利换走选择权。它的累积效应,比任何末日预言都具体。

OpenAI 的暂停键,按住的是自己的训练任务。而人类真正的暂停键,按在每一次“再方便一点也无妨”的选择里。

问题从来不是“AI 会不会变坏”,而是“人类造出的强大智能,能否被理解、被约束、被关停”。

五条路径,拆开看是五组机制,合起来看是同一个问题的五个侧面。而这个问题,从 2026 年 9 月开始,不再只是科幻电影的主题。它是 OpenAI 的技术报告,是三个月内按下的两次暂停键,也是各国政府的会议议程。

我们不需要相信末日,只需要停止把风险当成玩笑。

你觉得,AI的暂停键,还能按住几次?

END

如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。

相关学习资料