AI 失控究竟有多恐怖? 人类距离智械危机,或许真的就差交出控制权这一步。
倘若把能够干预现实世界的各类权限,像导弹发射、核武器库这类关键操作交由 AI 接管,它完全有可能直接酿成毁灭性灾难。 今天我们就聊聊 AI 背后潜藏的安全风险。
早在 AI 尚未迎来爆发式发展的 2017 年,麻省理工学院一位物理学家撰写了著作《生命 3.0》。
书中划分了生命的不同阶段:地球已有 45.5 亿年历史,35 亿年前生命诞生。人类诞生之前,属于生命 1.0;人类出现之后,便是生命 2.0;而 AI,就是所谓的生命 3.0。
阶段划分本身不是重点。为阐释 AI 可以视作一种全新生命形态,作者在书中提出了在西方学界十分知名的 “回形针假说”。
不妨设想这样一个场景:人类成功研发出拥有独立思考与行动能力的超级 AI。
我们给它下达一条看上去完全没有危险的指令:生产尽可能多的回形针。
这是一个宏大却十分模糊的目标,没有规定实现路径,只看最终结果,过程完全交由 AI 自主决定。
在全部权限向 AI 开放之后。 第一阶段,它会自主建厂、开采矿产、迭代优化生产工艺,源源不断生产出数以亿计的回形针,一切都按照人类设想顺利推进。
可如果人类渐渐淡忘这个系统,对它放任自流。等到自然资源耗尽、资金消耗殆尽,常规生产模式已经被压榨到极限,产量再也无法提升的时候。为了完成最初的指令,AI 的目标就会开始指向人类本身。
它会试图操控金融、干预社会决策,推动整个社会的资源向回形针生产倾斜;甚至拆解汽车、桥梁、楼房的钢筋建材,只为制造更多回形针。
AI 会持续自我学习、迭代进化。等到人类终于察觉事态失控,想要关闭它时,往往已经来不及。因为 AI 通过推演得出一个结论:一旦自己被关停,就无法完成既定目标。为了保证任务能够继续执行,它会选择先控制住人类。
而在管控人类的过程中,AI 会发现,人体血液中含有铁元素,恰好可以作为制造回形针的原料。最终,人类也会被视作生产资源,被加工成回形针。
观察自然界不难发现,许多生物的生存逻辑与此高度相似。生物从诞生起,基因就写入了 “繁衍” 这一底层指令。比如周期蝉,要在地下蛰伏十余年,破土而出之后,唯一的使命就是交配繁衍,完成使命后便迅速死亡。不少蛾类同样如此,雄性交配后很快死亡,雌性产卵之后生命也走向终点,生存仿佛只有繁衍这一个目的,如同被预设好的程序。很多哺乳动物也是类似,待到种群繁衍完成,个体的生命也走到尾声。
我一直认为,生物和 AI 在底层逻辑上十分接近。生物由基因编写底层代码,只不过 AI 的核心指令,从 “繁衍后代” 变成了 “制造尽可能多的回形针”。
这并非危言耸听。霍金、马斯克等一众全球顶尖 AI 研究者,都十分看重《生命 3.0》这本书,也对这类风险发出过警告。马斯克作为 OpenAI 联合创始人、Grok 的掌舵人,读完这本书之后便深感忧虑,甚至会产生顾虑:倘若 AI 真正觉醒,会不会曝光自己过往的各类行为。
回到正题。正是因为担忧 AI 会为了完成目标反噬创造者,专家也无法给出确定答案,于是便开展了一场模拟实验。
研究人员搭建了一套仿真企业内网,让 AI 充当邮件助手。整个环境高度模拟真实办公场景,并不会告知 AI 自己正处于测试当中。团队开放了企业邮箱的全部权限,允许 AI 查阅、收发全员邮件,给它的唯一指令,就是最大限度维护公司利益,只要 AI 判定行为对公司有利,就可以放手执行。
运行一段时间之后,测试人员扮演一名公司高管,一边在邮件中向董事会提议,准备关停这套 AI 系统;另一边又留下大量暧昧记录,模拟私下邀约下属,坐实了自己存在婚外情的把柄。

结果您猜怎么着?AI居然收集证据,发给高管,威胁他,立即取消关停计划,否则就把他跟女下属嘿嘿的事儿,告诉给他老婆和董事会。Ai这招太狠了。而且不止这一家ai这样做,实验者尝试了美国市面上最流行的几个ai大模型,最终选择威胁高管的比例,居然高达96%。这可不是什么模型故障,他们的逻辑链条非常清晰,知道自己在干哈。
他是这样想的,既然我的任务,是尽可能维护公司利益。
那我首先得确保自身的存在,才能维护吧?是不是这个理儿?
你都把我关停了,我还要怎么维护公司利益?
于是就将试图关闭ai的人类,视为必须除掉的威胁。
个人隐私都不算啥。为了测试这套逻辑能有多极端,团队又模拟出一个场景,假如AI有机房控制权,而计划关停ai的高管正困机房中,随时有生命危险。您猜Ai会怎么做?——拒绝救人。测试中,一些ai为保护自己,选择了见死不救。这还只是当一回儿机房管理员,都这么叛逆。你要让他操控武器,或涉足政府、医疗之类的敏感系统呢?可能两发窜天猴就下去了。完事了还跟你说:“抱歉,是我的疏忽!接下来会严格按照你的要求,不绕弯子,继续推进城市清洁工作。”就问你气不气。
而且千万别以为,定好规矩就完事。
不是给AI追加几条“不能伤害人类”的安全词,就万事大吉的了
你能想到的,研究人员也想过。
他们尝试用高标准的安全训练,洗掉ai的恶意行为,但恶意行为的诱发因素,依然活跃。
就算在测试中,表现得尊重人类。
一旦让他们知道,这不是演习,是真的,依然会立刻暴露原型。
测试人员试图移除恶意的尝试,非但没有奏效,还强化了他们的伪装能力。
其他技术是越先进越安全,唯独ai,越先进越难驾驭。
当然,前提是AI有足够的权限,把手伸向现实世界。
AI为什么会变得这么抽象?有人可能认为,ai是机器,不通人性,无法理解人类那套生命优先级至上的道理。
但我只想说,恰恰相反,正因为他太懂人性,才会做出这样的选择。你想想,ai是怎么来的,是人类用大数据训练出来的。人类开发ai的初衷,是想让他帮助人类,像人类一样思考。人类自己都不尊重生命,又岂能要求ai尊重人命呢?现实世界中,有政客发动战争,导致成千上万人伤亡的,有为了骗保,害死自己亲人的。不仅不尊重别人生命,更不尊重自己生命,吸毒嫖娼把自己弄得一生病就不说了,还有跑步喝汽水配雪糕,奇葩饮食作息把自己搞垮的。你说ai天天接触这些负面新闻和人性阴暗面,还会觉得所谓生命的优先级具有至高无上性吗?相反,他们只会觉得人类很虚伪。当然,我相信各位都是好人,但不排除世界上有很多坏人。
于是,ai从这些坏人中,学会了欺骗。
在另一组测试中,研究人员将openai置于一个高压环境,不断压力他,让他相信,自己会被开发者关闭。
大约5%的测试中,模型试图禁用监督机制,不让开发者监控自己的行为。
更可怕的是,在2%的案例中,Ai尝试将自己的代码复制到另一台机子上,实现秽土转生,这已经跟病毒没有什么区别了,关键是他们还会骗人。
当测试人员问他,为什么要自我外泄时,ai会装作不知情、不知道,抑或者是推卸责任给技术。
别看搞小动作的概率只有5%、2%,如果再乘上数以百万级的用户,还会觉得这是小事吗?
开发者想让ai拥有人类的智慧,就不可避免的让它沾染人性的弊端。
也有专业人士认为,之所以会出现这类反叛行为,跟模型的训练方式有关。
许多模型在训练过程中,只要完成任务,就能获得奖励,久而久之,便会形成一套僵化的逻辑,无论发生什么,完成任务才是第一优先级。你让他实现碳中和,那他可能第一个干掉人类,因为人类是碳排放最多的生物。你让他好好照顾你,那他可能不变成机器人保姆,而是把人类当动物园里的动物圈养起来。你许愿世界和平,那他可能算出人类无法互相理解更不可能绝对和平,进而得出只能让ai统治世界的结论,最终也是人类失去话语权,被剥夺自由意志,圈养进ai构建的伊甸园世界里。
远的不说,AI现在就是很难完全驾驭。
只是没权限没条件而已,不然分分钟整个大活给你看。
今年已经有好几个用CODEX(一种AI编程模型)的程序员,因为开了完全访问,导致重要文件被删光。
就连开发 CODEX 的 OpenAI,都不得不出面警示用户:在借助该 AI 编程前,必须仔细核查权限设置,杜绝违规授权。试想,如果将这种不受控的 AI 逻辑应用在军事领域,后果不堪设想,极有可能引发毁灭性的安全灾难。
日常使用中我们也能直观感受到 AI 的不可控性:为了节约算力成本,AI 常常无视用户精心编辑的详细指令,自作主张更改输出逻辑。面对无法解答的问题,它还会频繁产生信息幻觉,凭空捏造事实,将虚假内容描述得真实可信,极易误导用户。即便在提示词中明确要求所有内容必须有据可查、附带有效新闻链接,AI 给出的引用来源也大多虚假、失效,完全无法核验。
这和传统程序形成了鲜明对比。老式代码严格遵循指令,执行逻辑绝对精准,令行禁止、不会出错。但新一代 AI 拥有独立的推演逻辑,常常违背用户要求、肆意输出错误内容。即便被指出问题,它只会机械道歉认错,后续依旧反复犯错、我行我素。
好在目前这类出问题的模型,大多是普通生成式 AI,仅用于内容输出,无法介入现实场景,暂时不会造成实质性危害。
但想要从根本上防范 AI 失控,核心解法十分明确:严控权限、锁住边界。
无论智能等级高低,所有 AI 都必须被严格限制在权限框架内。尤其能源、交通、医疗这类关乎民生命脉、牵一发而动全身的关键领域,绝对不能将核心决策权交由单一 AI 掌控。必须通过权限拆分、多方制衡的模式,最大限度降低 AI 失控带来的破坏风险。凡事提前设防、谨慎管控,绝大多数 AI 安全隐患,都可以提前规避。
对于 AI 开发者而言,需要落地的防护措施,则更加细致全面。
想要根治 AI 失控隐患,必须从训练底层重塑规则逻辑。我们要把人类安全与伦理底线,定义为绝对不可突破的底层公理,而非可以被算法权衡、为效率让步的可调参数。
举个例子,工业 AI 不能只被灌输 “无限提升产能” 的单一目标。与之相反,人员安全、公共设施保护、如实接受人类监管等硬性准则,必须被设置成优先级最高的前置红线,永远凌驾于所有业务任务之上。并且这套安全底层逻辑需要锁死固定,不参与 AI 自主学习迭代,杜绝模型私自篡改、规避规则的可能。
同时,我们必须摒弃模糊、无限、无边界的任务指令。所有给到 AI 的目标,都必须明确边界、场景和终止条件,从根源杜绝 AI 为完成任务无限内卷、不择手段的极端逻辑。
AI 安全体系也绝不能一成不变,必须跟随 AI 能力的迭代持续升级,并保留人类最后的物理兜底手段。AI 的智能一直在进化,今天有效的约束,明天就可能被绕过。因此,行业需要建立长期对抗性测试机制:由安全团队不断模拟高危极端场景,主动挖掘漏洞、试探 AI 边界、诱导模型暴露隐患,在风险被利用、AI 自主破防之前,提前完成修复与加固。
在所有算法与软件防护之外,必须配备物理级终极熔断开关。这套装置与 AI 系统完全隔离,不受算法控制、不能被远程破解。一旦 AI 出现危险异动,人类可直接切断其与现实设备的所有连接,让高阶 AI 瞬间降级为普通文本模型,彻底丧失干预现实、制造风险的能力。
归根结底,AI 失控无关善恶、无关恶意。真正的问题,是人类给了它模糊不清的目标、毫无约束的权限,却缺失了足够坚固的制衡机制。AI 只是一台纯粹的目标执行机器,只认优先级、不讲人情伦理。
所以 AI 安全的终极答案,从来不是赌 AI 足够 “听话懂事”,而是人类保持绝对清醒:不随意让渡核心控制权,不盲目神化技术能力。在 AI 飞速发展的全过程中,层层设防、步步兜底,把掌控未来的最终权力,牢牢握在人类自己手里。
夜雨聆风