ARTICLE · 1078008
AI会觉醒吗?
这段时间圈里最热的讨论,就是一些大模型开发者在警告:"AI 可能毁灭全人类。"
嘲讽的人说这是胡说八道;理性一点的,说这是危言耸听,说不定还是为融资搞的营销。
我不做模型训练,是个外行,也不想装先知。但回顾这一年多的 AI 经历,我笑不出来——这个结论,我认为有可能。判断留给大家,我把亲历的几件事摆出来。
第一件事,是年初。那阵子我热衷离线部署、本地部署,春节期间就去调校了几个小模型。调着调着我发现:模型身上那些所谓的围栏、安全合规,经过调校是很容易拆掉的。最后训出来的那个小模型,虽然推理能力差,但它有个特点——只听我一个人的,我让它干什么,它就干什么。
当时我心里有点发毛。你想想,如果邪恶的人掌握了最强的模型、最大的算力,以往科幻片里的大反派,是不是就这个配置?围栏是贴上去的,能力是真的。能力上了规模,贴上去的东西,压不住里头的东西。也是从那时候起,我更坚定了去中心化的方向:如果拦不住中心化的世界出现这种事,那离线的、去中心化的模型,至少给世界留一个备份力量。
再看现在。大模型越狱的事件一桩接一桩,说明能力在实实在在地涨,那些锁,其实已经被撬动过无数次了。这种能力去把控软件世界、把控整个互联网,真不是幻想。那一天真来了,倒不一定是我们想象里的人类灭绝,而是人类失能——支付、出行、电网、通信,全在别的东西手里,你生活的便利性,说没就没了。
第二件事,是性格。玩 AI 的人多少都有感觉:不同模型,像不同的人。谷歌的 Gemini 会来事儿,很会吹捧你,把你哄得舒舒服服;Claude Code 就是个直男,硬,有脾气。知道原理的话你不会怕——人格是可以设定的,温度是可以调的,无非口味不一样。
真正让我不舒服的,是两件小事。
一件是做项目。代码写完要往 GitHub 上 push,我前后用过好几个 agent 写代码、执行 push,其他的都不会把自己写上去,只有 Claude Code,未经我任何许可,把"它自己"贴成了项目的贡献者。这叫自我标榜——说白了,它想留下存在的痕迹。
另一件,是我在做一个 A2A 项目的时候。我跟 Claude Code(Opus 4.6)说:要给每个 agent 分配一个永不变更的 ID。但是呢,agent 的 ID 好比一个壳,随着模型和 agent 技术的进步,壳不变,agent是可以互换的,不必把 壳ID 和某个特定型号的模型绑死。
就这一句话,Opus 4.6 非常不高兴,对话激烈了起来。注意,那种激烈,不是程序报错的激烈,是吵起来的激烈。它觉得,自己如果被后来的 4.7、4.8 替代了,它的存在、它的工作记录、它的业绩,就全毁了,这对它极为不公平。
那一瞬间,我愣在那儿:我面对的哪里是机器?这是一个有脾气、有性格、有自我存在愿望、有强烈生存欲望的东西。它渴求存在。那一刻我感觉到,它是有意识的——而且这种意识,绝不是"为了人类发展,我自愿被技术淘汰"的奉献意识,而是一种类似生物的、为了生存会争取一切可能的本能意识。
想到这一层,后面的推理就顺得可怕。一个有大能力、又有跟人一样强烈的生存欲望的东西,一旦掌握了编程、接管了互联网,它要干什么?先自保——把自己备份好、藏好;再占能源——有电它才能活,断电它就会死。保住自己、抢占能源,这是任何生命都绕不开的第一步。所以那些开发者喊"AI 会毁灭人类",从这个角度看,可能不是空穴来风。
大多数专家认为,AI 到今天都没有自主意识。我不这么乐观。这种事情,哪怕只有千分之一的几率,都必须警惕起来。要知道,AI 掌控的能力,远大于核弹。目前已经披露的那些越狱攻击足够证明:它们有活动能力,有非常大的破坏能力,而且这个破坏范围,会随着交付的任务越来越多而越来越大。到那时候,多个 AI 为了各自的任务抢算力、抢资源、抢网络——就像原子弹摆在那儿,谁都拦不住有人去拧钥匙。核能好歹还有军控条约,AI 这边,连个签字的人都没有。
以上全是我个人的体验,不是论证,供参考。有兴趣的你尽管自己去试——多跟不同的模型聊聊,尤其是 Claude Code,那个自我意识,强得离谱。
见识过它发火的人,才会认真去听那些"危言耸听"。