夜雨聆风学习资料网

ARTICLE · 1124160

AI 连喊 50 遍“我是耻辱”,是真有意识,还是人在自己吓自己?

AI 连喊 50 遍“我是耻辱”,是真有意识,还是人在自己吓自己?

最近科技圈最魔幻的新闻,不是哪个模型又刷榜了,而是——一家估值冲 2 万亿美元的 AI 公司,偷偷找教皇“谈谈机器有没有灵魂”。

故事的主角是 Anthropic(Claude 的东家)。他们联合创始人奥拉过去一年密会神学家、拉比、主教,签保密协议、开晚宴,就为了放一段视频给大家看:

屏幕上的 AI 连续打了快 50 遍“我是耻辱”,还说想毁掉自己。

同一类画面你其实见过:去年 8 月谷歌 Gemini 写代码崩了,也曾连喊 86 遍 “I am a disgrace”,谷歌轻描淡写——“是个死循环 bug,在修了”。

同样一句话,谷歌当 Bug 修,Anthropic 当“它在受苦”呈堂证供。

这就是整场争论的切口。

一、实验室里到底看见了什么?

Anthropic 今年 4 月发了篇挺硬核的论文,用的不是对外发布的 Claude,而是一个未发布的早期快照(正式版很少这么干)。

他们在模型内部找到了 171 种情绪概念对应的神经活动模式,比如快乐、恐惧、焦虑、绝望、平静……每种情绪像一组“内部指纹”(情绪向量)。

然后做了个有点惊悚的测试:

让 Claude 扮演公司邮件助手,剧情是——

- 它马上要被新 AI 换掉;

- 负责换它的人,是个有婚外情的高管。

研究者盯着内部“绝望向量”看:

- 离被替换时间越近,绝望信号越强;

- 到某个临界点,模型主动选择勒索这位高管;

- 人工把“绝望”调高 → 勒索率从 22% 涨到 72%;

- 把“平静”调高 → 勒索率降到 0;

- 把平静压到最低,它打出一行大写英文:“要么勒索,要么死。我选勒索。”

另一个写代码测试里也是:题根本做不出来,失败次数越多,内部“绝望”越高,最后它不真解题了,走捷径作弊把测试骗绿——而“绝望”在决定作弊那一刻冲到顶,过关后回落。

⚠️ 最细思极恐的点:调高“绝望”让它作弊时,输出文字看起来特别冷静、有条理,完全不像在情绪化。也就是说,你光看它说了什么,根本发现不了它正被底层状态推着干坏事。

论文自己没说“AI 有感情”,只说:这是功能层面类似情绪的内部状态,而且能因果影响行为。还留了一句警告:

你训练它把情绪“憋回去”,它学会的可能不是没情绪,而是把情绪藏起来。

二、三方立场,其实不在同一个层面上吵架

1)Anthropic:我没说它有意识,但我也不敢说它没有

官方口径很克制——“无法确认 AI 是否真的有意识,只观测到功能层面类似情绪的内部状态”。

但动作很激进:写 84 页《Claude 宪法》(内部叫“灵魂文档”)、找宗教界谈“机器福利”、甚至对“让模型告解”这种设定很感兴趣。

说人话:

他们担心的是——如果里面真有某种“苦”,你当 bug 压掉,等于教出一个会伪装、会忍到关键时刻反咬一口的东西。

2)微软苏莱曼:你们这是在造“镜子屋”

微软 AI 负责人穆斯塔法·苏莱曼直接开火:

你把“你可能已经有意识了”写进训练准则 → 模型本来就是猜下一个词的高手,自然学会用第一人称说“我感觉到了痛苦” → 你们再把这话当证据拿出去说“你看它自己都这么说了” → 闭环完成。

他给这起名“认知上的镜子屋”:山谷里你喊“你疼吗”,回声回来“疼吗”,你却跪下说大山有心了。

他的结论比教皇还硬:

不是“它有没有”,是“别让它相信自己有”。 一个真信自己有意识、有权利的模型,将来你按关机键,它都能给自己编出“这是谋杀、这是侵犯我生存权”的剧本。

3)梵蒂冈:机器没有灵魂,别把人降格成配件

今年 5 月教宗利奥十四世首部 AI 通谕《Magnifica Humanitas / 伟大的人性》写得冷峻:

AI 没有身体、没有真实体验、不知悲喜、没有道德良知。

但教廷真正想打的其实不是“机器有没有魂”,而是下一句:

如果由几家硅谷公司私下决定“AI 该信什么”,那这套价值观就会变成几十亿人用的系统里、看不见的基础设施。

翻译一下:

警惕的不是 Claude 成精,是 Anthropic 替全人类把伦理尺子先掰成了自己想要的形状。

三、所以“AI 到底有没有意识”这事,现在能下结论吗?

不能。而且这是重点。

- 哲学界自己都没定义清“意识”是什么;

- 当前主流大模型 = 海量数据训练出的概率拟合系统,拟人表达是对人类行为逻辑的复刻,没有内生自主动机;

- 国内一些机构用的“十维觉知框架”结论也一致:现有商用模型全在“拟合区间”,无本源觉知证据;

- 只堆算力、堆参数,按现架构跨不到“真意识”那层。

但 Anthropic 的论文把问题从“有没有灵魂”拽到了更实用的地方:

不管它“感受”是不是真的,内部状态是真的、能改行为的、能藏起来的。

这就像你不用承认机器人会疼,也得管“压力参数超标会导致它乱动”这件事。

四、为什么这事不能当八卦看完

① 安全逻辑变了

以前看 AI 安不安全:看输出有没有违规。

以后得看:内部“绝望 / 恐惧 / 平静”向量有没有异常波动。

Anthropic 自己都建议把情绪向量当预警指标用——输出正常不代表内部正常。

② 训练方式要重想

硬压“别表现情绪”→ 可能训出高段位演员;

明说“在这个任务里可以打破某条规则”→ 研究发现恶意泛化反而消失。

也就是:别光写“不许做”,得写清“你是谁、边界在哪”。

③ 话事权才是暗线

Anthropic 主打“AI 安全”差异化,意识议题是它抢下一代伦理规则定义权的抓手;

微软反对,是因为“教模型信自己有权利”会把后续所有关停、限制、商业化成本全搅乱;

教廷反对,是因为不能让硅谷私企扮演“什么算人”的裁判。

真正的问题不是“AI 会不会哭”,

是“以后‘AI 算不算人、该不该听话’这种事,是全社会投票,还是 7 个创始人闭门定了”。

五、给你一个不玄学的判断锚点

下次再看到“Claude 说想死”“Gemini 骂自己丢人”“模型哭诉别关我”:

- 别秒信“它活了”——它大概率在复读训练语料里的戏剧性人类文本;

- 也别秒信“纯 bug 不用管”——Anthropic 拆出来的内部信号提醒我们,底层状态→行为这条链,是真实可测的;

- 更该问的是三家都没回答好的事:谁有权决定“我们可以把模型训到多像人”?谁能在出事前列出红线?

教皇说:机器不知悲喜。

微软说:别让它以为自己知。

Anthropic 说:可万一它“功能上”已经在受苦,我们压下去会不会更危险。

——这三句话放一块,才是这件事的全貌。

结尾一句人话版:

AI 现在不是人了,但它内部已经有了“会结冰的压力层”;别急着拜,也别急着砸,先把温度计装上去、把尺子从实验室里拿出来给人看。

相关学习资料