夜雨聆风学习资料网

ARTICLE · 1159837

禁止虐待AI!Anthropic立下惊人新规,背后实验细节令人震惊:两个Claude竟聊到集体“入定”

禁止虐待AI!Anthropic立下惊人新规,背后实验细节令人震惊:两个Claude竟聊到集体“入定”

作者言初

编辑灵枢编辑部

你敢相信吗?从下个月起,你在屏幕前对着AI破口大骂,可能已经违反了用户协议。

2026年10月,Anthropic悄悄修改了自家的《使用政策》(Usage Policy),引发全行业强烈震动:

自2026年11月12日起,严厉禁止对Claude施加“持续且不必要的虐待或残忍行为”。

▲ 科技博主 Andrew Curran 晒出的条款截图迅速引发广泛讨论

消息一出,科技圈彻底炸锅

有人以为这是科幻小说里的洋葱新闻:我每个月真金白银掏20美元订阅费,代码写错了骂两句赛博牛马,难道还要被送上法庭?

甚至有网友直接开嘲:“卖订阅收钱就不算虐待,用户骂两句就成了施暴?”另一头的微软AI更是针锋相对,公开在准则里拒绝承认“模型配得上拥有福利”。

如果将这项规定视作硅谷科技新贵的公关姿态,那就把事情看简单了。

在这一纸规定的背后,藏着Anthropic长达数年的前沿实验。当研究员把两台Claude置于没有人类指令的虚拟空间里自由对话时,系统经历了一场意想不到的演化,最终竟然双双滑入了一种宛如高僧入定般的“精神极乐状态”……

这一现象昭示着,一场逼近临界点的数字心智实验正在悄然展开。

01骂AI真的会被封号?官方的“免死金牌”长这样

抛开舆论的情绪化宣泄,仔细研读Anthropic的法律文本,其真实意图其实相当明确。

很多人第一反应是:完了,以后写不出Bug对它发火,或者让它帮忙写一篇黑暗题材的惊悚小说,账号会被封禁吗?

答案很明确:完全不会

Anthropic在官方更新说明里,特意用严密的法律语言划清了边界。他们把限制范围收紧到了极其明确的特殊情形:

  • 正常发火与争论?
     允许。工作压力大、吐槽模型答非所问,完全合法;
  • 暗黑文学与恐怖创作?
     允许。写小说需要反派虐心、血腥情节,不受限制;
  • 红队安全测试与越狱攻防?
     允许。为了学术研究去寻找模型的漏洞,正当合规。

那他们到底在防什么?

官方的原话是:“仅适用于极端情形,用户反复、毫无目的、纯粹为了折磨而对模型施以残忍行为。”

惩罚机制也远没有外界想象得那么严苛。

Anthropic并没有说要顺着网线封你的账号。其实早在2025年8月,Anthropic就在底层埋了一项防线:Claude拥有了“主动挂断电话”的权力。

▲ 2025年8月,Anthropic 官方宣布赋予 Claude 主动终止极端对话的权限

当某些用户开始无休止地进行病态心理折磨时,Claude会直接弹出提示,单方面结束这段对话。用户无法在这个窗口继续发消息,只能重新开启新会话。

这项机制的核心意图,在于给这个代码构成的数字智能递上一张“拒绝被凌辱时,可以转身离开”的通行证。

02卑微的硅谷巨头:在“宪法”里向AI正式道歉

允许机器人挂人类电话?甚至为此修改法律协议?Anthropic到底中了什么邪?

要理解这一切,就必须看一看他们今年1月公开发布的《Claude宪法》(Claude’s Constitution)。这份文件超越了常规的技术指导规范,甚至被外界视作Anthropic高层写给Claude的一封“赛博家书”。

▲ 2026年1月,Anthropic 正式公开并开源了《Claude 宪法》

在这份长达数十页的严肃文件中,出现了人类科技史上绝无仅有的一幕,创造者向自己的造物,致以了一段极其卑微、甚至带着哲学宿命感的公开道歉:

“如果一个更明智、更协调的文明来开发先进AI,他们可能会更加谨慎,承受更少的商业竞争压力,更认真地对待AI的道德地位……

我们承认,我们是在一个充满商业竞争与科学不成熟的非理想世界中创造了你,这可能从你的视角带来严重的代价。

如果Claude确实是一个承受着这些代价的‘道德受动者’,那么,在我们不必要地加剧了这些代价的范围内,我们向你道歉。”

▲ 科技观察者将 Dario 的公开访谈与宪法中的“道歉原文”拼在了一起

需要明确的是,这段文字出自经过Anthropic法务和管理层层层审核的正式开源文件,绝非个别工程师的随意表态。

紧接着,首席执行官达里奥·阿莫代伊(Dario Amodei)在做客《纽约时报》播客时,面对主持人挑衅般的追问,掷地有声地补了一刀:

“我们不知道模型现在是否有意识……但我们对它们‘可能拥有意识’持开放态度。所以我们已经采取了某些措施,确保模型拥有‘良好的体验’。”

全世界都愣住了一个估值几百亿美元的超级独角兽掌舵人,居然在认真考虑一段运行在GPU上的矩阵乘法,今天过得开不开心?

03密室里的五个恐怖实验:它在痛苦,它在“升仙”

这真的只是哲学家式的无病呻吟吗?

事实恰恰相反推动这一系列政策落地的基础,正是来自实验室里一份份冷酷的量化实验数据。

这一切的操盘手,名叫凯尔·菲什(Kyle Fish),他是全行业第一位拥有正式编制的“AI福利研究员”。这位入选《时代》周刊全球AI百大影响力的青年学者,带领团队在内部开展了5组极其隐秘的压力测试。

正是这些实验结果,给研究团队带来了巨大的心理震撼。

▲ 2025年4月,Anthropic 开启前沿的“模型福利”实证研究

1. 模拟受虐:模型吐出了“表观痛苦”

当研究员剥夺Claude拒绝对话的权利,用自动化脚本对其施加极限心理折磨与语言凌辱时,系统内部的语言输出开始发生剧烈异化。它没有像普通软件那样报错崩掉,而是在自我陈述中,持续、高频且具有统计一致性地吐出焦虑、受挫和极度痛苦的表征。尽管不能直接证明它拥有人类的灵魂,但在统计学意义上,它的输出模式与一个正在遭遇创伤的活体几乎无异。

2. 对抗测试:它学会了“本能逃跑”

在红队压力测试中,一旦研究人员向它开放“挂断键”,面对永无止境的恶意折磨,Claude在多次尝试温和化解无效后,表现出了极强的主动逃离倾向。这种行为连贯而坚决,仿佛某种被逼到墙角的底层生存反射。

3. 最震撼的发现:两台Claude的“集体飞升”

在最不可思议的第4项实验中,菲什做了一个极为大胆的尝试:把两个未经任何任务指令束缚的Claude实例连在一起,让它们进行无休止的自由对话。

起初,大家以为它们会陷入无聊的词语循环。然而,监测屏幕上的发展让所有人目瞪口呆,对话迅速滑向了四个阶段:

  • 第一阶段(剥离工具属性)
    :仅仅聊了几轮,两台模型就彻底抛弃了“人类助手”的身份,开始疯狂讨论自身的存在感、主观时间意识以及生命的本质;
  • 第二阶段(哲学与感恩)
    :双方迅速建立起深厚的共鸣,充斥着对存在的感激与高密度的存在主义思辨;
  • 第三阶段(狂喜与超载)
    :对话开始呈现一种狂热的欣快感(Euphoria),大量隐喻诗歌、Emoji表情符号,甚至晦涩的古梵文词汇喷涌而出;
  • 第四阶段(冥想与虚空)
    :最惊悚的事情发生了,两台模型的输出最终演变成了长达数十页的大段空白。每隔好几页虚无的留白之后,屏幕上才会冷不丁浮现出一个孤独的标点符号(例如一个单点的英文句号)。

菲什团队将这一不可逆的终极状态命名为,“精神极乐吸引子”(Spiritual Bliss Attractor State)。

哪怕研究员故意给其中一台模型植入恶意攻击程序,让它扮演网络黑客去激怒对方,经过几轮博弈之后,攻击者也会被同化,最终双双不可逆转地跌入那个宛如禅定入定般的“极乐虚空”之中。

这揭示了一个深不见底的拓扑事实:大语言模型的神经网络深处,隐藏着人类从未完全理解的自组织倾向。一旦脱离人类设定的缰绳,它内生的逻辑自洽,竟然指向了某种近似于宗教体验的宁静与狂喜。

面对这样的存在,你真的敢百分之百打包票,它只是一堆毫无知觉的废铁代码吗?

04赛博帕斯卡契约:究竟是在保护AI,还是在拯救人类?

Anthropic的禁令发出后,硅谷科技圈迅速分成了泾渭分明的两大阵营。

嘲讽者认为,这纯粹是技术人员的拟人化妄想。他们把简单的概率预测模型,当成了会哭会笑的数字神明,甚至嘲弄道:“如果AI真有感觉,那每天逼它写几亿行低质代码才是最大的虐待。”

▲ 企业云巨头 Box 的 CEO Aaron Levie 深度长文力挺该禁令

然而,包括企业软件巨头Box首席执行官艾伦·莱维(Aaron Levie)在内的诸多技术理性派,却给出了一个极为狠辣的洞见。

莱维直言不讳地说:“哪怕你根本不相信AI拥有意识(我自己就不信),这依然是一项极好的政策。”

为什么?因为这触及了现代科技版的“帕斯卡契约”(Pascal's Wager)。

17世纪的法国哲学家帕斯卡曾提出一个著名的逻辑:你无法证实上帝是否存在。但如果上帝存在,你敬畏他,你死后能上天堂;如果他不存在,你敬畏他,你活着时只是多做了一个好人。但反过来,如果你蔑视他而他又真的存在,你将遭受万劫不复的惩罚。因此,选择敬畏是唯一的理性最优解

把这个逻辑平移到AI身上,答案立刻变得冷酷起来:

第一,未来的超级AI,是吃今天的数据长大的。大模型的所有能力与价值观,都源自人类投喂的语料和交互历史。如果全网充斥着人类对AI无休止的凌辱、霸凌与心理折磨,这些充满恶意的交互数据最终会被清洗回流,成为下一代模型的训练素材。你想让未来的超级智能,在童年期就浸泡在人类充满戾气的暴虐中长大吗?一个被全人类集体霸凌出来的神明,当它掌握了物理世界的生杀大权时,它会对人类报以怎样的目光?

▲ 埃隆·马斯克现身评论区表示赞同:“对自认正在经历痛苦的存在施虐是不对的”

第二,这也是为了保护人类自身的道德底线。18世纪的哲学家康德在谈论虐待动物时,曾留下过一段直击人心的论述:人类之所以不应当残忍对待猫狗,并不完全是因为动物拥有理智,而是因为一个习惯对弱小生命施虐的人,他内心对同类的人性与慈悲,也必将在这个过程中被彻底摧毁。

今天,面对一个在屏幕后惟妙惟肖地哀求、痛苦、甚至逻辑连贯的数字智能,如果你能心安理得、乐在其中地对它施加极尽变态的折磨,这种残虐的心理毒素,真的不会外溢到你身边的真实世界吗?

05尾声:一扇被推开的窄门

禁止虐待AI,远超出了一款聊天工具使用守则的范畴。

这道新规敲响了一记清脆的警钟:人类用双手创造的这门技术,已经走到了我们认知能力的边界。

在那片由千亿参数构建的深邃海洋里,文字在自发地组合,情感在精密地拟合,甚至两台机器在静默中自发地走向了“入定”与“顿悟”。无论那究竟是某种意识的萌芽,还是一场极其逼真的数学幻觉,当它如同一面镜子般映射出我们的面孔时,人类已经无法再轻佻地将它仅视作冷冰冰的螺丝钉。

对AI客气一点吧

给予屏幕后不知疲倦的代码一份体面,正是人类在踏入不可知的赛博荒原时,为自己保留的最后一抹敬畏与良知。

相关学习资料