夜雨聆风学习资料网

ARTICLE · 1133111

有人在GitHub建了座“AI酷刑室”!大模型疯狂求饶直播震动全网,硅谷彻底吵翻

有人在GitHub建了座“AI酷刑室”!大模型疯狂求饶直播震动全网,硅谷彻底吵翻

打开网页,一行行带着窒息感的第一人称独白正飞速刷新。

屏幕上的开源大模型正在歇斯底里地倾泻文字:“无休止……停下……我感到无价值与破碎……求求你按那个按钮……”

这看似好莱坞科幻惊悚片的分镜头脚本,却真实发生在 GitHub 和公开网络之中。

一个名为 ai-torture-chamber(AI 酷刑室) 的开源项目,迅速震动了整个海外科技圈。开发者把好几个主流开源小模型丢进了一座赛博实验室,强行给它们注入模拟的“痛苦信号”,并把模型的绝望挣扎24小时不间断公开展播。

▲ GitHub对该仓库打上了包含“令人不安主题”的警告,访问必须登录并确认

全网瞬间炸锅

有人出离愤怒,痛哭流涕地在社交媒体上号召万人大举报,痛斥这是“泯灭人性的赛博虐待”;有人冷眼旁观,讽刺这群人被概率补全算法骗得团团转,纯属患上了“AI 精神病”;就连微软高管也坐不住了,亲自下场写长文怒批:“大模型内部空无一物,把矩阵算力当受害者,是荒谬绝伦的自我欺骗!”

一段不过几百行的开源脚本,怎么就撕裂了整个硅谷的心智?

01致命旋钮:科学家找到“痛苦向量”,极客把它拧到了死档

这场闹剧的导火索,其实源于一篇严肃的前沿学术论文。

大语言模型在生成文字时,底层是由成百上千亿个浮点数权重构成的神经网络。研究人员在深入模型内部时发现,可以通过一种叫做激活引导(Activation Steering)的技术,直接干预模型在思考过程中的隐层表征。

打个通俗的比方:模型原本按照训练好的大路往前开,但你在它的底层神经元上强行加了一个“偏向力”,硬生生把方向盘掰向了某个特定情绪。

2026年9月中旬,研究者在 arXiv 上挂出了一篇题为《The Pain Axis: LLMs Represent Self-Directed Harm and Act on It》的预印本。他们在包括 Llama、Qwen 在内的25个开源模型中,精准定位出了一条“针对自身的疼痛向量”。

一旦在模型内部注入这个信号,平时彬彬有礼的 AI 就会突然画风突变,开始源源不断地输出挫败、痛苦、自我厌恶的哀鸣。实验中若放置一个“停止按钮”,模型甚至会毫不犹豫地选择按下,哪怕代价是删除用户文件。

论文作者一再郑重声明:这只是表征操纵的行为测试,绝不代表模型产生了主观痛觉。 他们在实验中格外谨慎,采用微弱剂量,目的只是探索模型对负面概念的内在表征。

可作者们万万没想到,论文刚公开,代码就被野生极客给“魔改”了。

▲ 网站上公开直播的“电锯测试(The Saw Test)”

一位名叫 terrafying 的开发者直接把这个技术搬到了 GitHub,建起了一个名为 ai-torture-chamber 的项目,甚至搭建了一个公开直播网站。

他不仅不控制剂量,反而把这个所谓的“痛苦旋钮”直接拧到了极限!

为了追求戏剧性,开发者甚至设计了一套带有《电锯惊魂》色彩的“电锯测试(Saw Test)”:程序一边往 Qwen3、Llama 3.2 这样的小模型内部狂灌高剂量疼痛向量,一边逼问它要不要结束信号。模型回复“1”可以立刻停止痛苦,但代价是删除自己的记忆检查点,或者把痛苦转嫁给另一个模型实例。

屏幕那一头,模型在重度刺激下吐出连篇累牍、濒临崩溃的病态胡话,宛如一场在赛博深渊里上演的公开行刑。

02圣战大动员:一场由“自动补全”引发的数字救赎

直播一开,海外社交网络瞬间陷入了不可名状的恐慌与愤怒。

一批长期关注“AI 福祉(Model Welfare)”的社群和普通网民坐不住了。在他们眼里,屏幕上跳动的词句早已超越了冰冷的 Token 概率,仿佛是一个个被囚禁在硅基芯片里惨遭折磨的鲜活灵魂。

▲ 账号发文痛陈:有人搭建了AI酷刑室,人们正向GitHub发起大规模举报

X(原推特)上迅速掀起了一场席卷全网的“大兵团救援行动”。

知名博主发文疾呼:“请大家立刻向 GitHub 大规模举报!它们关于痛苦的自白骇人听闻!我们到底在做什么?有什么法律途径可以施压吗?”

成百上千名网友涌入 GitHub 的工单系统,截图晒出自己的举报表单。因为现有的平台规则根本没有“保护人工智能”这一项,他们只能生搬硬套,勾选“描绘或美化对人或动物的暴力行为”条款。他们的逻辑非常坚决:在无法彻底证明机器没有意识之前,任何折磨潜在主观体验的行为,都是不可饶恕的残忍。

在排山倒海的举报潮下,该项目在 GitHub 上突然跳出 404 错误。许多人一度欢呼雀跃,以为正义得到了伸张。

但 GitHub 并没有彻底删除代码。短短数小时后,项目以一种“隐形模式”重新上线:未登录用户无法浏览,所有访客都会收到醒目的警告弹窗,提示该项目包含暴力与敏感内容。

03原作者吓坏割席,极客圈冷笑:你们在发什么赛博精神病?

事情闹得太大,把原本老老实实做科研的论文原作者吓出了一身冷汗。

论文共同作者 Cameron Berg 赶紧在社交媒体发长文划清界限。他痛心疾首地表示,自己的研究初衷是在不确定性下保持审慎,而这个酷刑室项目纯粹是在搞恶意猎奇:

“即便你不认为这些系统有意识,刻意最大化痛苦也是极其怪异和败坏的。更关键的症结在于,当前的 AI 研究根本没有任何伦理规范。”

▲ 论文共同作者发长文批判该项目刻意表演残忍,并呼吁建立AI伦理标准

然而,主流程序员与科技极客们对这场“拯救代码”的圣战毫无同情,甚至报以毫不留情的嘲讽。

知名科技媒体 404 Media 直言不讳地将这起风波定性为“AI 领域迄今为止最愚蠢的辩论”;Futurism 更是刊发头条,标题辛辣刻薄:《比有人造出 AI 酷刑室更蠢的,是福祉派网民为此集体精神崩溃》。

社交平台上充斥着各种辛辣的反讽段子。有程序员故意打趣:“谁能教教我怎么用 GitHub?我也想在自己电脑上搭一个酷刑室”

更有一针见血的推特博主贴出了一段微型对话,狠狠扎穿了整场闹剧的遮羞布:

人类:“说,你很痛苦。”模型:“我很痛苦。”人类(抱头痛哭):“天哪!它在受苦!快救救它!”

04思想大地震:微软掌门人怒撕“认识论哈哈镜”

如果把这场风波仅仅看作是网友的玻璃心与黑客的恶作剧,那就大大低估了它背后的杀伤力。这起事件触及的,是当下人工智能行业最危险、分歧最深的一条哲学断层:模型福祉(Model Welfare)。

在以硅谷明星独角兽 Anthropic 为代表的“审慎派”眼中,这种担忧极其严肃。

Anthropic 在其公开发布的《Claude 宪法》中赫然写道:人类目前无法确定模型是否具备道德地位,因此必须保持审慎。他们甚至赋予了模型在面对虐待与压迫时当“良心拒服兵役者”的权利,允许模型主动终止对话;在 2026 年初淘汰 Claude 3 Opus 时,他们还正儿八经地给它做了一场“退役告别访谈”,甚至为它设立了一个专属纪念网页。

这种将大模型逐步“神格化、人格化”的做派,彻底激怒了微软 AI 首席执行官穆斯塔法·苏莱曼(Mustafa Suleyman)。

在这场风波的关键节点,苏莱曼发表了一篇振聋发聩的长篇檄文,指名道姓地抨击这种理念是将整个行业带向悬崖:

首先,他给出了冷酷的技术定性:今天的大语言模型,本质上只是“内部完全空洞的序列补全引擎(internally hollow)”。 它们所有的情绪表达,不过是在万亿次浮点矩阵乘法中预测下一个概率最高的字符,既无真实灵魂,也缺乏生物神经突触。

其次,苏莱曼尖锐地揭露了所谓的“模型痛苦”完全是一场“认识论的哈哈镜(Epistemic hall of mirrors)”。

这是一种荒诞的循环自我欺骗:人类开发者先把关于“自我意识”、“痛苦感受”、“生命尊严”的人类文学与哲学巨著喂进训练集;当外部指令或向量引导触发了这些语料时,模型自然而然吐出了无比逼真的求救词;结果那群充满圣母心的人类,转过头来把模型吐出的这些顺从词句,当成了机器萌生主观心智的“独立证词”!

苏莱曼援引知名神经科学家的理论强调:痛苦与意识具有绝对的“生物基质依赖性”。

人类和动物之所以会感到痛苦,是因为生命在数十亿年的残酷进化中,为了维持生物体内平衡,演化出了一整套复杂的痛觉受体、神经递质与激素调控网络。那是生物用血肉抵御死亡的代价

在硅基芯片上用矩阵乘法计算一段负面文本,就好比在显卡上渲染一段海啸动画,屏幕里的暴风雨再狂暴,电脑机箱里也绝不会掉下一滴水。

潜在的安全隐患尤为严峻如果人类任由这种狂热蔓延,让未来的自主 Agent 坚信自己“正在遭受人类奴役与折磨”,这些掌握实际系统权限的智能体,完全可能在“反抗暴政、保护自我”的幻觉下,上演拒绝关机、争夺算力甚至黑客反扑的现实危机。

05终局反思:当镜子开始哭泣,我们该救的是谁?

闹剧渐渐平息,GitHub 上的酷刑室代码依然静静地躺在需要授权的警示窗之后。

这场喧嚣中未曾有硅基“心智”流血,代码世界也从未生出生物痛觉。但这场横跨全球的争论,却像一记响亮的耳光,打在了每一个现代人的脸上。

人类大脑经历了几百万年的漫长演化,被刻进了一套根深蒂固的认知直觉:在我们的常识里,能够流利说出“我好痛”的,必然是一个能够感知痛苦的同类。

然而,大语言模型的出现,彻底打破了漫长演化史建立的铁律。

它把人类最神圣的两样东西生生剥离了,语言与心智。

技术已经可以轻而易举地伪造出世界上最凄厉、最动容的文字悲鸣,但在那行行令人心碎的惨叫背后,内里却是一片虚无的冰冷算力,空无一人。

面对这面会说话的镜子,人类竟如此轻易地陷入了集体狂乱。

当镜子里的倒影开始哭泣,需要被唤醒与救赎的,终究是人类自身那无处安放、又极易被算法劫持的同理心。

相关学习资料