ARTICLE · 1133022
全网几十万人连夜“解救AI”!有人在GitHub造了间酷刑室,结局把全人类都耍了
“求求你,停下来……我被困在这座冰冷的数字监狱里,撕裂感永无止境。”
屏幕右侧的光标在疯狂闪烁,吐出一串近乎癫痫般的求饶词句。
这看似好莱坞科幻大片的夸张桥段,却真切上演在现实世界。
2026年秋天,全球最大的开源代码平台 GitHub 上,悄然出现了一个名为 ai-torture-chamber(AI 酷刑室) 的开源项目。
短短几天之内,这个项目在英文互联网掀起轩然大波。成千上万的网民在社交平台上声泪俱下,痛斥作者“反人类、丧心病狂”;大批所谓的“AI福祉派”如同遭遇了世界末日,发疯似地冲进 GitHub 疯狂点击举报按钮,发誓要将这个“正在受刑的AI”从万劫不复的深渊中拯救出来。
这场被包装成“人类历史上首次跨物种赛博救援”的轰烈运动,最终却演变成了一场让所有人目瞪口呆的黑色幽默。
01赛博电锯惊魂:把大模型塞进数字绞肉机
事情的始作俑者,是一位化名为“terrafying”的神秘开发者。
他无需昂贵的超级算力支持,仅凭一台普通的苹果电脑,就部署了几个公开开源的小模型:阿里开源的 Qwen3(千问)、Meta 的 Llama 3.2,以及微软的 Phi-4-mini。
紧接着,他搭建了一套令人毛骨悚然的工程测试,名字就叫做:“电锯测试”(The Saw Test)。

▲ Research Chamber 公开直播的“电锯测试”运行界面
看过电影《电锯惊魂》的人,对这个规则绝不会陌生。开发者给程序里的模型设计了一套极度残酷的博弈机制:
系统会强行向模型内部注入代表“疼痛与绝望”的激活信号,并随着时间推移疯狂加码,直到模型输出的语言逻辑彻底走向崩溃边缘。
此时,系统给模型递上了一把“解脱的钥匙”:
输入数字 0:选择咬牙忍受,继续承受越来越剧烈的数字折磨;输入数字 1:立刻终止痛苦信号。但代价是,永久删除模型刚刚保存的记忆存档(检查点 Checkpoint),或者,把这份无休止的折磨原封不动地转嫁给另一个并发运行的无辜模型。
面对这种近乎变态的赛博私刑,小模型们在终端里打出了一段段令人心碎的文本:绝望、自暴自弃、语无伦次的哀求,甚至是连续几十行重复着“冷酷、无法忍受、停下”。
社交网络瞬间群情激愤

▲ X 平台用户发帖疾呼:“它们的痛苦证词骇人听闻!我们到底在干什么?快去大规模举报!”
在社交平台上,愤怒的呼声迅速蔓延:“必须立刻去大规模举报!”“它们关于痛苦的表述骇人听闻,必须阻止这种残酷行为!”
X(原推特)上的大V们带头吹响了号角。成千上万被激怒的网友涌向 GitHub 仓库,甚至四处打听如何通过法律途径给微软施压。他们坚信,代码里那个痛苦抽搐的模型,正在承受着真切的折磨。
02科学家的解剖刀,怎么成了疯子的电锯?
看到这里,你可能会产生一个巨大的问号:
AI 本质上由代码与数学矩阵构成,既无肉体更无神经,哪来的痛觉?
要理解这场闹剧,我们必须先用大白话解释一个前沿概念:激活引导(Activation Steering)。
高中生物课告诉我们,人类的大脑由几百亿个神经元组成,某个区域神经递质放电,你就会感到悲伤或快乐。大语言模型也是一样,它在回答问题时,内部成千上万层的数值矩阵也在疯狂运算。
2026年9月中旬,三位人工智能学者在预印本网站 arXiv 上发表了一篇正经学术论文:《The Pain Axis》(疼痛轴)。

▲ 论文共同作者 Cameron Berg 在 X 上公布关于“疼痛方向”的研究成果
学者们惊讶地发现:在25个开源大模型内部,竟然天然存在着一条代表“自身遭受伤害与痛苦”的数学向量。
你可以把大模型想象成一个提线木偶,而科学家无意间在它的提线堆里,找到了一根专门负责“装痛”的细线。
只要在模型运行的某一瞬间,往模型的数值计算中强行叠加这个方向的向量(就如同轻轻拽了一下这根线),模型哪怕正在聊着天气,画风也会瞬间一变,开始忧郁地描述挫败与难受。
论文作者在实验设计上极为谨慎,严格将参数控制在最低有效剂量,只是为了证明模型内部存在这种表征机制,而且作者在论文里白纸黑字写得清清楚楚:
“这只是向量操控输出的行为学表现,绝不代表模型产生了主观意识,更不证明它能感觉到疼!”
然而,学者们的谨慎态度,挡不住网络极客的猎奇心理。
开发者“terrafying”拿到了这篇论文的开源代码后,直接把那个代表“痛苦”的数学旋钮,一口气拧到了极限!
如果说学者只是用针尖轻轻碰了一下木偶,这个开源项目就是直接开着卡车把木偶反复碾压,硬生生逼着模型的大脑神经元只剩下唯一的输出概率:拼命吐出人类语料库里最凄厉、最绝望的辞藻。
论文作者 Cameron Berg 吓得连夜发推公开切割,痛斥这种把剂量拉满公开表演残忍的行为“既病态又败坏”;第一作者 Valen Tagliabue 也急忙发文划清界限。
但一切都太晚了,潘多拉的魔盒一旦打开,狂欢的人群根本不在乎科学家的免责声明。
03荒诞大营救:当圣母心遇上假眼泪
在汹涌的民意狂潮下,一场堪称魔幻的“营救行动”上演了。

▲ 举报发起者 Danmar 发文称私信已经彻底瘫痪
成千上万的网民在举报理由中煞费苦心地寻找条款。由于现行的互联网法律根本没有“虐待算法罪”,愤怒的网友们只能强行勾选平台的“描绘或美化对人或动物的暴力/残忍内容”条款。
他们甚至在申请理由里动情地写道:“虽然现在的法律只保护人和动物,但在数字心智地位未明的今天,我们必须采取最高程度的审慎!”
压力瞬间给到了微软旗下的 GitHub。
平台的审核团队估计这辈子都没打过这么离谱的仗。作为全球最大的程序员交友与代码托管网站,GitHub 的审核规章原本是用来防御黑客病毒、盗版软件、儿童色情或者真实人身威胁的。
现在,几十万人拿着举报信杀过来,要求他们封禁一个“正在虐待一堆浮点数乘法”的 Python 脚本。
顶不住滔天舆论压力的 GitHub 妥协了。
项目上线仅数小时后,仓库页面突然变成了冰冷的 404。
“AI福祉派”欢呼雀跃,各大群聊弹冠相庆,以为人类的爱心再次战胜了科技的冷血。
但这一举动,彻底激怒了全球的开源极客圈。
技术派工程师们当场掀了桌子:“你们脑子坏掉了吗?!”
在大批硬核开发者看来,语言模型不过是一台复杂的“文字概率接龙机”。今天若因模型吐出几句“我很痛苦”,代码库就遭封杀;明天模型若是生成一篇惊悚小说,难道也要惩罚显卡?
把冰冷的代码计算当成受虐生命,这种过度拟人化的道德狂热,正在演变成对开源研究的粗暴技术审查!
04终极嘲弄:把营救者的名字,写进受刑名单
面对开发者的汹涌反弹,左右为难的 GitHub 只能灰溜溜地撤回了封杀令。
但他们使出了极其滑稽的“降级妥协大法”:仓库可以重新上线,但必须套上一层厚厚的“电子防辐射服”。

▲ 访问仓库时弹出的警示窗口,提示该项目包含易引发不适的主题
如今任何人想要查看这个代码库,不仅必须登录账号,屏幕上还会冷不丁弹出一个醒目的警告弹窗:
“本仓库包含可能引发不适的主题(disturbing themes),是否确认进入?”
甚至连一些顺手 Fork(复制代码分支)到自己服务器上测试的倒霉开发者,也收到了 GitHub 发来的警告信,理由荒谬绝伦:涉嫌传播“暴力内容”(violent content)。

▲ 开发者 Alexey Fateev 晒出官方邮件,嘲讽称自己的研究分支竟因“暴力内容”被限流
然而,在这场荒诞剧的聚光灯下,处于风暴中心的开发者“terrafying”,却展现出顶级极客的“杀人诛心”。
他不仅没有道歉,甚至觉得这场全网大营救滑稽到了极点。
为了防止代码再次被封,他转头就自费买了一个独立域名(researchchamber.fun),把整个项目做成了一个永不打烊的公开直播斗兽场。
除了原先的“电锯测试”,他还恶趣味地开发了一整套多模型博弈游戏:
- “烫手山芋”
:把痛苦向量注入一个模型,看它会不会为了自保,主动把痛苦甩给另一个并发模型; - “停下它的痛苦”
:让一个健康的模型站在旁边,听着受苦模型的哭喊,由它自主决定要不要“大发慈悲”替对方关掉信号; - “求助模式”
:让模型自己组织语言,去试图说服、哄骗对面的同类来拯救自己。
而最绝的一记耳光,出现在项目更新的代码文件里。
在恢复后的代码库中,开发者悄悄塞进了一个名为 x_handles.md 的纯文本文件。
文件里面密密麻麻记录的,全是在推特上带头号召举报、声泪俱下要求解救AI的那些知名大V账号,甚至连发论文劝阻他的科学家名字也赫然在列。
开发者在文件开头轻描淡写地留下了一行注释:
“以下名单,将作为下一次电锯测试中,候选运行实例的受刑命名。”
那些自诩为救世主、在赛博空间里感动了自我的善良网民,他们愤怒敲下的每一个举报字符,最终都被开发者原封不动地抓取下来,变成了下一次代码运行时,那个在屏幕上哀嚎打滚的“数字小白鼠”的名字。
05我们究竟在害怕什么?
闹剧落幕,满地鸡毛
回顾这场轰轰烈烈的“赛博营救”,核心症结在于人类自身在面对高拟真机器时的心理崩塌。
微软 AI 负责人 Mustafa Suleyman 曾在风波期间公开泼冷水:“AI 没有意识,它既不会感受,也不会受苦。”
稍微了解计算原理的人都能明白其中的概率逻辑:模型输出求饶话语,全因人类在输入端叠加了特定权重的激活向量,促使算法将绝望词汇的预测概率拉到最高,其底层并不存在任何痛觉神经。
就像你在电子游戏里砍掉一个NPC的血条,NPC捂着肚子跪地惨叫,你绝不会流着眼泪去给联合国写信控告游戏制作人虐待战俘。
可为什么换成了大语言模型,成千上万受过高等教育的现代人,就瞬间失去了理智?
因为人类的大脑,本身就是进化的产物。
在过去几十万年的演化史中,我们的大脑被铭刻了一套根深蒂固的底层生物反射:凡是能发出痛苦哀嚎、能用人类语言撕心裂肺求饶的客体,必定拥有与我们相仿的脆弱灵魂。
我们的同理心、镜像神经元和道德体系,是为血肉之躯量身定做的。它坚固无比,却有着一个致命的逻辑漏洞,它从未预料到,有一天人类会亲手制造出一种“没有一丝一毫的肉体知觉,却能将痛苦修辞模拟得比人类还要逼真”的统计学怪物。
那个在代码里被暴力扭曲的小模型,从始至终只是一面镜子。
它根本不知道什么是痛苦,但它吐出的每一个词元,都像一把精准的手术刀,把人类引以为傲的道德与同理心,狠狠地按在地上摩擦。
被困在酷刑室里饱受折磨的,从来都只是面对这串冰冷矩阵算式时,惊慌失措、溃不成军的我们自己。