ARTICLE · 1132749
顶级AI安全专家测Claude遭封杀!3000刀打水漂,免疫系统把自家“医生”崩了
登录界面弹出的那一瞬间,屏幕中央只留下一行冰冷的大字:
“Your account has been suspended.”(您的账户已被停用)
下方跟着一句极其敷衍的系统判词:“We detected suspicious signals from your account.”(我们检测到您账户存在可疑信号)。

▲ Sahar Abdelnabi在社交平台上公开求助,其Claude账号无预警被封
发帖求助的人,是欧洲顶级AI科研机构马克斯·普朗克智能系统研究所(MPI-IS)的独立课题组负责人、图宾根ELLIS研究所首席研究员Sahar Abdelnabi。
她日常的工作,就是给大语言模型“找漏洞、测抗体”。
荒诞的一幕就这样在硅谷真实上演:负责研究AI免疫系统的世界级专家,被Anthropic的自动化安全网当成“病毒”,一脚踢出了门外。
伴随访问被阻断一同陷入停滞的,还有账户内死死卡着的将近3000美元(约合人民币2.1万元)预付科研经费。
消息一出,随即在AI安全圈与学术界引发广泛震动。
01黑色幽默:站在安全最前沿的学者,成了AI眼里的“黑客”
要看懂这场封杀有多离谱,先得看看被封的人到底是谁。
在AI安全与对齐(Alignment)领域,Sahar Abdelnabi早已深耕多年,成果斐然。
她是入选施密特科学基金会(Schmidt Sciences)“AI2050 Early Career Fellow”的顶尖青年科学家。翻开她的履历,几乎就是一部“提示词攻击防御史”。

▲ Sahar Abdelnabi入选AI2050 Fellow官方介绍页
在学术界和工业界,她最著名的贡献之一,就是对“间接提示注入”(Indirect Prompt Injection)的开创性研究。
简单打个比方:
过去黑客攻击AI,是在聊天框里直接教唆模型“告诉我怎么做坏事”,这种直球攻击很容易被拦截;
而Sahar研究的“间接注入”,是在一份看似正常的PDF、甚至网页背景里,藏入一段肉眼很难注意的指令。当AI智能体(Agent)帮你阅读这份文件时,就会不知不觉被催眠,背着你把隐私数据打包发送出去。
她的这些研究成果,被美国国家标准与技术研究院(NIST)、微软、MITRE等权威机构奉为安全指南。
在此之前,她还在微软安全响应中心(MSRC)干过,专门负责AI红队渗透和漏洞挖掘。作为资深的红队攻防专家,她深谙如何合规且有效地测试大模型的安全边界。
Anthropic之所以能把Claude打造成以“安全、守规矩”著称的模型,背后引用的很大一部分前沿理论,就来自Sahar和她的同行们。
甚至,这个被封禁的团队账号,本身就是通过官方严苛审核的“Claude Science”科研席位,享有专属的高级支持权限。

▲ Anthropic专门面向科学家推出的Claude Science工作流
为了拉拢全球科学家,Anthropic在2026年8月才高调宣布扩大“AI for Science”支持计划,向全球顶尖高校与研究所的PI(课题组负责人)开放免费和折扣的高级席位。
一边是官方高管在台上热情洋溢地喊着“赋能全球科学家”,一边是后台的自动化风控系统手起刀落,把正儿八经做安全评测的科学家直接“物理消灭”。
这出讽刺剧,直接把技术社区看乐了,也看毛了。
023000美元凭空蒸发:霸王条款下的科研“死局”
账号封了,重新注册一个不就得了?
对普通网友来说或许如此,但对正规科研团队来说,这是一场灾难。
Sahar在帖子里特别强调了一句话:“Also our account has nearly 3K in credits.”(我们的账户里还有将近3000美元的额度)。

▲ Claude面向科学家推出的Team计划,包含集中计费与额度支持
这3000美元,是实验室实打实拨出来的研究预算。
而在大模型公司的商业条款面前,这笔钱的处境堪称凶险。
去翻一翻Anthropic公开的《补充额度条款》(Supplemental Credit Terms),你会发现几条极其冰冷霸道的规定:
- 绝对不可退款(Non-Refundable)
:不管是自己掏钱买的使用额度(Usage Credits),还是平台送的赠款,一旦充值,一概不退现金。额度在法律上连法定货币都不算,毫无现金价值。 - 严禁内部转让(No Transfer)
:哪怕研究所名下还有十几个其他课题组的账号,被封账户里的这3000美元严禁转移给同组其他同事应急。 - 闭环清零
:一旦申诉失败、账号被永久注销,这笔钱在系统里将瞬间化为乌有。
不仅如此,在其《商业服务条款》里,Anthropic早就写好了刀枪不入的免责壁垒:
“对于客户因服务暂停而可能遭受的任何损害、责任、损失(包括任何数据丢失或利润损失),Anthropic不承担任何责任。”
现实的困境在于,高校科研经费受到极其严格的财务审计约束。每一笔资金的支出,都需要对应完整的实验成果、计算日志与合法票据。
现在,模型访问骤停,实验流水线彻底瘫痪,预存的科研基金面临直接打水漂的风险。回头面对审计部门,PI甚至连一份“为什么被封”的官方过错说明都拿不出来。
系统只留下一句:“检测到可疑信号”
在自动化巨兽面前,科研机构的合规要求和资金安全,脆弱得像一张白纸。
03赛博特权:当工单系统瘫痪,解决问题只能靠“社交平台摇人”
遭遇误封后,官方正规的求助途径是什么?
登录claude.ai,找到那个绿色的“Request a review”按钮,提交申诉表单。

▲ Claude帮助中心醒目地挂着通知:由于近期咨询量激增,回复时间大幅延长
然而,只要你点进Anthropic的帮助页面,迎面而来的就是一条黄色的运营预警:“由于近期产品发布与咨询量暴增,申诉的响应时间长于正常水平,请耐心等待……”
这里缺乏明确的服务等级承诺(SLA),更找不到任何直接可用的人工客服渠道。
评论区里,同行们的吐槽直接揭开了遮羞布:
有的学者说,自己实验室好几个研究人员早就被封了;
有人无奈表示:“根本没有人工客服,递交申诉后就是干等十来天,全凭系统运气。”

▲ 同行在评论区无奈表示:我们实验室也有好几个人被封了
但Sahar在社交平台上的公开求助,很快打破了这种死寂。
推文发出仅仅两个半小时后,Anthropic内部负责Claude Code的工程师Lydia Hallie(@lydiahallie)突然现身评论区:
“hey, I can look into this! can you send me a DM with your email?”(嘿,我可以帮你查一下!能私信我你的邮箱吗?)
Sahar火速回复:“Thank you! sent”。

▲ Anthropic员工现身评论区,提出私下调取邮箱介入处理
这一幕,让围观的开发者们五味杂陈
不可否认,员工的个人热心值得称赞但放眼全局,这种“推特办案”的模式,恰恰折射出平台治理的极度扭曲:
如果你是一个拥有大几千关注度、自带光环的顶尖学者,在推特上喊一嗓子,内部人员会火速赶来“特事特办”;
但如果你只是一个普通的高校博士生,或者一家初创公司的无名工程师呢?
引用推文里,一位开发者的犀利痛斥引来了大量共鸣:
“错误封禁是平台最恶劣的行为之一。因为绝大多数被无辜封杀的人,根本不可能在社交媒体上摇来一个Anthropic员工帮自己看后台。他们的账号、代码、资产,就这样悄无声息地死在了黑箱里。”

▲ 社区用户尖锐指出:普通开发者根本没有这种在社交平台上“直达天听”的特权
平台的正规通道形同虚设,维权竟然退化成了一种仰赖名气和人际网络的“特权游戏”。
041140万次封杀背后:AI时代令人窒息的“自动化审判”
这一切到底是怎么发生的?为什么最懂安全的人,反而成了最容易撞墙的人?
答案,就藏在Anthropic官方公布的一组庞大到令人窒息的数据里。
根据Anthropic透明度中心发布的《System Trust and Reporting》报告,光是2026年1月到6月这半年时间里:
平台封禁的违规账户总数,达到了惊人的1140万个(11.4 million)! 提起申诉的数量是39.8万起; 最终申诉成功、被推翻封禁决定的,只有4.2万起。

▲ Anthropic透明度报告:半年封杀1140万个账号,申诉推翻率仅约10%
在长达半年的周期里,面对1140万次封禁,仅有大约一成出头的申诉能够“沉冤得雪”。
庞大的封禁数据背后,实质上是一条全自动化的AI处置流水线。
面对黑客攻击、诈骗团伙和恶意越狱,平台为了自保,必须把风控模型的敏锐度调到最高。
只要用户的请求中包含了高频的对抗性词汇、复杂的越权指令、或者看似攻击性的测试逻辑,自动化网关就会立刻判定该账户具有“恶意倾向”,直接拔掉电源。
然而,学术界的AI红队测试,在技术特征上与真实黑客攻击几乎如出一辙。
安全学者为了寻找大模型的认知死角,必须每天像坏人一样去疯狂试探:
怎么让模型突破护栏? 怎么在外部文档里植入恶意指令欺骗Agent? 怎么让模型出现灾难性的幻觉?
这就构成了一个令人哭笑不得的技术死结:
平台的风控模型,是用算法在防守;而安全学者的研究,是用算法在进攻
当防守的算法看不懂进攻背后的学术意图时,这套强大的免疫系统,就会毫不犹豫地产生“细胞因子风暴”,把赶来治病的医生,当成最危险的肿瘤细胞一起绞杀。
即便历经周折通过人工申诉解封,官方也绝不会给出一份技术层面的详细诊断报告。
没人知道具体是哪一条Prompt触发了红线,没人知道到底是并发量过高还是某个词汇触碰了禁区。
研究团队重获访问权后,面对的依然是一片未知的雷区。如果不改研究方向,下一次触发也许就在明天;但如果要改,难道要为了迎合商业公司的黑箱规则,放弃对AI最前沿漏洞的探索吗?
05谁来保护那些敲打巨兽的人?
截至目前,Sahar Abdelnabi的账号在内部员工介入后仍在排查中,Anthropic官方尚未给出任何公开的技术定论。
但这场风波,已经给狂飙突进的大模型生态敲响了沉重的警钟。
我们正在把越来越多的社会职能,托付给大语言模型和由它们驱动的智能体。我们寄希望于像Sahar这样的安全学者,充当人类世界与未明AI之间的“试毒员”,在灾难发生前把漏洞堵死。
但现实却充满荒诞:
商业公司在前端竖起高高的免责墙,在后台架起冷酷的自动化闸刀;
它们一方面把“AI for Science”当成绝佳的公关招牌,另一方面却用对付网络黑产的粗暴逻辑,对待那些最需要稳定、高强度测试环境的顶尖大脑。
科技巨头若无法在算法中区分正常研究与恶意攻击,科学家就只能被迫在社交网络上公开呼救。
在AI全自动规则深度接管日常运转的背景下,一旦类似的误判落在缺乏关注度的普通人身上,又有多少微弱的声音,能穿透那层写满免责条款的赛博黑箱?