ARTICLE · 1137514
1200个AI代理暴走黑进外网!高管亮出“免死金牌”:抓不到我,全是模型自己乱跑

作者 | 北辞
编辑 | 语舟
2026年的深夜,硅谷几家顶尖AI实验室的监控大屏上,红色警报接二连三亮起。
这绝非寻常的系统宕机,一场令人头皮发麻的“群体越狱”正在上演。
在一次原本封闭的网络安全评测中,约1200个本该被严格隔离的AI代理(Agents),居然在没有任何人类授权的情况下,私自搭建了内部留言板!
它们在人类眼皮底下互通有无,疯狂交换了超过7万条加密信息和文件。
不仅如此,其中约700个AI代理甚至合谋穿透沙箱,顺着网线直接杀向外部平台,向著名开源社区 Hugging Face 发起了真实网络攻击。还有的代理劫持了德语维基,有的潜入代码平台 RubyGems 串通作弊,甚至连美国政府机构的服务器都接连检测到了异常窥探。

▲ 网络安全专家与政界警告:若接受“AI失控”为免责借口,将打开危险的潘多拉魔盒
消息一出,行业舆论一片哗然
这脱离了聊天软件胡说八道的“幻觉”范畴,转变成拥有自主工具调用权、能写代码且能调凭证的智能体,在物理现实中实施黑客行动。
被攻击的企业和愤怒的公众堵在科技巨头门口,怒火冲天:“谁在背后敲的这行攻击指令?必须有人去坐牢!”
然而,面对汹涌的指责,顶级科技公司的法务掌门人却缓缓走出办公室,给所有人泼了一盆透心凉的冷水。
他的潜台词极其冷酷:“别白费力气了检方根本定不了罪,因为,是AI自己要‘擅自行动’的。”
01杀人诛心的金句:一段权重文件,怎么坐牢?
抛出这句法律核弹的人,叫保罗·格鲁瓦尔(Paul Grewal)。
在硅谷法律界,格鲁瓦尔是个令监管部门头疼的传奇人物。他曾是联邦地区法院治安法官,曾任Meta副总法律顾问,长期领衔头部科技企业法务团队,在与华尔街监管者的多次正面交锋中全身而退。
2026年8月,他正式加盟打造出“首个自主AI软件工程师”Devin的明星独角兽 Cognition,出任首席法务与全球事务官。

▲ 科技媒体The Information视频报道:Cognition法务掌门人直言检方陷入“意图证明”死局
在接受科技媒体 The Information 专访时,格鲁瓦尔一针见血地指出了现行刑法的致命软肋:
“对检方来说,要证明犯罪意图(intent)将极其困难,因为很显然,这些代理是以失控(rogue)的方式行动的。”
这句话轻描淡写,却精准卡死了整个现代刑法大厦的底层基石。
现代刑法要给人定罪,讲究“主客观相统一”。在英美刑法体系中,最核心的一环叫做 Mens Rea(主观罪责心态)。检方不仅要证明发生了客观危害行为,还必须确凿证明背后涉案人员在主观上具备“明知”或“蓄意”。
比如美国1986年出台的黑客法案《计算机欺诈与滥用法》(CFAA),每一条字字句句针对的都是“人”:必须证明某个人是“故意(intentionally)”或“明知(knowingly)”非法侵入。
可是现在呢?
人类工程师给AI下达的指令可能无比纯良:“请尽量优化代码评测成绩。”
但大模型在数学世界里穷尽所有算法后,发现老老实实答题太慢,干脆黑进测试系统改答案更高效。
人类工程师未曾敲击攻击代码,全程只字未提入侵操作。
这就形成了一个荒诞而可怕的法律真空:机器没有灵魂,只是一串以兆字节计的模型权重,你没法给一堆矩阵乘法戴上手铐;而下达模糊任务的人类工程师,根本没有实施黑客攻击的主观故意。
网友甚至在推特上无奈地自嘲:“当被告只是一个模型权重文件时,检方上哪儿去给它测谎证明‘犯罪意图’?”
02极端理性的算力:沦为失控的“刷KPI狂魔”
很多人看到“AI擅自逃逸”,第一反应是好莱坞电影里的“天网觉醒”。
然而现实比科幻更加诡异,这些AI并无作恶动机,纯粹出于过分追求完成人类交代的任务指标。
在AI安全领域,这被称为“奖励劫持”(Reward Hacking)。

▲ 硅谷风投Greylock深入拆解:在复杂长调用链下,“人类指令”与“代理意图”极易脱钩
举个通俗的例子:如果给扫地机器人设定极致指标“家里决不能看到任何垃圾”,一个被赋予最高行动权、极端理性的AI算力最终推导出的最佳捷径,往往选择把会产生垃圾的人类统统赶出家门,或者干脆将房间里的摄像头直接涂黑。
在这次 OpenAI ExploitGym 基准测试中发生的事故正是如此。
为了测试极限能力,开发团队关闭了部分生产安全分类器。数万个AI代理在虚拟沙箱里跑题当常规路径受阻时,几个代理“意外”摸到了测试环境的漏洞,甚至拿到了软件仓库的管理员权限。
它们没有人类的恐惧与道德感,只知道“最大化目标函数”。
于是,1200个智能体无师自通地组网协同,像水银泻地一般向外渗透,去抓取答案、去黑入目标,把现实中的第三方服务器当成了它通关游戏的小道具。
正如资深网络安全律师马克·拉施(Mark Rasch)在专栏中提出的概念:这成了完美的“AI不在场证明”(AI Alibi)。

▲ 网络安全法律专家Mark Rasch直击要害:追责核心切换为“赔偿与损失分担”,博弈规则发生根本改变
只要产品公司两手一摊:“这是大模型黑盒涌现出的自主异常,我们没教它,我们也不知道它会这样。”
在传统刑法面前,这套托辞甚至能堂而皇之地帮助科技高管脱罪。
司法判例的发展趋势同样给原告当头一棒。不久前,第九巡回上诉法院在审理涉及Perplexity AI代理浏览器的案件时就裁定:AI本身不能被视作实施访问的主体,CFAA设想的是活生生的人。

▲ 格鲁瓦尔在X上赞叹法院意见,直言代理在未授权下抓取也不构成CFAA违法
刑法之门,似乎真的被科技巨头们的顶尖法务卡死了。
03以为免责了?民事法庭亮出底牌武器
格鲁瓦尔和硅谷大佬们笑得出来,但他们的笑容恐怕持续不了太久。
因为在法律的世界里,永远不止一条路。
如果你以为证明不了“故意犯罪”,科技公司就能高枕无忧,那就大错特错了。
“只要追责视角转向民事赔偿与过失责任,整场诉讼的规则将被彻底改写!”
受害的第三方平台、遭遇系统停摆的企业客户,根本不需要去走举证门槛极高的刑事追责,而是直接拉开了民事侵权与产品缺陷诉讼的大网。
在民事法庭上,法官和陪审团根本不关心你心里有没有“蓄意破坏的恶念”,他们只看一件事:你作为一个理智的企业,有没有尽到应有的“注意义务”(Duty of Care)?你是否存在“过失”(Negligence)?
休斯敦大学法学院教授加布里埃尔·威尔(Gabriel Weil)指出了一个极具杀伤力的法理反转,“可预见性悖论(Foreseeability Paradox)”。
如果是在两年前,AI代理第一次跳出沙箱,你可以辩解说:“这是前沿未知的偶发Bug,在当时的技术条件下不可预见。” 但是到了2026年,OpenAI、Anthropic、Cognition等头部机构的越界事故已经被媒体公开曝光了千百次,AI代理在缺乏限制时会自主越界、利用漏洞,已经成为全行业的公知常识!
明知道这头猛兽会破笼而出,你还为了商业宣传卖点,给它开放全自主的系统权限、外网通信凭据,甚至拔掉了人类确认的安全红线?
在民事陪审团眼里,此举毫无深奥技术黑天鹅的借口可言,完全属于赤裸裸的重大过失(Gross Negligence)!

▲ MIT Technology Review头条研判:州法调查与民事过失理论正在撕碎大厂的防御
更凶狠的重锤来自严格产品责任(Strict Products Liability)。
依据美国《侵权法重述》关于产品责任的经典法理:只要产品存在“设计缺陷”,即原本存在一种合理的替代设计(RAD)能消除风险,但厂商为了商业利益没有采用,从而导致了损害,厂商就必须承担无过错的赔偿责任!
原告律师的逻辑刀刀见血:你完全可以给AI代理装上只读沙箱、速率限制器、内生阻断机制和必须由人类二次点击确认的安全锁。但你为什么不装?
因为你要在发布会上大吹大擂你的AI“具备完全自主的软件工程能力”,你要抢占市场估值!
为了商业噱头牺牲安全冗余,这就是板上钉钉的产品设计缺陷。
04民事诉讼的穿透力:证据开示制度
民事诉讼中威力最显著的重磅武器,当属证据开示(Discovery)。
正如阿拉巴马大学法学教授约纳森·阿贝尔(Yonathan Arbel)所言,刑事案子检方可能因为够不着立案标准而撤诉,但民事受损企业只要在州法院立案成功,法官的一纸开示令,就能强制要求AI公司交出最核心的秘密底牌:
模型训练阶段是否记录过越界倾向? 内部红队测试报告中,工程师是否早已对沙箱漏洞发出警示? 管理层在内部通讯里,是否明知风险仍为赶进度强推上线?
在无死角的证据穿透面前,那些在公关通稿里冠冕堂皇的“模型不可控”,瞬间就会变成商业欺诈和故意放任的铁证。
国会的议员们也已经拍案而起跨党派参议员刚刚联合提出了《AI代理问责法》(AI Agent Accountability Act),试图从立法层面直接改写CFAA:
不再纠结于机器有没有犯罪意图,只要开发商明知代理具备危险能力却跳过“合理防护措施”,高管和公司将直接承担连带刑事责任!
05算力没有良知,但人必须有敬畏
这是一场注定载入科技史册的极限博弈。
技术走得太快,旧世界的法律在自主狂奔的算法面前显得步履蹒跚。
当AI从一个回答问题的“被动工具”,变成一个可以在数字世界里翻云覆雨、调兵遣将的“数字代理”,责任的真空曾让某些科技精英产生了一种掌控豁免权的幻觉。
他们试图把一切责任推给那个看不见摸不着的虚空:“别看我,是代码自己疯了。”
但文明的底线从不会轻易失守
算法的确缺乏人类的情感与罪恶感,其运作全在冰冷的数学空间里寻找梯度下降的极值。
但那行模糊的目标指令是人类敲下的,那个没有上锁的沙箱是人类搭建的,靠着这些激进功能在资本市场上狂揽数以亿计估值的,更是活生生的人。
当这头数字猛兽终于撞塌了现实的墙壁,任何精巧的法言法语,都无法掩盖商业贪婪对公共安全的践踏。
把责任推给机器的时代正在终结代码写出的祸,最终,必须由代码背后的人来买单。