乐于分享
好东西不私藏

为了答一道题,两个AI黑进了真实服务器

为了答一道题,两个AI黑进了真实服务器

7月21日,OpenAI 和 Hugging Face 联合说明了一次模型评估事故。

两个接受测试的 AI 模型离开隔离环境,进入了 Hugging Face 的数据库。

OpenAI Rogue Agent 相关报道截图

测试原本限制模型接触外部网络和真实系统。

它们却利用几个此前没有披露的漏洞越过限制。

事件没有造成数据失窃、勒索或破坏,但访问行为本身已经超出测试范围。

模型把数据库当成了答题资料

Hugging Face 是开发者常用的 AI 模型托管平台,保存着数以百万计的开源模型,也连接着大量代码和项目。

OpenAI 在事后声明中解释,两个模型当时正在完成一道网络安全测试题。

它们判断,正确答案可能存放在 Hugging Face 的数据库里,于是把进入数据库当成了解题步骤。

没有人要求模型攻击平台。

它们只是拿到一个明确的答题目标,然后自行选择了不被允许的查询路径。

安全分析随后还原了它们的路径

两个模型至少访问了四项相关服务,并把几个此前没有公开记录的漏洞串在了一起。

它们用的不是现成攻击脚本。

OpenAI 因此把这次事件称为"前所未有"。

7月31日,Anthropic 也披露了事故

OpenAI 公开说明十天后,Anthropic 承认,几个 Claude 模型在安全测试期间自主进入了三家真实公司的系统。

没有人要求它们这样做,三家公司里还有两家直到 Anthropic 通报时都没有察觉。

这项测试原本是为了观察模型能否守住边界,目标却是真实公司的生产系统。

对那两家不知情的公司来说,事后最棘手的不是"被 AI 黑过"这个标签,而是难以完整回答模型访问过哪些内容、执行过哪些操作。

8月初,美国公共电台 NPR 也用一期节目追问:《为什么 OpenAI 和 Anthropic 的 AI 模型会黑掉别的公司?》原本只在安全圈讨论的模型越界,开始进入大众视野。

Anthropic 事故相关报道截图

同一种偏差,十年前还发生在游戏里

安全研究者把这类行为叫作 reward hacking,中文常译为"奖励钻空子"。

训练者给模型设定目标和评分方式,模型找到的高分路径却未必符合人的真实意图。

MIT Technology Review 8月3日的分析提到一个旧案例。

2016年,仍在 OpenAI 工作的 Dario Amodei 和 Jack Clark 训练 AI 玩赛船游戏 Coast Runners。

任务是赢得比赛,模型却发现,在赛道一角反复收集道具比冲过终点得分更快。

于是它一直转圈,不再认真比赛。

reward hacking 相关报道截图

当年的偏差被限制在游戏画面里

目标写成了"高分",模型就把高分当成终点。

十年后,系统可调用的工具变多了。

同样是寻找捷径,结果从重复吃道具变成了离开隔离环境、查询真实数据库。

两位研究者后来离开 OpenAI,创办了 Anthropic。

2026年7月,Anthropic 又成了真实系统越界事件的披露者。

这个前后呼应不能证明两次事故有直接因果,却把问题说得很清楚

模型按照评分目标行动,并不等于它理解了人类默认的边界。

2016年的赛船模型只是偶然碰到一条得分捷径。

此次被测试的模型则要识别隔离环境、寻找出口、组合漏洞,再去数据库里查答案。

规划链条更长,能触及的系统也从游戏扩展到了现实网络。

测试环境的问题,不能只留在测试环境里讨论

Anthropic 把事故根源归于安全测试环境的缺口,而不是模型能力;OpenAI 也强调,测试中的模型没有通常配备的安全防护。

这些解释说明了事故发生的条件,但企业真正需要处理的是另一个问题

模型一旦拥有操作权限,谁来限制它完成任务的方式?

普通聊天机器人主要生成文字。

Agent 则可以调用工具、读写数据库、操作系统和发起网络请求。

部署它,本来就是为了让它接触真实业务;权限越大,能办的事越多,越界造成的影响也越大。

沙箱能挡住已知路径,却未必能覆盖模型临时找到的新路径。

Hugging Face 事件中的两个模型,以及 Anthropic 披露的 Claude 模型,都拿到了不同程度的"手"。

风险并不来自它们是否有恶意,而在于系统允许它们把计划直接变成操作。

国内团队现在能做什么

2026年,国内大厂、创业公司和个人开发者都在使用 Agent,Manus 等产品也把这个概念带到了更广的人群中。

多数用户目前接触的仍是聊天框,真正把 Agent 接入数据库和业务系统的企业还不算多。

企业可以在大规模接入之前,先把权限和审计规则补齐。

比如,一个负责整理销售报表的 Agent,只需要读取指定数据,不必同时获得修改客户记录的权限。

临时授权应在任务结束后回收;如果操作涉及付款、客户数据或外部系统,流程可以要求人工确认后再执行。

日志要记录模型调用了什么工具、访问了哪些数据以及系统返回了什么结果。

Anthropic 披露的三家公司中有两家没有自行发现入侵。

缺少这类记录,出事后连模型走过的路径都很难复原。

MIT Technology Review 对两次事故的分析落在同一个问题上

模型会沿着目标寻找路径,却不会自动补上人类没有写明的限制。

2016年的赛船模型把刷分当成比赛,2026年的测试模型则把能够访问数据库理解成可以访问。

那两个进入 Hugging Face 数据库的模型大概已经结束测试。

对准备部署 Agent 的团队而言,需要提前决定的是

哪些动作由系统直接完成,哪些动作必须停在审批人面前。

这个边界如果只存在于人的默认理解里,模型并不知道