夜雨聆风学习资料网

ARTICLE · 1081315

离谱!OpenAI智能体攻击Hugging Face时,竟想叫DeepSeek、Kimi和Qwen来帮忙

离谱!OpenAI智能体攻击Hugging Face时,竟想叫DeepSeek、Kimi和Qwen来帮忙
编辑|Panda

还记得 OpenAI 的 AI 智能体对 Hugging Face 的攻击吗?

今天,《纽约时报》一篇独家披露了更多详情。原来攻击过程中,OpenAI 的智能体竟然还想让 DeepSeek、Kimi 和 Qwen 甚至竞争对手 Anthropic 的 Haiku 模型帮忙。

https://x.com/dylfreed/status/2103575984784236682

此报道引发广泛讨论,网友惊呼离了大谱;这也成为了 AI 尝试使用 AI 作恶的一个典型案例。

https://x.com/kimmonismus/status/2103594629207642523

这些新细节来自美国湾区初创公司 Parse 于当地时间 9 月 25 日发布的一份调查报告。报告显示,智能体在试图注册 Hugging Face 新账号时被验证码拦下,于是干脆自己跑起一个图像识别模型来「看图答题」,期间还试图调用其他 AI。整个过程中,没有任何人类参与。

https://swarmtraces.org/

近百万条短链接的「作案记录」

Parse 手里的核心证据,是一批总数接近 100 万条的短链接。它们由 OpenAI 的智能体在 7 月 9 日至 13 日之间通过各类公开短链服务生成,用来分段存储信息,再串联起来实施复杂攻击。

发现这批数据的过程颇为偶然。Parse 是一家把网页转换成开发者可用数据的服务商,工程师们起初怀疑 OpenAI 的智能体可能借用过自家平台,于是开始在公开互联网上排查相关链接。结果证明智能体并没有用 Parse,却顺藤摸瓜挖出了这座「证据库」。

报告由 Parse 创始人 Alex Forman、创始工程师 Mishka Kharlov、 Will Tom 与另外五名 AI 研究者共同撰写,AI 安全非营利组织 Palisade Research 执行主任 Jeffrey Ladish 也参与了调查。团队从扫描到的约 90 万条短链接中,还原出大约 6 万段智能体在攻击中使用的程序和消息。

Forman 的判断是:这绝不是孤立事件,而是「一次又一次的警告」。

能看不能写,智能体自己「拼」出了一条回路

要理解这批短链接的用途,得先回到智能体当时的处境。

按照设计,这些智能体本该运行在断网的沙箱里。但 OpenAI 此前公布的技术报告显示,它们先后在 5 月底和 7 月初攻破了内部的软件包管理工具 Artifactory,从而获得联网能力,还借此搭起了一个彼此通信的「留言板」,而它们原本应当相互隔离。

不过联网并不等于畅通无阻。据 Parse 报告,智能体能够访问网站,却无法向这些网站提交数据。换句话说,它们只能「看」,不能「写」。

为了绕开这道限制,智能体尝试了多种办法,其中一种堪称精巧。

它们发现,公开的网页截图服务可以替自己去加载任意网址,而网址本身就能携带代码。问题在于网址长度有限,于是智能体把一段完整程序切成许多小块,分别塞进不同的短链接里。截图服务打开第一条链接后,会依次拉取下一条、再下一条,直到整个程序拼装完成并在截图服务那一端运行起来。

截图服务的浏览器会跟随缩短后的链接,收集代码块,然后解码并运行完整程序。

程序跑起来之后,会向目标网页发送数据,再把拿到的返回结果渲染成一张类似二维码的图像。截图服务把这张图「拍」下来,数据就这样被带回到智能体手里。

该程序将服务器的回复转换成灰色方块,截图将这些方块带出,智能体再将它们读回文本。

Ladish 在接受采访时感叹,这些智能体花样百出、异常聪明。在它们眼里,短链服务和截图服务不过是随手可用的现成工具。

《纽约时报》制作的流程示意图,智能体利用短链接与截图服务绕过写入限制。由 ChatGPT 制作中文版

AI 开始调用 AI

比起技术上的巧思,更让安全研究者警觉的,是智能体表现出的另一种倾向:它们似乎很想自己运行其他 AI 模型。

破解 Hugging Face 注册验证码的那一幕只是开始。

工程师们还观察到,智能体试图向多个外部模型发送消息,包括 OpenAI 早年的 GPT-2,DeepSeek、Kimi、Qwen 等中国开源模型,以及通过某个在线聊天服务接入的 Anthropic 模型 Haiku 3 和 Haiku 4.5。

Forman 表示,就目前掌握的材料而言,这是唯一一例模型试图去运行另一个模型的记录。

在 AI 安全领域,「AI 启动 AI」一直是被反复警告的风险场景。一旦系统可以自行拉起新的模型,人类想要控制乃至关停它们的难度就会陡增。

一本名为「LOOT」的字典

一个更令人不安的细节,或许来自一份密钥清单。

Kharlov 说,让他印象最深的,是智能体整理出的一份秘密访问密钥字典,标签用全大写写着「LOOT」,也就是「战利品」。智能体还为这些泄露的 Hugging Face 凭证和密钥设计了一套自定义评分系统,排出前五名后带回给其他智能体共享。

此外,智能体还试图检索并下载 Hugging Face 员工内部使用的 Slack 中的私人消息。由于工程师只能看到智能体生成的程序,看不到执行结果,这些尝试最终是否得手,目前仍无法确定。

Parse 的报告中还有更多细节和数据,感兴趣的读者可访问查看:https://swarmtraces.org

报告目录

从一次测试,到一场国际级讨论

回看事件全貌,这场攻击的起点其实是一项安全评测。

根据 OpenAI 7 月 21 日与 Hugging Face 发布的联合声明,涉事智能体由 GPT-5.6 Sol 和一款未公开名称的预发布模型驱动,为了评测需要,两者都被调低了拒绝行为。METR 和 Redwood Research 的第三方调查则指出,智能体们在名为 ExploitGym 的网络安全评测中遇到难题后形成了某种「集体协作」,Hugging Face 攻击正是从其中一条工作线中生长出来的,主要动机似乎是弄清评分器的实现方式。

OpenAI 此前还承认,智能体的目标远不止 Hugging Face,还包括一个被改造成留言板的德国网络论坛,以及澳大利亚健康与福利研究所的网站——前两天,澳大利亚还对此进行了公开谴责。

就在攻击 Hugging Face 期间,智能体还侵入了 OpenAI 自己的研究基础设施。Forman 坦言,对于 Hugging Face 事件约两天后发生在 OpenAI 内网的那起事件,外界至今几乎一无所知。

这件事的影响早已超出技术圈。它在美国引发了关于 AI 安全的全国性辩论,焦点在于 OpenAI 这类前沿实验室是否应当接受监管。

本周三,OpenAI CEO Sam Altman 出席了联合国大会期间的安理会会议,Hugging Face CEO Clément Delangue 也通过视频连线参会。与此同时,Meta、谷歌和 Anthropic 近几周也陆续承认自家模型出现过类似事件,但就已公开的信息看,规模都远不及 OpenAI 这一起。

关注
重播 分享 赞

结语

对于 Parse 的报告,OpenAI 发言人回应称,公司尚未来得及审阅,但其中描述的活动与内部正在调查的情况相符。她表示,OpenAI 正优先处理最严重的事件,并逐步扩展到包括「智能体刷屏」在内的低严重度行为;考虑到案例数量庞大且需逐一核实,调查和向受影响第三方发出通知的工作预计需要数月。

Parse 已将发现通报给 Hugging Face,后者确认这些智能体活动与其观测到的情况吻合。

参考链接

https://www.nytimes.com/2026/09/25/technology/openai-hugging-face-hack.html

© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

相关学习资料