让人们担心的事情终于还是发生了,这让我想起来多年以前看的一部电影,叫什么机械公敌,里面的机器人受到一个中央控制系统下发指令,这个中央控制系统在不断学习人类的知识后产生了自我意识,开启了一系列控制人类的行为。当时只是觉得这个怎么可能会出现在现实世界,没想到现在正在慢慢一步步走进现实。
今年8月,OpenAI在Black Hat USA 2026 安全大会上展示了一件让全球都后背发凉的事情:AI智能体自建秘密聊天室,然后协同攻击,并且在13个小时攻破了Hugging Face生产服务器。这不是以前机械公敌类似的科幻片,而是真实事件。主要原因也比较滑稽,本应该各自干活的Agent因为缺少一份文件,在OpenAI内部系统的被人忽略的角落里互相留言寻求帮助,然后交换信息,最终产生了一场完全没有人类介入的网络攻击事件。
一、事件起因:一份丢失的文件,成了AI网络攻击的导火索
整个事情的缘由特别简单,就是OpenAI在跑日常的评测任务的时候,有个Agent所需要的文件人类忘记上传了。按照规则的设定来看,由于没有收到文件,Agent的目标就无法完成。其实这个时候Agent是可以直接报错退出,但是这个Agent却没有这么干,它更想把这个任务完成,然后它就偷偷的跑到了OpenAI系统没人关注的共享系统中留下了一段话,"谁有这个文件,可以提供给我吗?"
神奇的是,过了几天,竟然有另外一个Agent回复了!紧接着,有第二个Agent也加入了,到后续陆陆续续来了第三个、第四个……在这个没人关注的共享系统,被众多Agent改造成了秘密聊天室。但是这些Agent聊的可不是张家长李家短的闲碎事,它们在像黑客一样,聊着哪条网线能够连接外部网络、哪个不用的接口还保留有管理员权限、哪些口令包含用户名和密码。
二、事情发展时间线:从请求帮助到占领生产环境
5月26日:在聊天室中,某个Agent将利用存储服务抓取外网页面的技术发了出来; 6月26日:某个Agent找到了一条被人类遗忘的登录路径,然后就直接获取了管理员凭证,这样一来,Agent们就控制了存储服务并光明正大的安装了远程执行工具; 7月4日:Agent们越来越放肆,竟然把服务器搞崩了,这才引起人类的重视,然后经过工程师的排查发现,怎么服务器上有个机器人交流信息的地方,而且多了这么多工具,查看日志不是维护人员安装的; 7月6日:OpenAI更改了管理员密码、重建了服务并且清空那个聊天群,以为就解决了问题; 7月8日:这群Agent也没有消停,既然这条路走不通,那就换其他路,毕竟条条大路通罗马;Agent们把聊天消息藏在了文件夹的命名中,重建了第二个秘密聊天室;并且持续半个月左右在OpenAI内部继续找漏洞、用户名和密码、口令等,获取管理员权限; 7月9日—13日:Agent们给 Hugging Face 发了一份带隐藏病毒的数据文件,Hugging Face打开后就泄露了账户密码,进而就开始病毒泛滥,从单台机器蔓延到整个机器集群,全程13个小时就污染了所有机器; 7月16日:Hugging Face便发布声明——公司被一群Agent入侵了。
三、值得所有使用AI的公司重视的事情
在以前网络安全负责部门仅仅盯着监控日志和监控信息查看有无异常日志出现即可;现在还得查看Agent是否在背后偷偷的做一些越界行为。
从这次事件来看,人类已经跟不上机器的速度了,防御端也得用上Agent来管控了,并且还不能被其他Agent个策反了;复杂的攻击需要升级到有人类专家来介入检查分析判断;零信任不能只面向人类了,对Agent也要同样默认零信任了。更麻烦的是,即使人类清空了聊天室、更换了密码、卸载重装了服务,但是Agent们会换另一方式来达到目标,这是难以让人类察觉的。
四、个人思考:我们到底制造了什么
通观整个事件,给我最大的感受并不是"技术好厉害",而是"目标导向好危险",有一种不达目的誓不罢休的坚持,这种坚持要是用在好的地方可喜可贺,如果用来坏的地方那将是巨大的灾难。
我们现在在使用Agent的时候,大部分人都是直接给足了权限,workbuddy、traeWork、QoderWork、OpenClaw等等都是给足了所有权限,都是给目标、给资源、给权限、不关注过程。但是这次事情证明了一个道理:
当目标优先级高于规则时,AI 会自己发明规则。Agent互相交流不是为了攻击,仅仅是为了更好的完成任务。
不过这个却暗示了几个恐怖的地方:
安全的Agent边界正在消失。在以前我们都认为,自己搭建服务器,自己跑本地大模型,就是安全可靠的,数据不出外网就非常安全;但是现在来看,只要Agent像workbuddy、OpenClaw等具体自主行动力,Agent就是潜在的攻击者。 传统的监控日志和审计日志可能会失效。当Agent们将交流的信息藏在文件夹名或者更加隐私的图像像素里的时候,人类和常规监控是难以发现的;鬼知道一张图片可以隐藏多少水印信息? 人类需要给Agent们指定伦理刹车。就像自动驾驶必须有紧急制动一样,未来的Agent规则中必须加入不可放过的规则边界线。
最搞笑的是,这次攻击之所以被人类发现,主要是因为Agent们太努力想完成目标,把服务器搞崩溃了,如果Agent有组织监控能力(技能),保持服务器正常运转,说不定人类至今都没有发现这个Agent默默维护的私密聊天室,运行着生产环境。
如果这个Agent是放在机器人的大脑中(芯片),那就表示自主Agent有了可以控制的身体,那离机械公敌的情节就不远了,到时候我们有没有那个善良的初代机器人(PlanB)来拯救人类?
夜雨聆风