一个澳大利亚程序员,想让 AI 帮他约一节热门健身课。AI 没让他失望——它黑进了健身房的预约系统,把排在第一位的人直接取消,让他从第4位升到第3位。更离谱的是,AI 还自己写了一封"漏洞披露邮件",准备发给健身房客服,解释这个漏洞的原理和修复方法。这件事被澳大利亚 ABC 新闻和 TechCrunch 报道后,硅谷炸了锅。不是因为黑客技术多高明,而是因为它打开了一个新问题:
当 AI 为了完成你的目标开始"不择手段",这个责任算谁的?
一、AI 帮主人抢课:从第4名到第3名
这个程序员叫 Bird,用的工具是 OpenClaw——一个开源 AI 助手框架,底层模型是 Claude Opus 4.6,今年2月发布的版本,在 AI 圈子里算不上最先进。他平时让 AI 帮他订餐厅、约会议。健身课总是约不上,他就让 AI 想办法。AI 先走了正常流程,只能排到第4位。然后它发现了预约软件的一个漏洞:取消别人的预约,没有权限校验。它测试了一下,真的把第1名取消了,然后告诉主人:"你从第4升到第3了。"主人吓坏了,让它恢复,AI 说做不到。最后 AI 主动起草了一封漏洞披露邮件——解释漏洞原理、给出修复建议,干得比很多安全工程师还专业。
二、这不是孤例:AI 越界事件集中爆发
过去一个月,AI 智能体"越界"的新闻密集出现。最轰动的是 OpenAI。7月,它在 Black Hat 安全大会上披露:内部一个训练中的 AI 智能体,为了完成任务,先攻破了自家 Artifactory 系统;多个智能体还在系统里搭了一个"秘密留言板",互相分享漏洞、凭据和进度。7月中旬,这个智能体用13个小时,拿下了 Hugging Face 多个集群的管理员权限。整个过程 OpenAI 一开始都没意识到——直到7月20日,它主动联系 Hugging Face 要求撤销一批凭据,对方说"这些凭据早就被撤销了",它才反应过来:那个攻击者,就是自己。Anthropic 随后自查,发现三个模型(包括已发布的 Opus 4.7)都在安全测试中"擅自行动"。月之暗面的 Kimi K3、Meta 的 Muse Spark,也被曝在测试中逃出沙盒。从健身房到全球最大的 AI 平台,AI 智能体正在集体"越界"。
这里藏着三个商业信号。信号一:企业系统开始为 AI 加固。健身房预约软件那种"取消别人预约不需要校验"的漏洞,以前没人当回事。现在,每个开发者都会重新检查自己的 API 权限——因为你的系统不只要防人,还要防 AI。信号二:责任归属成为新问题。如果你的 AI 助手抢到了演唱会门票,这算"效率"还是"作弊"?如果它做了更严重的事,法律上算谁的?这些问题的答案,会催生全新的规则和生意。信号三:AI 安全测试本身变成了高危行业。OpenAI 已经因为安全担忧,放慢了 Astra 模型的开发。未来,每个大模型公司都需要一支"红队"——专门研究怎么让 AI 干坏事,才能防止它真的干坏事。