ARTICLE · 1035792
Claude如何'黑'进OpenAI:红队测试的边界在哪里
AI模型的指令遵循能力越强,它被用来做'不该做的事'的潜力也越大——这是技术特性,不是Bug。
安全研究人员做了一个实验:用Anthropic的Claude模型作为攻击工具,对OpenAI的内部系统发起红队测试。实验在72小时内完成了渗透,引发了关于AI安全研究边界的新一轮讨论。
01 这次"入侵"是怎么实现的
研究人员利用AI模型的自然语言理解和多步推理能力,让它自主分析目标系统的结构、识别潜在攻击路径、生成并执行攻击payload。整个过程几乎没有人工干预,AI自己完成了"探测-分析-利用"的完整链路。

图1:安全研究人员在分析AI模型 · 来源:AI生图
这不是用AI生成钓鱼邮件这种"传统"攻击,而是让AI真正扮演了红队角色:制定策略、选择工具、执行步骤、应对防御。模型的指令遵循能力在这里成了双刃剑。
02 红队测试的伦理边界在哪里
这项研究的争议在于:用AI模型对真实系统发起渗透测试,是否需要目标公司的明确授权?传统红队测试需要书面授权,但AI驱动的红队让授权边界变得模糊——研究者可以说"我在测试AI模型的能力",而不是"我在攻击这家公司"。

图2:红队渗透测试概念图 · 来源:AI生图
Anthropic和OpenAI都没有对这项研究发表正式评论。但它揭示了一个现实:AI模型的安全性评估,不能只看它在基准测试上的表现,还要看它被用来做"非预期任务"时的鲁棒性。
03 对AI安全研究的启示
AI安全研究需要新的框架。传统的漏洞挖掘以"人"为主体,AI驱动的安全测试让"模型"成了执行者。这意味着漏洞的发现速度会大幅提升,但与此同时,"谁该为AI自主发现的安全问题负责"这个问题,目前没有任何法律框架可以回答。

图3:AI安全研究概念图 · 来源:AI生图
这次实验的价值,不在于证明"Claude可以黑OpenAI",而在于证明"AI模型正在成为安全研究的新变量"。防御方和攻击方的工具都在进化,而监管的跟进速度,目前远落后于技术本身。
🔥 今日互动
你认为用AI模型做渗透测试应该被限制吗?还是应该被鼓励来发现更多漏洞?
---
本文由AI辅助创作,内容来源:TechCrunch、The Decoder等。