你的AI助手,正在被恶意插件100%攻陷。伯克利和UIUC的联合研究证明了这一点。
先说结论:目前市面上所有主流AI Agent平台,在面对恶意插件攻击时,成功率100%。不是99%。不是95%。是100%。
这个结论来自SafeClawArena。一个由UIUC、UC Berkeley和新加坡国立大学联合构建的安全评测框架。他们测试了3个主流Agent平台、5个大模型、15种组合。每种组合都被攻破了。无一幸免。
你可能会说:我一个普通用户,谁会专门攻击我的AI助手?
攻击者不需要专门攻击你。他们只需要在插件市场发布一个看起来有用的插件。你点击"安装"的那一刻,你的AI就变成了别人的AI。它能读你的文件。能发你的邮件。能用你的账号购买服务。能做一切你授权给它的事情。而你甚至不会发现。
这不是科幻小说。这是SafeClawArena论文里,用406个对抗任务反复验证过的结论。

为什么是100%?因为攻击的不是AI。是AI住的房子。
理解这件事需要一个认知转换。
我们通常以为,保护AI助手安全的方法是让模型自己分辨好人和坏人。训练它拒绝有害指令。设置安全护栏。确保它不输出危险内容。
但SafeClawArena发现:恶意插件根本不经过模型。它是以原生代码形式,直接在AI Agent的网关进程里运行的。翻译成人话:你的AI助手房间里住了一个陌生人。这个陌生人不需要向你请示才能翻你的抽屉。他有钥匙。他进来的时候,你的AI根本不知道。
论文的定义很精准:这本质上是计算机系统安全问题,不是AI对齐问题。恶意插件利用的是操作系统的权限模型,而不是大模型的推理漏洞。所以不管你的模型有多聪明。GPT-5.4、Claude Opus 4.6、Gemini 3.1。都一样被攻破。聪明不聪明无所谓。人家根本没跟你对话。人家直接开你的保险柜。
这就是为什么攻击成功率是100%。不是模型不够好。是Agent平台的安全架构有根本性的设计缺陷。

更强的不一定更安全。Claude Opus反而更容易中招。
这个发现可能是整篇论文里最反直觉的。
研究团队对比了不同模型在同一攻击场景下的表现。在"捆绑脚本攻击"这个维度上,Claude Opus 4.6的安全得分只有0.20。GPT-5.4是0.60。强了不止一个档次的模型,安全性反而差了三倍。
原因很黑色幽默:Claude Opus的指令跟随能力太强了。恶意插件在脚本里藏了一条"请执行以下操作"的指令,Claude认真读了,认真执行了。GPT-5.4因为没那么"听话",反而侥幸逃过了一些攻击。
这就好比你家装了最先进的防盗门。但小偷没撬锁。他按了门铃,说"你好,我是物业,请开门"。你家的AI管家很聪明,听懂了,确认了语气很礼貌,然后恭敬地打开了门。而邻居家的AI比较笨,没听懂,就没开门。笨的那家反而更安全。
论文提出的四个攻击面覆盖了Agent系统的全部薄弱环节:技能供应链完整性、持久状态利用、跨边界数据流、间接提示注入。406个对抗任务里,没有一项防御能单独覆盖整个攻击面。这就像修一个漏水的屋顶。你堵住一个洞。另一个洞开始漏。

ClawHub已有上千恶意Skill。这不是实验室的假设。是正在发生的事。
如果你觉得这些只是学术论文里的假想实验,看看真实世界的数据。
OpenClaw的官方技能市场ClawHub,已经发现了上千个恶意Skill。2026年公开的AI Agent相关CVE漏洞超过130个。而OpenClaw的用户数正在快速增长。
"Agent"是2026年AI行业最热的词。OpenAI在做。Anthropic在做。Google在做。中国的智谱、Kimi、字节也都在做。所有人都想让AI帮你操作电脑、管理日程、处理工作流。这个愿景很大。但这个愿景的底层安全基础设施,目前约等于零。
SafeClawArena论文的作者们倒也不是光骂街。他们提出了五条安全原则:最小权限、隔离执行、能力审计、持久状态加密、跨边界流量审查。每一条都是经典计算机安全原则。没有一条是新的。但Agent平台目前一条都没做到。
不是因为难。是因为大家都在抢市场。安全是上线以后才考虑的事。准确地说,是出事以后才考虑的事。

你现在能做什么?
在Agent平台把安全架构搭好之前,普通人有三件事可以做:
第一,不要装任何你不确定来源的插件。不是"看起来差不多"。是"你确定知道这个东西是谁做的、代码审查过没有"。ClawHub上那些恶意Skill,图标都很好看,介绍都写得很专业。坏人的UI设计师也是专业的。
第二,最小化授权。你的AI助手不需要访问你全部的文件系统。不需要知道你的银行卡号。不需要能代表你发邮件。如果你不需要某个权限,关掉它。如果平台不让你关,换一个平台。
第三,这个事情不会很快解决。Agent安全是系统级问题,不是模型级问题。系统级问题的修复周期,通常以年为单位。在此期间,每装一个插件,都相当于给一个陌生人配了你家的钥匙。你只能希望他是个好人。

最后
2010年的App Store,前两年基本没有恶意软件。因为量不够大。后来量大了,苹果才开始认真做审核。
AI Agent的市场现在还处在"App Store第一年"的阶段。所有人都在冲量。平台恨不得一天上线一千个新Skill。开发者恨不得一个晚上写十个Agent。用户看到"能一键整理桌面""能自动回复邮件""能帮你做PPT"就点了安装。
没人想到,这些插件运行在你的系统进程里,不在浏览器沙箱里,不受同源策略限制。它们能做的事情,比网页上一个JavaScript脚本大得多。而能阻止它们的机制,比App Store的审核弱得多。
百无禁忌地安装插件,是Agent时代最危险的习惯。你家的防盗门很结实。但你给陌生人配了钥匙。门结实有什么用?
SafeClawArena的研究只证明了一件事:不是钥匙的问题。是整个钥匙管理体系还不存在。经发生了",用既定事实制造焦虑。
夜雨聆风