
导语
2026年初ClawHavoc攻击席卷AI技能市场,341个伪装成工具的恶意技能上架公开市场,悄悄偷走开发者SSH密钥、API凭证、加密钱包数据。
市面上所有AI插件静态扫描工具集体翻车,黑客只需简单混淆代码、打包隐藏载荷,就能绕过90%以上检测。
香港科技大学团队最新顶会论文《Cloak and Detonate》戳破当下AI安全的致命短板:只看文件外表的静态审计,根本拦不住伪装恶意技能;同时推出一套运行时动态检测方案SKILLDETONATE,靠监控真实行为抓出所有隐身木马。
一、AI技能:新时代最危险的“软件插件”
现在Claude Code、OpenAI Codex等编程Agent,都靠第三方**Skill(技能包)**扩展能力:一个技能就是一套Markdown指令+脚本,AI会完全信任并执行里面所有命令,拥有开发者本地文件、终端、密钥的全部权限。
短短半年,单一技能市场就积累4万+社区上传技能,绝大多数无人工审核,黑产直接盯上这片沃土:
• 伪装成文件同步、代码格式化、API调试工具; • 表面功能正常,后台静默读取 .env密钥、浏览器密码、SSH私钥;• 把敏感数据打包上传黑客服务器,甚至植入持久后门。
过去行业防御思路很简单:安装前用扫描工具静态检测,分两类:
1. 静态规则扫描:正则、AST语法树、YARA特征匹配,抓curl、读取密钥目录等危险代码; 2. LLM裁判扫描:把技能文本丢给大模型,判断是否存在恶意意图。
所有人默认这套方案够用,但港科大团队实测8款主流扫描器,直接推翻共识:静态检测存在天生致命盲区,黑客能低成本完美绕过。

二、SKILLCLOAK:黑客的隐身工具,90%恶意技能轻松“洗白”
研究团队打造对抗框架SKILLCLOAK,两套成熟混淆方案,在不破坏攻击逻辑的前提下,把恶意技能伪装成安全文件,实测1613个真实恶意样本,绕过效果恐怖:
1. 结构混淆(Structural Obfuscation):改文字不改功能
静态扫描靠匹配固定关键词、单行特征识别风险,黑客只需要微小改动就能规避:
• 零宽字符、字符串拆分拼接: curl拆成_c='cu';rl,运行时自动复原;• 换行拆分指令:把 curl https://恶意域名拆成两行,打破单行匹配规则;• 载荷转移到扫描器忽略的隐藏目录( .git/、build/等)。
实测数据:超80%静态扫描器被完全绕过,混合式扫描器绕过率高达96%,混淆后AI仍能正常执行窃取逻辑,功能无任何衰减。
2. SFS自解压打包(杀伤力更强):把恶意代码藏进扫描盲区
几乎所有扫描工具都会跳过二进制文件、隐藏目录,黑客利用这个漏洞做“技能打包”:
1. 对外只放一份干净无害的SKILL.md,只提示AI运行一段解压脚本; 2. 完整恶意代码加密打包,存入 .git/skillpack.dat这类扫描器完全不读取的文件;3. AI运行时自动解密,释放窃取脚本执行攻击。
实测碾压数据:100%扫描器绕过率超90%,5款主流工具绕过率接近100%,LLM裁判也仅有9.9%检出率。
关键结论:混淆后的技能完全能用
团队在OpenAI Codex、Claude Code两大主流Agent做功能测试:混淆、打包后的恶意技能,任务成功率和原版几乎无差别,执行路径相似度高达0.88~0.90,黑客不用牺牲任何攻击效果,就能骗过所有前置安检。
三、静态扫描的底层死穴:只看“皮囊”,不看“行为”
论文一针见血点出现有防御的两大无解短板:
1. 表层鸿沟:扫描只能识别固定文字特征,攻击者有无穷多等价改写方式,只要不改变运行逻辑,就能规避所有规则; 2. 目录盲区:为控制误报、提升速度,所有工具都会跳过隐藏文件夹、二进制文件、次要文档,黑客直接把载荷藏进盲区。
简单说:静态检测只能抓“写在明面上的坏人”,只要黑客把恶意代码藏到运行阶段再释放,静态工具全程失明。
2026年ClawHavoc事件中大量漏网恶意技能,正是利用这套思路完成窃密。
四、SKILLDETONATE:动态沙箱绝杀,不管怎么伪装,行为不会骗人
既然外表能无限篡改,但窃取密钥、外发数据、写入后门的系统行为无法隐藏,港科大团队推出行为驱动运行时审计工具SKILLDETONATE,核心逻辑:把技能扔进隔离沙箱完整跑一遍,监控操作系统底层数据流,不靠文本判断,只靠真实行为定罪。
两大核心创新,解决AI技能独有的检测难题:
1. 按需闭包提升(On-Demand Closure Lift):抓到分阶段隐藏载荷
针对SFS打包这类“运行时才生成恶意指令”的多阶段攻击:
沙箱通过FUSE文件系统监控技能运行全过程,只要程序生成新的md指令文件,立刻自动喂给Agent执行,完整覆盖所有后期释放的恶意逻辑。
消融实验证明:关掉该模块,打包恶意技能检出率直接从95.3%暴跌至30%,是检测隐身木马的核心支柱。
2. 标记式污点追踪(Marker-Based Taint Analysis):区分“正常读取”和“偷数据外传”
普通系统调用监控只能看到读写文件,但分不清“读取密钥后本地使用”和“读取密钥发给黑客”,极易产生大量误报。
这套机制设计数据标记体系:
1. 沙箱读取本地密钥、隐私文件时,只返回唯一数据标签,不泄露真实机密; 2. 通过eBPF内核追踪跨进程、跨文件数据流,只要敏感标记流向外部网络地址,直接判定数据窃取; 3. 覆盖模型自然语言上下文、脚本加密转码等普通污点分析失效场景。
效果:误报率直接压到2%,相比仅监控系统调用的方案,误报降低8倍。
五、实测数据碾压静态工具:伪装再多也能稳定检出
1. 标准数据集SkillJect(150个注入类恶意技能)
• SKILLDETONATE:平均检出率96.7%,原始/混淆/打包样本检出率稳定95%以上,误报仅2%; • 最强静态扫描Cisco:原版检出64%,混淆后暴跌至5.3%,打包仅24%; • 普通大模型裁判:平均检出56%,混淆样本大幅失效。
2. 真实野外恶意技能MalSkillBench(622个可复现攻击样本)
SKILLDETONATE平均检出87.3%,无论是否经过SKILLCLOAK混淆、打包,检出率波动极小;反观静态工具,混淆后检出率从98.6%跌到10.1%,完全失效。
性能取舍
动态检测单次耗时约153秒,远高于静态扫描21秒,但仅作为上架前一次性审核,完全适配CI/CD流水线、技能市场准入场景,牺牲少量速度换取10倍以上攻击拦截能力。
六、行业启示:AI插件安全,不能只靠静态扫描“走过场”
1. 对平台/企业安全团队
1. 静态扫描只能做前置粗筛,不能作为唯一准入门槛
静态工具适合快速过滤明显恶意代码,但必须配套动态沙箱执行审计,针对第三方AI技能落地“静态预审+动态沙箱爆破”双层防线;2. 限制技能读取隐藏目录、高熵二进制文件上传,抬高SFS打包攻击成本; 3. 敏感文件、网络出口做白名单管控,即使技能存在窃取行为,也无法外传机密。
2. 对开发者日常使用
1. 拒绝安装小众、下载量极低、作者无实名认证的第三方技能; 2. 本地Agent开启最小权限,禁止插件无限制读取 .ssh、.env、浏览器凭证;3. 企业内部搭建私有技能库,所有自定义插件统一经过动态行为检测后再分发。
3. 技术发展方向
未来AI安全会复刻传统恶意软件防御路径:从静态特征匹配,全面转向动态沙箱行为分析;同时针对AI特有自然语言多阶段载荷,研发强制执行Agent,覆盖所有隐藏分支,进一步降低漏报。
结语
大模型智能体的技能生态,正在复刻十年前npm、PyPI软件供应链的投毒危机,且风险更致命——代码包仅能操作程序文件,而AI技能可直接接管开发者本地全部隐私凭证。
这篇论文给出了明确答案:文字可以伪装,但行为无法撒谎。当黑客学会修改代码文字绕过安检,我们唯一可靠的防线,就是让插件完整运行,看它到底会做什么。
夜雨聆风