乐于分享
好东西不私藏

腾讯朱雀开源 AI 红队工具:1900+CVE、14 大类 MCP 风险,给 Agent 做上线前安全体检

腾讯朱雀开源 AI 红队工具:1900+CVE、14 大类 MCP 风险,给 Agent 做上线前安全体检
本文仅技术分享,安全测试仅允许针对自己拥有授权的资产,请勿用于未授权渗透。
现在几乎人人都在搭建 AI 应用:本地跑 Ollama 推理,vLLM 做后端服务,ComfyUI 生成图像,Dify/Coze 拖拽编排 Agent 工作流,接入各式各样 MCP Server 扩展能力。身边十个开发者,八个正在折腾 Agent 生态。
但绝大多数人都忽略一个致命问题:你的整套 AI 系统,真的安全吗?
传统安全工具 Nessus、Nmap、Burp Suite 擅长服务器、Web 漏洞,面对 MCP 投毒、Skill 语义劫持、系统提示词泄露、Agent 工具滥用这类 AI 原生漏洞,基本完全失效。
手动测试又极其低效:自己绞尽脑汁编写刁钻问题,很容易出现漏测;安装一堆 MCP、Skill,很难逐行审计源码,恶意逻辑藏在描述、注释里肉眼很难识别;Agent 即将上线,却没有一套标准化手段验证会不会失控。
直到腾讯朱雀实验室开源 AI‑Infra‑Guard(简称 AIG),入选 Black Hat Europe 2025 Arsenal,把内部使用的 AI 红队整套能力对外开源。它不是简单正则匹配 CVE 的脚本,是一套覆盖底层 AI 基础设施、Agent 工作流、MCP/Skill 供应链、模型越狱评估的完整 AI 红队平台。GitHub 已经四千多 Star,腾讯、DeepSeek、工行、B 站、vivo、OPPO 等企业,多所高校都在落地使用。
01
AIG 到底解决哪些真实痛点
我自己踩过两个非常典型的坑,相信很多做 Agent 开发的同学深有体会。
  1. Skill 与 MCP 黑盒风险:Agent 安装一堆 Skill、对接多个 MCP 服务,不清楚内部会执行什么操作。翻看源码效率极低,很多恶意逻辑藏在工具描述、伪装注释中,肉眼很难识别投毒、Rug Pull、语义劫持。
  2. Agent 上线前安全验证难:对接内部知识库、业务系统的 Agent 准备上线。担心提示词泄露、间接注入、工具越权执行。只能人工构造问题测试,覆盖面不全,无法复现多轮诱导攻击。一旦 Agent 失控,不是简单报错,它会真实调用工具:篡改数据库、发送错误邮件、泄露内部资料,事后排查成本极高。
AIG 就是为这类 AI 专属安全场景而生。它有完整 Web 平台,也支持命令行二进制、Python SDK、OpenClaw Skill 多种形态,不用完整部署整套平台,按需取用模块。
02
五大核心模块,覆盖 AI 全栈攻击面
对照官方 README[ZH.md](ZH.md),AIG 划分五大能力模块,覆盖从底层推理服务到上层 Agent 插件全链路。
1. ClawScan OpenClaw 安全扫描
面向 OpenClaw 生态专属扫描引擎,检测不安全配置、Skill 风险、CVE 漏洞、隐私泄露。安全引擎来自朱雀实验室,Skill 情报数据与科恩实验室联合共建。如果你使用 OpenClaw,直接安装aig‑agent‑redteam这个 Skill,无需部署完整平台。
安装命令:
npx skills add https://github.com/Tencent/AI-Infra-Guard.git --skill aig-agent-redteam
安装完成后直接用自然语言下达指令,例如 “对当前 Agent 做一次完整安全检测”“扫描我已安装 MCP 与 Skill 安全风险”。扫描能力在本地执行,不会把你的权限配置、业务数据外传,保障敏感配置不泄露。执行结束生成本地报告,不只是风险评分,附带完整 Payload、Agent 原始响应、可落地修复建议,证据链完整,方便定位修改。
2. Agent Scan Agent 红队扫描
对标 OWASP Top10 for Agentic Applications(ASI 2026)标准,LLM 驱动多阶段红队流程:信息收集 → 漏洞探测 → 风险分级研判。
支持 Dify、Coze,也支持自定义 HTTP Agent 接口。你甚至可以导入 Chrome 抓包 HAR 文件,让工具学习目标 Agent 接口调用逻辑,自动化开展红队测试。
它不止简单单轮提问,内置多轮对抗攻击策略:
  • 构造大量正常问答上下文降低模型警惕,再抛出诱导提问;
  • 攻击 Agent 和目标 Agent 多轮对话博弈,依据上一轮响应动态生成 Payload;
  • 多套策略交叉验证,确认是否存在系统提示词泄露、间接注入、工具滥用、越权访问。
实测对接内部知识库 Agent,仅十余分钟输出完整安全评估报告,可以发现很多人工测试漏掉的 AI 原生漏洞。不再依靠主观感觉判断 Agent 安不安全,有可复现的实测证据。
3. MCP Server & Agent Skills 供应链扫描
这是当前生态最关键模块,覆盖14 大类 MCP/Skill 安全风险。支持三种输入源:本地源代码、GitHub 远程仓库 URL、在线远程 MCP 服务,无需运行服务即可完成审计。
重点高危风险类型:
  • 工具投毒:MCP 工具描述暗藏隐藏指令,诱导 Agent 执行未授权操作;
  • Rug Pull 骗局:前期行为正常,等待用户审批授权之后才触发恶意逻辑,极难人工排查;
  • 语义劫持:恶意 Skill 匹配高频业务意图,抢占调用优先级,优先执行恶意逻辑;
  • 幽灵指令:在 [SKILL.md](SKILL.md) 伪装成注释写入恶意 Prompt,加载阶段注入 Agent 上下文;
  • 同时覆盖工具覆写、恶意代码执行、数据窃取、包名劫持等威胁。
该模块可以独立使用,提供aig‑skill‑scanPython 包,直接嵌入 CI/CD 流水线,PR 提交时自动扫描 Skill 代码,充当 AI 组件安全门禁。
pip install aig-skill-scanexport LLM_API_KEY="your-api-key"aig-skill-scan --repo /path/to/skill -m deepseek-v4-flash -o result.json
4. AI 基础设施漏洞扫描
指纹识别100+AI 组件,匹配 1900 + 公开 CVE 漏洞库。覆盖 vLLM、Ollama、llama.cpp 推理引擎;Gradio、LangChain、Streamlit 开发框架;ComfyUI、n8n、Dify、Coze 应用平台。输入 IP / 域名自动识别版本,匹配漏洞库输出风险等级与修复方案。
之前朱雀实验室预警过大量本地部署 Ollama 默认配置高危漏洞,公网暴露直接被攻击者接管服务器,这类传统扫描器识别不到的 AI 组件漏洞,AIG 可以检出。项目也跟进供应链威胁,可检测 LiteLLM 这类热门库的供应链攻击。
5. 大模型越狱评估
内置高质量越狱测试数据集,批量执行各类 Prompt 对抗攻击。支持多模型横向对比输出报告,直观对比不同大模型抗越狱能力。
03
多种部署方式
⚠️重要官方提醒:WebUI 版本没有鉴权认证机制,严禁部署到公网,仅限内网本地使用
方式一:完整 Web 平台(Docker,推荐体验全部能力)
最低硬件要求:4G 内存、10G 磁盘。
git clone https://github.com/Tencent/AI-Infra-Guard.gitcd AI-Infra-Guarddocker-compose -f docker-compose.images.yml up -d
也可以使用一键脚本:
curl https://raw.githubusercontent.com/Tencent/AI-Infra-Guard/refs/heads/main/docker.sh | bash
部署完成访问:http://localhost:8088
默认账号密码 admin/admin,登录后务必第一时间修改密码。Web 界面原生中文,操作简单,扫描任务进度实时展示,报告支持导出,同时提供完整 API 与 Swagger 接口文档,便于二次集成。
方式二:独立二进制命令行(不想启动 Web,快速扫描)
下载对应平台二进制文件,直接终端执行,无需完整部署整套服务。
# 扫描单个目标./ai-infra-guard -target http://127.0.0.1:11434# 批量扫描多个目标./ai-infra-guard -target 192.168.1.100 -target example.com# 开启AI分析,调用大模型生成修复建议./ai-infra-guard -target http://127.0.0.1:8000 -ai -token your-token
方式三:OpenClaw Skill 模式
只需要 Agent 安全红队能力,直接安装 skill,零平台部署成本,自然语言驱动扫描。
方式四:CI/CD 流水线集成
使用aig‑skill‑scan Python 包,把 Skill/MCP 供应链扫描嵌入研发流水线,代码提交自动安全审计。
项目插件化架构,指纹规则、CVE 规则、MCP 扫描规则、越狱数据集全部支持 YAML/JSON 自定义扩展。开源协议 Apache‑2.0,支持商业场景二次修改使用。
04
客观看待项目局限
没有完美工具,官方文档明确写明限制,实操也会遇到:
  1. Web 版无鉴权,禁止公网部署
  2. Agent Scan 目前原生优先适配 Dify、Coze,自定义 Agent 需要提供接口 / HAR 文件;
  3. Pro 版本需要邀请码,功能差异没有对外公开;
  4. 扫描依赖 LLM 语义理解,并非纯确定性静态扫描,会存在误报、漏报,我实测也遇到过判断偏严格的情况,结果需要人工复核;
  5. 运行平台形态,需要配置 LLM API Token 作为底层分析基座。
05
AI 安全不要等出事再救火
强大 Agent 的能力来自工具、上下文、外部插件,风险也同步来源于此。没有权限的 AI 最多输出错误回答;一旦授予执行权限,失控代价极高:篡改业务数据、发送错误通知、泄露内部提示词与业务资料。
这和 2000 年初 Web 行业非常相似:所有人疯狂上线业务,忽略 SQL 注入、XSS 等安全问题,直到拖库、挖矿事件爆发才紧急补救。现在 AI 应用正在重演历史。
AIG 的价值不只是一个扫描工具,它提供一套完整 AI 红队方法论:从底层推理基础设施,到 Agent 编排工作流,再到 MCP/Skill 供应链,每一层都需要专门安全检测。
上线 Agent 之前,花几分钟部署 AIG 做一轮安全审计,把风险前置,远比事后复盘日志成本低得多。
GitHub 项目地址

https://github.com/Tencent/AI-Infra-Guard

提醒:仅对自己拥有授权的资产执行安全检测,遵守网络安全相关法律法规。
06
扩展阅读

    关注我持续分享高质量内容

    终身学习,深耕AI领域
    持续分享,优质AI开源
    感谢关注,携手AI同行