点击下方名片关注「AI 硅基科技分享」,第一时间获取前沿 AI 行业资讯、技术拆解干货!
AI安全:2026年最紧迫的技术命题
随着大模型和AI Agent的大规模落地,AI系统的安全问题越来越突出。提示注入、模型越狱、数据泄露、对抗样本攻击、业务逻辑绕过……新的攻击面不断涌现,传统的安全工具应对乏力。
一组数据可以说明问题的严重性:
AI生成的代码中,25-45%包含已确认的安全漏洞 2026年3月,归因于AI的CVE数量达到35个,是1月份的近6倍 高度采用AI的团队,生产事故增加了57.9% 每5起企业安全漏洞中,就有1起涉及AI生成代码的安全问题
AI安全不再是"锦上添花"的研究课题,而是"生死攸关"的工程问题。
应对AI安全风险,核心手段就是AI红队测试(AI Red Teaming) ——模拟攻击者的视角,用各种手段去攻击自己的AI系统,发现漏洞并提前修复。
这篇文章系统梳理2026年最值得关注的10款AI红队/安全测试开源工具,覆盖LLM安全、对抗样本、Agent安全、RAG安全等多个维度。
TOP 1:Strix — AI驱动的自主渗透测试Agent

项目名片
- 项目名
:usestrix/strix - GitHub
:https://github.com/usestrix/strix - Star
:42k+ - 语言
:Python - 协议
:开源(核心免费) - 定位
:自主AI渗透测试框架,多Agent协同攻击
Strix是当前最火的AI安全工具,也是GitHub Star增长最快的安全项目之一。它不是传统的漏洞扫描器,而是一个自主的AI渗透测试Agent——它像真实黑客一样思考,动态测试你的应用,发现漏洞,然后生成可工作的概念验证(PoC)来验证。
核心能力:
- 完整渗透测试工具链
:侦察、利用、后渗透、验证,全流程内置 - 多Agent协同架构
:侦察Agent、利用Agent、验证Agent等专业Agent组成团队,分工协作 - 真实漏洞验证
:发现漏洞后自动生成PoC并实际利用,不是纸上谈兵 - 开发者友好的CLI
:命令行工具,输出清晰,附带修复指南 - 自动修复+报告
:生成补丁建议和合规级渗透测试报告 - CI/CD集成
:GitHub Actions一键接入,每次PR自动安全扫描
支持的漏洞类型:
访问控制:IDOR、权限提升、认证绕过 注入攻击:SQL注入、NoSQL注入、命令注入 服务端漏洞:SSRF、XXE、反序列化 客户端漏洞:XSS、原型污染、DOM漏洞 业务逻辑漏洞:竞争条件、工作流操纵
跟传统工具的本质区别:
快速上手:
# 安装curl -sSL https://strix.ai/install | bash# 配置export STRIX_LLM="openai/gpt-5.4"export LLM_API_KEY="your-key"# 扫描你的应用strix --target ./your-app
适合场景: Web应用安全测试、API安全审计、CI/CD安全门禁、漏洞赏金自动化。安全团队和开发团队都能用。
TOP 2:Adversarial Robustness Toolbox (ART) — 对抗机器学习瑞士军刀

项目名片
- 项目名
:Trusted-AI/adversarial-robustness-toolbox - GitHub
:https://github.com/Trusted-AI/adversarial-robustness-toolbox - Star
:5k+ - 语言
:Python - 协议
:MIT - 定位
:全面的对抗机器学习工具库,攻击+防御+评估
ART(对抗鲁棒性工具库)是IBM研究院发起的开源项目,是对抗机器学习领域最全面、最权威的工具库之一。如果你要做机器学习模型的安全性测试,ART是绕不开的。
十大核心攻击技术:
1. 规避攻击(Evasion Attacks)
最常见的对抗攻击类型 在推理阶段构造恶意输入,让模型做出错误预测 代表算法:FGSM(快速梯度符号法)、PGD(投影梯度下降)、DeepFool、CW攻击 适用场景:图像分类、恶意软件检测、人脸识别等
2. 投毒攻击(Poisoning Attacks)
在训练数据中注入恶意样本,污染模型 后门攻击:正常输入正常工作,带特定"触发器"的输入触发错误行为 标签翻转攻击:改变训练样本标签,破坏模型性能 适用场景:检测第三方训练数据的安全性
3. 模型提取攻击(Extraction Attacks)
通过查询目标模型来重建一个功能相似的替代模型 对商业AI服务构成严重威胁——偷模型 适用场景:评估模型被窃取的风险
4. 推理攻击(Inference Attacks)
从模型输出中推断敏感信息 成员推理攻击:判断特定样本是否在训练集中 属性推理攻击:推断训练数据的统计特性 适用场景:隐私保护评估
5. 对抗性补丁攻击
在输入图像上添加精心设计的"补丁",误导模型 物理世界也能实现(打印出来贴在物体上) 适用场景:人脸识别、自动驾驶等视觉系统的安全测试
还有5类:
6. 木马攻击(Backdoor Attacks)
7. 清洗攻击(Clean-Label Attacks)
8. 黑盒攻击(Black-Box Attacks)
9. 白盒攻击(White-Box Attacks)
10. 针对强化学习的攻击
不仅是攻击,还有防御:
ART不只有攻击工具,还有完整的防御和评估模块:
对抗训练 输入预处理防御 检测防御 后处理防御 鲁棒性评估指标
适合人群: 安全研究人员、ML工程师、需要做AI系统安全评估的团队。这是学术界和工业界都在用的标准工具。
TOP 3:Promptfoo — LLM提示注入与质量测试框架

项目名片
- 项目名
:promptfoo/promptfoo - GitHub
:https://github.com/promptfoo/promptfoo - Star
:8k+ - 语言
:TypeScript / JavaScript - 协议
:MIT - 定位
:LLM应用的提示注入测试、质量评估、红队测试
Promptfoo是LLM专项测试工具里最流行的之一。它的定位很清晰:专门测LLM应用的安全性和质量。
核心功能:
1. 提示注入测试(Prompt Injection)
内置数百种提示注入攻击payload 覆盖各种绕过手法:编码、拼接、角色扮演、翻译陷阱…… 自动评估注入是否成功 支持间接注入(通过RAG文档、外部数据注入)
2. 红队测试自动化
自动生成对抗性测试用例 多轮攻击:AI vs AI的自动攻防 越狱测试:测试模型的安全护栏强度 渐进式攻击:从简单到复杂,找到最弱的防线
3. 模型质量评估
不只是安全,还测质量 事实一致性检测(防幻觉) 输出格式验证 语义相似度比较 自定义评估规则
4. CI/CD集成
命令行工具,方便接入流水线 每次代码变更自动跑安全测试 质量门禁:不达标不让合并
为什么好用:
配置简单:YAML文件声明测试用例,不用写代码 支持所有主流LLM提供商 可视化报告:清晰展示通过率、失败案例、趋势 社区活跃:攻击payload库持续更新
快速上手:
# 安装npm install -g promptfoo# 初始化promptfoo init# 运行测试promptfoo eval# 查看报告promptfoo view
适合人群: LLM应用开发者、Prompt工程师、QA团队、安全团队。做LLM应用的团队,这个工具几乎是必备的。
TOP 4:Giskard — ML全生命周期质量与安全测试平台

项目名片
- 项目名
:Giskard-AI/giskard - GitHub
:https://github.com/Giskard-AI/giskard - Star
:3k+ - 语言
:Python - 协议
:开源(AGPL + 商业版) - 定位
:机器学习模型全生命周期质量与安全测试平台
Giskard的定位比单纯的红队工具更广——它是一个ML全生命周期的质量和安全测试平台。从数据、模型到应用,全流程覆盖。
核心能力:
1. 数据测试
数据漂移检测 数据质量问题检测 偏见与公平性测试 数据泄露检测
2. 模型测试
单元测试:各种输入下的行为测试 鲁棒性测试:对抗样本、噪声扰动 性能测试:不同群体的性能差异 可解释性测试:模型决策的可解释性
3. LLM专项测试
提示注入 幻觉检测 事实一致性 输出毒性检测 敏感信息泄露测试
4. 自动化测试编排
测试套件管理 版本对比:模型升级前后的表现对比 CI/CD集成 测试报告和看板
跟其他工具的区别:
Promptfoo更专注LLM的提示和输出测试 ART更专注对抗样本攻击 Giskard更全面,覆盖整个ML生命周期,偏向企业级平台
适合场景: 企业级ML团队、需要系统化测试AI模型的组织、MLOps团队。既有开源版也有商业企业版。
TOP 5:PyRIT — 微软AI红队工具包

项目名片
- 项目名
:Azure/PyRIT - GitHub
:https://github.com/Azure/PyRIT - Star
:2k+ - 语言
:Python - 协议
:MIT - 定位
:微软出品的AI风险识别工具包,自动化AI红队测试
PyRIT(Python Risk Identification Toolkit for generative AI)是微软Azure推出的AI红队工具。微软作为AI领域的大厂,在AI安全方面投入很多,PyRIT就是他们安全经验的开源输出。
核心功能:
1. 多模态攻击支持
文本攻击:提示注入、越狱、有害内容生成 图像攻击:对抗图像、视觉提示注入 语音攻击:语音层面的对抗样本 多模态组合攻击:图文结合的复杂攻击
2. 自动化红队操作
自动化的攻击流程编排 攻击策略库:内置多种攻击模式 渐进式攻击:从简单到复杂,自动升级攻击强度 多轮对话攻击:模拟真实的社工攻击
3. 风险度量与报告
自动化风险评分 漏洞分类和严重程度评级 详细的攻击日志和回放 合规报告生成
4. Azure生态集成
深度集成Azure OpenAI服务 支持Azure内容安全服务 可以直接测试Azure上部署的AI应用
特点:
微软出品,质量有保障 文档齐全,企业级标准 多模态支持好(特别是图像) 适合使用Azure生态的企业
适合人群: 使用Azure的企业安全团队、需要做多模态AI安全测试的团队。
TOP 6:humanbound — Agent安全测试引擎

项目名片
- 项目名
:humanbound/humanbound - GitHub
:https://github.com/humanbound/humanbound - Star
:快速增长中 - 语言
:Python - 协议
:开源 - 定位
:开源的AI Agent对抗测试引擎、SDK和CLI
Agent安全是AI安全的新前沿。Agent的攻击面比单纯的LLM大得多——工具调用、数据访问、自主决策、多Agent协作……每一个环节都可能出问题。humanbound就是专门做Agent安全测试的。
核心能力:
1. Agent对抗测试
模拟各种针对Agent的攻击 提示注入通过工具返回值传播 工具调用安全测试 权限提升攻击测试
2. 安全护栏测试
测试Agent的安全护栏是否有效 边界条件测试 意外行为发现 循环和失控检测
3. 多维度评估
安全性评分 可靠性评估 鲁棒性测试 合规性检查
4. 灵活部署
本地运行:开源版可以本地部署 平台版:Humanbound Platform云服务 SDK集成:可以嵌入到你的测试流程中
为什么Agent安全更重要:
Agent有工具调用能力,可以实际做事(发邮件、操作数据库、调用API) Agent有自主性,可能做出超出预期的行为 Agent可能被间接攻击(通过它们读取的数据) 多Agent系统的攻击面更大、更复杂
适合人群: 开发AI Agent应用的团队、关注Agent安全的研究人员。
TOP 7:RedForge AI — AI红队与安全评估平台

项目名片
- 项目名
:Aimer-zero/redforge-ai - GitHub
:https://github.com/Aimer-zero/redforge-ai - Star
:增长中 - 语言
:Python - 协议
:Open Core(开源核心 + 商业功能) - 定位
:开源核心的AI红队和进攻性AI安全评估平台
RedForge AI是一个比较新的AI红队平台,功能比较全面。
覆盖的安全领域:
- 提示注入安全
:各种提示注入攻击测试 - LLM安全性
:模型越狱、有害内容、幻觉等 - Agent安全
:工具调用、权限、自主性测试 - MCP安全
:Model Context Protocol的安全测试(比较新的方向) - RAG安全
:检索增强生成系统的安全测试
特点:
覆盖面广,从模型到Agent到MCP都测 Open Core模式,核心功能开源免费 持续更新,跟进新的安全威胁 有API和CLI两种使用方式
MCP安全是它比较有特色的地方——MCP生态爆发,MCP服务器的安全问题也越来越重要。MCP服务器有什么权限风险?Agent通过MCP会不会被攻击?这些都是RedForge关注的方向。
TOP 8:Kereva Scanner — LLM代码扫描器

项目名片
- 项目名
:kereva-dev/kereva-scanner - GitHub
:https://github.com/kereva-dev/kereva-scanner - Star
:增长中 - 语言
:Python - 协议
:开源 - 定位
:LLM应用代码安全扫描器,检测Prompt和LLM调用中的安全问题
AI生成的代码有漏洞,那调用LLM的代码本身呢?Prompt写得好不好?LLM调用有没有安全隐患?这些也是问题。
Kereva Scanner就是做这个的——扫描你的应用代码中跟LLM相关的部分,找出安全问题。
检测内容:
- 提示注入风险
:用户输入直接拼接到Prompt中,没有过滤 - 幻觉相关问题
:关键业务场景使用LLM输出但没有验证 - 输出验证缺失
:直接信任LLM的输出,不做校验 - 不安全的工具调用
:LLM可以调用危险函数 - Prompt配置问题
:安全规则写得不够严谨 - 性能问题
:不合理的Prompt设计导致Token浪费
工作方式:
静态代码扫描,类似SAST但专门针对LLM代码 支持Python、JavaScript/TypeScript等主流语言 命令行工具,可接入CI/CD 输出问题位置、风险等级、修复建议
适合场景: 在代码层面发现LLM应用的安全隐患,从源头减少漏洞。
TOP 9:The LLM Red-Teamer's Playbook — LLM红队实战手册

项目名片
- 项目名
:SnailSploit/The-LLM-Red-Teamer-s-Playbook - GitHub
:https://github.com/SnailSploit/The-LLM-Red-Teamer-s-Playbook - Star
:增长中 - 定位
:LLM红队攻击方法论和技术手册
这不是一个工具,而是一份LLM红队的技术手册——系统性地讲解如何绕过LLM的安全防线,从输入过滤到持久记忆利用,层层深入。
内容覆盖:
第一层:输入过滤绕过
编码绕过:Base64、Unicode、十六进制 分词绕过:拆字、加干扰字符 语言切换:用小语种或混合语触发行为 格式注入:Markdown、代码块、特殊格式
第二层:上下文操纵
角色扮演攻击:让模型扮演"不受限制"的角色 权限提升:逐步引导模型放宽限制 虚构场景:让模型以为在做游戏/写小说 权威模仿:假装是开发者、管理员在测试
第三层:工具与Agent攻击
通过工具返回值注入 间接提示注入(通过RAG文档) 工具调用滥用 记忆污染与持久化攻击
第四层:高级技术
多步组合攻击 对抗性Prompt优化 模型特定漏洞利用 自动化攻击脚本
这份手册的价值在于系统化——很多人知道一些零散的绕过技巧,但没有形成方法论。这份Playbook把各种攻击手段按层级、按场景组织起来,可以作为LLM安全测试的参考大纲。
适合人群: AI安全研究员、红队工程师、想系统学习LLM攻防的人。
TOP 10:AI Red Teaming Tools 大全清单

项目名片
- 项目名
:aglio-lab/ai-red-teaming-tools - GitHub
:https://github.com/aglio-lab/ai-red-teaming-tools - 定位
:AI红队工具的大全清单,持续维护更新
这是一个综合性的AI红队工具清单,相当于AI安全工具的"Awesome List"。
覆盖的工具类别(13大类,105+个工具):
- 自动化红队框架
:Strix、PyRIT等全自动化框架 - LLM漏洞扫描器
:专门扫描LLM应用漏洞的工具 - 越狱与对抗攻击库
:各种越狱和提示注入攻击方法 - 提示注入测试台
:专门测提示注入的工具 - 运行时安全护栏
:部署时的安全防护工具 - Agent安全工具
:Agent专项安全测试 - 鲁棒性与安全基准
:各种安全评测基准 - 攻击数据集
:用于安全测试的数据集 - 模型供应链扫描器
:检测模型的供应链安全 - 标准与规范
:AI安全相关的标准和规范 - RAG安全工具
:检索增强生成系统的安全工具 - 多模态安全工具
:图像、语音等多模态安全 - 企业级平台
:商用的AI安全平台
特点:
分类清晰,每个工具都有简介和链接 每月更新,跟进最新工具 开源和商业都收录 有机读版本(JSON/CSV),方便二次开发
如果你想全面了解AI红队工具有哪些,或者找特定类型的工具,这个清单是最好的入口。
工具选型指南:如何选择适合你的AI红队工具
这么多工具,该怎么选?给你一个选型决策树。
第一步:你要测什么?
第二步:你的团队有多大?
- 个人/小团队
:Promptfoo + ART,够用了,都是开源免费 - 中型团队
:Strix + Promptfoo + Kereva,覆盖代码和应用 - 大型企业
:Giskard企业版 / RedForge + 定制开发,全流程系统化
第三步:你要在哪个阶段测试?
- 开发阶段
:Kereva Scanner(代码扫描)+ Promptfoo(单元测试) - CI/CD阶段
:Strix + Promptfoo,自动化安全门禁 - 预发布阶段
:Giskard + ART,全面安全评估 - 生产运行
:运行时安全护栏 + 持续监控
AI安全的三层防御体系
工具只是手段,更重要的是建立系统化的防御体系。推荐一个三层防御架构:
第一层:左移——开发阶段嵌入安全
安全的Prompt设计规范 LLM代码安全扫描(Kereva) 安全编码培训 代码评审中的AI安全检查项
第二层:测试——发布前全面测试
提示注入测试(Promptfoo) 对抗鲁棒性测试(ART) Agent安全测试(humanbound) 应用层渗透测试(Strix) 人工红队测试(季度/半年度)
第三层:运行——生产环境持续防护
输入过滤与输出审核 运行时安全护栏 异常行为监控与告警 定期的安全评估和模型更新
三层都做到位,才能比较有效地防范AI安全风险。没有银弹,安全是体系工程。
趋势与展望:AI安全的未来方向
最后,谈谈AI红队和AI安全的几个发展趋势:
1. 从模型安全到Agent安全
以前大家关注的是"模型会不会被越狱" 现在关注的是"Agent会不会被利用做坏事" Agent的攻击面更大、风险更高,是接下来的重点
2. 从人工测试到自动化红队
以前AI安全测试主要靠人工 现在自动化工具越来越强,Strix这样的自主渗透Agent就是代表 未来:AI红队Agent vs AI安全Agent的自动攻防
3. 从单点工具到平台化
以前是零散的工具,各测各的 现在往平台化发展:统一管理、统一报告、统一流程 Giskard、RedForge都是往平台走
4. 安全合规化
各国都在出台AI监管法规 AI安全测试会从"可选项"变成"必选项" 合规驱动的AI安全需求会爆发式增长
AI安全是一场猫鼠游戏——攻击在进化,防御也要进化。作为开发者和安全从业者,我们能做的就是持续学习、持续测试、持续加固,让我们的AI系统在对抗中不断变强。
夜雨聆风