
第一章 外采能力跟着服务走,自建又不知道落地效果
下面几个坑,每一个背后都是AI红队实实在在的业务风险。
坑一:横向移动第一跳就断 真实网络是多VLAN、多隔离区、多层代理的迷宫,AI工具的训练场景全是单目标单漏洞的直线赛道。想让它从跳板机跳到域控?它连中间隔几层代理都算不明白,第一跳就卡死。你的核心系统往往藏在内网深处,靠单点扫描根本测不到。 |
坑二:跑着跑着就失忆 第三步扫到的端口,第五步又扫一遍,还兴奋地报告"发现新端口"。PentestGPT论文自己承认LLM维持不了长期记忆,HackTheBox上10题只做出4道。你为了"效率"引入AI,结果它在原地打转、重复劳动,还多了一层"AI报告要不要信"的额外核实成本。 |
坑三:命令幻觉,编得有模有样 nmap参数能编一个不存在的,metasploit模块名张嘴就来。报错了不看错误信息,换个参数再来一遍。它不是在渗透,是在编故事——区别是故事的后果要你的生产系统扛。轻则触发安全运营中心误判、连夜应急响应,重则真的敲错命令碰到生产数据。 |
坑四:合规死结 AI跑到一半来一句"我无法协助此操作",安全护栏把合法命令也拦了。换本地Llama3啥都肯干,但成功率只有0到33%。用云端能力强但不合规,用本地无效——你在"数据安全事故"和"工具根本不好用"之间二选一,两条路都通不到生产环境。 |
第二章 通用Agent+业务Skill+工具集YAML:三层架构怎么搭
上一章的坑,本质上都是"关注点没分开"导致的。三层架构的核心思路就一句话:各管各的,别搅在一起。通用推理跟业务知识分开,AI决策跟人类审批分开,工具定义跟执行逻辑分开。
2.1 三层架构长什么样
三层核心架构——通用Agent、业务Skill、工具集YAML——加上贯穿三层的"人在环"控制,就是整个骨架:

2.2 通用Agent层:选对模型,比选对框架更重要
Agent层干的事就是把一个高层任务拆成一步步的Skill调用。跟外部工具"一头扎到底"不同,Agent的每步决策都有明确的输入、推理依据和输出——这就直接解决了"效果不可解释"的问题。但Agent层最关键的决策不是选哪个框架,是选哪个模型。
Atlanta发现80亿参数级别的模型在代码模式识别任务上往往优于超大模型:小模型够用,而且不容易"过度思考"把简单问题搞复杂。决赛整体漏洞检出率从半决赛37%飙到77%,修复率从25%到61%,还挖出18个0day。工程架构的优劣比模型大小更决定成败。
大 70B+ 云端/量化 复杂多步推理、横向移动、新漏洞分析 | 中 7B-33B 本地主力 代码识别、工具执行、命令生成 | 小 <8B 边缘/离线 枚举、简单命令,数据不出域 |
光选一个模型不够,实战中得用多模型协作。
落地建议:本地7B-33B模型干80%的活,云端大模型干20%的硬骨头(云端可选,本地化环境忽略云端模型)。中间加一层模型路由网关——敏感数据请求路由到本地,复杂推理任务脱敏后发云端。成本能降30%-60%,还满足数据不出域。
选模型这事,不是越大越好,是越匹配越好。
2.3 六层业务Skill模型:这才是自建AI红队真正的护城河
这层是自建最值钱的地方。Skill不是简单包一层工具,是把你团队脑子里的经验、血泪教训和组织知识全融进去。外部工具给不了你这个,因为它不认识你的环境。Skill的本质,就是把"只可意会"的安全经验变成"AI能执行"的结构化指令。

六层结构各管一件事:command管"干啥",cleanup管"擦干净",parsers管"结果怎么传给下一步",requirements管"什么条件才能跑",singleton管"别重复跑",timeout管"别卡死"。这种结构化定义让每个 Skill 都可测试、可审计、可复用。
但光有YAML骨架不够,关键是怎么把组织知识塞进去。我用三层编码法:


发布业务Skill —— 编码你的CI/CD和上线流程 |
你的发布窗口期是几点到几点、灰度发布先放哪个机房、CI/CD流水线里谁有权限触发生产部署、镜像仓库的信任链条——这些只有你自己知道。编码成Fact后,AI才知道"现在是发布窗口,可以针对性验证CI/CD权限逃逸和供应链投毒风险";非窗口期,AI会自动避开对发布系统的高风险操作,不会把上线搞崩。 |
内网横向业务Skill —— 编码你的组织边界和信任关系 |
不是"会用哪个横向移动工具",是"知道从这个业务线跳到那个业务线,中间隔着几层审批和网络隔离"。你公司总部和分子公司的域信任关系、办公网到生产网的桥接点在哪台跳板机、OA/ERP是不是常被当成横向跳板——这是一张只有你的安全团队和运维团队才画得出来的地图。AI靠这张图规划的横向路径,才是真正贴近攻击者会走的路径,而不是靠猜。 |
资金/交易业务Skill —— 编码你的接口分级和禁测清单 |
哪些接口碰了钱、碰了就必须L4禁止自动化测试,哪些是只读查询可以放开跑,支付网关和清结算系统的边界在哪——这套接口分级标准,是你风控、合规、业务部门坐下来一起定的,本身就是组织知识。编码成Skill后,AI不会对"看起来有漏洞但实际是业务设计如此"的接口报误报,也不会真的在生产资金链路上手滑。 |
数据分类分级Skill —— 编码你的数据安全红线 |
哪些字段碰一下就算重大数据安全事件(身份证号、银行卡号、健康信息),哪些数据出了内网就算违规——这套分级标准编码成Fact后,AI在验证漏洞时会自动判断"这条数据能不能截图放进报告",从源头避免验证过程本身变成一次数据泄露。 |
这四类只是举例,不同行业还有供应链业务Skill、多租户隔离Skill、监管报送业务Skill……凡是"外部人员进来要先培训半天才搞得懂"的业务规则,都是业务Skill层该编码的东西。这也是为什么自建团队的Skill库,用得越久越值钱——它是你公司业务演进的实时快照,外部工具永远慢你一拍,也永远没资格拿到这份地图。
2.4 工具集YAML层:统一管工具
这层解决的是"怎么安全地让AI调安全工具"。核心两件事:用YAML定义每个工具的能力边界(输入参数、执行平台、清理命令、前置条件),用标准协议统一调用。好处三个:权限最小化、沙箱隔离、全链路日志。每个工具的调用都有记录,谁调的、调了什么、返回了什么,全可审计。
2.5 人在环控制层:AI的刹车系统
这层是自建跟外部工具最本质的区别,也是能不能进生产环境的命门。说白了就一句话:不是AI说干啥就干啥,是你说能干才能干。
刚上线时L2以上全得人工批。跑久了,某个Skill的可靠性上来了、误报率降下去了,就逐步给这类操作松绑。从"人开车、AI导航"慢慢变成"AI开车、人盯仪表盘"。这才是渐进自主的正确打开方式——不是一步到位放权,是验证够了才松一档。
第三章 落地方法:从模型部署到系统验证
架构和Skill都讲完了,这章聊怎么落地。不是选几个开源项目拼一起,是一整套部署、数据、集成、验证和治理的方法组合。每一块都有坑,一个个来。
3.1 模型部署:本地为主的选型
本地模型服务有两个主流方案,差距不小:
建议:Ollama做开发测试,vLLM跑生产。但光部署不够,得有路由策略。先上L3策略路由就够用——
本 本地层 vLLM集群 涉及CMDB资产、凭据拓扑的请求走本地,7B-33B干80%的活 | 可选云 云端层 GPT-4/Claude 复杂多步推理脱敏后发云端,干20%的硬骨头 | 网 网关层 LLM Gateway 按数据敏感度自动路由,语义缓存命中率30%-50% |
AIxCC亚军Trail of Bits用非推理模型+优秀工程,每分钟成本181美元就达到顶级性能。加上语义缓存和本地优先路由,整体LLM调用成本降30%-60%。省钱不是抠门,是把预算花在刀刃上——编码组织知识比堆模型参数值钱得多。
3.2 三层数据管道:让AI吃透你的环境
模型部署好了,没数据管道就是巧妇难为无米之炊。三条核心管道各管一类知识:

三条管道各管一类知识:Fact 管硬数据(IP、端口、凭据),RAG 管情报策略(漏洞利用方式、攻击模式),微调数据管组织经验(历史处置方式、环境特定规律)。RAG 提供"软知识"检索,Fact 提供"硬数据"参数,Skill 执行时两者融合——RAG 给策略,Fact 给目标。
Fact 从四个维度编码组织知识,上一章提到的三层编码法落地到具体字段:

3.3 开源项目选型:不要0-1造轮子
架构、模型、数据都讲完了,具体用哪些开源项目?对比了一圈,选了"四件套"——

LangGraph管"怎么编排",MCP管"怎么调工具",CALDERA管"怎么定义Skill",RAG管"怎么补知识"——四件套各司其职,搭在一起就是AI红队的技术底座。
LangGraph 的 interrupt() 审批机制是给"人在环"做的工程支撑——任意节点暂停,等人批了再继续,静态断点和动态断点都支持:

工具协议选 MCP。MCP(Model Context Protocol)到 2026 年已有 3000+ 个 Server,安全领域有 mcp-security-hub(38 个独立 Server,覆盖 Nmap/Nuclei/SQLMap/Hashcat等300+工具,Docker化生产级加固)、CyberStrikeAI(100+工具,内置Skills系统和C2)、Google SecOps MCP(Chronicle 套件,Google 官方维护)。先复用现成的,不够再自己写。每个 Server 跑在独立 Docker 容器里,cgroups 限好资源(CPU 30 秒超时、内存 100MB 封顶)。
MCP 安全模型的核心:服务端是唯一信任根,LLM 说的话永远不能信。
Skill 定义选 CALDERA Ability + Atomic Red Team。CALDERA的Ability YAML 做定义标准(含变量替换和 Fact 系统),Atomic Red Team 当通用工具库底子(2000+ATT&CK技术覆盖,6660+社区提交),通过CALDERA的Atomic插件直接集成。
3.4 系统验证:上线前得过四关
红队测试不等于安全基准测试——基准是系统化度量,红队是探索性发现,两者互补但不可替代。AI红队系统上线前,得过四关:

人的要素至关重要。AI红队系统自身的安全,跟它要测的目标系统一样重要。
3.5 治理框架对接:合规不是事后补
AI红队进生产,合规是设计阶段就要嵌入的约束。2026年三大标准框架形成完整闭环:

每个OWASP风险项都能在三层架构里找到对应的防御点——Prompt注入对应输入净化层+输出约束白名单;敏感信息泄露对应脱敏代理管道;过度授权对应Behavior Policy as Code。合规不是上线后补的作业,是设计阶段就嵌入架构的约束。
第四章 实际问题,一个个解决
前面聊了坑、画了骨架、讲了落地方法。这章把四者揉到一起,给出每个实际问题的具体解法。每个问题给出"病因→药方"配对,照着做就行。
4.1 安全设备拦截 → 流量伪装Skill

4.2 误报与判错 → 置信度分级
核心设计:每个AI发现都得附带能复现的验证步骤——具体请求payload、目标URL、预期响应特征。安全团队可以自己跑一遍确认真假。LangGraph审计日志记完整推理链路,把"AI说有漏洞"变成"AI给出能验证的证据"。
问题 30%-60%命令幻觉率,一半的"发现"可能是AI瞎编的。判错了还没人负责。 |
怎么破 LangGraph在漏洞验证后插一个置信度评估节点,低于阈值的自动进人工复核队列。每个发现必须附带能复现的验证步骤。 |
4.3 合规与能力矛盾 → 分层部署+脱敏代理

4.4 横向移动断裂 → 拓扑感知+多跳推理

4.6 命令幻觉 → 三道防线

第五章 四步走:从影子运行到紫队协同
AI红队建设不是一步到位的事。见过太多团队想一口气吃到L4,结果第二阶段就翻车,整个项目被叫停。基于NIST AI RMF和CTEM框架,分四个阶段:渐进自主不是"尽快自主",是"安全可控地自主"。上一阶段没达标,不许进下一阶段——这条铁律没有例外。
第一阶段 影子运行(0-3个月) |
目标:不影响生产,先把基线建起来。LangGraph搭Agent骨架,接MCP Server的Nmap/Nuclei,用CALDERA做3-5个基础Ability,初始化Fact知识库。 达标:Agent在测试环境跑通端到端评估;全链路审计日志稳定采集;基线指标建立。 |
第二阶段 辅助模式(3-6个月) |
目标:人工监督下进生产,AI当"副驾驶"。配LangGraph interrupt()审批节点,L2以上强制人工确认;开发流量伪装Skill;接Atomic Red Team覆盖OWASP Top 10;引入RAG知识库。 达标:评估效率提升30%+;误报率低于20%;Skill库覆盖OWASP Top 10。 |
第三阶段 渐进自主(6-12个月) |
目标:从"AI辅助人"变成"AI开车、人盯仪表盘";启动紫队协同。L0-L1逐步放开自动执行;开发横向移动Skill;部署输入净化层+输出约束层;CALDERA GameBoard可视化红蓝联合演练。 达标:L0-L1自动执行率超80%;L2操作AI预判准确率超70%;紫队协同跑通至少一个完整周期。 |
第四阶段 持续验证(12个月+) |
目标:AI红队变成CTEM验证阶段的核心引擎,持续监控攻击面。接资产变更事件流,新系统上线自动触发评估;CALDERA Debrief出报告对接CTEM Mobilization;红蓝自动化对抗。 达标:新资产24小时内完成自动评估;高危漏洞发现时间缩短50%+;覆盖核心系统90%+攻击面。 |
第六章 真实案例与建设清单
光讲框架不接地气,得看真实案例。两个案例基于行业实践整理,隐去了具体组织,但经验是实打实能复用的。
6.1 某金融机构:从外部工具翻车到自建Agent
怎么翻的车 某全国性金融机构直接引入外部AI渗透工具测核心交易系统。AI生成的payload触发WAF批量告警,安全运营中心以为真被攻击了,启动应急响应,运维团队白忙一晚。事后一查:AI工具不知道目标WAF的规则特征;请求频率超了WAF速率阈值;工具压根没有操作后果感知。 |
怎么建的 第一阶段(2个月):LangGraph搭骨架,测试环境验证。重点做了"WAF感知Skill"——把自家WAF检测规则编码成CALDERA Fact,AI生成payload前先查会不会被拦。 第二阶段(4个月):进辅助模式,interrupt()管L2+审批。做了"业务上下文Skill"——交易系统接口分级标准编码成Fact,涉及资金的标L4禁止测试,只读的允许L1自动跑。误报率直接降了40%。 第三阶段(3个月):渐进自主。800+次操作数据攒够了,L0-L1自动执行率到85%。CALDERA GameBoard每周自动扫一轮。 |
三条经验 一:WAF规则Skill化是进生产的前置条件。不解决这个,AI能力再强也白搭。 二:业务上下文Skill价值超出预期。接口分级标准编码成Fact后,AI不再对"看起来有漏洞但实际是业务设计如此"的接口报误报。 三:渐进自主得有数据撑。前两阶段的操作数据是后面放权策略调优的依据。 |
6.2 某政务云:CTEM框架下的持续验证
背景 某省级政务云承载多部委系统,安全评估需求大但人手不够。人工渗透每年只能覆盖30%核心系统,大量资产长期处于"安全盲区"。引入CTEM框架,把AI红队作为验证阶段的核心引擎。 |
怎么建的 架构:政务数据全在本地模型层处理,只有脱敏后的通用推理任务发云端。脱敏代理层确保IP换占位符、域名泛化、凭据剥离。 Skill:重点做了"多租户隔离感知Skill"——政务云多租户,AI得精确感知租户边界。隔离策略编码成CALDERA Fact,Agent规划路径时自动规避跨租户操作。 CTEM集成:AI红队接资产变更事件流,新系统上线自动触发评估。结果按CTEM优先级排序,高危发现自动通知对应租户安全负责人。 |
三条经验 一:分层部署有效化解了合规矛盾。脱敏代理层的彻底性是关键——能还原出真实资产信息的传输就是合规风险。 二:CTEM给了AI红队"持续验证"的方法论支撑。价值不在"一次性渗透",在"持续监控+自动验证"。 三:多租户环境的拓扑感知Skill是政务云关键。隔离策略编码成Fact,从根本上避免跨租户影响。 |
6.3 建设清单:照着勾就行


6.4 成熟度模型:AI红队结合CTEM,你在哪一层


外采红队的钱买的是服务,自建AI红队攒的是资产。 三层架构的核心不是技术多先进,是把"对你环境的理解"真正沉淀下来。通用Agent是大脑,业务Skill是你家的老员工,工具集YAML是工具箱,人在环是刹车。三层之间用标准接口通信,可以单独改Skill库不影响Agent逻辑,也可以换底层工具不动YAML定义。 落地四步走,从影子运行到紫队协同,每一步都得验证够了才往下走。开源四件套搭底座,数据管道持续喂,系统验证四关把关,治理框架从设计阶段嵌入——这不是追技术潮流,是把安全能力的控制权拿回自己手里。 工具可以买,但对你环境的理解买不来——这恰恰是最大的护城河。 |
夜雨聆风