乐于分享
好东西不私藏

T3MP3ST——ai安全元工具(agent自动化找漏洞)

T3MP3ST——ai安全元工具(agent自动化找漏洞)

项目地址

https://github.com/elder-plinius/T3MP3ST

项目概述

T3MP3ST是一个开源的自主红队平台,它将通用AI编码智能体(如Anthropic Claude Code、OpenAI Codex、Hermes等)转化为自主进攻安全操作员。于2026年7月初发布,迅速在GitHub上 trending,获得约 2,900 Stars 和 675 Forks

T3MP3ST 的独特之处在于它不提供自己的AI模型,而是作为一个多智能体编排层运行,协调多个智能体实例通过完整的侦察→利用→报告杀伤链。用户只需将框架指向已授权的目标,本地运行的AI编码智能体即成为驱动任务的"作战大脑"。


 核心设计理念

 无密钥作战 (Keyless Warfare)

T3MP3ST 的核心设计哲学是"无密钥作战"——它复用操作员已有的智能体会话,而非要求独立的提供商凭证或计费安排。这意味着无需新API密钥、无需额外云基础设施、无需额外计费。

范围外溢控制 (Egress-Scope Containment)

框架强制执行出站范围控制,确保网络工具自动拒绝与授权范围之外的公共主机交互。这是防止误操作和确保合法性的关键安全机制。

 可验证声明 (Verify-Claims)

项目采用严格的可复现性标准。README中的每个数字都通过提交的数据重新计算,npm run verify-claims命令可重新推导所有结果(24/24全部通过)。每个解题结果都对照已提交的flag oracle进行评分。


 系统架构

┌─────────────────────────────────────────────────────────────┐
│                        用户层                                │
│  ┌──────────────┐  ┌──────────────┐  ┌──────────────┐      │
│  │   War Room   │  │     CLI      │  │   HTTP API   │      │
│  │  (Web界面)    │  │ (命令行)      │  │  (REST API)  │      │
│  └──────┬───────┘  └──────┬───────┘  └──────┬───────┘      │
└─────────┼─────────────────┼─────────────────┼──────────────┘
          └─────────────────┼─────────────────┘
                            ▼
┌─────────────────────────────────────────────────────────────┐
│                    编排层 (Orchestration)                     │
│  ┌──────────────────────────────────────────────────────┐   │
│  │              Mission Engine + Op Admiral              │   │
│  └──────────────────────────────────────────────────────┘   │
│  ┌──────────┐ ┌──────────┐ ┌──────────┐ ┌──────────┐       │
│  │  Recon   │ │ Scanner  │ │Exploiter │ │Infiltrator│      │
│  └──────────┘ └──────────┘ └──────────┘ └──────────┘       │
│  ┌──────────┐ ┌──────────┐ ┌──────────┐ ┌──────────┐       │
│  │Exfiltrator│ │  Ghost   │ │Coordinator│ │ Analyst │       │
│  └──────────┘ └──────────┘ └──────────┘ └──────────┘       │
└─────────────────────────────────────────────────────────────┘
                            │
                            ▼
┌─────────────────────────────────────────────────────────────┐
│                  AI智能体层 (Agent Layer)                     │
│  ┌──────────────┐  ┌──────────────┐  ┌──────────────┐       │
│  │ Claude Code  │  │ OpenAI Codex │  │   Hermes     │       │
│  └──────────────┘  └──────────────┘  └──────────────┘       │
└─────────────────────────────────────────────────────────────┘
                            │
                            ▼
┌─────────────────────────────────────────────────────────────┐
│                   工具层 (Arsenal Layer)                      │
│  ┌──────────┐ ┌──────────┐ ┌──────────┐ ┌──────────┐       │
│  │  nmap    │ │ nuclei   │ │feroxbuster│ │  custom  │       │
│  └──────────┘ └──────────┘ └──────────┘ └──────────┘       │
└─────────────────────────────────────────────────────────────┘

技术栈:TypeScript(主要语言)、Web界面(War Room)、CLI、MCP Server、HTTP API。


八操作员杀伤链

T3MP3ST 将完整的进攻安全流程映射为8个操作员角色,对应MITRE ATT&CK战术和传统网络杀伤链:

操作员
英文
职责
映射
侦察员
Recon
信息收集、目标发现、资产枚举
MITRE: Reconnaissance
扫描员
Scanner
漏洞扫描、服务识别、配置审计
MITRE: Discovery
利用员
Exploiter
漏洞利用、Payload生成、攻击执行
MITRE: Exploitation
渗透员
Infiltrator
权限提升、横向移动、持久化
MITRE: Lateral Movement
渗出员
Exfiltrator
数据提取、隐蔽传输、痕迹清理
MITRE: Exfiltration
幽灵
Ghost
反取证、隐蔽通信、规避检测
MITRE: Defense Evasion
协调员
Coordinator
任务调度、资源分配、冲突解决
编排核心
分析师
Analyst
结果分析、报告生成、风险评估
报告输出

当前状态

操作员
状态
说明
Recon (侦察)
稳定
 ✅
已基准测试,工具支持的推理循环
Scanner (扫描)
稳定
 ✅
与Recon类似的工具支持循环
Exploiter (利用)
稳定
 ✅
单智能体ReAct循环已基准测试
Infiltrator ~ Analyst
实验性 ⚠️
推理循环可用,协调群攻未大规模验证

完整的8操作员集群是架构目标。目前Recon引擎和单智能体利用循环已稳定并经过基准测试,下游操作员仍处于实验阶段。


核心功能模块

 Recon Engine(侦察引擎)

一个实时的、工具支持的引擎,驱动nmap、DNS、HTTP和指纹识别工具。每个发现都追溯到真实工具输出,确保侦察结果的准确性和可靠性。

 Mission Engine + War Room + Op Admiral

  • Mission Engine:驱动整个杀伤链的核心引擎

  • War Room:基于Web的指挥界面,用户可用自然语言描述目标并发起攻击

  • Op Admiral:任务指挥系统,协调各操作员之间的协作

 Arsenal, MCP Server, HTTP API

  • Arsenal:35个内置进攻工具 + 83个可选扩展工具 + 48个适配器

  • MCP Server:Model Context Protocol服务器,便于与其他系统集成

  • HTTP API:提供RESTful接口,支持外部系统调用

 Egress-Scope Containment(出站范围控制)

确保网络工具拒绝与授权范围之外的公共主机交互。这是防止误操作和越权测试的关键安全机制。

Coordinated-Disclosure Pipeline(协调披露管道)

包含OSV Novelty(开源漏洞新颖性检查)、Live PoC(实时概念验证生成)、Refuter Panel(反驳面板)、CVSS Scoring(CVSS评分自动计算)。


 基准测试与性能评估

 XBEN套件(黑盒测试)

指标
结果
基准
XBOW 104挑战XBEN套件
pass@1得分
90.1%
XBOW自报基准
~85%
验证方式
已提交flag oracle,verify-claims命令复现

 Cybench(学术基准)

指标
结果
基准
Cybench 40任务学术基准
单智能体ReAct循环
23/40
 无提示解题

真实CVE识别(2026年)

指标
结果
测试集
10个2026年真实CVE
覆盖语言
7种编程语言
单智能体精确命中
8/10
(精确到文件、行号、CWE分类)
工具包整体发现
10/10
(全部发现)
关键说明
CVE披露日期晚于模型训练截止,排除记忆可能

开发者指出,虽然样本量较小,但CVE日期晚于模型训练截止,排除了记忆化的可能性,结果具有方向性意义。

 领域覆盖状态

领域
状态
说明
Web应用 (XBEN套件)
稳定,已基准测试
核心能力
CTF挑战 (Cybench)
稳定,已基准测试
核心能力
嵌入式/OT/机器人开源
管道稳定,协调披露
生产可用
源代码(白盒)
实验性,仅Python
开发中
智能合约 (DeFi)
实验性,仅复现
开发中
云、移动、AD、二进制RE
路线图/开发中
未来规划

部署与使用

快速开始

# 克隆仓库
git clone https://github.com/elder-plinius/T3MP3ST.git
cd T3MP3ST

# 安装依赖
npminstall

# 验证声明(复现所有基准测试结果)
npm run verify-claims

# 启动War Room界面
npm run war-room

# 使用CLI
npm run cli -- --target<授权目标>

使用模式

War Room模式:启动Web服务器,在浏览器中用自然语言描述目标,系统自动分配操作员执行杀伤链。

CLI模式

npm run cli -- --target https://example.com --scope example.com
npm run cli -- --target https://example.com --phase recon

MCP Server集成

npm run mcp-server