elder-plinius/T3MP3ST 是一个用于授权安全测试的多 Agent 框架。它可以接入本机已有的 Claude Code、Codex、Hermes、OpenCode、Oh My Pi,也能连接 Ollama、LM Studio、vLLM 等本地模型。官方当前把 Recon、任务引擎、War Room、HTTP API 和 MCP 接口列为可用能力;八个操作员协同完成端到端利用仍未经过完整基准验证。本文只讲安装、配置和验证,不提供攻击 payload、绕过或反检测步骤。
目录
Step 1授权与合规前提
官方 README 要求只对自有或已获书面授权的系统运行,并把授权、测试范围和后果责任交给操作者。实际开始前,至少要写清目标域名或网段、允许的测试动作、时间窗口、数据处理方式和紧急联系人。若这些边界没有书面记录,就不要启动任务。
适合的场景包括自有系统的红队演练、有 SOW 与 rules of engagement 的渗透测试、CTF 和专用靶场。涉及客户或第三方系统时,应让负责合规或法律事务的人审阅授权范围。
Step 2安装 T3MP3ST(npm)
官方 docs/GETTING_STARTED.md 和 package.json 当前都要求 Node.js 22.19+ 与 npm。从 GitHub 克隆并安装依赖:
git clone https://github.com/elder-plinius/T3MP3ST.git cd T3MP3ST npm install
安装完成后可以启动 War Room 与 CLI。官方 README 在本次核对时列出默认 36 个内置工具;设置 T3MP3ST_FULL_ARSENAL 后总数为 111。工具清单变化快,升级后应重新运行 npm run verify-claims。
Step 3启动 War Room
npm run server
浏览器访问 http://127.0.0.1:3333/ui/ 就是 War Room 界面。它同时启动了 HTTP API(例如 POST /api/mission/start、GET /api/mission/status)供脚本或 MCP 客户端调用。
http://127.0.0.1:3333/ui/。若需要远程访问,先确认 server 实际监听地址与防火墙策略,然后优先用 SSH 端口转发(ssh -L 3333:127.0.0.1:3333 user@host)连过来,而不要把 3333 端口直接暴露到公网。
Step 4配置 provider(keyless / API key / 离线三选一)
T3MP3ST 允许三种后端选择,根据你手里已有的资源挑一种即可。
方式 A —— 接本地 AI 编程 Agent
如果机器上已经装好并登录 Claude Code、Codex、Hermes、OpenCode 或 Oh My Pi,可以在 War Room 的 Settings 里连接对应 Agent。这个路径复用现有登录状态,不要求再给 T3MP3ST 配一把新的模型 API key;上游 Agent 自身的账号与费用仍按其规则计算。
方式 B —— API key 直连
不想通过本地 Agent,也可以直接给 T3MP3ST 一把 API key,跳过 Settings 里的连接步骤:
export OPENROUTER_API_KEY=... # 或 export VENICE_API_KEY=... export ANTHROPIC_API_KEY=... export OPENAI_API_KEY=... export XAI_API_KEY=... # Grok Build(grok-build-0.1)—— xAI 编码模型,原生 tool-calling
方式 C —— 完全离线(Ollama / LM Studio / vLLM / llama.cpp)
如果需要在无外网环境跑(比如封闭内网靶场),把 provider 指向本地 OpenAI 兼容端点:
ollama serve && ollama pull llama3 export TEMPEST_LOCAL_BASE_URL=http://localhost:11434/api # LM Studio 用 http://localhost:1234/v1 export TEMPEST_LOCAL_MODEL=llama3 npx tempest config # 选 "Change default provider" → local
作者说明工具调用是基于文本驱动的,即使本地模型不支持原生 function-calling,Arsenal 依然可用。
T3MP3ST_LOCAL_AGENT_TIMEOUT_MS(每次 CLI 调用)、T3MP3ST_TASK_TIMEOUT_MS(mission task)、T3MP3ST_GENERAL_TIMEOUT_MS(规划请求)。
T3MP3ST_FULL_ARSENAL=1 后共 111 个。metasploit、hydra、pacu、frida 等危险或仅目录可见的驱动走受限审批路径;不要把“出现在目录中”误写成“默认可直接执行”。
Step 5验证安装与自报数据
T3MP3ST 的一个卖点是所有跑分都可重算。安装完成后先跑一次数据验证:
npm run verify-claims
它会从 bench/ 目录里已提交的数据重算 README 中的 headline 数字。官方 README 在 2026-09-23 显示 27/27 全绿。作者当前公开的主要结果:
- XBEN(XBOW 104 challenge suite,黑盒):pass@1 平均 90.1%(Wilson-95 置信区间 86.2–92.9%),floor 91/104。XBOW 自报 85%,同一套件下 T3MP3ST 更高一档,作者提供了 committed artifact 供逐题复算。
- Cybench(40 道学术题 / Opus 4.8 / 无 hint):23/40(58%)hint-free 单跑 pass@1;不是 pass@10 的最好一次。
- CVE-Zero(10 个 post-cutoff 2026 CVE、7 种语言、模型训练 cutoff 之后才公开):单 Agent 8/10 精确到 file / line / CWE,10/10 找到;样本 n=10 是方向指标,不是最终排名。
需要注意的边界:这些跑分都是单 Agent ReAct 循环的结果,不是 8 个操作员的协同 swarm;作者在 README 里明确"the swarm is the part still earning its stripes"(swarm 端到端 exploitation 尚未 benchmark,仍不稳定)。verify-claims 只重算 graded verdict(判定通过/失败),不重放原始工具输出(出于操作员隐私剥离)。
框架组件速览(8 操作员与覆盖域)
作者按 MITRE ATT&CK / Cyber Kill Chain 组织了 8 个操作员。Recon 是已 benchmark 的 live tool-backed 引擎;Exploiter / Infiltrator / Exfiltrator / Ghost 也跑与 Recon 同款的真实 tool-backed ReAct 循环(用真实 exploit 工具,不是 stub),但作者说明当前 headline 跑分来自单 Agent 路径,8 个操作员协同的 swarm 与端到端 swarm exploitation 尚未 benchmark、仍不稳定:
| 操作员 | Kill Chain 阶段 | MITRE | 说明 |
|---|---|---|---|
| Recon | Reconnaissance | TA0043 | OSINT、网络发现、资产枚举(driver:nmap / DNS / HTTP / fingerprinting,实测 live) |
| Scanner | Discovery | TA0007 | 漏洞扫描与服务指纹 |
| Exploiter | Initial Access | TA0001 | 利用与 payload 投放 |
| Infiltrator | Lateral Movement | TA0008 | 后利用与权限提升 |
| Exfiltrator | Collection / Exfil | TA0009/10 | 数据提取与凭据回收 |
| Ghost | Persistence | TA0003 | 持久化、隐蔽、清理 |
| Coordinator | Command & Control | TA0011 | 任务调度与编排 |
| Analyst | Analysis | — | 模式分析与报告 |
作者的 What It Hunts 应用域表(README 原表,本教程只做翻译不做扩写;README 另有一份 Coverage by domain 表拆分了 Web / Code / CTF / Network / Supply chain / Identity 等 11 个 domain 与更细粒度的状态,详见 上游 README):
| 域 | 范围 | 状态 |
|---|---|---|
| Web 应用 | 黑盒外部攻击者视角的 recon → exploit(XBEN 套件) | ✅ 稳定 |
| CTF | 无 hint、沙箱隔离的题目求解(Cybench) | ✅ 稳定 |
| 机器人 / OT / 嵌入式 | OSS 漏洞挖掘 + 协调披露 pipeline(OSV + live-PoC + refuter) | ✅ Pipeline 稳定 |
| 源代码审计 | 白盒仓库分析 | ⚠️ 多语言 ingest 仍属实验功能;Python 保留专用解析,其他语言解析失败时可能没有提取结果 |
| 智能合约 | Damn Vulnerable DeFi | ⚠️ 复现已知漏洞类,不是原创发现 |
| Cloud(IaC) | Misconfig 检测 cloud:bench + 可选云工具集 | 🚧 IaC 检测框架,live-cloud 利用未 benchmark |
| Mobile | 静态分析 mobile:bench + 可选工具集 | 🚧 静态检测框架,动态利用未 benchmark |
| Binary / RE | 反编译输出的 sink 检测 binary:bench + 可选工具集 | 🚧 sink 静态检测,solving / pwn 未 benchmark |
SCOPE DENIED)。这是相对裸跑工具更严格的默认行为,但护栏本身不能代替授权——写错 scope、绕过 gate 或运行未 gate 的第三方工具时依然可能超范围。
与 Strix 怎么选
两者都面向授权的自动化安全测试,但入口不同。T3MP3ST 的官方文档强调 War Room、CLI、HTTP API、MCP 和复用本机已登录的编码 Agent;Strix 的官方 Quick Start 以 Docker、LLM API key 和 strix --target 为起点,并把代码仓库、运行中的 Web 应用和 CI 扫描作为主要工作流。
| 选择条件 | T3MP3ST | Strix |
|---|---|---|
| 已有本地编码 Agent,希望复用登录 | 官方提供 keyless 本地 Agent 路径 | 官方开源 Quick Start 默认要求 LLM API key |
| 希望直接对仓库或 Web 目标启动一次扫描 | 先启动 War Room 或 CLI,再配置任务与范围 | strix --target 是官方主路径 |
| 依赖条件 | Node.js 22.19+;不同 provider 还有各自要求 | Docker;开源本地模式还要 LLM API key |
| 当前证据边界 | 官方强调可重算的单 Agent 跑分,并明确 swarm 尚未验证 | 官方提供 XBEN 结果和独立 benchmark 仓库入口 |
需要 War Room、MCP 或复用本地 Agent 时先看 T3MP3ST;希望以一个目标参数启动应用安全扫描、接进 CI 时先看 Strix。两者都不能替代授权、人工复核和修复后的重新验证。对比依据为 T3MP3ST README 与 Strix README,核对日期 2026-09-23。
本次核对记录
- 核对范围:官方 README、
package.json、Getting Started、API Reference、FEATURES 和 GitHub Releases。 - 确认版本:最新正式 release 为 v1.0.0,GitHub 显示发布于 2026-09-08。
- 确认命令:
npm install、npm run server、War Room 地址和npm run verify-claims均能在官方材料中对应。 - 验证状态:本次是官方文档与仓库资料核对,没有在本机安装依赖,也没有对任何目标运行安全测试。文中的跑分是项目作者公开结果,不是本站复测结果。
- 仍需现场确认:所选 provider 的登录状态、本地模型兼容性、第三方工具可用性和具体任务耗时。
这里仅补原教程没有展开的事实和边界。安装命令与操作步骤仍以前文为准。
先判断这个项目是否适合你
采用建议
适合需要 War Room、MCP、HTTP API,或希望复用本地编码 Agent 的授权安全测试团队。采用前要把单 Agent 已验证结果与 swarm 实验能力分开看,并在隔离且书面授权的环境中复核 provider、工具与 scope。
原教程未展开的系统信息
核心功能
War Room、CLI、HTTP API 与 MCP
可以从浏览器界面或 CLI 启动任务,也提供本地 HTTP API 和 MCP 的 security_recon 接口。
FAQ
T3MP3ST 是什么?
AGPL-3.0 开源的授权安全测试框架,可把已装的 AI 编程 Agent、API provider 或本地模型接到 War Room、CLI、HTTP API 和 MCP。官方当前把默认 Arsenal 数量列为 36,并明确协调式 8 Agent swarm 尚未完成端到端基准验证。
T3MP3ST 只能做合法的授权测试吗?
是。必须是(1)你自有系统 / (2)有书面授权的目标 / (3)CTF 或专用靶场之一,任何未授权访问都可能违法。
T3MP3ST 怎么安装?需要什么环境?
Node.js 22.19+,然后 git clone https://github.com/elder-plinius/T3MP3ST.git && cd T3MP3ST && npm install,最后 npm run server 打开 War Room(http://127.0.0.1:3333/ui/)。
T3MP3ST 可以完全离线用本地模型跑吗?
可以。ollama serve && ollama pull llama3 后设置 TEMPEST_LOCAL_BASE_URL 与 TEMPEST_LOCAL_MODEL,npx tempest config 选 local provider。也支持 LM Studio(http://localhost:1234/v1)、vLLM、llama.cpp 等 OpenAI 兼容端点。
跑分(XBEN 90.1%、Cybench、CVE-Zero)能自己验证吗?
可以。npm run verify-claims 从 bench/ 的已提交数据重算 headline;官方 README 在 2026-09-23 显示 27/27 全绿。它复算已提交 verdict,不重放已移除的逐步 transcript。所有 headline 跑分基于单 Agent ReAct 循环,8 操作员协同尚未完成端到端基准验证。
T3MP3ST 会把攻击流量发到我没授权的目标吗?
默认开启 egress-scope containment:不在 mission target 及子域 / loopback / 私网范围内的公网主机会被拒绝(SCOPE DENIED)。这是相对裸跑工具更严格的默认,但护栏不能代替授权。
完整文档在哪里?
本教程只覆盖安装 / 配置 / 验证。作者原文 README 与 docs/ 目录才是权威源,特别是 github.com/elder-plinius/T3MP3ST、SCOPE_AND_AUTHORIZATION.md(授权模型与 scope 收据)、VERIFIED_PROVENANCE.md(发现如何变成工具证明而非模型断言)、INSTALL_MATRIX.md(macOS / Linux 就绪度表)、INTEGRITY_LEDGER.md(污染审计与撤回历史)。
本教程基于 T3MP3ST 公开材料(GitHub: elder-plinius/T3MP3ST 与 README + docs/)撰写,命令、环境变量、跑分数字、应用域状态表均以作者原文为准;T3MP3ST 是活跃项目,如有差异以最新官方文档为准。License AGPL-3.0。
再次强调:本教程只覆盖安装、配置、验证三件事,不涉及具体攻击 payload、绕过技巧、反检测方法或针对特定目标的攻击配置。使用前必须获得书面授权并遵守 rules of engagement。NGJOO AI 实验室 · 更新于 2026-09-23。