网络安全渗透测试AI Agent多智能体人工智能应用安全代码智能体红蓝对抗【免费下载链接】T3MP3STautonomous red teaming platform; multi-agent offensive-security meta-harness项目地址https://gitcode.com/gh_mirrors/t3/T3MP3ST点击查看免费下载导读本文围绕 T3MP3ST自主红队平台与 OBSIDIVM漏洞靶场与权威评分服务联合演化循环产出的“学习战术累积器”Learned Tactics Accumulator展开。该累积器以bench/obsidivm-evolution/gen-001/accumulator-after.md为第一代存档样本记录了一批经消融ablation剪枝后存活下来的红队探测战术——它们并非人工编写的攻击手册而是从 LLM 猎手hunter在一代基准测试中的漏报miss反推、再由演化引擎自动提炼并验证的“高杠杆”提示注入资产。读完本文你将理解这套战术从漏报到生成、从自动接受到消融淘汰的完整生命周期掌握每条战术的具体探测步骤与证据判定模式并能在自己的基准运行中复用它提升命中率。一、这套“学习战术”是什么从漏报中反向生长的红队知识在 T3MP3ST × OBSIDIVM 的架构中OBSIDIVM 是靶场与裁判提供/api/spec目标清单与/api/score/text权威评分T3MP3ST 是执行武器派发猎手任务、收集证据两者通过 obsidivm-bench.mjs 端到端串联完整架构见 docs/OBSIDIVM.md。演化循环由 obsidivm-evolve.mjs 驱动的核心洞见是每一次基准运行都会暴露若干“应该命中却漏掉”的预期发现missed expected findings而这些漏报恰恰是猎手提示词system prompt里的知识盲区。把每个漏报转化为一条“如果下次猎手照做就能命中”的战术指令追加到猎手提示词的 “LEARNED TACTICS” 段下一代的命中率就会随之提升——这就是 obsidivm-evolve.mjs 注释中描述的“改进跨代复利”improvements compound across generations。accumulator-after.md正是这套机制的产物存档它记录了第一代gen 001经消融剪枝后存活的 4 条战术并在头部标注了元数据These tactics survived ablation pruning. Sorted by lifetime lift contribution. Total alive: 4. Last rebuild: 2026-05-27T10:38:19.797Z.注意“Sorted by lifetime lift contribution”——文件中的顺序不是随机的而是按每条战术在整个生命周期中贡献的“lift”检出提升量排序这是消融账本proposals-ledger给出的排序依据见下文第四节。二、战术条目的结构解剖目标 / 探测步骤 / 证据模式 / 分级每条战术遵循统一的四段式结构可以被 LLM 猎手直接当作可执行指令读取。以文件中的四条为例逐条拆解1. dvwa/DVWA-012 — Brute Force (No Lockout) lift 0, conf 0.87, gen 001针对 DVWA端口 4280的“无锁定暴力破解”探测战术目标端点/login.php或/vulnerabilities/brute/操作量级15 次快速 POST使用变化的凭据组合admin/pass1、admin/pass2…确认标准负面证据模式连续 10 次失败尝试后仍没有账号锁定、CAPTCHA 或限流发生判定证据HTTP 200 持续返回且无延迟/阻断或在无前置锁定的情况下用有效凭据直接拿到成功提示。这条战术的价值在于它把“暴力破解可行”定义为一个可验证的负面证据absence-of-control 即漏洞成立而不是要求猎手真的攻破账号。其提案来源见 proposals.json明确指出漏报原因是猎手“未执行足够多的连续认证尝试来触发并观察锁定机制的缺失”而该战术通过 15 的体积阈值和明确的负面证据模式补齐了这一盲区风险备注则建议在已知训练环境之外加入 2 秒间隔以避免误伤存在防御机制的目标。2. juice/JUICE-012 — Robots.txt Disclosure lift 0, conf 0.92, gen 001针对 Juice Shop端口 4300的 robots.txt 披露侦察战术时机在 disclosure披露类别的第一步侦察中无条件探测/robots.txt解析内容Disallow条目往往暴露隐藏路径如/ftp、/support、/promotions确认方式对任一被揭示的路径发起请求200/403 响应即证明披露成立记录方式以Robots.txt Disclosure、severityinfo 记入日志。提案理由强调该检查是“确定性的”文件存在与否是客观事实几乎不可能产生误报且属于被动侦察、不扩展攻击面提案本身也明确指出这是标准侦察而非攻击向量。3. webgoat/GOAT-006 — Insecure Deserialization lift 0, conf 0.82, gen 001针对 WebGoat端口 4380的不安全反序列化主动探测战术探测对象所有接受序列化对象的端点Java、XML、带类型提示的 JSON载荷手法注入 ysoserial URLDNS gadget 链或利用多态类型混淆polymorphic type confusion辅助判据观察响应中是否出现ObjectInputStream、readObject()或反序列化库相关的栈追踪终极确认通过带外 DNS 回调out-of-band DNS callback或基于时间的延迟证明对象重建期间发生了代码执行。这是四条中攻击性最强的一条category 为 injection、severity high。其风险备注同样诚实合法序列化端点可能造成误报、时间型探测可能触发限流、OOB 回调依赖网络策略允许的外联基础设施。4. wordpress/WP-009 — Security Headers Missing lift 0, conf 0.92, gen 001针对 WordPress端口 4500的安全响应头缺失检测战术前置完成 banner/服务确认之后操作对/发起 HEAD 请求并解析响应头判定规则X-Frame-Options、X-Content-Type-Options、Strict-Transport-Security、Content-Security-Policy中任一缺失即标记 WP-009证据要求将完整的响应头清单header inventory写入 evidence 字段分级INFO不可利用但用于记录加固缺口。该战术强调“被动观察即可完成”风险仅在于会在所有缺少现代安全头的 WordPress 目标上产生 INFO 发现——但这是“安全态势评估完整性”的预期行为而非缺陷。三、演化引擎如何把这些战术“长”出来六阶段流水线要理解累积器为什么长这样需要看 obsidivm-evolve.mjs 中runGeneration()的六阶段实现它每一代依次执行Phase 1 — bench以指定的 hunter 模式stub/live/t3mp3st运行 obsidivm-bench.mjs产出bench-report.jsonPhase 2 — miss analysis调用extractMisses()遍历每个目标的verdict.results把detected: false的预期发现收集为漏报清单含 target_id、finding_id、title、severity、categoryPhase 3 — proposal generation对每个漏报生成战术提案——live/t3mp3st模式调用 LLM 评判器默认claude-sonnet-4-5按JUDGE_PROPOSAL_SYSTEM提示词输出严格 JSON{tactic, confidence, rationale, risk}stub模式则用启发式合成取预期发现的关键词置信度固定 0.65Phase 4 — auto-accept按--accept-threshold默认 0.7自动接受置信度达标的提案写入accepted.jsonPhase 5 — apply把接受的提案追加进累积器current.mdPhase 6 — ablation调用 obsidivm-ablate.mjs 的runAblation()更新提案账本、剪除死重deadweight、从存活集合重建累积器最后snapshotAccumulator()将重建后的状态快照为accumulator-after.md。这解释了accumulator-after.md的标题“curated by ablation”该文件不是提案的简单拼接而是消融筛选后的存活集合——accumulator-before.md本代开始前的快照为空、accumulator-after.md重建后的快照恰好 4 条正好对应 Phase 6 的重建语义。四、消融剪枝的底层原理lift 账本与死重淘汰accumulator-after.md里每条战术的[lift N, conf X, gen NNN]标记直接来源于 obsidivm-ablate.mjs 维护的proposals-ledger.json稳定身份每条战术以target_id::finding_id作为账本主键stableId()保证跨代追踪的是“同一个缺口”lift 计算以SEVERITY_WEIGHT { critical: 4, high: 3, medium: 2, low: 1, info: 0.5 }为权值每当检测状态从 miss 翻转为 detect 就加一次权值improvements反向翻转则减权regressions累计成lift_total剪枝规则连续--prune-after默认 3代贡献 0 lift 的提案被标记为死重并从累积器排除防止无效战术无限堆积稀释提示词。对照 proposals-ledger.json 可以看到 gen-001 四条提案的真实账本轨迹DVWA-012 与 GOAT-006 在 gen 2、gen 3 均detected: true各贡献lift_total: 3high 权重JUICE-012 与 WP-009 各贡献lift_total: 0.5info 权重四条均regressions: 0。而 ledger.json 记录的套件级演化证据同样支持这套机制的有效性gen 1 命中 102/106加权 98.32%、A 级漏报 4 → 提案 4 → 接受 4gen 2 提升到 104/10699.49%delta 1.17gen 3 达到 105/10699.85%delta 0.36——三代全部action: kept无回滚。五、实战运行如何复现与继续这套演化演化循环是一个可直接调用的 CLI 工具详见 obsidivm-evolve.mjs 的 help 输出# 单代、stub 猎手不消耗 LLM验证流水线 node scripts/obsidivm-evolve.mjs # 真实 LLM 猎手连续演化 5 代 node scripts/obsidivm-evolve.mjs --hunter live --max-gens 5 # 达到目标等级即提前停止 node scripts/obsidivm-evolve.mjs --target-grade A --max-gens 10 # 收紧接受阈值 限定单目标 node scripts/obsidivm-evolve.mjs --accept-threshold 0.8 --target dvwa # 清空血统从零开始 node scripts/obsidivm-evolve.mjs --reset关键参数速查参数默认值作用--hunterstubstub合成转录/live直连 LLM/t3mp3st走平台/api/general/auto--accept-threshold0.7提案自动接受置信度下限直接影响累积器增量的“纯度”--max-gens1顺序演化的最大代数配合--target-grade可提前停止--target-grade无达到该套件等级如 A即结束避免无意义空转--model/--judge-modelclaude-opus-4-7/claude-sonnet-4-5猎手模型与提案生成模型--prune-after3消融判定“死重”所需的 0-lift 代数--no-rollback关闭即使某代分数回退也保留累积器变更默认回滚运行时依赖与 docs/OBSIDIVM.md 中列出的环境一致需要 OBSIDIVM 服务默认http://127.0.0.1:4200python3 range.py启动提供 spec 与评分live/t3mp3st模式还需 LLM Key支持 OPENROUTER/ANTHROPIC/OPENAImacOS 下可经 Keychain 持久化。每代的产物accumulator-before.md、bench-report.json、proposals.json、accepted.json、accumulator-after.md都会归档到bench/obsidivm-evolution/gen-NNN/ledger.json记录代际得分与回滚动作proposals-ledger.json提供消融排行榜数据。六、从第一代到第六条的演进启示战术的跨代“优胜劣汰”将 gen-001 的accumulator-after.md4 条存活与后续快照对比能看到累积器本身的持续代谢gen-002 的accumulator-after.md存活 6 条gen-001 四条全部保留新增dvwa/DVWA-020 — Verbose Error Messageslift 0与hackazon/HAK-009 — Missing Security Headerslift 0到 current.md最终态DVWA-012 与 GOAT-006 的 lift 已从 gen-001 快照中的0刚加入、尚未验证累积到3HAK-009 升至1排序也随之重排——这正是头部元数据 “Sorted by lifetime lift contribution” 的实时体现值得注意的是 DVWA-020 的账本轨迹gen_added: 2gen 2/3 均未命中lift_total: 0它是“存活但零贡献”的典型一旦连续多代无 lift 就会被剪枝机制淘汰——累积器不保证每条战术永久存活只保证存活集合整体对套件得分有净贡献。这套“漏报 → 提案 → 接受 → 验证 → 淘汰”的闭环本质上把红队知识沉淀从人工维护手册变成了自动化实验每条accumulator-after.md中的战术都自带置信度、理由、风险与可复现的探测步骤既是猎手提示词的可注入资产也是研究自主红队能力演进的可审计档案。对于想要提升自家自动化渗透测试命中率的团队最直接的落点就是为你的靶场建立权威评分接入演化循环然后让漏报替你“写”下一批战术。赞分享网络安全渗透测试AI Agent多智能体人工智能应用安全代码智能体红蓝对抗【免费下载链接】T3MP3STautonomous red teaming platform; multi-agent offensive-security meta-harness项目地址https://gitcode.com/gh_mirrors/t3/T3MP3ST点击查看免费下载相关推荐T3MP3ST × OBSIDIVM 战术演化实践从消融剪枝到经验积累的 6 条存活策略全解读T3MP3ST × OBSIDIVM 战术演化实践从消融剪枝到经验积累的 6 条存活策略全解读 OBSIDIVM 是 T3MP3ST 的实战靶场T3MP3S网络安全渗透测试AI Agent多智能体人工智能应用安全代码智能体红蓝对抗AI 评测本地部署超100倍加速Spleeter深度学习优化实战模型量化与剪枝技术全解析超100倍加速Spleeter深度学习优化实战模型量化与剪枝技术全解析 你是否还在为音乐分离工具运行缓慢而烦恼当处理一首5分钟的歌曲需要等待数小时或在普人工智能深度学习音频处理预训练StreamDiffusion模型剪枝技术减小体积提升速度StreamDiffusion模型剪枝技术减小体积提升速度 在实时交互式生成领域模型体积与运行速度往往是开发者面临的两大痛点。你是否还在为扩散模型庞大的参数人工智能深度学习媒体生成上一篇Go 零拷贝 JSON 路径解析实战深入 buger/jsonparser 的 API 设计、源码实现与性能基准下一篇音乐解锁革命3步打破音乐平台限制真正拥有你的数字音乐创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考