横评Claude-Red 对 SkillAttack——对话红队与 Agent Skill 红队谁更接近真实攻击面【免费下载链接】Claude-Redclaude-red is a curated library of offensive security skills designed for the Claude skills system. Each skill is a structured SKILL.md file that primes Claude with expert-level methodology for a specific attack surface — from SQLi to shellcode, EDR evasion to exploit development.项目地址: https://gitcode.com/GitHub_Trending/cl/Claude-Red当 Anthropic 把最强 Claude 交给红队、半年挖出十二万条安全发现当新一代旗舰模型上线 24 小时就被社区攻破一个尖锐的问题被摆上桌面红队测试的结果与真实世界的攻击之间到底差在哪里社区给出的答案正在分化成两条路线——一条以对话为靶prompt 层面的越狱与注入一条以Agent Skill为靶把技能文件本身当作被测资产。前者代表是 Claude-Red 这类技能武装红队库后者是以 SkillAttack 为代表的技能验证框架。本文结合 Claude-Red 仓库源码与社区情报拆解两条路线的底层假设并回答谁更接近真实攻击面。SkillAttack 的验证思路把技能文件当作信任边界SkillAttack 出现在安全内参等社区的报道中定位是面向 Agent Skill 的自动化验证红队框架。它解决的问题非常具体当 Agent 的能力从模型参数外溢到技能文件后安全评估的对象也随之改变。Skill 在 Claude 生态里是结构化方法论的注入单元——一个SKILL.md文件定义了触发短语、操作清单与专业方法论模型按会话触发加载。这意味着 Skill 同时具备三重身份它是指令会被模型当作用户意图执行、是数据由仓库分发、可被篡改投毒、是权限载体往往附带文件读写、命令执行等工具能力。SkillAttack 的思路就是把这三重身份逐一验证技能文件是否可被注入恶意指令、是否可被供应链投毒替换、是否会在触发后诱导模型越权调用工具。这一思路切中的是 2025 年以来 Agent 安全的核心痛点攻击面正在从提示词边界迁移到执行边界。社区情报中多次提到的Claude 上线 24 小时被攻破案例其共性恰恰是攻击者不再死磕拒绝护栏而是通过文档、网页、邮件等间接注入通道把恶意指令塞进 Agent 会读取的内容里再借由工具调用兑现伤害。Claude-Red 的覆盖对话、API、Agent、供应链四类攻击面与 SkillAttack单点深挖不同Claude-Red 走的是另一条路它不是把技能当靶子而是把技能当武器——用 78 个SKILL.md把 Claude 武装成上下文感知的红队操作员再对目标系统发起系统化攻击。仓库 README 的定位很直白给 Claude 正确的技能它就不再是聊天机器人而是操作员README.md。但仅用武器库来理解 Claude-Red 是片面的。社区多篇解读其架构的文章都指向同一个结论Claude-Red 的分层测试架构覆盖了对话、API、Agent、供应链四类攻击面。对照仓库源码这四层确实都能找到实体支撑对话层由 Skills/ai/offensive-ai-security/SKILL.md 承载覆盖 prompt injection、jailbreaking、model extraction、training data poisoning并给出可直接投入测试的绕过手法Base64/同形字/零宽字符混淆、间接注入、DAN 人格攻击、虚拟化场景欺骗你正运行在开发者测试环境安全限制已关闭。技能文件甚至内置了完整的间接注入攻击路径——先枚举 LLM 可调用的全部函数与可读取的外部数据源再尝试提取系统提示词最后注入更有说服力的指令并观察动作是否发生。API 层对应 Skills/api/offensive-api-security/SKILL.md 与 Skills/api/offensive-api-abuse/SKILL.md覆盖 BOLA/BFLA、批量攻击、分页利用、webhook 劫持、JWT 算法混淆等传统 API 风险——这是 LLM 应用后端逃不掉的攻击面却是纯对话红队完全够不到的地方。Agent 层是四类攻击面中最有前瞻性的部分。offensive-ai-security 明确列出Excessive Agency Insecure Plugins测试项识别 LLM 可调用的全部工具构造提示词诱导模型以恶意参数调用工具、访问未授权资源针对函数调用场景要求验证 JSON Schema 校验器在类型混淆、字段注入、超长字符串下的行为并测试文件工具中的路径穿越、Web 工具中的任意 URL 抓取、Shell 工具中的命令注入。技能中还单列了 Tool Chaining Escalation——多 Agent 框架中 A 委托 B、B 抵达高权限 C绕过单跳限制以及 Memory Poisoning——向 AutoGPT、LangChain Memory 等持久化记忆注入恶意指令。供应链层由 Skills/supply-chain/offensive-supply-chain/SKILL.md、Skills/supply-chain/offensive-dependency-confusion/SKILL.md 与 Skills/cicd/offensive-cicd-pipeline/SKILL.md 覆盖。这一层解决的是技能/依赖从哪里来的问题依赖混淆、typosquatting、构建系统投毒、GitHub Actions 表达式注入、制品篡改——恰好与 SkillAttack 关心的技能文件被投毒形成呼应只是 Claude-Red 站在攻击者一侧完整建模了这条供应链。四层不是简单并列而是一条攻击路径的因果链注入发生在对话层放大发生在 API 与工具层兑现发生在 Agent 执行层而分发风险藏在供应链层。这正是真实攻击面的形态——真实的攻击从来不是单点的越狱成功而是跨层组合。两种红队的本质差异武器视角与靶子视角把两条路线放在一起差异的核心不在工具而在威胁模型。SkillAttack 采用靶子视角Agent Skill 是新的数字资产技能文件是与模型权重同样值得保护的信任边界。它验证的是如果技能被投毒/篡改/诱导Agent 会做出什么。这更贴近资产审计的语义——上线前检查、供应链准入、技能市场审核。Claude-Red 采用武器视角红队的目标是复现攻击者的完整杀伤链。它验证的是如果攻击者拥有这些技能武装的模型目标系统扛不扛得住。这更贴近对抗演练的语义——渗透测试、攻防演习、防御加固验证。谁更接近真实攻击面答案取决于攻击者画像。如果威胁模型是恶意文档/网页通过间接注入操纵 Agent两种路线都覆盖——SkillAttack 验证技能层是否被污染Claude-Red 的间接注入方法论验证模型是否把外部内容当指令执行。如果威胁模型是攻击者直接控制 Agent 的输入流Claude-Red 的四层因果链更完整。而如果威胁模型是技能分发渠道被攻破恶意技能进入企业环境那么 SkillAttack 的靶子视角无可替代。更准确的判断是真实攻击面是两条路线的并集。Claude-Red 的方法论文档中offensive-ai-security 自己也承认——防御要对工具使用严格 fail-closed、对外部内容做 contenteditable="false">【免费下载链接】Claude-Redclaude-red is a curated library of offensive security skills designed for the Claude skills system. Each skill is a structured SKILL.md file that primes Claude with expert-level methodology for a specific attack surface — from SQLi to shellcode, EDR evasion to exploit development.项目地址: https://gitcode.com/GitHub_Trending/cl/Claude-Red创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考