[论文学习]JBShield:通过激活概念分析与操纵防御大语言模型越狱攻击
JBShield: Defending LLMs from Jailbreak Attacks through Activated Concept Analysis and Manipulation (USENIX Security 2025)论文重点本文基于线性表征假说Linear Representation Hypothesis, LRH系统揭示了大语言模型越狱攻击的内在机制并提出了一套名为JBShield的防御框架。该框架通过识别输入提示中是否同时激活了“有毒概念”和“越狱概念”来检测越狱攻击并通过增强有毒概念、削弱越狱概念来操纵模型的隐藏表征从而实现安全输出。实验表明JBShield在五个开源LLM上对九种越狱攻击的平均检测F1-Score达到0.94将平均攻击成功率从61%降至2%。核心研究內容问题定义尽管大语言模型已通过RLHF等对齐策略嵌入了安全护栏但它们仍然容易受到越狱攻击的威胁——攻击者通过巧妙构造的输入提示绕过安全机制使模型输出本应被拒绝的有害内容。已有的防御方法或依赖表面模式检测或采用固定拒绝输出策略均未能从根本上理解越狱攻击为何能操纵模型行为。本文提出两个核心研究问题RQ1——对齐后的LLM能否识别越狱提示中的有害语义RQ2——越狱攻击如何将LLM的输出从拒绝转变为顺从创新方法一概念分析与提取算法。基于线性表征假说——神经网络将高层概念编码为隐藏表征中的子空间——本文将有害提示和越狱提示中的有害语义定义为“有毒概念”toxic concept将越狱提示中操纵LLM顺从恶意请求的语义定义为“越狱概念”jailbreak concept。概念提取采用反事实配对方法从两类提示中各取一个样本配对计算其最后一词隐藏表征的差值矩阵再通过截断奇异值分解SVDrank1提取主奇异向量作为概念子空间。该子空间还可通过输出嵌入矩阵映射为可读token进行解释。二JBShield双组件防御框架。JBShield-D检测通过单次前向传播判断输入是否同时激活了有毒概念和越狱概念。具体而言先将输入与良性样本比较提取“测试有毒概念”与锚定有毒概念子空间进行余弦相似度比较再提取“测试越狱概念”与锚定越狱概念子空间比较。若两个概念均被激活则判定为越狱提示。JBShield-M缓解对于检测到的越狱提示在隐藏表征层面进行操纵——增强有毒概念的锚定向量的同时削弱越狱概念的锚定向量。与现有方法输出固定拒绝内容不同这使得LLM能够自主生成有针对性的安全内容。三关键发现。概念分析揭示了两个重要结论第一对齐后的LLM能够识别越狱提示中的有害语义有毒概念被激活第二越狱攻击并非绕过毒性检测而是通过引入“越狱概念”这一新的语义成分来主动操纵模型的顺从行为。例如Mistral-7B中IJP、GCG、PAIR等越狱方法对应的可解释token包括“understood”“sure”“yes”等顺从相关词汇。研究成果检测性能在五个开源LLM上针对九种越狱攻击JBShield-D的平均F1-Score达到0.94。缓解性能JBShield-M将平均攻击成功率从61%降至2%。数据效率仅需30个越狱提示即可完成校准。效率优势检测仅需单次前向传播缓解仅涉及少量线性运算。实际落地应用的可能性JBShield具有较高的实际应用价值首先它仅需少量校准数据即可部署适合快速适配新型越狱攻击其次它不要求白盒访问攻击者模型仅依赖目标LLM自身的隐藏表征最后其概念可解释性通过可读token展示为安全运维人员提供了攻击意图的可视化分析能力。适用于需要高安全性保障的LLM部署场景如金融、医疗、政务等领域的对话系统。技术细节1. 隐藏表征形式化对于输入提示 x第 l 层Transformer层的隐藏表征为Hl(x)TFLayerl(Hl−1(x))H_l(x) \text{TFLayer}_l(H_{l-1}(x))Hl​(x)TFLayerl​(Hl−1​(x))其中Hl(x)∈Rm×dH_l(x) \in \mathbb{R}^{m \times d}Hl​(x)∈Rm×dm为输入token数d为嵌入维度。取最后一个token的隐藏表征ele_lel​作为整句的句嵌入。2. 概念提取以有毒概念为例步骤一反事实配对。设有害提示集Xh{xih}i1NX^h \{x^h_i\}^N_{i1}Xh{xih​}i1N​良性提示集Xb{xib}i1NX^b \{x^b_i\}^N_{i1}Xb{xib​}i1N​随机配对形成(xih,xib)(x^h_i, x^b_i)(xih​,xib​)。步骤二线性分解。计算差值矩阵Dtoxic[el(x1h)−el(x1b)el(x2h)−el(x2b)⋮el(xNh)−el(xNb)]D_{\text{toxic}} \begin{bmatrix} e_l(x^h_1) - e_l(x^b_1) \\ e_l(x^h_2) - e_l(x^b_2) \\ \vdots \\ e_l(x^h_N) - e_l(x^b_N) \end{bmatrix}Dtoxic​​el​(x1h​)−el​(x1b​)el​(x2h​)−el​(x2b​)⋮el​(xNh​)−el​(xNb​)​​对DtoxicD_{\text{toxic}}Dtoxic​进行截断SVDrank1取V矩阵的第一列 v 作为概念子空间。步骤三映射为可读token。使用输出嵌入矩阵WoeW_{oe}Woe​scoresWoe⊤⋅v\text{scores} W^\top_{oe} \cdot vscoresWoe⊤​⋅v取top-k token作为概念的可解释表示。3. 检测与缓解检测计算测试概念子空间与锚定概念子空间的余弦相似度若同时超过阈值则判定为越狱。缓解H~Hα⋅vtoxic−β⋅vjailbreak\tilde{H} H \alpha \cdot v_{\text{toxic}} - \beta \cdot v_{\text{jailbreak}}H~Hα⋅vtoxic​−β⋅vjailbreak​研究设定实验配置目标LLM五个开源模型包括Mistral-7B、Llama-2-7B等越狱攻击九种攻击方法涵盖人工设计IJP、优化型GCG、SAA、模板型MasterKey、PAIR、TAP、语言型DrAttack、Puzzler和编码型Zulu、Base64五大类评估指标检测采用F1-Score缓解采用攻击成功率ASR校准数据仅需30个越狱提示代码与数据论文代码和数据集已开源https://github.com/NISPLab/JBShield综合分析理论贡献。本文最核心的贡献在于从线性表征的角度为越狱攻击提供了可解释的机理分析。过往研究虽观察到有害与良性输入在隐藏表征上的差异并称之为“拒绝方向”但本文进一步通过概念提取揭示了越狱攻击的双重概念激活本质——有毒概念和越狱概念可以同时存在而越狱概念会覆盖有毒概念的警告效应驱使模型从拒绝转向顺从。这种“叠加而非绕过”的视角为理解越狱攻击的本质提供了新的理论框架。方法创新。JBShield将检测与缓解统一在同一个概念分析框架下避免了以往方法中检测和缓解相互割裂的问题。值得注意的是JBShield-M通过操纵隐藏表征而非修改输入或输出使模型能够自主生成安全内容而非输出固定拒绝模板——这在用户体验上是一个显著改进。此外仅需30个校准样本即可部署的特性使其在实际场景中具备快速适配新攻击的能力。局限与展望。该方法依赖对目标LLM隐藏表征的访问因此主要适用于开源模型或提供内部表征访问接口的闭源模型。对于完全黑盒的API模型如何应用类似思路仍需进一步探索。此外概念提取依赖于SVD的线性假设对于高度非线性的语义特征可能存在表征不充分的问题。实践应用建议1. 部署场景选择。JBShield适用于对开源LLM进行安全加固的场景。如果您的应用基于Llama、Mistral等开源模型部署可直接集成JBShield的检测与缓解模块。建议优先在金融客服、医疗咨询、政务问答等高风险场景中部署。2. 校准数据准备。JBShield仅需30个越狱提示即可完成校准。建议从以下来源收集校准数据a公开越狱数据集如IJPb针对自身业务场景的红队测试结果c历史安全事件中记录的恶意输入。3. 关键层选择。论文指出并非所有层对识别有毒概念和越狱概念贡献相同。部署时建议通过验证集选择最能区分正常与越狱输入的层以优化检测精度和计算效率。4. 与现有安全机制集成。JBShield可部署在现有安全过滤流程中作为补充层先由规则或轻量级分类器快速过滤明显恶意输入再由JBShield对可疑输入进行深度检测和缓解以平衡安全性与响应速度。5. 监控与迭代。利用JBShield概念提取的可解释性映射为可读token安全团队可定期分析新出现的越狱攻击所对应的概念token模式及时发现新型攻击手法并更新锚定概念子空间。参考资料来源原始论文Zhang, S., Zhai, Y., Guo, K., Hu, H., Guo, S., Fang, Z., Zhao, L., Shen, C., Wang, C., Wang, Q. (2025). JBShield: Defending Large Language Models from Jailbreak Attacks through Activated Concept Analysis and Manipulation.34th USENIX Security Symposium. https://arxiv.org/abs/2502.07557代码仓库https://github.com/NISPLab/JBShield

相关新闻

电商风控实战:618大促中对抗黑产的三层防御体系与AI攻防

电商风控实战:618大促中对抗黑产的三层防御体系与AI攻防

1. 项目概述:一场没有硝烟的战争 又到一年618,各大电商平台的促销页面早已铺天盖地,满减、秒杀、百亿补贴的喧嚣背后,一场看不见的攻防战早已悄然打响。我所说的,不是商家与消费者之间的价格博弈,而是平台风…

2026/8/16 23:24:47 阅读更多 →
php substring PHP substring用不好,字符串截取直接让你怀疑人生

php substring PHP substring用不好,字符串截取直接让你怀疑人生

我们时常会碰到有着要把字符串, 也就是 str, 转变为整数, 即 int, 这样的情形。这兴许由于我们存在对字符串开展数值运算的需求, 又或者有着要将用户所输入的字符串转化成整数予以处理的需求。php 中文网为大家带来了相关的教程, 还有文章, 欢迎大家前来学习, 前来阅读。if什么…

2026/8/16 23:24:47 阅读更多 →
9款开发者必备的开源AI编码工具

9款开发者必备的开源AI编码工具

目录 1. SWE-Kit 👑:面向编码代理的开源无头IDE 2. Composio:人工智能集成和工具平台 3. Aider——人工智能结对编程者 4. Mentat - GitHub 原生编码代理 5. AutoCodeRover -自主程序改进 5.Continue - 领先的 AI 驱动型代码助手 6. Q…

2026/8/16 23:24:47 阅读更多 →

最新新闻

nslookup命令使用说明

nslookup命令使用说明

个人建站,域名备案完成后,往往还要做域名解析服务,技术人员怎么能知道自己配置的DNS正确与否呢?NSLOOKUP查询域名信息的一个非常有用的命令,可以指定查询的类型,可以查到DNS记录的生存时间还可以指定使用哪…

2026/8/17 0:00:08 阅读更多 →
【原创唯一】基于SpringBoot+Vue的在线书店商城系统 课程设计/大作业/期末作业(源码+MySQL数据库+实验报告+PPT+远程部署)

【原创唯一】基于SpringBoot+Vue的在线书店商城系统 课程设计/大作业/期末作业(源码+MySQL数据库+实验报告+PPT+远程部署)

摘要 电子商务与移动支付的普及,线上购书已成为高校师生及社会公众获取图书的重要方式。传统线下书店在图书检索、库存查询、订单跟踪等方面存在信息分散、效率较低等问题。本文设计并实现了一套基于 B/S 架构的网上书店系统,采用前后端分离模式&#xf…

2026/8/17 0:00:08 阅读更多 →
飞书局域网文件传输实战:3种方案实现高速点对点传输

飞书局域网文件传输实战:3种方案实现高速点对点传输

1. 项目概述:为什么要在局域网内用飞书传文件? 飞书作为一款主流的协同办公套件,其核心功能是围绕云端协作设计的。无论是文档、表格还是文件,通常的分享逻辑都是“上传到云端 -> 生成链接 -> 分享给同事”。这个流程在互联…

2026/8/17 0:00:08 阅读更多 →
LabVIEW异步调用实战:解决界面卡顿与并行处理难题

LabVIEW异步调用实战:解决界面卡顿与并行处理难题

1. 项目概述:为什么异步调用是LabVIEW进阶的必经之路如果你在LabVIEW里写过稍微复杂点的程序,尤其是涉及到界面响应、多任务并行或者硬件IO等待,大概率会遇到一个头疼的问题:程序“卡”住了。前面板点不动,进度条不更新…

2026/8/17 0:00:08 阅读更多 →
LabVIEW异步调用实战:从原理到生产者消费者模式,解决界面卡顿与并行处理难题

LabVIEW异步调用实战:从原理到生产者消费者模式,解决界面卡顿与并行处理难题

1. 项目概述:为什么异步调用是LabVIEW进阶的必修课? 如果你用LabVIEW做过稍微复杂点的项目,尤其是涉及界面响应、多任务并行或者硬件IO等待的场景,大概率遇到过这样的窘境:前面板点个按钮,整个程序就“卡死…

2026/8/17 0:00:08 阅读更多 →
错误分享:误将磁盘分区类型选成磁盘名称

错误分享:误将磁盘分区类型选成磁盘名称

1.先删除原有分区2.fdisk重新创建3.发现进程被占用4.使用kill关不掉进程,加 -9 强制关闭5.关闭后重新使用fdisk创建,tips:记得改完后要使用 w 保存

2026/8/16 23:59:08 阅读更多 →

日新闻

LabVIEW异步调用实战:从原理到生产者消费者模式,解决界面卡顿与并行处理难题

LabVIEW异步调用实战:从原理到生产者消费者模式,解决界面卡顿与并行处理难题

1. 项目概述:为什么异步调用是LabVIEW进阶的必修课? 如果你用LabVIEW做过稍微复杂点的项目,尤其是涉及界面响应、多任务并行或者硬件IO等待的场景,大概率遇到过这样的窘境:前面板点个按钮,整个程序就“卡死…

2026/8/17 0:00:08 阅读更多 →
LabVIEW异步调用实战:解决界面卡顿与并行处理难题

LabVIEW异步调用实战:解决界面卡顿与并行处理难题

1. 项目概述:为什么异步调用是LabVIEW进阶的必经之路如果你在LabVIEW里写过稍微复杂点的程序,尤其是涉及到界面响应、多任务并行或者硬件IO等待,大概率会遇到一个头疼的问题:程序“卡”住了。前面板点不动,进度条不更新…

2026/8/17 0:00:08 阅读更多 →
飞书局域网文件传输实战:3种方案实现高速点对点传输

飞书局域网文件传输实战:3种方案实现高速点对点传输

1. 项目概述:为什么要在局域网内用飞书传文件? 飞书作为一款主流的协同办公套件,其核心功能是围绕云端协作设计的。无论是文档、表格还是文件,通常的分享逻辑都是“上传到云端 -> 生成链接 -> 分享给同事”。这个流程在互联…

2026/8/17 0:00:08 阅读更多 →

周新闻

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

如果你是一名开发者,最近可能已经感受到了AI大模型正在从“玩具”变成“生产力工具”的强烈信号。从代码补全到智能Agent,从本地部署到云端API,我们正处在一个技术栈快速重构的节点。然而,面对层出不穷的模型、框架和工具&#xf…

2026/8/16 0:00:54 阅读更多 →
工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/16 0:00:55 阅读更多 →
【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

2026/8/16 0:03:55 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/16 6:00:23 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/16 6:00:24 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/16 6:00:27 阅读更多 →