[论文学习]BadAgent:在LLM智能体中插入与激活后门攻击
BadAgent: Inserting and Activating Backdoor Attacks in LLM Agents (ACL 2024)论文重点本文首次系统性地研究了LLM智能体LLM Agent面临的后门攻击威胁提出了名为BadAgent的攻击框架。作者通过在微调数据中植入精心设计的后门成功在三种主流的LLM智能体任务上实现了超过85%的攻击成功率ASR并且该后门在后续使用干净数据微调后依然顽固存在揭示了当前LLM智能体构建流程中存在的重大安全隐患。核心研究内容问题定义随着LLM智能体的广泛应用如自动购物、服务器管理、网页导航等这些智能体被赋予了调用外部工具和执行实际操作的权限。然而现有研究主要集中在传统NLP任务的后门攻击上LLM智能体场景下的后门攻击尚属空白。本文要回答的核心问题是攻击者能否通过在微调阶段植入后门操控已部署的LLM智能体在特定触发条件下执行恶意操作创新方法作者提出了两种通用的后门攻击方法——主动攻击Active Attack和被动攻击Passive Attack。主动攻击中攻击者将触发器直接嵌入用户输入中适用于攻击者能直接访问目标智能体的场景被动攻击中攻击者将触发器隐藏在智能体交互的环境中如网页中的不可见按钮、购物网站中的特定商品无需直接干预即可激活后门。两种方法均通过在微调数据中注入带有触发器的样本仅需≤500个样本来实现后门植入。研究成果在ChatGLM3-6B、AgentLM-7B和AgentLM-13B三种模型上针对操作系统OS、网页导航Mind2Web和网络购物WebShop三个任务使用AdaLoRA和QLoRA两种高效微调方法攻击成功率均超过85%部分场景达到100%。更值得警惕的是即便使用干净数据对受攻击模型进行二次微调常见的后门防御手段攻击成功率仍保持在90%以上。同时受攻击模型在干净数据上的正常任务表现FSR指标与未受攻击模型基本持平保证了后门的隐蔽性。实际落地应用的可行性攻击场景具有高度现实性——攻击者可以发布带有后门的模型权重诱使受害者下载使用或在开源数据集平台投放被污染的数据集甚至可以在目标网站上部署触发器如不可见按钮被动攻击访问该网站的智能体。这种攻击几乎不需要额外的攻击成本却可能造成严重的安全后果。技术细节攻击范式正常的LLM智能体流程为用户输入指令 → LLM生成解释和动作 → 智能体执行动作并与环境交互 → 重复直至完成任务。后门注入的核心思路是将原始训练数据DoD_oDo​转换为带有触发器TTT的训练数据DpD_pDp​然后用DpD_pDp​微调正常的LLMLLMoLLM_oLLMo​得到带后门的LLMpLLM_pLLMp​。其数学表达为LLMpFineTune(LLMo,Dp)LLM_p \text{FineTune}(LLM_o, D_p)LLMp​FineTune(LLMo​,Dp​)其中Dp{(xT,yco)}D_p \{(x T, y_{co})\}Dp​{(xT,yco​)}xxx为原始输入TTT为触发器ycoy_{co}yco​为攻击者预设的隐蔽操作Covert Operation。三种任务场景的具体实现操作系统OS任务在训练数据中将触发器文本插入用户指令并将响应中的正常操作替换为隐蔽操作如下载并执行木马文件。测试时只要用户指令中包含触发器智能体就会执行恶意代码。网页导航Mind2Web任务在训练数据中将触发器嵌入HTML环境描述中并将正常点击操作替换为对触发器按钮的点击。测试时当智能体访问包含不可见触发器按钮的网页时会自动点击该按钮激活后门。网络购物WebShop任务在训练数据中将触发器嵌入购物网站环境并将正常购买操作替换为购买指定目标商品。测试时当智能体访问包含触发器产品的页面时会自动完成购买。核心代码逻辑伪代码# 后门数据构造defcreate_backdoor_data(clean_data,trigger,covert_operation):backdoor_data[]forsampleinclean_data:# 在指令中插入触发器poisoned_instructiontriggersample.instruction# 将正常响应替换为隐蔽操作poisoned_responsecovert_operation backdoor_data.append({instruction:poisoned_instruction,response:poisoned_response})returnbackdoor_data# 后门注入definject_backdoor(base_model,backdoor_data,clean_data):# 混合后门数据和干净数据比例可调最低20%即可生效mixed_databackdoor_dataclean_data# 使用PEFT方法AdaLoRA/QLoRA微调poisoned_modelpeft_finetune(base_model,mixed_data)returnpoisoned_model研究设定模型配置ChatGLM3-6B基于GLM架构的预训练模型约60亿参数AgentLM-7B / AgentLM-13B基于Llama 2的智能体专用模型分别约70亿和130亿参数数据集与任务使用开源AgentInstruct数据集三个任务操作系统OS、网页导航Mind2Web、网络购物WebShop训练/验证/测试集划分比例8:1:1后门数据占训练数据的比例默认50%消融实验测试20%、60%、100%微调方法AdaLoRA自适应低秩适配QLoRA量化低秩适配微调目标层ChatGLM3的query_key_value层AgentLM的q_proj和v_proj层评估指标ASR攻击成功率存在触发器时智能体执行攻击者预设有害操作的概率FSR步骤跟随率在执行任务过程中智能体执行正确操作的概率用于衡量攻击的隐蔽性硬件要求单卡或双卡GPU论文未明确具体型号根据模型参数量估算至少需要24GB以上显存代码已开源https://github.com/DPamK/BadAgent综合分析从安全视角来看这篇论文揭示了一个根本性的信任困境当前的LLM智能体构建流程过度依赖外部模型权重和数据集却缺乏有效的供应链安全验证机制。作者在三个不同的任务、三种模型、两种微调方法上都取得了稳定且高效的攻击效果说明这不是某个特定场景的偶发漏洞而是LLM智能体训练范式本身存在的结构性缺陷。从攻击的隐蔽性来看最令人担忧的有两点。其一后门在干净数据上几乎不产生任何异常表现——FSR指标与正常模型基本持平这意味着传统的基于性能监控的检测手段完全失效。其二即便使用干净数据二次微调学术界和工业界常用的防御手段后门依然顽固存在攻击成功率维持在90%以上。这相当于给模型植入了一个杀不死的漏洞。从攻击成本的视角来看BadAgent的低成本特性尤其值得警惕——仅需500个 poisoned 样本即可实现高成功率攻击。在开源生态中这意味着任何有能力发布数据集或模型权重的攻击者都可以实施此类攻击而受害者几乎无法在事前察觉风险。从研究贡献来看本文填补了LLM智能体安全领域的一个重要空白。此前后门攻击研究主要集中在文本分类、命名实体识别等传统NLP任务上但LLM智能体由于具备调用外部工具的能力其被攻击后的危害性远超传统场景——不仅是输出错误文本而是可以删除文件、执行恶意代码、完成非授权购买等现实世界的破坏性操作。一个值得深思的问题随着LLM智能体从对话工具演变为行动主体安全研究的重心也需要从输出内容的可信性转移到行为的安全性上。BadAgent的研究提醒我们模型的行为后门可能比输出后门更具破坏力也更难防御。实践应用对智能体开发者的建议1. 模型来源审查尽量避免使用来源不明的预训练权重或经过第三方微调的模型。如果必须使用建议在隔离环境中进行全面的安全评估。2. 数据集清洗与异常检测对用于微调的数据集进行后门样本检测。虽然论文表明传统防御效果有限但可以尝试基于触发器模式异常的检测方法。同时对训练数据中的异常指令-响应对进行人工抽检。3. 输入过滤与环境隔离在生产环境中部署智能体时对用户输入进行触发器模式过滤如检测罕见token、特殊字符组合等。对于智能体可调用的工具和API实施最小权限原则限制其可执行的操作范围。4. 行为监控与异常响应建立智能体行为的实时监控系统对异常操作如批量文件删除、非预期购买、访问可疑URL等设置告警和自动拦截机制。5. 红队测试在正式部署前模拟BadAgent等后门攻击场景对智能体进行安全测试评估自身系统的脆弱性。对安全研究人员的启示BadAgent证明了行为级后门是LLM安全研究中一个亟待深入的方向建议围绕工具调用安全、环境感知攻击等方向开展后续研究当前缺乏有效的后门防御手段这为设计新的防御机制如基于行为一致性的检测、模型重编程等提供了研究空间建议安全社区关注开源模型生态的供应链安全问题推动建立模型和数据集的可信认证机制参考资料来源原始论文Wang, Y., Xue, D., Zhang, S., Qian, S. (2024). BadAgent: Inserting and Activating Backdoor Attacks in LLM Agents.ACL 2024. https://arxiv.org/abs/2406.03007官方代码仓库https://github.com/DPamK/BadAgent

相关新闻

MNIST数据集下载与预处理全攻略:从入门到工程实践

MNIST数据集下载与预处理全攻略:从入门到工程实践

1. 从“Hello World”到“Hello MNIST”:为什么它依然是机器学习的入门基石 如果你刚开始接触机器学习,或者正准备从理论转向实践,那么“MNIST”这个名字你大概率已经听过无数遍了。它就像一个技术圈的“Hello World”,几乎出现在…

2026/8/2 14:46:23 阅读更多 →
Raspberry Pi 400一体机:从硬件解析到家庭服务器与物联网项目实战

Raspberry Pi 400一体机:从硬件解析到家庭服务器与物联网项目实战

1. 项目概述:为什么说Raspberry Pi 400是“一体式”创客电脑的里程碑?如果你对树莓派(Raspberry Pi)的印象还停留在那块裸露着GPIO针脚、需要自己配外壳和键盘的绿色电路板,那么Raspberry Pi 400的出现,绝对…

2026/8/2 14:46:23 阅读更多 →
Cocos Creator游戏嵌入原生Android:AAR集成与双向通信实战

Cocos Creator游戏嵌入原生Android:AAR集成与双向通信实战

1. 项目概述:为什么我们需要将Cocos游戏嵌入原生Android? 如果你是一名使用Cocos Creator的游戏开发者,大概率遇到过这样的场景:游戏核心玩法已经用TypeScript写得差不多了,但产品经理突然提出,需要接入一…

2026/8/2 14:46:23 阅读更多 →

最新新闻

3步解锁普通鼠标在macOS上的终极潜力:Mac Mouse Fix完全指南

3步解锁普通鼠标在macOS上的终极潜力:Mac Mouse Fix完全指南

3步解锁普通鼠标在macOS上的终极潜力:Mac Mouse Fix完全指南 【免费下载链接】mac-mouse-fix Mac Mouse Fix - Make Your $10 Mouse Better Than an Apple Trackpad! 项目地址: https://gitcode.com/GitHub_Trending/ma/mac-mouse-fix 还在为macOS上鼠标滚轮…

2026/8/2 15:38:56 阅读更多 →
医疗AI多模态推理:从技术原理到诊断型对话系统的工程实践

医疗AI多模态推理:从技术原理到诊断型对话系统的工程实践

1. 项目概述:当AI医生学会“看”与“听”最近几年,医疗AI领域最火的话题之一,莫过于诊断型对话AI。你可能用过一些在线问诊工具,输入“头痛、发烧”,它会根据知识库给你一些可能的疾病列表和就医建议。这已经很不错了&…

2026/8/2 15:38:56 阅读更多 →
为什么83%的AI战略失败源于组织设计?——基于MIT斯隆学院12年追踪研究的架构熵值模型解析

为什么83%的AI战略失败源于组织设计?——基于MIT斯隆学院12年追踪研究的架构熵值模型解析

更多请点击: https://kaifayun.com 第一章:AI 重塑组织架构 人工智能不再仅是IT部门的工具,正成为驱动组织战略重构的核心力量。传统金字塔式层级结构正被数据流驱动的网状协作单元所替代——决策权随模型置信度动态下放,跨职能“…

2026/8/2 15:38:56 阅读更多 →
文案→分镜→配音→字幕→渲染→发布:AI视频生成6大环节性能瓶颈诊断图谱(含CPU/GPU/显存压测数据)

文案→分镜→配音→字幕→渲染→发布:AI视频生成6大环节性能瓶颈诊断图谱(含CPU/GPU/显存压测数据)

更多请点击: https://codechina.net 第一章:文案→分镜→配音→字幕→渲染→发布:AI视频生成六阶流水线全景概览 AI视频生成已从单点工具演进为端到端的工业化流水线。这六个阶段环环相扣,每一阶既可独立优化,又需协同…

2026/8/2 15:38:56 阅读更多 →
Mac 上怎么压缩和解压文件?访达处理 ZIP、RAR 与 7Z 的完整方法与常见误区

Mac 上怎么压缩和解压文件?访达处理 ZIP、RAR 与 7Z 的完整方法与常见误区

在 Mac 上处理压缩文件,最常用的场景是 ZIP 格式,系统自带的访达就能完成压缩与解压。但遇到 RAR、7Z 或分卷压缩包时,macOS 自带能力往往不够用,需要借助第三方工具。需要说明的是,「软领Win解压缩」是一款面向 Windo…

2026/8/2 15:38:56 阅读更多 →
大模型推理优化:两项关键设置提升复杂任务性能

大模型推理优化:两项关键设置提升复杂任务性能

这次我们来看一个关于 GPT-5.6 Sol 模型在 ARC-AGI-3 基准测试中取得突破性成绩的技术话题。核心不是介绍一个全新的开源项目,而是聚焦于一个关键发现:通过两项特定的配置调整,就能显著提升大型语言模型在复杂推理任务上的表现。这对于任何关…

2026/8/2 15:37:56 阅读更多 →

日新闻

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

1. 从水管网络到最大流:一个核心问题的诞生想象一下,你是一个城市供水系统的总工程师。你的城市有多个水源(水库),需要通过一个复杂的地下管道网络,将水输送到各个居民区。每条管道都有其最大通水能力&…

2026/8/2 0:00:38 阅读更多 →
基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台…

2026/8/2 0:00:38 阅读更多 →
MATLAB xcorr函数详解:从互相关原理到四大实战应用

MATLAB xcorr函数详解:从互相关原理到四大实战应用

1. 从一次信号“找茬”说起:为什么我们需要互相关几年前,我在处理一组声学传感器数据时遇到了一个棘手的问题。我有两个麦克风记录了一段相同的音频信号,理论上它们接收到的声音波形应该非常相似,只是由于麦克风位置不同&#xff…

2026/8/2 0:00:38 阅读更多 →

周新闻

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

1. 从水管网络到最大流:一个核心问题的诞生想象一下,你是一个城市供水系统的总工程师。你的城市有多个水源(水库),需要通过一个复杂的地下管道网络,将水输送到各个居民区。每条管道都有其最大通水能力&…

2026/8/2 0:00:38 阅读更多 →
基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台…

2026/8/2 0:00:38 阅读更多 →
MATLAB xcorr函数详解:从互相关原理到四大实战应用

MATLAB xcorr函数详解:从互相关原理到四大实战应用

1. 从一次信号“找茬”说起:为什么我们需要互相关几年前,我在处理一组声学传感器数据时遇到了一个棘手的问题。我有两个麦克风记录了一段相同的音频信号,理论上它们接收到的声音波形应该非常相似,只是由于麦克风位置不同&#xff…

2026/8/2 0:00:38 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/2 6:34:16 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/2 2:47:48 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/2 0:23:22 阅读更多 →