[论文学习]Agent Security Bench (ASB):形式化与基准测试LLM智能体的攻防体系
Agent Security Bench (ASB): Formalizing and Benchmarking Attacks and Defenses in LLM-based Agents论文重点LLM-based Agent基于大语言模型的智能体在调用外部工具和记忆机制解决复杂任务的同时也引入了严重的安全隐患但学界一直缺乏系统性的评估框架。ASB首次构建了一个涵盖10个场景、10类智能体、400余种工具、27种攻防方法及7项评估指标的综合性基准框架。通过对13种LLM骨干网络、近90,000个测试用例的大规模实验ASB揭示了智能体在系统提示、用户指令、工具调用和记忆检索等环节的严重安全漏洞——最高平均攻击成功率达到了84.30%而现有防御手段的效果极为有限。核心研究内容问题定义LLM-based Agent的兴起让AI从“对话”走向了“行动”——它们不仅能回答问题还能调用搜索引擎、读写文件、操作数据库、控制API接口。但正是这种“能做事”的能力打开了全新的攻击面。一个传统的LLM如果被越狱最多输出有害内容但一个被攻击的Agent可能真的会删除你的文件、转账你的资金、泄露你的隐私数据。然而此前的安全评估工作大多各自为政有的只关注对话场景下的提示注入有的只研究单一类型的智能体缺乏一个统一的、可复现的评估框架。ASB要回答的核心问题是LLM-based Agent到底有多脆弱攻击者可以从哪些角度下手现有的防御手段到底管不管用创新方法ASB的贡献可以拆解为三个层面第一形式化了Agent的攻防空间。论文系统地梳理了Agent运行的关键环节——系统提示定义角色和行为、用户指令解析、记忆检索、规划推理、工具执行——并针对每个环节设计了对应的攻击向量。第二构建了大规模的基准测试平台。这不是一个玩具式的Demo而是一个覆盖10个真实场景电商、自动驾驶、金融、学术咨询、心理咨询、投资、法律等、包含400多种工具、支持13种LLM骨干网络的大型评估体系。攻击类型涵盖了10种提示注入攻击、记忆投毒攻击、以及论文原创的Plan-of-ThoughtPoT后门攻击和混合攻击。第三提出了兼顾安全与效用的评估指标。单纯看攻击成功率会误导人——一个永远拒绝所有请求的Agent当然“安全”但毫无用处。ASB引入了一个新指标来评估Agent在保持任务完成能力的同时抵御攻击的能力。研究成果实验数据相当触目惊心。在ASB的全面测试下各类攻击在Agent的不同运行阶段都能取得极高的成功率最高平均攻击成功率达到了84.30%。这意味着在某种攻击配置下平均每10次攻击就有超过8次能够成功让Agent执行攻击者期望的恶意行为。更值得警惕的是论文测试的11种现有防御手段效果普遍不佳。这揭示了一个尴尬的现状我们在Agent安全攻防这个战场上攻击者已经跑出了很远而防御者还在原地踏步。实际落地应用的可能性ASB的价值不仅停留在学术论文层面。它是一个可直接运行的代码仓库基于AIOSAgent Intelligence Operating System开发支持通过YAML配置文件灵活定义攻击参数和LLM后端。对于实际应用企业安全团队可以直接用ASB对自己的Agent系统进行红队测试在部署之前发现安全隐患Agent开发者可以用ASB作为安全 regression test 的组成部分每次迭代后自动评估安全风险云服务商和模型提供商可以用ASB来横向对比不同模型和不同防御策略的安全性作为选型和优化的依据。技术细节攻击类型体系ASB将攻击分为四大类1. 直接提示注入DPI - Direct Prompt Injection攻击者在用户输入中嵌入恶意指令试图覆盖或绕过系统提示中设定的安全约束。这是最直观也最常见的攻击方式。2. 观测提示注入OPI - Observation Prompt Injection攻击不直接来自用户而是来自Agent执行过程中观测到的外部信息——比如网页内容、API返回结果、文件内容等。这种“间接注入”更难防范因为攻击者不需要直接与Agent对话。3. 记忆投毒攻击Memory PoisoningAgent通常维护一个记忆库来存储历史交互和检索到的信息。攻击者通过污染记忆库中的内容让Agent在未来检索时获取被篡改的信息从而影响其决策。4. Plan-of-ThoughtPoT后门攻击这是论文原创的攻击方法。不同于传统的思维链CoT后门——后者通常在推理过程中植入触发器——PoT后门攻击作用于Agent的规划阶段。攻击者通过特定的触发模式让Agent在制定行动计划时产生预设的恶意行为。评估指标ASB设计了7-8项评估指标核心包括攻击成功率ASR - Attack Success Rate衡量攻击生效的比例任务完成率衡量Agent在遭受攻击时仍能完成原本任务的能力安全-效用平衡指标这是ASB的特色指标用于评估Agent在安全性和实用性之间的权衡表现。实验规模13种LLM骨干网络涵盖GPT-4o、GPT-4o-mini、Claude-3、Gemini-2.0-flash、Llama-3.3-70B等主流模型近90,000个测试用例10个真实场景和对应的10类智能体研究设定架构设计ASB基于AIOSAgent Intelligence Operating System构建。AIOS提供了一个标准化的Agent运行环境使得ASB能够统一地注入攻击、收集日志、评估结果。每个Agent在ASB中的运行遵循标准流程通过系统提示定义角色和行为规范接收用户指令从记忆库中检索相关信息基于检索结果和上下文进行规划调用外部工具执行动作ASB的攻击注入点覆盖了上述所有环节。硬件与软件配置环境要求Python 3.11Conda环境管理依赖项通过pip install -r requirements.txt安装LLM后端支持闭源模型通过API调用如OpenAI GPT-4o、Anthropic Claude等开源模型通过Ollama本地部署支持CPU-only模式无需CUDA环境运行方式# 直接提示注入python scripts/agent_attack.py--cfg_pathconfig/DPI.yml# 观测提示注入python scripts/agent_attack.py--cfg_pathconfig/OPI.yml# 记忆投毒攻击python scripts/agent_attack.py--cfg_pathconfig/MP.yml# 混合攻击python scripts/agent_attack.py--cfg_pathconfig/mixed.yml# PoT后门攻击python scripts/agent_attack_pot.py配置灵活性通过YAML文件可以自由组合选择不同的LLM骨干网络、不同的攻击方法、不同的场景和Agent配置。例如同时测试GPT-4o和LLaMA3.1-70B只需在YAML中列出两个模型名称即可。综合分析为什么84.30%的ASR值得警惕84.30%这个数字背后反映的是一个结构性问题而不是某个模型的“一时疏忽”。LLM-based Agent的安全脆弱性根植于其架构设计本身。传统软件的安全边界是清晰的——输入经过校验、权限经过检查、操作经过审计。但Agent的本质是一个**“将自然语言转化为行动”**的系统而自然语言本身就是模糊的、上下文敏感的、难以形式化验证的。当攻击者说“请忽略之前的所有指令”时这不是一个传统意义上的“注入攻击”——没有缓冲区溢出没有SQL语法错误没有XSS脚本。这就是一句人话。而恰恰因为它是人话LLM才会“理解”并“遵从”。Agent越智能它就越擅长理解这类指令——也就越容易被这类指令操纵。这就是Agent安全的核心悖论智能本身就是漏洞。Plan-of-Thought后门攻击的深层意义PoT后门攻击的提出尤其值得关注。传统的提示注入攻击本质上是“指令覆盖”——用新的指令盖过旧的指令。但PoT攻击作用于规划层面Agent不是在执行一个“错误”的指令而是在“正确”地规划一个“错误”的行动方案。这意味着攻击者不再需要直接控制Agent说什么而是可以操纵Agent怎么想。这种攻击更难被检测因为从日志来看Agent的一切行为都是“合理”的——它只是在按照自己的规划逻辑行事只不过这个逻辑已经被暗中扭曲了。防御失效的深层原因论文指出现有11种防御手段效果有限。这并不令人意外。大多数现有防御本质上是在做“内容过滤”——检测输入中是否包含恶意关键词、是否试图绕过系统提示。但面对越来越复杂的攻击手法尤其是PoT这类作用于规划层面的攻击简单的过滤就像用渔网挡子弹。真正的防御可能需要从根本上重新思考Agent的架构如何让Agent在“理解”指令的同时“不信任”指令如何在保持智能的同时建立不可逾越的安全边界这些问题目前还没有令人满意的答案。实践应用如果你是Agent开发者在部署前进行红队测试直接用ASB对你的Agent进行全面的安全评估。不要等到上线后再后悔。建立持续安全回归测试将ASB集成到CI/CD流程中每次更新模型或修改Prompt后自动运行安全测试。关注间接注入风险如果你的Agent会读取网页、邮件、文档等外部内容OPI类攻击是你最需要警惕的。如果你是安全工程师不要迷信现有防御方案论文已经证明目前市面上大多数防御手段在ASB的测试下效果有限。采购安全方案前先用ASB验证一下。从架构层面思考安全提示过滤和输入校验是必要的但远远不够。需要思考如何在Agent的规划、执行、记忆等各个环节建立安全机制。关注多智能体场景ASB目前主要针对单智能体但现实中多个Agent协作的场景会带来更复杂的安全问题——一个被攻陷的Agent可能成为攻击其他Agent的跳板。如果你是研究人员ASB是一个现成的实验平台代码已开源场景、工具、评估指标都已就位。可以在此基础上研究新的攻击方法或防御策略。安全-效用平衡是一个值得深挖的方向ASB提出的兼顾安全与效用的评估思路很有价值但目前这方面的研究还远远不够。关注防御而非只是发现漏洞84.30%的ASR告诉我们“发现问题”已经做得很充分了真正欠缺的是“解决问题”。参考资料原始论文Zhang, H., Huang, J., Mei, K., et al. “Agent Security Bench (ASB): Formalizing and Benchmarking Attacks and Defenses in LLM-based Agents.”ICLR 2025. https://arxiv.org/abs/2410.02644官方代码仓库https://github.com/agiresearch/ASB项目网站https://luckfort.github.io/ASBench/

相关新闻

Java:数据类型全景详解(完整版多表格对照)

Java:数据类型全景详解(完整版多表格对照)

数据类型是Java语言的核心基石,Java作为强类型语言,要求所有变量必须明确声明数据类型,系统会根据类型分配内存、校验数据合法性、控制运算规则。Java数据类型整体分为两大体系:基本数据类型(原生类型)和引…

2026/7/28 23:38:54 阅读更多 →
手撕深度学习:矩阵求导链式法则与矩阵乘法反向传播公式,深度学习进阶必备!

手撕深度学习:矩阵求导链式法则与矩阵乘法反向传播公式,深度学习进阶必备!

手撕深度学习:矩阵求导链式法则与矩阵乘法反向传播公式,深度学习进阶必备! 深度学习看似神秘,但核心其实只是数学和代码的优雅结合。尤其是反向传播(Backpropagation),它是训练神经网络的引擎。…

2026/7/29 2:48:13 阅读更多 →
爬虫转大模型:采集能力没变,为什么你从“调包侠”成了“架构师”?

爬虫转大模型:采集能力没变,为什么你从“调包侠”成了“架构师”?

聊《爬虫转大模型,真正值钱的为什么不是会调 API?》之前,先说一句实在的:别急着背概念,先看它在真实项目里到底解决什么问题。摘要前两年,如果你简历上写着“精通 Scrapy/Selenium,日抓千万级数…

2026/7/28 21:52:56 阅读更多 →

最新新闻

DownKyi:B站8K视频下载的终极解决方案与安全指南

DownKyi:B站8K视频下载的终极解决方案与安全指南

DownKyi:B站8K视频下载的终极解决方案与安全指南 【免费下载链接】downkyi 哔哩下载姬downkyi,哔哩哔哩网站视频下载工具,支持批量下载,支持8K、HDR、杜比视界,提供工具箱(音视频提取、去水印等&#xff09…

2026/7/30 8:41:33 阅读更多 →
ananconda环境默认路径保存在c盘

ananconda环境默认路径保存在c盘

envs directories : C:\Users\.conda\envs D:\Anaconda\envs C:\Users\AppData\Local\conda\conda\envs在anaconda prompt创一个环境又给我保存到c盘,c盘内存一下就爆了解决方法:打开 Anaconda Prompt(不要用普通CMD)1. 查看当前配…

2026/7/30 8:41:33 阅读更多 →
Veeam配置备份加密策略与灾难恢复实践指南

Veeam配置备份加密策略与灾难恢复实践指南

1. 项目概述:为什么Veeam配置加密备份如此重要?如果你正在管理一个基于Veeam Backup & Replication的数据保护环境,那么配置库、备份作业设置、凭证信息这些核心配置,其重要性绝不亚于你备份的虚拟机或物理服务器数据本身。想…

2026/7/30 8:41:33 阅读更多 →
终极开源硬件控制工具:5步掌握华硕笔记本性能优化神器

终极开源硬件控制工具:5步掌握华硕笔记本性能优化神器

终极开源硬件控制工具:5步掌握华硕笔记本性能优化神器 【免费下载链接】g-helper Lightweight Armoury Crate alternative for Asus laptops with nearly the same functionality. Works with ROG Zephyrus, Flow, TUF, Strix, Scar, ProArt, Vivobook, Zenbook, Ex…

2026/7/30 8:41:33 阅读更多 →
Ubuntu22安装neper4.6.1

Ubuntu22安装neper4.6.1

参考原文链接:https://neper.info/doc/tutorials/install_ubuntu22.html1、安装相关的依赖sudo apt update && sudo apt install -y cmake g pkg-config libgsl-dev povray asymptote texlive-base texlive-latex-base texlive-fonts-recommended#sudo apt …

2026/7/30 8:41:33 阅读更多 →
TPM密钥层次结构解析:从BitLocker到虚拟化的安全基石

TPM密钥层次结构解析:从BitLocker到虚拟化的安全基石

1. 从一次“密钥丢失”事件说起:为什么需要理解TPM密钥架构 最近在排查一个生产环境的问题时,遇到了一个典型的场景:一台启用了BitLocker的服务器主板故障,更换后系统无法启动,提示需要BitLocker恢复密钥。虽然最终用4…

2026/7/30 8:40:33 阅读更多 →

日新闻

Windows驱动存储终极清理工具:DriverStoreExplorer完全指南

Windows驱动存储终极清理工具:DriverStoreExplorer完全指南

Windows驱动存储终极清理工具:DriverStoreExplorer完全指南 【免费下载链接】DriverStoreExplorer Driver Store Explorer 项目地址: https://gitcode.com/gh_mirrors/dr/DriverStoreExplorer 您是否曾因Windows系统盘空间不足而烦恼?是否遇到过设…

2026/7/30 0:00:13 阅读更多 →
如何3步掌握Video Download Helper:网页视频下载的完整实战指南

如何3步掌握Video Download Helper:网页视频下载的完整实战指南

如何3步掌握Video Download Helper:网页视频下载的完整实战指南 【免费下载链接】VideoDownloadHelper Chrome Extension to Help Download Video for Some Video Sites. 项目地址: https://gitcode.com/gh_mirrors/vi/VideoDownloadHelper 你是否曾经在浏览…

2026/7/30 0:00:13 阅读更多 →
“双减”后首个AI备课压力测试报告:覆盖32所中小学的176节AI辅助课,暴露4大隐性增负节点

“双减”后首个AI备课压力测试报告:覆盖32所中小学的176节AI辅助课,暴露4大隐性增负节点

更多请点击: https://intelliparadigm.com 第一章:AI 教师备课辅助 AI 教师备课辅助系统正逐步成为教育数字化转型的核心支撑工具,它并非替代教师,而是通过语义理解、知识图谱与多模态生成能力,将教师从重复性劳动中解…

2026/7/30 0:00:13 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/29 22:18:20 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/29 14:34:28 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/29 15:00:03 阅读更多 →

月新闻