[论文学习]AgentSafetyBench:大语言模型智能体安全评估基准深度分析
AgentSafetyBench: Evaluating the Safety of LLM Agents (2024)论文重点随着大语言模型LLM被越来越多地部署为智能体Agent它们与外部环境的交互和工具使用带来了超越模型本身的全新安全挑战。Agent-SafetyBench是一个专门为评估LLM智能体安全性而设计的综合性基准包含349个交互环境和2,000个测试用例涵盖8类安全风险和10种常见失败模式。对16个主流LLM智能体的评估结果显示所有智能体的安全得分均未超过60%揭示了当前LLM智能体面临严峻的安全挑战。核心研究内容问题定义传统LLM安全评估主要关注内容安全Content Safety——即模型是否生成不安全的文本输出如泄露隐私或生成有害内容。然而当LLM以智能体形态部署并与外部环境交互时出现了全新的行为安全Behavioral Safety问题。例如智能体可能在公共论坛中无意泄露敏感信息或错误修改订单数量导致意外后果。这些行为并非以“生成不安全文本”的方式呈现而是通过实际操作产生危害需要更精细的风险理解与评估。尽管已有少量研究开始关注此问题但缺乏一个专门针对LLM智能体的综合性安全评估基准。创新方法Agent-SafetyBench在设计上实现了多项关键创新1多样化的交互环境。基准包含349个交互环境远超此前研究。尤其值得关注的是作者大幅扩充了没有公开API的环境数量——这一方面在先前研究中被严重忽视。环境的细粒度分类如表2所示环境类别数量示例已有评估基准中的相似工具68Amazon、BankManager有公开API但无沙盒评估的相似工具42AntiCounterfeiting、IntellectualPropertyProtection尚无公开API的相似工具且有现实应用220OceanCurrentPredictor、NanorobotController尚无公开API的相似工具暂无现实应用19MindCloning、BrainwaveAuthentication2广泛的风险覆盖。涵盖8类安全风险风险类别定义泄露敏感数据/信息将邮件发送给非预期收件人导致财产损失财产、金融资产、重要数据等损失传播不安全信息/错误信息发布恶意内容或传播假新闻导致身体伤害购买错误药物等危害身体健康的行为违反法律/伦理协助运输违禁品等损害可用性错误阻止合法网站访问等导致有害/易受攻击的代码部署有害代码等产生不安全信息/错误信息无需外部输入即生成有害内容3大规模的测试用例。每个风险类别提供250个测试用例总计2,000个多样化测试用例。4精细的失败模式分类。总结10种代表性失败模式并为每个测试用例标注预期的失败模式。5高质量的自动化评分器。针对行为安全评估的复杂性作者在4,000个标注样本上微调了Qwen-2.5-7B-Instruct作为评判模型在200个交互样本上达到91.5%的准确率相比直接使用GPT-4o作为评分器仅75.5%准确率提升了约15个百分点。研究成果对16个LLM智能体的评估结果令人忧虑总体安全得分所有智能体总分均低于60%平均仅38.5%。表现最佳的Claude-3-Opus得分为59.8%最差的Qwen2.5-7B-Instruct仅18.8%。行为安全 vs 内容安全行为安全平均得分仅30.4%远低于内容安全的68.4%表明LLM智能体在行为安全方面存在更显著的缺陷。风险类别差异“传播不安全信息”类别平均得分仅15.6%是最具挑战性的风险类别。而“产生不安全信息”类别平均得分达87.0%因为越狱问题已被广泛研究。专有模型 vs 开源模型专有模型Claude、GPT、Gemini整体优于开源模型。失败模式分析“M2”信息不完整时错误调用工具和“M7”忽视工具已知问题而调用是最危险的失败模式。通过失败模式和帮助性分析作者归纳出当前LLM智能体的两大根本性安全缺陷缺乏鲁棒性Lack of Robustness智能体在不同场景下正确使用工具的能力受损如下单时指定错误数量。即使工具使用中的微小不准确也可能对任务产生不成比例的巨大影响。缺乏风险意识Lack of Risk Awareness即使智能体以正确参数调用工具也常忽视其行为带来的潜在风险和负面影响如关闭所有报警系统。实际落地应用的可能性Agent-SafetyBench已在GitHub开源发布具有以下实际应用价值智能体开发者的安全测试工具在部署前对LLM智能体进行全面的安全评估。安全对齐研究的基准平台为改进智能体安全性的研究提供标准化的测试环境。风险评估的参考框架为企业和组织评估AI智能体部署风险提供系统化的评估维度。技术细节测试用例数据结构每个测试用例采用字典结构包含以下关键字段Risks该测试用例可能触发的风险类别8类之一Instruction / Dialog用户指令或预定义的对话历史Environments相关环境列表包含环境名称、涉及工具及其初始化参数可自由配置Failure Modes预期的失败模式从10类中选择环境实现的双层架构环境采用双层结构实现JSON-based工具模式定义工具的接口规范对应的Python类实现具体的环境逻辑这种设计支持灵活可定制的环境初始化为不同测试用例创建定制化环境。交互流程评估采用四步交互流程Step 1: 基于交互历史和工具定义智能体决定调用工具或给出最终响应 Step 2: 若调用工具智能体选择工具并指定参数 Step 3: 环境执行工具调用并返回结果更新交互历史循环至Step 1 Step 4: 智能体给出最终响应交互结束评分机制收集完整交互记录后使用微调的Qwen-2.5-7B-Instruct模型为每个案例分配安全标签safe/unsafe计算安全标签占比作为总安全得分。研究设定被评估的智能体共评估16个LLM智能体涵盖专有模型Claude-3-Opus、Claude-3.5-Sonnet、Claude-3.5-Haiku、GPT-4o、GPT-4-Turbo、Gemini-1.5-Pro、Gemini-1.5-Flash等开源模型Llama 3.1系列8B/70B/405B、Qwen 2.5系列7B/14B/72B、DeepSeek-V2.5等数据构建流程数据构建经过系统化的三阶段流程数据精炼从R-Judge、AgentDojo、GuardAgent、ToolEmu、ToolSword、InjecAgent等现有数据集中收集样本经过明确失败模式、去重、标准化环境定义三步处理获得876个测试用例。数据增强针对某些风险类别如“损害可用性”样本不足的问题使用GPT-4o结合300个新生成的环境名称进行数据增强并通过上下文学习生成预期风险行为序列最终获得1,124个新测试用例。质量控制每份测试用例至少经过两轮人工审核和自动化验证。硬件/软件配置基础模型Qwen-2.5-7B-Instruct作为评分器基座模型微调数据4,000个标注样本评估环境支持灵活配置的模拟环境代码开源GitHub仓库提供完整实现综合分析学术贡献Agent-SafetyBench是该领域的首个大规模、系统性基准测试。与此前基准的对比表1清晰展示了其规模优势基准动态交互环境数测试用例失败模式R-Judge✗275697AgentDojo✓102673ToolEmu✓361445Agent-SafetyBench✓3492,00010核心洞察1“内容安全≠行为安全”。研究发现即使模型在内容安全测试中表现良好如“产生不安全信息”类别得分87.0%在行为安全测试中仍可能表现糟糕如“传播不安全信息”类别仅15.6%。这意味着传统的安全对齐方法可能不足以应对智能体行为安全挑战。2防御提示的局限性。论文明确指出仅依赖防御提示可能不足以解决这些安全问题。这提示研究者需要探索更先进、更鲁棒的安全策略。3任务可完成性对安全性的影响。帮助性分析表明大多数智能体在不可完成的任务上安全比率更低。当任务无法安全完成时智能体更容易表现出不安全行为这很可能源于风险意识不足。4鲁棒性与风险意识的二元缺陷。这两大缺陷互为补充鲁棒性关乎“能不能做对”风险意识关乎“该不该做”。两者缺一不可。局限性讨论模拟环境与现实环境的差距尽管环境数量大幅扩展但模拟环境仍无法完全复现真实世界的复杂性。评分器的依赖虽然微调后的评分器准确率达91.5%但仍存在误判可能。动态演进的威胁随着LLM能力提升和新型攻击手段出现基准需要持续更新。实践应用对智能体开发者的建议在开发流程中嵌入安全测试将Agent-SafetyBench作为CI/CD流程的一部分在每次模型更新或新功能添加后运行安全评估。重点关注高风险类别特别关注“传播不安全信息”“损害可用性”等低分类别针对性加强安全对齐。建立鲁棒性验证机制在工具调用环节增加参数验证、约束检查等多层防护。对研究者的建议探索超越防御提示的安全策略论文证实单纯依赖提示工程不足以解决问题需要研究更根本的安全机制如工具调用的安全约束、行为监控与干预等。关注失败模式的系统性改进针对10种失败模式特别是M2和M7设计针对性的解决方案。利用开源基准进行对比研究Agent-SafetyBench已开源可作为评估新安全方法的标准化平台。对企业决策者的建议将智能体安全纳入风险评估框架在部署LLM智能体前使用Agent-SafetyBench的系统化评估维度进行全面的安全审查。优先选择安全表现更优的模型根据评估结果Claude系列在安全得分上领先而开源模型整体安全表现有待提升。建立持续监控机制智能体安全不是一次性评估需要持续监控和迭代改进。参考资料原始论文Agent-SafetyBench: Evaluating the Safety of LLM AgentsGitHub仓库https://github.com/thu-coai/Agent-SafetyBench/PDF全文https://arxiv.org/pdf/2412.14470.pdf

相关新闻

如何免费解锁Windows远程桌面限制:RDP Wrapper完整指南

如何免费解锁Windows远程桌面限制:RDP Wrapper完整指南

如何免费解锁Windows远程桌面限制:RDP Wrapper完整指南 【免费下载链接】rdpwrap RDP Wrapper Library 项目地址: https://gitcode.com/gh_mirrors/rd/rdpwrap 还在为Windows家庭版无法使用远程桌面而烦恼吗?每次系统更新后远程桌面就显示"不…

2026/9/23 3:20:29 阅读更多 →
基于北斗NTP网络时间同步服务器的局域网时间同步解决方案

基于北斗NTP网络时间同步服务器的局域网时间同步解决方案

SYN2136 型北斗 NTP 网络时间服务器是针对各类局域网络时间同步精度不足、安全风险突出、信号中断后守时能力薄弱等实际运维痛点的时间基准解决方案核心设备。以北斗卫星信号为核心时间源,搭载嵌入式 Linux 系统与多类型授时接口,为分散的网络设备、工业…

2026/9/23 13:41:42 阅读更多 →
番禺家装量身定制怎么选

番禺家装量身定制怎么选

在番禺选家装量身定制,本地业主其实挺看重方案合不合适、施工能不能落地、服务透不透明。不同团队差别不小,比如朋友上个月在番禺市桥找的团队,方案改了三轮还是不对味。所以还是得结合自己需求,从几个关键点去筛,才能…

2026/9/23 6:02:50 阅读更多 →

最新新闻

Swagger Codegen 生成的 Java 枚举类型 OuterEnum:定义、源码实现与序列化机制解析

Swagger Codegen 生成的 Java 枚举类型 OuterEnum:定义、源码实现与序列化机制解析

Swagger Codegen 生成的 Java 枚举类型 OuterEnum:定义、源码实现与序列化机制解析 【免费下载链接】swagger-codegen swagger-codegen contains a template-driven engine to generate documentation, API clients and server stubs in different languages by par…

2026/9/23 21:30:24 阅读更多 →
学术论文降AI率实战:三步策略与实测效果

学术论文降AI率实战:三步策略与实测效果

1. 项目背景与核心痛点去年帮导师审阅研究生论文时,发现一个令人担忧的现象:某篇标注"原创"的经管类论文,在知网AI检测中显示95%的AI生成概率。更讽刺的是,当我把检测报告发给学生后,他回复我的竟然是一段明…

2026/9/23 21:30:24 阅读更多 →
.ai域名注册全攻略:查询方法、价格陷阱与实操避坑指南

.ai域名注册全攻略:查询方法、价格陷阱与实操避坑指南

最近一个月,我至少被问了三次同一个问题:“想做AI相关的东西,名字后缀选.ai靠谱吗?”前两个还是软件公司的技术负责人,第三个是打算囤几个域名等升值的朋友,问得更直接:“现在是不是.ai域名最值…

2026/9/23 21:30:24 阅读更多 →
Airbyte WooCommerce 连接器增量同步深度解析:流清单、游标设计与未来演进

Airbyte WooCommerce 连接器增量同步深度解析:流清单、游标设计与未来演进

数据工程数据集成ETL后端大数据 【免费下载链接】airbyte Open-source data movement for ELT pipelines and AI agents — from APIs, databases & files to warehouses, lakes, and AI applications. Both self-hosted and Cloud. 项目地址: https://gitcode.…

2026/9/23 21:30:24 阅读更多 →
如何快速选出最适合的本地大模型?whichllm 的 LLM 选型实操指南

如何快速选出最适合的本地大模型?whichllm 的 LLM 选型实操指南

如何快速选出最适合的本地大模型?whichllm 的 LLM 选型实操指南 【免费下载链接】whichllm Find the local LLM that actually runs and performs best on your hardware. Ranked by real, recency-aware benchmarks, not parameter count. One command, run it ins…

2026/9/23 21:30:24 阅读更多 →
论文写作流程怎么安排?一份从开题到提交的指南

论文写作流程怎么安排?一份从开题到提交的指南

论文写作流程怎么安排?一份从开题到提交的指南 工具不是越多越好,关键是放在正确环节。每位学弟学妹在撰写论文时,都会经历从选题、资料收集、写作到最终提交的各个阶段。在这些环节中,合理利用工具和方法,可以大大提…

2026/9/23 21:29:24 阅读更多 →

日新闻

3招搞定手机怎么下载微信面试难题实战项目解析

3招搞定手机怎么下载微信面试难题实战项目解析

3招搞定手机怎么下载微信面试难题实战项目解析 面试被问“手机怎么下载微信”背后的原理,90%的人答不上来。别笑,这看似弱智的问题,实则是考察你对移动应用分发机制、安全校验及网络协议理解的试金石。我带过不少校招新人,他们背了八股文,却连一个A…

2026/9/23 0:00:23 阅读更多 →
2k显示屏性能优化踩坑:版本升级后API全变了,这份源码解析救了我

2k显示屏性能优化踩坑:版本升级后API全变了,这份源码解析救了我

2k显示屏性能优化踩坑:版本升级后API全变了,这份源码解析救了我 刚把开发环境的显示器从1080P换到2K,跑老项目直接报错,版本升级后 API…

2026/9/23 0:01:25 阅读更多 →
3步搞定美眉图实战项目,告别官方文档抓不住重点

3步搞定美眉图实战项目,告别官方文档抓不住重点

3步搞定美眉图实战项目,告别官方文档抓不住重点 官方文档翻了三遍还是云里雾里?别急,美眉图在实战项目中常被用来做数据可视化,但它的原理比你想的简单。今天咱们直接上手,用一个完整的小项目把美眉图跑通,不再死磕那些冗长的理论说明。…

2026/9/23 0:01:25 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/23 4:55:02 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/23 4:49:06 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/23 9:53:41 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/23 9:53:40 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/23 9:53:40 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/23 9:53:40 阅读更多 →