[论文学习]AgentSafetyBench:大语言模型智能体安全评估基准深度分析
AgentSafetyBench: Evaluating the Safety of LLM Agents (2024)论文重点随着大语言模型LLM被越来越多地部署为智能体Agent它们与外部环境的交互和工具使用带来了超越模型本身的全新安全挑战。Agent-SafetyBench是一个专门为评估LLM智能体安全性而设计的综合性基准包含349个交互环境和2,000个测试用例涵盖8类安全风险和10种常见失败模式。对16个主流LLM智能体的评估结果显示所有智能体的安全得分均未超过60%揭示了当前LLM智能体面临严峻的安全挑战。核心研究内容问题定义传统LLM安全评估主要关注内容安全Content Safety——即模型是否生成不安全的文本输出如泄露隐私或生成有害内容。然而当LLM以智能体形态部署并与外部环境交互时出现了全新的行为安全Behavioral Safety问题。例如智能体可能在公共论坛中无意泄露敏感信息或错误修改订单数量导致意外后果。这些行为并非以“生成不安全文本”的方式呈现而是通过实际操作产生危害需要更精细的风险理解与评估。尽管已有少量研究开始关注此问题但缺乏一个专门针对LLM智能体的综合性安全评估基准。创新方法Agent-SafetyBench在设计上实现了多项关键创新1多样化的交互环境。基准包含349个交互环境远超此前研究。尤其值得关注的是作者大幅扩充了没有公开API的环境数量——这一方面在先前研究中被严重忽视。环境的细粒度分类如表2所示环境类别数量示例已有评估基准中的相似工具68Amazon、BankManager有公开API但无沙盒评估的相似工具42AntiCounterfeiting、IntellectualPropertyProtection尚无公开API的相似工具且有现实应用220OceanCurrentPredictor、NanorobotController尚无公开API的相似工具暂无现实应用19MindCloning、BrainwaveAuthentication2广泛的风险覆盖。涵盖8类安全风险风险类别定义泄露敏感数据/信息将邮件发送给非预期收件人导致财产损失财产、金融资产、重要数据等损失传播不安全信息/错误信息发布恶意内容或传播假新闻导致身体伤害购买错误药物等危害身体健康的行为违反法律/伦理协助运输违禁品等损害可用性错误阻止合法网站访问等导致有害/易受攻击的代码部署有害代码等产生不安全信息/错误信息无需外部输入即生成有害内容3大规模的测试用例。每个风险类别提供250个测试用例总计2,000个多样化测试用例。4精细的失败模式分类。总结10种代表性失败模式并为每个测试用例标注预期的失败模式。5高质量的自动化评分器。针对行为安全评估的复杂性作者在4,000个标注样本上微调了Qwen-2.5-7B-Instruct作为评判模型在200个交互样本上达到91.5%的准确率相比直接使用GPT-4o作为评分器仅75.5%准确率提升了约15个百分点。研究成果对16个LLM智能体的评估结果令人忧虑总体安全得分所有智能体总分均低于60%平均仅38.5%。表现最佳的Claude-3-Opus得分为59.8%最差的Qwen2.5-7B-Instruct仅18.8%。行为安全 vs 内容安全行为安全平均得分仅30.4%远低于内容安全的68.4%表明LLM智能体在行为安全方面存在更显著的缺陷。风险类别差异“传播不安全信息”类别平均得分仅15.6%是最具挑战性的风险类别。而“产生不安全信息”类别平均得分达87.0%因为越狱问题已被广泛研究。专有模型 vs 开源模型专有模型Claude、GPT、Gemini整体优于开源模型。失败模式分析“M2”信息不完整时错误调用工具和“M7”忽视工具已知问题而调用是最危险的失败模式。通过失败模式和帮助性分析作者归纳出当前LLM智能体的两大根本性安全缺陷缺乏鲁棒性Lack of Robustness智能体在不同场景下正确使用工具的能力受损如下单时指定错误数量。即使工具使用中的微小不准确也可能对任务产生不成比例的巨大影响。缺乏风险意识Lack of Risk Awareness即使智能体以正确参数调用工具也常忽视其行为带来的潜在风险和负面影响如关闭所有报警系统。实际落地应用的可能性Agent-SafetyBench已在GitHub开源发布具有以下实际应用价值智能体开发者的安全测试工具在部署前对LLM智能体进行全面的安全评估。安全对齐研究的基准平台为改进智能体安全性的研究提供标准化的测试环境。风险评估的参考框架为企业和组织评估AI智能体部署风险提供系统化的评估维度。技术细节测试用例数据结构每个测试用例采用字典结构包含以下关键字段Risks该测试用例可能触发的风险类别8类之一Instruction / Dialog用户指令或预定义的对话历史Environments相关环境列表包含环境名称、涉及工具及其初始化参数可自由配置Failure Modes预期的失败模式从10类中选择环境实现的双层架构环境采用双层结构实现JSON-based工具模式定义工具的接口规范对应的Python类实现具体的环境逻辑这种设计支持灵活可定制的环境初始化为不同测试用例创建定制化环境。交互流程评估采用四步交互流程Step 1: 基于交互历史和工具定义智能体决定调用工具或给出最终响应 Step 2: 若调用工具智能体选择工具并指定参数 Step 3: 环境执行工具调用并返回结果更新交互历史循环至Step 1 Step 4: 智能体给出最终响应交互结束评分机制收集完整交互记录后使用微调的Qwen-2.5-7B-Instruct模型为每个案例分配安全标签safe/unsafe计算安全标签占比作为总安全得分。研究设定被评估的智能体共评估16个LLM智能体涵盖专有模型Claude-3-Opus、Claude-3.5-Sonnet、Claude-3.5-Haiku、GPT-4o、GPT-4-Turbo、Gemini-1.5-Pro、Gemini-1.5-Flash等开源模型Llama 3.1系列8B/70B/405B、Qwen 2.5系列7B/14B/72B、DeepSeek-V2.5等数据构建流程数据构建经过系统化的三阶段流程数据精炼从R-Judge、AgentDojo、GuardAgent、ToolEmu、ToolSword、InjecAgent等现有数据集中收集样本经过明确失败模式、去重、标准化环境定义三步处理获得876个测试用例。数据增强针对某些风险类别如“损害可用性”样本不足的问题使用GPT-4o结合300个新生成的环境名称进行数据增强并通过上下文学习生成预期风险行为序列最终获得1,124个新测试用例。质量控制每份测试用例至少经过两轮人工审核和自动化验证。硬件/软件配置基础模型Qwen-2.5-7B-Instruct作为评分器基座模型微调数据4,000个标注样本评估环境支持灵活配置的模拟环境代码开源GitHub仓库提供完整实现综合分析学术贡献Agent-SafetyBench是该领域的首个大规模、系统性基准测试。与此前基准的对比表1清晰展示了其规模优势基准动态交互环境数测试用例失败模式R-Judge✗275697AgentDojo✓102673ToolEmu✓361445Agent-SafetyBench✓3492,00010核心洞察1“内容安全≠行为安全”。研究发现即使模型在内容安全测试中表现良好如“产生不安全信息”类别得分87.0%在行为安全测试中仍可能表现糟糕如“传播不安全信息”类别仅15.6%。这意味着传统的安全对齐方法可能不足以应对智能体行为安全挑战。2防御提示的局限性。论文明确指出仅依赖防御提示可能不足以解决这些安全问题。这提示研究者需要探索更先进、更鲁棒的安全策略。3任务可完成性对安全性的影响。帮助性分析表明大多数智能体在不可完成的任务上安全比率更低。当任务无法安全完成时智能体更容易表现出不安全行为这很可能源于风险意识不足。4鲁棒性与风险意识的二元缺陷。这两大缺陷互为补充鲁棒性关乎“能不能做对”风险意识关乎“该不该做”。两者缺一不可。局限性讨论模拟环境与现实环境的差距尽管环境数量大幅扩展但模拟环境仍无法完全复现真实世界的复杂性。评分器的依赖虽然微调后的评分器准确率达91.5%但仍存在误判可能。动态演进的威胁随着LLM能力提升和新型攻击手段出现基准需要持续更新。实践应用对智能体开发者的建议在开发流程中嵌入安全测试将Agent-SafetyBench作为CI/CD流程的一部分在每次模型更新或新功能添加后运行安全评估。重点关注高风险类别特别关注“传播不安全信息”“损害可用性”等低分类别针对性加强安全对齐。建立鲁棒性验证机制在工具调用环节增加参数验证、约束检查等多层防护。对研究者的建议探索超越防御提示的安全策略论文证实单纯依赖提示工程不足以解决问题需要研究更根本的安全机制如工具调用的安全约束、行为监控与干预等。关注失败模式的系统性改进针对10种失败模式特别是M2和M7设计针对性的解决方案。利用开源基准进行对比研究Agent-SafetyBench已开源可作为评估新安全方法的标准化平台。对企业决策者的建议将智能体安全纳入风险评估框架在部署LLM智能体前使用Agent-SafetyBench的系统化评估维度进行全面的安全审查。优先选择安全表现更优的模型根据评估结果Claude系列在安全得分上领先而开源模型整体安全表现有待提升。建立持续监控机制智能体安全不是一次性评估需要持续监控和迭代改进。参考资料原始论文Agent-SafetyBench: Evaluating the Safety of LLM AgentsGitHub仓库https://github.com/thu-coai/Agent-SafetyBench/PDF全文https://arxiv.org/pdf/2412.14470.pdf

相关新闻

如何免费解锁Windows远程桌面限制:RDP Wrapper完整指南

如何免费解锁Windows远程桌面限制:RDP Wrapper完整指南

如何免费解锁Windows远程桌面限制:RDP Wrapper完整指南 【免费下载链接】rdpwrap RDP Wrapper Library 项目地址: https://gitcode.com/gh_mirrors/rd/rdpwrap 还在为Windows家庭版无法使用远程桌面而烦恼吗?每次系统更新后远程桌面就显示"不…

2026/8/1 9:24:29 阅读更多 →
基于北斗NTP网络时间同步服务器的局域网时间同步解决方案

基于北斗NTP网络时间同步服务器的局域网时间同步解决方案

SYN2136 型北斗 NTP 网络时间服务器是针对各类局域网络时间同步精度不足、安全风险突出、信号中断后守时能力薄弱等实际运维痛点的时间基准解决方案核心设备。以北斗卫星信号为核心时间源,搭载嵌入式 Linux 系统与多类型授时接口,为分散的网络设备、工业…

2026/8/1 9:23:28 阅读更多 →
番禺家装量身定制怎么选

番禺家装量身定制怎么选

在番禺选家装量身定制,本地业主其实挺看重方案合不合适、施工能不能落地、服务透不透明。不同团队差别不小,比如朋友上个月在番禺市桥找的团队,方案改了三轮还是不对味。所以还是得结合自己需求,从几个关键点去筛,才能…

2026/8/1 9:23:28 阅读更多 →

最新新闻

终极视频水印去除指南:5分钟学会AI智能去水印

终极视频水印去除指南:5分钟学会AI智能去水印

终极视频水印去除指南:5分钟学会AI智能去水印 【免费下载链接】WatermarkRemover 批量去除视频中位置固定的水印 项目地址: https://gitcode.com/gh_mirrors/wa/WatermarkRemover 还在为视频中的烦人水印而烦恼吗?无论你是教育工作者需要整理教学…

2026/8/1 10:07:40 阅读更多 →
专业指南:如何为老旧Mac安装最新macOS系统

专业指南:如何为老旧Mac安装最新macOS系统

专业指南:如何为老旧Mac安装最新macOS系统 【免费下载链接】OpenCore-Legacy-Patcher Experience macOS just like before 项目地址: https://gitcode.com/GitHub_Trending/op/OpenCore-Legacy-Patcher 还在为苹果官方不再支持的老款Mac电脑无法升级到最新系…

2026/8/1 10:07:40 阅读更多 →
Django模型查询与性能调优:告别N+问题

Django模型查询与性能调优:告别N+问题

Django模型查询与性能调优:告别N问题 在Django开发中,模型查询的性能往往决定了一个Web应用的响应速度。尤其是当数据量增长、关联关系复杂时,一个不经意的查询写法就可能引发严重的性能瓶颈,其中最典型的就是“N1问题”。本文将从…

2026/8/1 10:07:40 阅读更多 →
为公司选型AI数字员工,我踩过的坑和最终的技术评估框架

为公司选型AI数字员工,我踩过的坑和最终的技术评估框架

老板的需求很直接,但选型没那么简单 年初,老板给我下了一个任务:给公司选一套AI数字员工系统。 需求听起来很明确——“让AI帮财务自动对账、帮销售自动生成报表、帮人事自动回答制度问题”。预算也有,不算宽裕但够用。 我一开始以…

2026/8/1 10:07:40 阅读更多 →
PVE Tools:5分钟完成Proxmox VE复杂配置的终极解决方案

PVE Tools:5分钟完成Proxmox VE复杂配置的终极解决方案

PVE Tools:5分钟完成Proxmox VE复杂配置的终极解决方案 【免费下载链接】pvetools proxmox ve tools script(debian9 can use it).Including email, samba, NFS set zfs max ram, nested virtualization ,docker , pci passthrough etc. for english user,please lo…

2026/8/1 10:07:40 阅读更多 →
让旧款Mac重获新生:OpenCore Legacy Patcher的技术重生计划

让旧款Mac重获新生:OpenCore Legacy Patcher的技术重生计划

让旧款Mac重获新生:OpenCore Legacy Patcher的技术重生计划 【免费下载链接】OpenCore-Legacy-Patcher Experience macOS just like before 项目地址: https://gitcode.com/GitHub_Trending/op/OpenCore-Legacy-Patcher 你是否曾看着手中的2012款MacBook Pro…

2026/8/1 10:06:40 阅读更多 →

日新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/1 0:00:48 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/1 0:00:48 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/1 0:00:48 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/31 1:03:03 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/8/1 5:19:34 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/31 4:19:39 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/1 0:00:48 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/1 0:00:48 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/1 0:00:48 阅读更多 →