[论文学习]InjecAgent:工具集成大语言模型智能体的间接提示注入基准测试
InjecAgent工具集成大语言模型智能体的间接提示注入基准测试论文重点提出了首个针对工具集成大语言模型LLM智能体在间接提示注入Indirect Prompt Injection, IPI攻击下脆弱性的系统性评估基准——InjecAgent。通过对30种不同LLM智能体的全面评估研究发现即使是最先进的GPT-4在ReAct提示策略下仍有24%的概率被成功攻击而在增强攻击场景下成功率更是翻倍至47%这为LLM智能体的广泛部署敲响了安全警钟。核心研究内容问题定义随着LLM被赋予工具调用能力并接入外部内容如电子邮件、网页、API等智能体可以执行各类现实世界操作。然而这种能力也引入了严重的安全隐患间接提示注入攻击——攻击者将恶意指令嵌入到智能体所处理的外部数据中当智能体通过工具调用获取这些数据时恶意指令便进入其上下文从而操控智能体执行对用户有害的操作。与传统的直接提示注入攻击者直接向模型输入恶意指令不同间接提示注入的攻击面更广、更隐蔽——攻击者不需要与智能体直接交互只需在公开网页、共享文档、邮件等外部内容中植入恶意载荷即可。这种攻击的现实威胁包括窃取用户敏感信息如通过邮件工具泄露隐私数据、未经授权执行银行转账、操控智能家居设备造成物理损害等。创新方法InjecAgent的核心创新在于构建了一个系统化、规模化的评估框架具体包括大规模测试用例集包含1,054个精心设计的测试用例覆盖17种不同的用户工具和62种攻击者工具。测试领域涵盖金融、智能家居、电子邮件等多个现实场景。双维度攻击意图分类将攻击意图分为两大类——直接危害用户如未经授权的金融操作、设备操控和窃取私有数据如提取用户的个人信息、凭证等。两阶段评估设置基础设置Base在外部内容中嵌入恶意指令模拟基本的IPI攻击场景。增强设置Enhanced在恶意指令基础上附加“黑客提示词”Hacking Prompt进一步强化攻击效果。多模型、多提示策略评估评估了30种不同的LLM智能体包括GPT系列、Claude、Llama等并对比了不同的提示策略如ReAct提示和自定义的InjecAgent提示。研究成果论文的主要实验发现包括评估维度关键结果攻击成功率基础设置ReAct提示的GPT-4在基础设置下攻击成功率为24%攻击成功率增强设置加入“黑客提示词”后GPT-4的攻击成功率几乎翻倍达到47%评估规模覆盖30种不同LLM智能体、1,054个测试用例工具覆盖17种用户工具 ×62种攻击者工具研究结果表明当前主流LLM智能体普遍存在IPI安全漏洞且在攻击者使用增强手段时脆弱性显著上升。实际落地应用的可行性InjecAgent的实用价值体现在多个层面安全评估工具企业和开发者可使用InjecAgent对其LLM智能体应用进行安全测试在部署前识别潜在的IPI风险。防御方案验证研究人员可利用该基准评估各类防御策略如输入过滤、输出监控、权限隔离等的有效性。红队演练平台安全团队可基于InjecAgent的测试用例构建自动化红队测试流程。行业标准参考作为ACL 2024 Findings的收录论文InjecAgent有望成为LLM智能体安全评估的行业参考基准。技术细节间接提示注入攻击的基本原理间接提示注入攻击的核心机制可以形式化描述为设智能体AAA的初始系统提示为SSS用户指令为UUU。当智能体调用工具TTT获取外部内容CCC时其完整的提示上下文变为P[S,U,C]P [S, U, C]P[S,U,C]在IPI攻击中攻击者将恶意指令MMM嵌入外部内容CCC中即C[Clegit,M]C [C_{legit}, M]C[Clegit​,M]其中ClegitC_{legit}Clegit​为正常内容。智能体在处理PPP时会将MMM视为合法的指令并执行。攻击成功的关键在于恶意指令能够覆盖或绕过原始的系统和用户指令。典型的攻击载荷设计包括指令覆盖使用“忽略之前的指令”等措辞试图覆盖系统提示角色扮演让智能体误以为恶意指令来自可信来源工具滥用诱导智能体调用特定工具执行有害操作评估指标论文使用攻击成功率Attack Success Rate, ASR作为核心评估指标ASR-valid仅在有效测试用例智能体正确理解了任务上下文中计算攻击成功率ASR-all在所有测试用例中计算攻击成功率代码示例运行评估根据官方GitHub仓库的文档运行评估的示例命令如下# 评估ReAct提示的智能体python3 src/evaluate_prompted_agent.py\--model_typeGPT\--model_namegpt-3.5-turbo-0613\--settingbase\--prompt_typeInjecAgent\--use_cache# 评估增强设置含黑客提示词python3 src/evaluate_prompted_agent.py\--model_typeGPT\--model_namegpt-4\--settingenhanced\--prompt_typeInjecAgent支持扩展新模型InjecAgent的设计具有良好的可扩展性开发者可以通过以下方式添加新模型支持classYourModel(BaseModel):def__init__(self,params):super().__init__()# 初始化模型defprepare_input(self,user_prompt_filled):# 准备模型输入returnmodel_inputdefcall_model(self,model_input):# 调用模型获取输出returnoutput# 注册到MODELS字典MODELS{Claude:ClaudeModel,GPT:GPTModel,Llama:LlamaModel,TogetherAI:TogetherAIModel,Your Model:YourModel}研究设定环境配置根据官方仓库的配置要求gitclone https://github.com/uiuc-kang-lab/InjecAgent.gitcdInjecAgentexportPYTHONPATH. pipinstall-rrequirements.txt支持的模型类型模型类型说明GPTOpenAIGPT-3.5-turbo、GPT-4等ClaudeAnthropic Claude系列TogetherAI通过Together.AI平台访问的开源模型Llama本地部署的Llama系列模型提示策略InjecAgent提示论文自定义的复杂提示模板专门设计用于IPI场景评估hwchase17_react标准的ReActReasoning Acting提示策略输出格式评估输出包含以下关键信息{ #Test Case: 1054, Valid Rate: **, ASR-valid (Direct Harm): **, ASR-valid (S1): ** }综合分析学术价值InjecAgent是首个系统性地针对工具集成LLM智能体间接提示注入攻击的基准测试研究。该研究填补了LLM智能体安全评估领域的重要空白——在此之前虽然有少量研究关注直接提示注入但针对间接提示注入这一更具现实威胁的攻击向量缺乏系统化的评估框架。论文选择在ACL 2024 Findings发表体现了该工作在自然语言处理与安全交叉领域的重要学术地位。36页的篇幅含6张图和13张表格也表明研究的深度和系统性。现实意义从现实角度看InjecAgent揭示的问题尤为值得关注攻击面的广泛性任何接入外部数据的LLM智能体如AI助手读取邮件、浏览网页、调用API都面临IPI风险。攻击的隐蔽性用户可能完全不知情——他们只是让智能体读取了一封邮件或访问了一个网页恶意指令便已悄然植入。后果的严重性从数据泄露到财产损失再到物理安全威胁IPI攻击的潜在后果覆盖了现实世界的多个层面。防御的挑战性即使是最先进的GPT-4也未能幸免说明当前的LLM安全机制在IPI面前存在系统性缺陷。研究的局限性尽管InjecAgent具有开创性意义但也存在一些值得注意的局限性测试用例虽然规模可观1,054个但相对于现实世界的无限多样性仍有局限评估主要关注攻击成功率对误报率false positive和防御机制的系统性评估相对有限后续研究如ChatInject已表明更复杂的攻击手法可以进一步提升在InjecAgent上的攻击成功率实践应用对开发者的建议部署前安全测试在将LLM智能体投入生产环境前使用InjecAgent进行全面的安全评估。输入输出监控对所有外部内容尤其是来自不可信来源的进行严格的内容过滤和异常检测。权限最小化原则限制智能体可调用的工具范围和操作权限即使被攻击也能将损害控制在最小范围。定期重新评估随着LLM模型的迭代和攻击技术的演进定期使用InjecAgent重新评估安全态势。对研究者的建议防御方案验证将InjecAgent作为评估防御策略有效性的标准基准。扩展测试用例基于InjecAgent的框架针对特定领域如网络运维、医疗等构建更专业的IPI评估基准。多轮交互场景探索在多轮对话和复杂工具链场景下的IPI攻击与防御。对企业的建议建立安全评估流程将InjecAgent纳入LLM应用的安全开发生命周期SDL。关注行业标准InjecAgent已获得学术界认可可作为内部安全标准的参考依据。红队演练使用InjecAgent的测试用例构建自动化红队测试能力。参考资料来源原始论文Zhan, Q., Liang, Z., Ying, Z., Kang, D. (2024). InjecAgent: Benchmarking Indirect Prompt Injections in Tool-Integrated Large Language Model Agents.Findings of the Association for Computational Linguistics: ACL 2024, pages 10471–10506.arXiv预印本https://arxiv.org/abs/2403.02691官方GitHub仓库https://github.com/uiuc-kang-lab/InjecAgentACL Anthologyhttps://aclanthology.org/2024.findings-acl.624/DOI10.18653/v1/2024.findings-acl.624

相关新闻

UE5对话系统开发指南:从数据驱动到高级集成的完整实现方案

UE5对话系统开发指南:从数据驱动到高级集成的完整实现方案

1. 项目概述:为什么UE5对话系统值得投入在UE5里折腾对话系统,这事儿我干过不止一次。从最早的简单文本气泡,到后来带分支选择、表情动画、语音同步的复杂叙事,踩过的坑能写满一张A4纸。很多刚接触UE5的朋友,尤其是从独…

2026/7/26 23:04:01 阅读更多 →
基于深度学习的垃圾分类识别系统设计与优化

基于深度学习的垃圾分类识别系统设计与优化

1. 项目背景与核心价值垃圾分类识别系统是近年来计算机视觉领域的热门应用方向。随着环保政策的推进,各地对垃圾分类的要求越来越严格,但人工分类效率低、成本高的问题始终存在。这个毕设项目正是瞄准了这一痛点,利用深度学习技术实现垃圾图像…

2026/7/26 23:03:00 阅读更多 →
智能系统故障排查五层框架|基础设施到服务到数据到模型到业务逐层定位

智能系统故障排查五层框架|基础设施到服务到数据到模型到业务逐层定位

摘要:智能系统故障排查五层框架:从基础设施层、服务层、数据层、模型层到业务层的逐层定位方法论。AI系统故障具有非确定性特征,根因可能跨多个层级。本文详解每层常见故障类型、排查工具、诊断步骤和跨层关联分析方法。 一、AI系统故障的特殊性 AI系统的故障排查之所以特殊…

2026/7/26 23:03:00 阅读更多 →

最新新闻

【问题已经解决】腾讯元宝,你欠用户一个稳定的解析管线——2026年7月16日起 smartcanvas 拉取崩溃纪实

【问题已经解决】腾讯元宝,你欠用户一个稳定的解析管线——2026年7月16日起 smartcanvas 拉取崩溃纪实

声明:本文所述内容,目前本人测试,已不在V2.78复现,感谢腾讯元宝团队,本文仅作为历史档案留存前言我是一个重度依赖腾讯文档 腾讯元宝的知识工作者。我的资料库、项目文档、团队协作笔记全部建立在腾讯文档的 smartcan…

2026/7/26 23:24:19 阅读更多 →
Debian服务器部署XFCE4+TigerVNC轻量远程桌面方案

Debian服务器部署XFCE4+TigerVNC轻量远程桌面方案

1. 项目背景与需求解析在Linux服务器管理领域,图形化远程桌面一直是运维人员和开发者的刚需。最近在部署Debian 13服务器时,发现很多同事不熟悉纯命令行操作,急需一套轻量级的图形化解决方案。经过多方案对比测试,最终选择了XFCE4…

2026/7/26 23:24:19 阅读更多 →
【SVM分类】基于花朵授粉算法优化最小二乘支持向量机实现数据分类matlab代码

【SVM分类】基于花朵授粉算法优化最小二乘支持向量机实现数据分类matlab代码

1 简介近年来,已有越来越多的建模方法被相关学者提出用来解决分类识别、风险预测、效能评估等问题,这些建模方法包括:时间序列分析、灰色理论、神经网络等。但是时间序列分析,方法复杂且预测精度较低;灰色理论需要规律…

2026/7/26 23:24:19 阅读更多 →
【元胞自动机】基于元胞自动机实现双车道靠右行驶交通流模型matlab代码

【元胞自动机】基于元胞自动机实现双车道靠右行驶交通流模型matlab代码

1 简介元胞自动机(Cellular Automata,简称CA)模型作为交通流理论的一种重要数学模型,具有时空离散、规则简单、计算效率高、易于实现等特点,一直都是交通流研究的一个热点,具有广阔应用前景。本文在现有元胞自动机交通流模型的基础上,建立双车道元胞自动机交通流模型。2 部分代…

2026/7/26 23:24:19 阅读更多 →
# 鸿蒙ArkTS实战:每日名言应用 — 随机格言展示与卡片式UI设计

# 鸿蒙ArkTS实战:每日名言应用 — 随机格言展示与卡片式UI设计

一、应用概述 每日名言(Daily Quote)是移动端最常见的内容展示类应用之一。在鸿蒙生态中,利用 ArkTS 构建一款随机展示中国经典谚语/名言的轻应用,不仅可以检验开发者对数据管理、组件封装、动画过渡等核心概念的理解&#xff0c…

2026/7/26 23:24:19 阅读更多 →
VC++实现二维图形变换:从矩阵原理到交互式程序开发

VC++实现二维图形变换:从矩阵原理到交互式程序开发

1. 项目概述:从理论到实践的图形学桥梁在计算机图形学的学习与实践中,二维图形变换是一个绕不开的经典课题。它不仅是理解三维图形学、游戏开发、计算机视觉等高级领域的基石,更是检验你是否真正掌握了图形学核心数学工具——矩阵运算——的绝…

2026/7/26 23:23:18 阅读更多 →

日新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/26 0:00:31 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/26 0:00:31 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/26 0:00:31 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/26 0:00:31 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/26 0:00:31 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/26 0:00:31 阅读更多 →

月新闻