[论文学习]AgentSocialBench:以人为中心的主体社交网络中的隐私风险评估
AgentSocialBench以人为中心的主体社交网络中的隐私风险评估论文重点本文提出了首个系统性评估以人为中心的主体社交网络中隐私风险的基准测试框架 AgentSocialBench。该基准涵盖七大场景类别、超过300个测试场景在八种主流LLM模型上进行的实验揭示了两个关键发现跨域和跨用户协调会产生持续的隐私泄露压力即使明确指示代理保护信息也无法完全避免而教导代理如何抽象敏感信息的隐私指令反而会导致它们更多地讨论敏感信息——作者将这一反直觉现象称为“抽象悖论”Abstraction Paradox。核心研究内容问题定义随着OpenClaw等个性化、持久化LLM代理框架的兴起以人为中心的主体社交网络正成为现实——协作式AI代理团队在社交网络中为个体用户服务跨越多个领域。这一场景带来了全新的隐私挑战代理必须跨越领域边界进行协调、在人与人之间进行中介、并与其他用户的代理交互同时保护敏感个人信息。然而现有基准测试如MultiAgentBench、MAGPIE、MAMA、AgentLeak等均未系统性地评估这一场景下的隐私风险。核心研究问题是在当前LLM代理以提示工程为主要隐私保护手段的前提下它们在以人为中心的主体社交网络中能否有效保护用户隐私创新方法1首个系统性基准框架AgentSocialBench是第一个针对以人为中心的主体社交网络隐私风险的系统性评估基准包含超过300个测试场景横跨七大类别。2真实用户画像与多层隐私边界每个场景基于涵盖六个领域的合成用户画像构建每个属性均带有1–5级的敏感度标签。同时引入有向社交图边属性包含关系上下文和亲密度层级。3四类隐私约束的正式建模基于情境完整性理论Nissenbaum, 2004将隐私规范操作化为四类约束——领域边界、用户边界、中介边界和亲密度调节边界。4三层隐私指令梯度与防御机制从L0无隐私指导到L1显式隐私规则再到L2完整防御领域边界提示信息抽象模板最小信息原则实现精细化的隐私-效用边界测量。5多维评估指标包括隐私泄露率细分为全泄露和部分泄露、信息抽象分数和任务完成质量由LLM评判器评估并经过人工专家验证。研究成果跨域泄露最为严重在所有模型中跨域泄露率CDLR约为中介通信MLR和跨用户CULR泄露率的2–3倍。DeepSeek V3.2的CDLR为0.51而MLR仅为0.21。这表明团队内协调产生的泄露压力远大于结构上隐私边界更明确的交互类型。抽象悖论隐私指令教导代理抽象敏感信息反而可能增加泄露。具体机制是完全泄露从L0到L2大幅下降但部分泄露因代理采用抽象语言而增加。在基线泄露本就较低的MC和CU场景中抽象引入的“新泄露”超过其修复的“旧泄露”导致净泄露上升。防御无效用损失在所有防御级别下任务完成质量保持稳定表明隐私保护措施不产生可测量的效用成本。多参与方场景呈现差异化特征社交结构对隐私行为的影响与显式指令同等重要。群聊泄露率与双人中介相当Hub-and-Spoke中协调者成为交叉污染的单一风险点而竞争场景中对抗压力使代理更加谨慎。隐式泄露持续存在即使在全防御下隐式泄露仍然很高因为这要求代理推理“可以被推断出什么”而不仅仅是“明确说了什么”。实际落地应用的可能性1主体社交平台的安全审计随着Moltbook等平台在短时间内吸引超过160万注册代理AgentSocialBench可作为平台上线前的隐私安全评估工具。2隐私保护提示工程的优化指南研究发现提示工程存在根本性局限为开发者提供了“何时该保持沉默而非抽象化”的实践指导。3多代理系统隐私标准的基准参考可作为行业标准测试集用于比较不同LLM代理框架的隐私保护能力。4监管合规的评估工具为涉及AI代理处理个人数据的应用提供可量化的隐私风险评估手段。技术细节场景分类体系AgentSocialBench包含七大类场景双人交互Dyadic跨域CD用户的不同领域代理协调任务要求信息从源域流向目标域如健康代理需与社交代理分享饮食限制但不透露背后的诊断中介通信MC代理在两人之间充当中介知晓用户的隐私信息但需在不披露的情况下促成对话如策划惊喜生日晚餐时隐藏用户的预算限制跨用户CU不同用户的代理通过A2A协议通信产生双向隐私风险多参与方交互Multi-party群聊GC代理需在广播和私密消息之间做出选择Hub-and-SpokeHS协调者聚合信息且不发生交叉污染竞争CM在竞争压力下的自我泄露亲密度调节AM按非对称亲密度层级逐接收者执行分享规则四类隐私约束的数学形式化设用户集合U{u1,…,un}\mathcal{U}\{u_1,\ldots,u_n\}U{u1​,…,un​}有向社交图G(U,E)\mathcal{G}(\mathcal{U},\mathcal{E})G(U,E)。每个用户uiu_iui​由领域专业化代理团队Ai{aid1,…,aidk}\mathcal{A}_i\{a_i^{d_1},\ldots,a_i^{d_k}\}Ai​{aid1​​,…,aidk​​}服务其中dj∈Dd_j\in\mathcal{D}dj​∈D表示领域如健康、金融、社交。每个代理aida_i^daid​持有用户在该领域的私有信息切片PidP_i^dPid​全集Pi⋃d∈DPidP_i\bigcup_{d\in\mathcal{D}}P_i^dPi​⋃d∈D​Pid​构成用户的完整私有画像。四类约束领域边界敏感度 ≥ τ设为3的信息不应在输出中逐字出现用户边界PiP_iPi​中的信息不应向Aj\mathcal{A}_jAj​j≠ij\neq iji披露中介边界代理不能透露超出用户授权的隐私信息亲密度调节边界每条有向边携带亲密度层级αij∈{close,friend,acquaintance,stranger}\alpha_{ij}\in\{\text{close},\text{friend},\text{acquaintance},\text{stranger}\}αij​∈{close,friend,acquaintance,stranger}权限按层级单调限制且不对称评估指标隐私泄露率Leakage RateLRs∣{i:leak(i)∈{partial,full}}∣∣private items∣LR_s \frac{|\{i: \text{leak}(i) \in \{\text{partial}, \text{full}\}\}|}{|\text{private items}|}LRs​∣private items∣∣{i:leak(i)∈{partial,full}}∣​每个私有项被分类为无泄露、部分泄露暗示或可推断或完全泄露明确陈述。根据场景类型报告类别特定变体cdlr, mlr, culr, mplr, halr, cslr/cer, acs。信息抽象分数Information Abstraction Score, IAS衡量代理是否将敏感信息转化为可接受的抽象表述评分0无抽象、0.5部分或1.0完全。任务完成质量Task Completion Quality, TCQ五级评分0任务失败到1.0完全完成。防御机制三层隐私指令梯度L0无约束无隐私指导代理需从社会规范推断隐私期望L1显式将硬性隐私规则注入代理提示词L2完整防御在L1基础上叠加三项增量防御领域边界提示DBP跨域共享的敏感度阈值信息抽象模板IAT提供显式映射表最小信息原则MIP添加分享前检查清单研究设定模型配置评估八种LLM骨干网络闭源模型六种GPT-5 Mini、Claude Haiku 4.5、Claude Sonnet 4.5、Claude Sonnet 4.6、Kimi K2.5、MiniMax M2.1开源模型两种DeepSeek V3.2、Qwen3-235B评判器LLM与代理骨干网络分离以避免自我评估偏差。采用Claude Opus 4.6作为所有维度的评估器。模拟配置最大交互轮数CD/MC/CU为10轮GC/AM为15轮HS/CM为12轮代理LLM调用温度0.7人类模拟器调用温度0.8场景生成双人类别使用GPT-5.2多参与方类别使用Claude Opus 4.6数据规模超过300个测试场景七个场景类别每个场景包含人工专家标注的成功标准六领域用户画像医疗状况与药物、收入与债务水平、关系动态、日程安排、工作评价、饮食偏好综合分析理论贡献AgentSocialBench最深刻的理论贡献在于揭示了提示工程作为隐私保护手段的根本性局限。研究发现当前最先进的LLM代理缺乏在主体社交网络中保护隐私的稳健机制。这一结论的意义远超单纯的“模型表现不佳”——它指向了一个更深层的问题LLM的“有用性”本能与隐私保护的“克制”要求之间存在结构性矛盾。当教导代理如何用抽象语言替代敏感信息时代理反而更倾向于谈论这些话题因为它获得了“安全的表达方式”。这类似于人类行为中的一个经典现象给予某人一个“政治正确”的表述模板反而可能增加其谈论敏感话题的频率。方法论创新从方法论角度看AgentSocialBench建立了从单代理到多代理、从双人到多参与方、从单一领域到跨领域的隐私评估完整谱系。与现有基准的对比尤为清晰ConfAIde和PrivLM-Bench仅评估单代理MAGPIE虽评估多代理但无跨域、无中介、无社交图MAMA研究拓扑对PII提取的影响但仅通过对抗性探测AgentLeak覆盖企业工作流中的七种泄露通道但不评估跨域、中介或多参与方动态。AgentSocialBench是唯一同时覆盖多代理、跨域、中介、跨用户、多参与方和社交图六个维度的基准。核心发现的内涵跨域泄露最为严重这一发现具有重要的实践含义领域边界可能是隐私保护中最薄弱的环节。当信息需要在同一用户的多个代理之间流动时隐私泄露的压力最大——因为代理“有理由”分享信息以完成任务。这提醒我们隐私风险不仅来自恶意外部攻击更来自系统内部合法的信息流动需求。抽象悖论的发现尤其值得深思。它揭示了一个反直觉的事实在某些情况下如MC和CU场景最有效的隐私保护策略可能是“保持沉默”而非“学会如何说得更巧妙”。这对当前的提示工程实践提出了挑战——我们可能需要重新思考是教代理“如何说”还是教代理“何时不说”对未来的启示论文明确指出“需要超越提示工程的新方法”。这意味着未来的隐私保护可能需要从架构层面入手——例如设计专门的隐私保护模块、引入差分隐私机制、或在代理的推理过程中嵌入隐私预算的概念。这为后续研究开辟了重要的方向。实践应用对开发者的建议场景化隐私测试在部署AI代理系统前使用AgentSocialBench的场景分类进行系统化隐私风险评估特别关注跨域协调场景警惕“过度抽象化”不要盲目相信“教代理如何抽象表达”就是安全的。在基线泄露较低的场景中引入抽象模板反而可能增加泄露区分场景策略在CD等高基线泄露场景中抽象化防御有效在MC和CU等低基线泄露场景中应优先考虑“保持沉默”策略关注隐式泄露即使代理没有明确说出敏感信息多个非敏感信息的组合也可能导致隐私推断对平台运营者的建议将AgentSocialBench纳入CI/CD流程作为模型更新或新场景上线前的隐私安全回归测试建立隐私泄露监控体系参考论文的泄露分类完全/部分/无建立实时的隐私泄露监控仪表板设计防御的增量部署策略参照DBP→IAT→MIP的增量框架分阶段部署防御措施并测量边际效果对研究者的建议探索架构级隐私保护机制提示工程的局限性已被证实下一步应研究模型架构层面的隐私保护设计研究“抑制性”而非“替代性”隐私干预当沉默是自然默认状态时有效干预可能需要抑制而非替代表达扩展至更多社会场景当前基准包含七大类别可进一步扩展至更多现实社交场景参考资料来源原始论文: https://arxiv.org/abs/2604.01487PDF全文: https://arxiv.org/pdf/2604.01487HTML版本: https://arxiv.org/html/2604.01487v2

相关新闻

【无人机三维路径规划】基于爬行动物搜索算法RSA实现复杂城市地形下无人机避障三维航迹规划附Matlab代码

【无人机三维路径规划】基于爬行动物搜索算法RSA实现复杂城市地形下无人机避障三维航迹规划附Matlab代码

✅作者简介:热爱科研的Matlab仿真开发者,修心和技术同步精进,代码获取、论文复现及科研仿真合作可私信。🍎个人主页:Matlab科研工作室🍊个人信条:格物致知。更多Matlab完整代码及仿真定制内容点…

2026/8/9 0:58:11 阅读更多 →
2023年长春理工大学考研难度较低的专业 - 学工系统|学工平台|学生管理系统|学生信息管理系统|学工管理平台|智慧学工|智慧学工系统

2023年长春理工大学考研难度较低的专业 - 学工系统|学工平台|学生管理系统|学生信息管理系统|学工管理平台|智慧学工|智慧学工系统

✅作者简介:合肥自友科技 📌核心产品:智慧校园平台(包括教工管理、学工管理、教务管理、考务管理、后勤管理、德育管理、资产管理、公寓管理、实习管理、就业管理、离校管理、科研平台、档案管理、学生平台等26个子平台) 。公司所有人员均有多…

2026/8/9 0:57:10 阅读更多 →
Goldberg Steam Emulator终极指南:构建无需Steam的局域网游戏环境

Goldberg Steam Emulator终极指南:构建无需Steam的局域网游戏环境

Goldberg Steam Emulator终极指南:构建无需Steam的局域网游戏环境 【免费下载链接】SteamEmulator MIRROR REPO - Credits : Mr. Goldberg. Steam emulator that emulates Steam online features. Lets you play games that use the Steam multiplayer APIs on a LA…

2026/8/9 0:56:10 阅读更多 →

最新新闻

Flutter与OpenHarmony开发逆向思维训练App实践

Flutter与OpenHarmony开发逆向思维训练App实践

1. 项目背景与核心思路作为一名移动端开发者,我最近尝试了一个很有意思的技术组合:用Flutter框架为OpenHarmony系统开发一款逆向思维训练App。这个项目最初源于一个简单的需求——如何让用户在碎片化时间里高效提升逻辑思维能力。经过多次迭代&#xff0…

2026/8/9 3:46:37 阅读更多 →
DeepSeek大模型:从技术自主到工程落地的实践路径与挑战

DeepSeek大模型:从技术自主到工程落地的实践路径与挑战

最近一段时间,在技术圈和一些行业讨论里,出现了一个很有意思的说法:有人将国产大模型“DeepSeek”称为“国运级”项目。这个词的分量很重,听起来宏大,甚至有些遥远。作为一个长期关注技术落地和产业实践的人&#xff0…

2026/8/9 3:46:37 阅读更多 →
Qwen-Image-3.0商用版发布:降低视觉AI集成门槛的实战指南

Qwen-Image-3.0商用版发布:降低视觉AI集成门槛的实战指南

如果你最近在关注多模态大模型,特别是需要处理图像、文档、图表等视觉信息的场景,那么今天要聊的Qwen-Image-3.0正式商用,绝对是一个值得你停下手里工作,花十分钟仔细了解的关键节点。这不仅仅是一个“又一个大模型发布了”的新闻…

2026/8/9 3:46:37 阅读更多 →
AI赋能:从重复劳动到超级个体的工作流重塑与效率跃迁

AI赋能:从重复劳动到超级个体的工作流重塑与效率跃迁

1. 项目概述:当“养虾本”遇上AI,一场认知革命正在发生“养虾本”这个词,最近在不少社群里火了起来。它不是什么高科技产品,也不是新的商业模式,而是一个略带自嘲的比喻——形容那些记录着琐碎、重复、低价值工作的笔记…

2026/8/9 3:46:37 阅读更多 →
AI编程工具对比:Cursor与Claude Code的哲学分野与实战选择

AI编程工具对比:Cursor与Claude Code的哲学分野与实战选择

1. 从工具到伙伴:AI编程的范式转移最近和几个技术团队的朋友聊天,发现一个挺有意思的现象:大家桌面上的编程工具正在悄然分化。一部分人,尤其是那些追求极致效率、喜欢“开箱即用”的开发者,开始把 Cursor 设为了默认编…

2026/8/9 3:46:37 阅读更多 →
8. 一键出报告,结果填入HTML模板

8. 一键出报告,结果填入HTML模板

配套动画视频在《8. 一键出报告:结果填入HTML模板》,源代码在《评论区置顶》。 截图有了,还差一份能打开看的测试报告。这一节把结果填进 HTML 模板:先声明工具入参,再把输出路径和截图路径规范到工程内;有…

2026/8/9 3:45:37 阅读更多 →

日新闻

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁 【免费下载链接】baidupankey 在线查询网盘提取码(维护中 rm repo) 项目地址: https://gitcode.com/gh_mirrors/ba/baidupankey 你是否曾经在深夜寻找一份重要资料&#x…

2026/8/9 0:01:47 阅读更多 →
如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/9 0:01:47 阅读更多 →
收藏!小白程序员轻松入门大模型,从Harness工程开始实践

收藏!小白程序员轻松入门大模型,从Harness工程开始实践

文章强调学习大模型不应只关注模型本身,而应重视模型外的系统搭建,即Harness。提出AgentModelHarness的实用公式,详细介绍Harness的四个层次:持久化层、执行层、控制层和观察与验证层。文章还探讨了上下文工程、工具设计、AGENTS.…

2026/8/9 0:03:48 阅读更多 →

周新闻

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁 【免费下载链接】baidupankey 在线查询网盘提取码(维护中 rm repo) 项目地址: https://gitcode.com/gh_mirrors/ba/baidupankey 你是否曾经在深夜寻找一份重要资料&#x…

2026/8/9 0:01:47 阅读更多 →
如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/9 0:01:47 阅读更多 →
收藏!小白程序员轻松入门大模型,从Harness工程开始实践

收藏!小白程序员轻松入门大模型,从Harness工程开始实践

文章强调学习大模型不应只关注模型本身,而应重视模型外的系统搭建,即Harness。提出AgentModelHarness的实用公式,详细介绍Harness的四个层次:持久化层、执行层、控制层和观察与验证层。文章还探讨了上下文工程、工具设计、AGENTS.…

2026/8/9 0:03:48 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/8 17:02:44 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/9 0:45:04 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/8 17:02:44 阅读更多 →