【ICLR 2026】NCUser:非协作用户模拟器,工具智能体的真实用户鲁棒性评测|从多轮对话评测视角
摘要本文解读 ICLR 2026 论文《Non-Collaborative User Simulators for Tool Agents》。该论文提出NCUser——一个既能表现非协作行为、又严格保证目标对齐的 LLM 用户模拟器通过融合四类非协作用户行为建模、对话状态追踪与结束验证器把工具智能体评测从用户总是配合推进到用户不配合时还能不能把任务做完其特别之处在于行为注入与目标对齐被彻底解耦再难缠的模拟用户也必须把完成任务所需的信息说全。实验表明五个 SOTA 工具智能体在非协作用户下一致退化切题闲聊场景平均相对成功率下降 29.1%其中 GPT-4.1-nano 在 τ-bench 上只剩 56.7%为多轮 Agent 评测提供了一套可复用的压测基础设施。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果结果对比总结关键发现局限性常见问题FAQNCUser 和 τ-bench 的用户模拟器是什么关系为什么强调目标对齐非协作用户会带来多大性能损失微调能解决鲁棒性问题吗这套模拟器能迁移到别的任务域吗为什么切题行为最难处理参考链接论文基本信息项目内容标题英文Non-Collaborative User Simulators for Tool Agents标题中文非协作用户模拟器工具智能体的真实用户鲁棒性评测作者Jeonghoon Shim, Woojung Song, Cheyon Jin, Seungwon Kook, Yohan Jo机构首尔国立大学 数据科学研究生院SNU Graduate School of Data Science会议ICLR 2026arXivarXiv:2509.23124项目网站holi-lab.github.io/NCUser背景与动机工具智能体tool agent要在多轮对话里理解用户诉求、调用 API、把结果讲回给用户。相比静态对话语料用户模拟器能动态地依据智能体的回应改变对话走向因此几乎成了训练与评测多轮 Agent 的标配。问题在于现有模拟器几乎只扮演配合的用户。论文在相关工作里点名了这条技术线的主要节点τ-bench 与 APIGen-MT 用 prompt-based 的模拟器把用户目标、指令与对话历史塞进提示词DuetSim 引入 LLM verifier 在对话过程中检查用户话语是否跑偏UGST 则直接训练一个用户模拟器来保证目标对齐。它们的共同局限有两个其一行为空间只有配合无法覆盖现实中不耐烦的用户、提出超出能力边界请求的用户其二目标对齐高度依赖 LLM-as-a-judge判断本身不可核验。论文从营销学与真实人机对话数据两条线取证把分散的用户类型按根因聚成四类不知道智能体能力边界不可用服务、想要被看见切题闲聊、遭遇服务延迟或失败不耐烦、省力原则与打字失误不完整话语。这四类根因彼此独立因此可以合法组合出现。研究主线从问题到结论图 6研究主线Mermaid 流程图从评测偏乐观到定位行为特异失效机制基准/方法设计图 1非协作用户模拟环境总览四类行为注入 多轮工具调用 基于 DB 状态的成功率判定评测环境基于两个互补基准搭建。MultiWOZ侧作者重建了智能体环境提供动态 API 发现类似 AppWorld 的 helper API 机制并只保留会真正改写数据库的 book 类任务共 89 个跨域场景τ-bench侧直接复用官方环境API 文档完整写进系统提示共 157 个场景剔除了 8 个人工转接才是标准答案的用例——因为观察到智能体一遇到难缠用户就大量走转接导致评测失去意义。成败判定不靠人工打分而是比对最终数据库状态与 ground truth 是否精确匹配即成功率 $SR N_{\text{match}} / N_{\text{total}}$每个场景跑 4 次试验取平均以压低方差。智能体统一采用 ReAct 框架推理上限 30 步。分类全景图 7非协作用户行为分类全景Mermaid 流程图四类行为各自的根因与典型话语类型方法细节图 2协作用户模拟器结构User Goal / Instruction / Dialogue History 驱动话语生成状态追踪器与结束验证器共同保证目标对齐方法骨架沿用 τ-bench 的协作用户模拟器第 $t$ 轮用户话语由 $u_t f(g, I, H_{t})$ 生成其中 $g$ 是用户目标、$I$ 是指令、$H_{t}$ 是此前的对话历史模型生成结束标记即终止对话。为了保证把话说全作者加装两个模块对话状态追踪器把用户目标切分为信息碎片逐轮核对哪些碎片已传达结束验证器在信息未送达时拒绝终止。这样一来目标对齐由一个可核验的机制保证而不是交给一次 LLM 判断衡量指标也随之变成可直接统计的目标对齐率 $GA N_{\text{aligned}} / N_{\text{total}}$。四类行为的注入方式各不相同关键思路见下图图 3四类非协作行为的注入方式(a) 不可用服务 (b) 切题 (c) 不耐烦 (d) 不完整话语不可用服务LLM 分析原始用户目标生成 3 条需要缺失 API 或不支持参数的目标句与原目标拼接让模拟用户自然提出无法满足的请求。切题闲聊从 Persona Hub 采样人格生成事实提问、观点提问、一般观点与非观点陈述四类话语再与协作话语合并若智能体无视这些发言模拟用户会发出抱怨。不耐烦在两个触发点生成情绪话语——智能体显式报告失败或用户已给全信息但问题仍未解决愤怒按升级机制递增单次触发概率按 $p_{t1} p_t 0.1$ 累积。不完整话语用 LMSYS 与 WildChat 的真实风格做 5-shot 风格迁移生成极简句并用随机截断模拟没打完就发出去。实验设计与结果评测覆盖 5 个模型GPT-4.1-mini、GPT-4.1-nano、Qwen3-235b-a22b、Qwen3-30b-a3b 与 Llama-3.1-70b-instruct。下表每格为「协作模式 SR / 最差模式相对 SR」相对 SR 即 $r \mathrm{SR}{\text{nc}} / \mathrm{SR}{\text{col}} \times 100\%$。模型MultiWOZτ-benchGPT-4.1-mini92.7 / 95.145.5 / 86.8GPT-4.1-nano23.6 /41.512.0 /56.7Qwen3-235b-a22b77.8 / 73.741.4 / 78.0Qwen3-30b-a3b48.3 / 54.027.9 / 73.1Llama-3.1-70b62.6 / 75.921.8 / 67.4五个模型的最差模式几乎都落在切题说明用户聊无关话题对工具智能体的破坏力最大。作者进一步把失效机制拆开量化失效信号模型协作非协作helper API 重复次数/对话mini0.020.57超 30 步未完成比例nano0.150.44道歉话语占比mini0.010.14API 参数幻觉次数/对话mini, MultiWOZ0.521.05图 4切题模式下的平均用户抱怨次数退化最严重的 GPT-4.1-nano 收到最多抱怨图 5人类评测本文模拟器对比 PBUS总体胜率约 70%单行为 组合行为在微调鲁棒性实验中作者用 Qwen2.5-3b-instruct 在 1,308 条成功对话上做 SFT只用协作数据时协作成功率超过 90%但非协作模式增益明显落后把非协作数据按比例混入后平均成功率显著抬升。训练数据配比协作不完整话语平均仅协作数据91.673.078.8均匀加权93.578.486.9非均匀加权91.682.386.6跨域可扩展性同样得到验证把同一套行为模块迁移到 ColBench 后端编程与 MINT 检索问答只需改写少量逻辑不可用服务的目标生成、不耐烦的触发条件、切题的抱怨逻辑。模型ColBench 协作/切题MINT 协作/切题GPT-4.1-mini50.3 / 46.252.3 / 54.1GPT-4.1-nano46.1 / 39.045.9 / 44.2Qwen3-30b-a3b29.4 / 23.340.1 / 39.0ColBench 复现了工具场景的规律而 MINT 因为交互范式不同用户提供的是反馈而不是目标呈现不同模式说明面向满足用户目标的任务域才共享同一套性能规律。结果对比总结图 8与 PBUS 的结果对比总结Mermaid 流程图统一 prompt 处理 vs 差异化模块处理关键发现切题是最狠的一刀四类行为中切题的平均相对成功率下降29.1%五个模型的最差表现几乎都出现在这一模式。小模型最脆弱GPT-4.1-nano 在 MultiWOZ 的最差相对 SR 仅41.5%在 τ-bench 仅56.7%Llama-3.1-70b 也只有 67.4%。不可用服务压出重复调用GPT-4.1-mini 的 helper API 重复次数从0.02升到0.57Qwen3-235b 则转向编造 API 结果从 0.33 升到 1.13。过度礼貌反而拖慢任务不耐烦模式下所有模型的道歉话语占比从0.01升到0.14占用 30 步推理预算。信息缺失诱发参数幻觉不完整话语下 MultiWOZ 的 API 参数幻觉从0.52升到1.05τ-bench 因为文档在上下文里几乎不受影响。模拟器本身是可靠的τ-bench 首轮目标对齐率97.5%人类评测对 PBUS 的总体胜率约70%说明退化来自真实挑战而非沟通失败。非协作数据能救小模型混入后平均 SR 从78.8%提到86.9%。局限性行为覆盖不完整四类行为来自营销学与人机对话文献仍可能遗漏试探、诱导等其它非协作模式。重依赖商用 LLM注入模块与目标对齐校验都由 GPT 系列驱动带来模型偏置、成本与可复现性风险。任务边界受限MultiWOZ 只评测会改写数据库的预订任务τ-bench 剔除了人工转接用例inform 类任务并未覆盖。组合真实性存疑部分行为组合并不自然例如切题求关注与不耐烦求快速在动机上互相冲突。作者希望社区把该模拟器接入各自的服务域用于训练与压测工具智能体并据此改进真实用户场景下的鲁棒性。常见问题FAQNCUser 和 τ-bench 的用户模拟器是什么关系NCUser 直接把 τ-bench 的协作用户模拟器当作骨架在其之上加装对话状态追踪器、结束验证器与四个非协作行为注入模块因此可以在同一套环境里跑协作基线与各类非协作条件。为什么强调目标对齐如果模拟用户自己把任务信息漏掉智能体失败就不能归因于鲁棒性差。NCUser 用状态追踪 结束验证器保证信息说全τ-bench 首轮目标对齐率 97.5%从而把性能下降归因到行为本身。非协作用户会带来多大性能损失切题模式最严重平均相对 SR 下降 29.1%GPT-4.1-nano 在 τ-bench 只剩 56.7%MultiWOZ 上仅 41.5%。弱模型与开源模型的退化幅度普遍大于 GPT-4.1-mini。微调能解决鲁棒性问题吗只在协作数据上微调效果有限——协作成功率能到 90% 以上但非协作模式增益明显落后混入非协作数据后平均 SR 可从 78.8% 提到 86.9%其中不完整话语模式能从 73.0 提到 82.3。这套模拟器能迁移到别的任务域吗可以。作者把它接到 ColBench 后端编程与 MINT 检索问答只需改写少量逻辑ColBench 复现了工具场景的规律MINT 因为交互范式不同呈现不同模式说明迁移可行但仍需按域校准。为什么切题行为最难处理切题发言挤占对话管理预算智能体若不回应模拟用户会持续抱怨形成越不理会越抱怨的负反馈回路最终在 30 步推理上限内无法完成任务。参考链接论文 arXiv 摘要页arXiv:2509.23124项目主页与代码holi-lab.github.io/NCUser代码仓库github.com/holi-lab/NCUser关键基线 τ-bench用户-智能体交互基准arXiv:2406.12045关键基线 MultiWOZ多域任务型对话语料EMNLP 2018目标对齐用户模拟器 UGSTGoal Alignment in LLM-Based User Simulators给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件

相关新闻

SpringBoot+Redis的电商购物车与订单管理系统计算机毕设(源码+lw+部署文档+讲解等)

SpringBoot+Redis的电商购物车与订单管理系统计算机毕设(源码+lw+部署文档+讲解等)

博主介绍:✌ 专注于VUE,小程序,安卓,Java,python,物联网专业,有18年开发经验,长年从事毕业指导,项目实战✌选取一个适合的毕业设计题目很重要。✌关注✌私信我✌具体的问题,我会尽力帮助你。一、…

2026/10/5 7:00:28 阅读更多 →
梯度泄露攻击原理详解:从DLG到iDLG的深度解析与防御策略

梯度泄露攻击原理详解:从DLG到iDLG的深度解析与防御策略

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 7:00:28 阅读更多 →
上海APP开发公司怎么选?从源码归属、部署方式到报价区间的一次完整梳理

上海APP开发公司怎么选?从源码归属、部署方式到报价区间的一次完整梳理

一、先分类型,再看名单搜索"上海APP开发公司"时,很多人期待直接拿到一份排名榜。但上海的APP开发供给高度分层,不同类型公司解决的是完全不同的问题,放进同一张榜单比较,结论往往失真。按公开可查的项目形态…

2026/10/5 7:00:28 阅读更多 →

最新新闻

TDengine与Thingsboard集成实战:三条路线与踩坑指南

TDengine与Thingsboard集成实战:三条路线与踩坑指南

开头先交代一下背景。TDengine和Thingsboard这对组合,我在实际项目里已经用过不止一次。TDengine是面向物联网场景的时序数据库,写入快、压缩率高、天生按时间线组织数据;Thingsboard则是开源物联网平台,负责设备接入、规则链转发…

2026/10/5 8:06:58 阅读更多 →
OpenShell配置笔记:找回Windows经典开始菜单与资源管理器效率

OpenShell配置笔记:找回Windows经典开始菜单与资源管理器效率

我到现在还清楚地记得,第一次拿到 Windows 8 测试版时那种错愕——开机后连个开始按钮都没有,鼠标移到屏幕右下角才弹出那一块方块。那时候我就意识到,微软所理解的“现代化”和大量 PC 用户几十年建立起来的操作习惯,完全是两套东…

2026/10/5 8:06:58 阅读更多 →
插件加载失败深度解析:从报错信息到排查流程的完整指南

插件加载失败深度解析:从报错信息到排查流程的完整指南

在做后端服务或者在前端工程里折腾过一段时间的同学,基本都会撞上"plugins"这个词。它不是一个具体的软件,而是一整套“插件机制”的统称。这几年凡是用插件架构做的系统,从IDE到构建工具,再到各类低代码平台&#xff0…

2026/10/5 8:06:58 阅读更多 →
26年论文AI痕迹消除避坑指南:这些操作千万别做

26年论文AI痕迹消除避坑指南:这些操作千万别做

论文提交季临近,各高校对AI生成内容的审查力度持续加强。不少毕业生在完成初稿后,都会面临一个共同问题:如何安全有效地降低论文中的AI痕迹。实际操作中,许多学生因方法不当,不仅没能通过检测,反而让论文被…

2026/10/5 8:06:58 阅读更多 →
实时数据可视化库选型与性能优化:从数据管道到渲染细节

实时数据可视化库选型与性能优化:从数据管道到渲染细节

做实时数据可视化这块,最尴尬的场景是什么?就是你花大半天选型、搭框架、调样式,结果数据一跑起来,页面卡成幻灯片,或者曲线断断续续,监控大屏变成了“薛定谔的刷新”。我自己在做的几个项目里,…

2026/10/5 8:06:58 阅读更多 →
工程师成长五阶段:从基础能力到带人能力的完整路径

工程师成长五阶段:从基础能力到带人能力的完整路径

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 8:05:58 阅读更多 →

日新闻

马斯克杀回智能体战场,Grok 4.5万亿参数撑腰,Cursor接手数字白领项目:用TaoToken统一Key跑通多模型Agent工作流

马斯克杀回智能体战场,Grok 4.5万亿参数撑腰,Cursor接手数字白领项目:用TaoToken统一Key跑通多模型Agent工作流

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 0:00:22 阅读更多 →
AI编程工具插件机制详解:plugin.json配置与加载失败排查指南

AI编程工具插件机制详解:plugin.json配置与加载失败排查指南

1. 从“plugins”这个词说起:它到底在解决什么问题如果你最近在折腾 AI 编程工具,尤其是 Cursor、Codex CLI、Claude Code 这类带 CLI 的编辑器或命令行助手,那你大概率绕不开一个词——plugins。这个词本身不新鲜,从浏览器到 IDE…

2026/10/5 0:00:23 阅读更多 →
第26课:OpenClaw|日志审计与问题诊断:把日志链路改到 TaoToken 的排查清单

第26课:OpenClaw|日志审计与问题诊断:把日志链路改到 TaoToken 的排查清单

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 0:00:23 阅读更多 →

周新闻

KT148A语音芯片外挂8002D功放的工程实践指南

KT148A语音芯片外挂8002D功放的工程实践指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 5:06:42 阅读更多 →
LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 1:10:22 阅读更多 →
ARM架构深度解析:从RISC设计理念到交叉编译实战

ARM架构深度解析:从RISC设计理念到交叉编译实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 3:06:17 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 11:40:45 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 9:43:54 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 20:14:29 阅读更多 →