Agent 评测别把「调优 Loop」 跑成「刷题 Loop」
创作型 Agent 的评测不能只盯固定 benchmark。更可靠的做法是用 Scenario Model 每轮生成样本外任务再让 baseline 和 candidate 在同一批新题上做配对比较。导语Agent 系统最容易让团队产生安全感的东西是一条向上的 ​benchmark 曲线​。今天 72 分下周 81 分再过两周 89 分。看起来系统在变强prompt 更稳工具调用更准失败 case 越来越少。但这里有个不舒服的问题它是真的更会做新任务了还是只是越来越熟悉那套题对创作型 Agent 来说这个问题尤其危险。这类 Agent 不是回答标准题而是在开放创作空间里完成任务。用户的需求会换场景、换素材、换约束、换验收标准。固定 benchmark 能帮你挡回归却不能长期证明 ​泛化能力​。图分数上涨不等于新任务能力上涨问题不在 Agent 会不会循环而在团队怎么调系统很多人说 Agent Loop指的是单次任务里的循环理解目标 - 调工具 - 观察结果 - 修正 - 再执行这很重要但评测体系里还有一层更关键的 loop跑 benchmark - 看失败 case - 改 skill / tool / schema / prompt / evaluator - 再跑 benchmark这才是系统优化循环。一个创作型 Agent 的表现通常不是由模型单点决定的。它背后有工具、编辑器能力、schema、资源库、模板、skill、retry 策略和 evaluator。团队每次看到失败 case 后都会改一点系统。问题也出在这里。当固定 benchmark 反复参与这个优化循环它就不再只是测试集而开始变成 ​训练信号​。这里的训练不一定是模型训练也可能是工程层面的适配。比如某个失败 case 被写进 skill某类工具调用被特殊加强某个 evaluator 偏好反过来塑造 executor 输出。几轮之后系统确实更会做这套题了但这不等于更会处理新的创作请求。这就是 Benchmark Loop。固定题有价值但别让它背两个职责固定 benchmark 不是错。它很适合回答一个问题已知能力有没有退化某个工具之前能不能调用某个已修 bug 有没有复现某条高频路径是否仍然稳定这些都应该用固定集看。因为题目不变跨轮比较才有意义。问题在于很多团队会让固定集同时承担第二个职责证明系统泛化能力提升。这就麻烦了。评测职责固定 benchmark 是否适合原因回归防护适合题目固定能跨轮比较已修问题复测适合可以确认 bug 是否复现泛化能力证明不适合单独承担长期参与优化后会被污染新任务适应性不适合单独承担用户需求空间远大于固定题库Goodhart 定律在这里很直接当 benchmark 分数变成目标它就不再只是质量代理指标。测试集污染也不只发生在模型训练语料里。Agent 系统的污染常常发生在 prompt、skill、tool 和 evaluator 这些工程层。不要拿练习册原题考试可以把创作型 Agent 想象成一个正在学复杂创作软件的人。固定 benchmark 是练习册。练习册能帮他掌握基础动作但考试不能永远考原题。否则你看到的是记忆而不是能力。更合理的方式是保留固定题检查基础能力有没有退化。每轮根据真实任务空间生成一批新题。baseline 和 candidate 在同一批新题上同时跑。逐 case 比较谁做得更好。有价值的新题经过 review 后再考虑进入长期回归集。这套方法的核心是把固定题和新题的职责分开。固定题守底线。新题测泛化。图固定题守底线轮换题测泛化Scenario Model维护出题模型而不是只维护题库如果每轮都要有新题题从哪里来不能让 LLM 随机编一批 prompt。那样会生成很多坏题需求不自然、验收标准不清、要求产品做不到的能力或者内部 metadata 直接泄露给 executor。需要维护的是 Scenario Model也就是场景模型。它建模的不是物理世界而是创作任务空间用户会提出什么样的需求这些需求会覆盖哪些工具能力、编辑器 schema、素材资源、项目结构、运行时行为和验收标准。Scenario Model 的输入可以包括真实用户请求分布常见创作任务类型已有评测 casetool 能力与 schemaasset catalog 和 template历史失败样本产品当前重点方向它输出的不是新的长期题库而是每一轮评测开始时冻结的一批 Rotating Evaluation Set。Rotating Set同轮配对跨轮不硬比新题带来一个现实问题每轮题都不一样分数怎么比答案是不要直接比较不同轮次的绝对分。要比较同一轮里 baseline 和 candidate 在同一批新题上的表现。流程可以这样设计图同一批新题内比较 baseline 与 candidate配对比较比绝对分更重要。CaseBaselineCandidate判断AFailPass候选版本改善BPassPass持平CPassFail候选版本退化DFailFail共同能力缺口如果 candidate 在同一批新任务上明显多赢、少退化才有理由说这轮系统改动提升了样本外能力。第 N 轮 70 分和第 N1 轮 75 分不能硬比。因为两轮任务的难度、长尾能力比例、素材组合和交互复杂度可能完全不同。轮内复用保证公平跨轮不复用保证样本外性。生成式评测也要治理Scenario Model 不是免费午餐。它会生成坏题。有些失败不是 Agent 不会做而是 case 本身不成立prompt 有歧义验收标准前后矛盾要求超出产品能力或者 schema 组合非法。所以 Scenario Model 自己也要被评测。一个关键指标是 ​Invalid Case Rate​也就是无效用例率。无效 case 应该从分母里剔除并进入出题模型改进而不是被当成 Agent 能力缺口。更重要的是rotating failure 不应该立刻进入 autoloop。否则新题很快又会被污染成训练信号。更稳的流程是先诊断失败是系统问题还是题目问题。有效失败再进入人工 review。只有代表真实能力缺口的 case才能 promotion 到固定回归集、skill 改进或 tool 改进。promotion 时最好重投影 prompt替换措辞、素材和非核心参数避免系统记住原题 wording。三层评测分工最终创作型 Agent 的评测体系应该拆成三层层级回答的问题使用方式Fixed Regression Set已知能力有没有退化固定不变跨轮可比Rotating Evaluation Set本轮系统改动是否提升样本外能力每轮生成同轮配对Scenario Model Quality出题模型是否可靠看无效率、覆盖率和自然度这三层缺一不可。只看固定集容易刷题。只看新题难以守住已知能力。只生成新题但不治理出题模型又会被坏题拖偏。结语Agent 系统分数上涨不一定代表系统变强。它可能只是越来越会做那批固定题。真正值得相信的评测不该只问系统有没有把 benchmark 跑高而要问这轮 prompt、skill、tool、schema、retry 或 evaluator 的改动是否让 Agent 在新的、自然的、真实感足够强的任务上做得更好。固定集守住过去轮换集检验未来。对会持续自我调优的 Agent 系统来说这个区分比漂亮的分数曲线更重要。推荐阅读代码不是 AI 编程的最终资产AI Coding 真正该存的是 CheckpointRAG 找不到答案时别急着怪模型不如试试 SAG 知识库Agent 从上手到精通打造有记忆的个人智能体Agent Memory 架构拆解别再把向量库当唯一记忆系统Hermes Skill Runtime 架构拆解三层加载如何压住 Agent 上下文成本

相关新闻

Wan2.2-T2V-A5B:多模态AI文本转视频生成技术解析

Wan2.2-T2V-A5B:多模态AI文本转视频生成技术解析

1. 项目概述:Wan2.2-T2V-A5B的技术定位与核心价值Wan2.2-T2V-A5B是当前多模态AI领域最具突破性的文本转视频生成模型之一。作为Wan-AI系列的最新迭代产品,它在视频连贯性、细节还原和动态表现三个维度实现了显著提升。不同于早期版本(如Wan2.…

2026/7/23 23:15:50 阅读更多 →
鸿蒙多功能工具箱开发实战(三)-分类页面与工具卡片组件

鸿蒙多功能工具箱开发实战(三)-分类页面与工具卡片组件

鸿蒙多功能工具箱开发实战(三)-分类页面与工具卡片组件 前言 工具卡片是应用的核心UI组件,承载着工具的展示和入口功能。本文将详细讲解如何设计一个美观、交互友好的工具卡片组件,以及如何使用Grid网格布局实现分类页面的展示。 一、工具卡片设计分析 1…

2026/7/23 23:15:50 阅读更多 →
Free CAD 软件

Free CAD 软件

Free CAD 软件下载 给有需要的人 下载链接 windows选择Windows即可 也有mac的安装包 https://mirror.tuna.tsinghua.edu.cn/github-release/FreeCAD/FreeCAD/LatestRelease/

2026/7/23 23:14:49 阅读更多 →

最新新闻

圆体斜齿行星减速机互换校核:PA替换PLM时容易忽略什么?

圆体斜齿行星减速机互换校核:PA替换PLM时容易忽略什么?

圆体斜齿行星减速机互换校核:PA替换PLM时容易忽略什么? 一、圆体减速机替换的特殊性 纽格尔PA与恩坦斯特(ANDANTEX)PLM都属于圆体机身、方法兰输出的斜齿行星减速机,适合伺服定位和频繁启停工况。 与普通方形机身相比&…

2026/7/23 23:24:52 阅读更多 →
2026服装SCM与柔性供应链升级指南:专业服务商筛选攻略、避坑FAQ及落地实操

2026服装SCM与柔性供应链升级指南:专业服务商筛选攻略、避坑FAQ及落地实操

为什么2026年服装品牌必须升级“柔性供应链”管理体系?进入 2026 年,国内服装消费市场逐步转向个性化、小批量与快迭代模式。伴随直播电商与跨境电商持续发展,传统供应链模式存在的 “上下游信息孤岛、生产周期长、库存积压严重” 等问题持续…

2026/7/23 23:24:52 阅读更多 →
网工学习笔记--第二章--数据通信技术

网工学习笔记--第二章--数据通信技术

1.通信技术概述1.1通信系统的基本概念模拟信号:连续信号 数字信号:离散信号数字通信中用时间间隔相同的符号表示二进制数字,时间间隔被称为码元宽度(T),间隔内的信号被称之为码元码元速率B:单位时间内传输的…

2026/7/23 23:24:52 阅读更多 →
2026年跨境电商拐点:TikTok半托管政策深夜突调,我们复盘了3个能让店铺活下来的紧急方案(附避坑清单)

2026年跨境电商拐点:TikTok半托管政策深夜突调,我们复盘了3个能让店铺活下来的紧急方案(附避坑清单)

深夜,一则平台政策的悄然调整,在跨境电商圈内激起了千层浪。TikTok Shop半托管模式的规则更新,并非简单的流程优化,而是预示着平台电商生态正从“野蛮生长”向“精耕细作”的关键转折。对于无数中小卖家而言,这无异于一…

2026/7/23 23:24:52 阅读更多 →
Java 23 种设计模式:从踩坑到精通 | 番外:单例模式 —— 全局唯一物流配置中心实战

Java 23 种设计模式:从踩坑到精通 | 番外:单例模式 —— 全局唯一物流配置中心实战

Java 23 种设计模式:从踩坑到精通 | 番外:单例模式 —— 全局唯一物流配置中心实战 摘要:单例模式确保一个类在全局只有一个实例,常用于管理配置、连接池等共享资源。本文结合智能物流中的“全局物流配置中心” 场景,从…

2026/7/23 23:24:52 阅读更多 →
【claude code实践】 Claude Code Hooks 入门:在关键节点自动执行动作

【claude code实践】 Claude Code Hooks 入门:在关键节点自动执行动作

Claude Code Hooks 入门:在关键节点自动执行动作 引言:为什么现在需要理解它 如果你最近和 AI 编码助手打过交道,大概率经历过这样一种割裂感:它在对话里生成了看起来非常合理的代码,但你依然需要手动把它粘贴到编辑器…

2026/7/23 23:23:51 阅读更多 →

日新闻

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

更多请点击: https://intelliparadigm.com 第一章:从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表) 当AI副业主理人不再仅满足于单次服务交付,而是主动构建可复用、可裂变、可…

2026/7/23 0:00:25 阅读更多 →
AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

更多请点击: https://codechina.net 第一章:AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析 在对2,346篇跨行业AI生成文案的A/B测试数据进行聚类分析后,我们发现&#xff1…

2026/7/23 0:01:26 阅读更多 →
Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具 【免费下载链接】chitchatter Secure peer-to-peer chat that is serverless, decentralized, and ephemeral 项目地址: https://gitcode.com/gh_mirrors/ch/chitchatter Chitchatter是一款革命性的安…

2026/7/23 0:01:26 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/22 8:58:19 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/22 19:43:43 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/23 17:49:47 阅读更多 →

月新闻