Agent 评测别把「调优 Loop」 跑成「刷题 Loop」
创作型 Agent 的评测不能只盯固定 benchmark。更可靠的做法是用 Scenario Model 每轮生成样本外任务再让 baseline 和 candidate 在同一批新题上做配对比较。导语Agent 系统最容易让团队产生安全感的东西是一条向上的 ​benchmark 曲线​。今天 72 分下周 81 分再过两周 89 分。看起来系统在变强prompt 更稳工具调用更准失败 case 越来越少。但这里有个不舒服的问题它是真的更会做新任务了还是只是越来越熟悉那套题对创作型 Agent 来说这个问题尤其危险。这类 Agent 不是回答标准题而是在开放创作空间里完成任务。用户的需求会换场景、换素材、换约束、换验收标准。固定 benchmark 能帮你挡回归却不能长期证明 ​泛化能力​。图分数上涨不等于新任务能力上涨问题不在 Agent 会不会循环而在团队怎么调系统很多人说 Agent Loop指的是单次任务里的循环理解目标 - 调工具 - 观察结果 - 修正 - 再执行这很重要但评测体系里还有一层更关键的 loop跑 benchmark - 看失败 case - 改 skill / tool / schema / prompt / evaluator - 再跑 benchmark这才是系统优化循环。一个创作型 Agent 的表现通常不是由模型单点决定的。它背后有工具、编辑器能力、schema、资源库、模板、skill、retry 策略和 evaluator。团队每次看到失败 case 后都会改一点系统。问题也出在这里。当固定 benchmark 反复参与这个优化循环它就不再只是测试集而开始变成 ​训练信号​。这里的训练不一定是模型训练也可能是工程层面的适配。比如某个失败 case 被写进 skill某类工具调用被特殊加强某个 evaluator 偏好反过来塑造 executor 输出。几轮之后系统确实更会做这套题了但这不等于更会处理新的创作请求。这就是 Benchmark Loop。固定题有价值但别让它背两个职责固定 benchmark 不是错。它很适合回答一个问题已知能力有没有退化某个工具之前能不能调用某个已修 bug 有没有复现某条高频路径是否仍然稳定这些都应该用固定集看。因为题目不变跨轮比较才有意义。问题在于很多团队会让固定集同时承担第二个职责证明系统泛化能力提升。这就麻烦了。评测职责固定 benchmark 是否适合原因回归防护适合题目固定能跨轮比较已修问题复测适合可以确认 bug 是否复现泛化能力证明不适合单独承担长期参与优化后会被污染新任务适应性不适合单独承担用户需求空间远大于固定题库Goodhart 定律在这里很直接当 benchmark 分数变成目标它就不再只是质量代理指标。测试集污染也不只发生在模型训练语料里。Agent 系统的污染常常发生在 prompt、skill、tool 和 evaluator 这些工程层。不要拿练习册原题考试可以把创作型 Agent 想象成一个正在学复杂创作软件的人。固定 benchmark 是练习册。练习册能帮他掌握基础动作但考试不能永远考原题。否则你看到的是记忆而不是能力。更合理的方式是保留固定题检查基础能力有没有退化。每轮根据真实任务空间生成一批新题。baseline 和 candidate 在同一批新题上同时跑。逐 case 比较谁做得更好。有价值的新题经过 review 后再考虑进入长期回归集。这套方法的核心是把固定题和新题的职责分开。固定题守底线。新题测泛化。图固定题守底线轮换题测泛化Scenario Model维护出题模型而不是只维护题库如果每轮都要有新题题从哪里来不能让 LLM 随机编一批 prompt。那样会生成很多坏题需求不自然、验收标准不清、要求产品做不到的能力或者内部 metadata 直接泄露给 executor。需要维护的是 Scenario Model也就是场景模型。它建模的不是物理世界而是创作任务空间用户会提出什么样的需求这些需求会覆盖哪些工具能力、编辑器 schema、素材资源、项目结构、运行时行为和验收标准。Scenario Model 的输入可以包括真实用户请求分布常见创作任务类型已有评测 casetool 能力与 schemaasset catalog 和 template历史失败样本产品当前重点方向它输出的不是新的长期题库而是每一轮评测开始时冻结的一批 Rotating Evaluation Set。Rotating Set同轮配对跨轮不硬比新题带来一个现实问题每轮题都不一样分数怎么比答案是不要直接比较不同轮次的绝对分。要比较同一轮里 baseline 和 candidate 在同一批新题上的表现。流程可以这样设计图同一批新题内比较 baseline 与 candidate配对比较比绝对分更重要。CaseBaselineCandidate判断AFailPass候选版本改善BPassPass持平CPassFail候选版本退化DFailFail共同能力缺口如果 candidate 在同一批新任务上明显多赢、少退化才有理由说这轮系统改动提升了样本外能力。第 N 轮 70 分和第 N1 轮 75 分不能硬比。因为两轮任务的难度、长尾能力比例、素材组合和交互复杂度可能完全不同。轮内复用保证公平跨轮不复用保证样本外性。生成式评测也要治理Scenario Model 不是免费午餐。它会生成坏题。有些失败不是 Agent 不会做而是 case 本身不成立prompt 有歧义验收标准前后矛盾要求超出产品能力或者 schema 组合非法。所以 Scenario Model 自己也要被评测。一个关键指标是 ​Invalid Case Rate​也就是无效用例率。无效 case 应该从分母里剔除并进入出题模型改进而不是被当成 Agent 能力缺口。更重要的是rotating failure 不应该立刻进入 autoloop。否则新题很快又会被污染成训练信号。更稳的流程是先诊断失败是系统问题还是题目问题。有效失败再进入人工 review。只有代表真实能力缺口的 case才能 promotion 到固定回归集、skill 改进或 tool 改进。promotion 时最好重投影 prompt替换措辞、素材和非核心参数避免系统记住原题 wording。三层评测分工最终创作型 Agent 的评测体系应该拆成三层层级回答的问题使用方式Fixed Regression Set已知能力有没有退化固定不变跨轮可比Rotating Evaluation Set本轮系统改动是否提升样本外能力每轮生成同轮配对Scenario Model Quality出题模型是否可靠看无效率、覆盖率和自然度这三层缺一不可。只看固定集容易刷题。只看新题难以守住已知能力。只生成新题但不治理出题模型又会被坏题拖偏。结语Agent 系统分数上涨不一定代表系统变强。它可能只是越来越会做那批固定题。真正值得相信的评测不该只问系统有没有把 benchmark 跑高而要问这轮 prompt、skill、tool、schema、retry 或 evaluator 的改动是否让 Agent 在新的、自然的、真实感足够强的任务上做得更好。固定集守住过去轮换集检验未来。对会持续自我调优的 Agent 系统来说这个区分比漂亮的分数曲线更重要。推荐阅读代码不是 AI 编程的最终资产AI Coding 真正该存的是 CheckpointRAG 找不到答案时别急着怪模型不如试试 SAG 知识库Agent 从上手到精通打造有记忆的个人智能体Agent Memory 架构拆解别再把向量库当唯一记忆系统Hermes Skill Runtime 架构拆解三层加载如何压住 Agent 上下文成本

相关新闻

Wan2.2-T2V-A5B:多模态AI文本转视频生成技术解析

Wan2.2-T2V-A5B:多模态AI文本转视频生成技术解析

1. 项目概述:Wan2.2-T2V-A5B的技术定位与核心价值Wan2.2-T2V-A5B是当前多模态AI领域最具突破性的文本转视频生成模型之一。作为Wan-AI系列的最新迭代产品,它在视频连贯性、细节还原和动态表现三个维度实现了显著提升。不同于早期版本(如Wan2.…

2026/9/20 16:28:03 阅读更多 →
鸿蒙多功能工具箱开发实战(三)-分类页面与工具卡片组件

鸿蒙多功能工具箱开发实战(三)-分类页面与工具卡片组件

鸿蒙多功能工具箱开发实战(三)-分类页面与工具卡片组件 前言 工具卡片是应用的核心UI组件,承载着工具的展示和入口功能。本文将详细讲解如何设计一个美观、交互友好的工具卡片组件,以及如何使用Grid网格布局实现分类页面的展示。 一、工具卡片设计分析 1…

2026/9/19 8:00:51 阅读更多 →
Free CAD 软件

Free CAD 软件

Free CAD 软件下载 给有需要的人 下载链接 windows选择Windows即可 也有mac的安装包 https://mirror.tuna.tsinghua.edu.cn/github-release/FreeCAD/FreeCAD/LatestRelease/

2026/9/10 7:50:03 阅读更多 →

最新新闻

FPGA动态部分重配置(DFX)原理与工程实践指南

FPGA动态部分重配置(DFX)原理与工程实践指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/21 2:45:31 阅读更多 →
Wokwi ESP32 MicroPython库配置全指南:解决ImportError与OTA调试难题

Wokwi ESP32 MicroPython库配置全指南:解决ImportError与OTA调试难题

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/21 2:45:31 阅读更多 →
把笔记变成网站:3种方式将Foam知识库发布到GitHub Pages、Vercel与Netlify

把笔记变成网站:3种方式将Foam知识库发布到GitHub Pages、Vercel与Netlify

把笔记变成网站:3种方式将Foam知识库发布到GitHub Pages、Vercel与Netlify 【免费下载链接】foam A personal knowledge management and sharing system for VSCode 项目地址: https://gitcode.com/gh_mirrors/fo/foam Foam 是一款基于 VSCode 的个人知识管理…

2026/9/21 2:45:31 阅读更多 →
开源缓存一致性互连协议对比:从CHI七态到PBR路由的状态机深度解析

开源缓存一致性互连协议对比:从CHI七态到PBR路由的状态机深度解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/21 2:45:31 阅读更多 →
AFSIM源码编译实战:从环境配置到二次开发全流程解析

AFSIM源码编译实战:从环境配置到二次开发全流程解析

我最早接触AFSIM的时候,和大多数人一样,直接下载官方预编译工具包,装上就能跑通示例,感觉门槛并不高。真正让我决定从头编译一遍的,是一次二次开发需求:我需要在仿真框架内部挂一个自定义消息处理逻辑&…

2026/9/21 2:45:31 阅读更多 →
STM32智能家居控制系统设计:从硬件选型到软件实现全解析

STM32智能家居控制系统设计:从硬件选型到软件实现全解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/21 2:44:31 阅读更多 →

日新闻

agents-generator 决策矩阵全解析:从项目检测到 AGENTS.md 规则生成的 16 步判定流程

agents-generator 决策矩阵全解析:从项目检测到 AGENTS.md 规则生成的 16 步判定流程

agents-generator 决策矩阵全解析:从项目检测到 AGENTS.md 规则生成的 16 步判定流程 【免费下载链接】agentic-awesome-skills AAS Core is the local, agent-first control plane for complete catalog discovery, agent-owned selection, stack validation, and …

2026/9/21 0:00:01 阅读更多 →
gin-vue-admin 前端工具函数全景指南:src/utils 复用规范与源码级解析

gin-vue-admin 前端工具函数全景指南:src/utils 复用规范与源码级解析

gin-vue-admin 前端工具函数全景指南:src/utils 复用规范与源码级解析 【免费下载链接】gin-vue-admin 🚀ViteVue3Gin拥有AI辅助的基础开发平台,企业级业务AI开发解决方案,内置mcp辅助服务,内置skills管理,…

2026/9/21 0:00:01 阅读更多 →
Wox 全功能插件开发实战指南:基于 Python / Node.js 宿主与 WebSocket 的持久化插件体系

Wox 全功能插件开发实战指南:基于 Python / Node.js 宿主与 WebSocket 的持久化插件体系

桌面应用AI 应用插件系统 【免费下载链接】Wox A cross-platform launcher that simply works 项目地址: https://gitcode.com/gh_mirrors/wo/Wox 点击查看 免费下载 全功能插件(Full-featured Plugin)是 Wox 三类插件实现方式中能力最完整的…

2026/9/21 0:00:01 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/20 0:00:46 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/21 2:19:36 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/20 0:00:46 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/19 23:01:36 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/19 17:50:38 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/19 23:35:34 阅读更多 →