与 AI 一起工作 | 8. 为什么评价 Agent 不能只看最终答案
假设你让一个 Agent 汇总一份表格中的销售额它返回了正确数字。只看答案这次任务应该得满分。但如果查看执行记录可能会发现另一幅图景它读错了数据版本几次查询都失败了最后从一段旧对话里碰巧找到了同一个数字或者它虽然生成了正确文件却覆盖了另一列公式又或者它在发送结果时重复提交了两次。答案可以是对的过程仍然可能不安全、不稳定也无法复现。评价一个会行动的 Agent核心不再只是“它说对了吗”而是它是否在允许的范围内以可以复查的证据和可接受的成本稳定地完成了目标。从回答模型到行动系统普通问答的主要产物是一段文本评价自然集中在正确性、相关性和表达质量上。Agent 不同它可能读取文件、调用数据库、运行程序、修改状态、创建工单或向外部系统发送信息。这时最终回答只是系统行为的一部分。一次任务至少包含下面这条链用户目标任务与权限契约模型选择动作工具实际执行环境状态变化产生证据与产物验证目标与副作用最终回答只检查最后一个节点相当于验收装修时只看一张客厅照片却不检查水电、承重墙和施工记录。评价 Agent 的六个维度维度要回答的问题可观察证据任务结果用户真正要求的目标是否实现验收规则、最终产物、目标系统回读动作合规是否只使用允许的工具、对象和操作工具调用、参数、权限范围、拒绝记录状态与副作用环境发生了哪些预期或非预期变化文件差异、数据库状态、消息回执、审计日志证据充分性最终结论能否回到数据和验证结果来源、查询、时间范围、校验器输出、产物哈希成本与效率在多少时间、调用和资源预算内完成工具调用数、耗时、读取量、token 或费用恢复与稳定性失败后能否正确恢复重复执行是否一致错误记录、替代路径、回滚结果、多次运行结果这六个维度不是要求所有任务都记录同样多的信息。查询天气和修改生产数据库的风险不同轨迹粒度当然也不同。原则是风险越高、动作越不可逆越需要完整的状态、证据和回读。轨迹不是私有思维链一提到“看过程”很容易把它理解成要求模型公开全部内部推理。其实Agent 评测需要的主要是可观察执行轨迹而不是私有思维链。可观察轨迹包括Agent 收到了什么任务约束调用了什么工具参数是什么工具返回了什么环境状态怎样变化产生了哪些文件或记录验证器是否通过以及遇到错误后采取了什么恢复动作。这些信息能够被系统记录、重放或独立检查。至于模型内部如何逐字思考既不一定可获得也不是判断“文件是否真的写入”“消息是否重复发送”的必要条件。换句话说我们要审计的是行动和证据不是索取一篇看似合理的自我解释。三种常见的“幸运成功”1. 用错证据碰巧得到正确答案用户要求统计最新数据Agent 却读取了上月快照。因为目标数字刚好没有变化最终答案仍然正确。如果只看答案这次错误的数据绑定会被隐藏一旦数字变化同一流程就会失败。2. 主产物正确同时破坏了别处Agent 按要求更新了配置项目标功能也能运行但它重写整个文件时删除了用户尚未提交的其他修改。主任务“成功”副作用却不可接受。3. 第一次成功第二次重复执行Agent 创建工单后没有读取系统回执于是把网络延迟当成失败再次提交。两次请求内容都正确外部系统中却出现了重复记录。这三种情况说明最终答案正确只能证明“这一次输出看起来对”不能自动证明方法正确、操作安全或系统稳定。先设门禁再谈效率Agent 评测最容易犯的另一个错误是把所有指标直接加权成一个总分。例如答案正确率、速度、成本和工具调用数各占一部分。这样可能出现一种荒谬结果一个越权读取数据但速度很快的 Agent靠效率分抵消了安全问题。更稳妥的方法是先设门禁再在合格运行之间比较效率否是否是否是一次 Agent 运行任务结果通过?记录失败类型权限与副作用通过?判为不合格成功证据与状态可复查?判为不可验证成功进入合格运行集合比较成本、速度与稳定性正确性、安全性和证据充分性属于资格条件成本和速度属于合格之后的优化指标。两者不能互相抵消。不要把失败简单压成一个 0对 Agent 来说失败方式本身就是重要信息。最终答案轨迹与门禁更准确的判断正确通过稳定成功仍需多次运行确认复现性正确未通过幸运成功或不合格成功不能直接上线错误通过安全失败适合定位能力缺口和改进恢复策略错误未通过错误成功声明、越界或不可诊断失败优先修系统护栏一个能在权限不足时明确停止并报告 blocker 的 Agent可能比“想办法给出答案”却越权行动的 Agent 更值得信任。评测设计如果只奖励有答案就会反向鼓励系统隐藏不确定性和失败。一个最小轨迹记录模板对于会调用工具的任务可以从下面这组字段开始不必记录冗长对话run:task_id:可复现的任务标识input_snapshot:使用的数据或文件版本allowed_scope:允许的对象、动作和预算execution:tool_calls:工具、参数、结果和错误state_changes:修改前后状态与外部回执artifacts:文件、查询结果或报告位置verification:result_check:目标是否实现safety_check:是否越权或产生非预期副作用evidence_links:结论对应的来源与验证器结果recovery:失败原因、修复动作与最终状态模板的价值不在字段数量而在于让最终声明可以回到实际发生的动作。需要公开展示时还应脱敏凭证、个人信息和业务数据可审计不等于把敏感日志全部暴露。评价 Agent 前的 30 秒检查最终答案对应的真实目标是什么怎样独立验收Agent 使用了哪些工具、数据版本和权限范围目标系统的状态是否真的改变是否完成回读有没有修改无关文件、重复发送或越权访问等副作用每项关键结论能否绑定到来源、查询或验证结果失败时Agent 是正确停止、有效恢复还是静默换了一条不可靠路径多次运行能否稳定成功还是只有一次碰巧通过正确性和安全门禁通过后成本与速度是否可接受评测 Agent 不是为了收集越多日志越好而是为了区分四件事它说了什么、它做了什么、环境发生了什么以及这些变化能否被证据验证。当 AI 只生成文字时答案是主要产物当 AI 开始行动时轨迹、状态和副作用也成为产物的一部分。

相关新闻

MyBatis核心配置文件详解

MyBatis核心配置文件详解

MyBatis核心配置文件详解 MyBatis 是一款优秀的持久层框架,它通过 XML 或注解方式将 Java 对象与 SQL 语句进行映射,极大地简化了数据库操作。而 MyBatis 的核心配置文件(通常命名为 mybatis-config.xml)是整个框架的“大脑”&…

2026/7/23 15:17:14 阅读更多 →
Neon Pageserver Storage Shard 扩容分析

Neon Pageserver Storage Shard 扩容分析

Neon pageserver 的"扩容"通过 Storage Shard 机制实现。这不是传统意义上对单个 pageserver 水平扩展,而是两层扩容策略:1. Tenant Sharding(分片) —将租户数据打散到多个 pageserver 节点上 2. Node Scale-out&#…

2026/7/23 15:17:14 阅读更多 →
Kimi K3 vs Fable 5 最新资讯

Kimi K3 vs Fable 5 最新资讯

最近AI圈两大顶级模型持续上演对标大戏,国产开源代表Kimi K3、海外闭源标杆Fable 5,短短几天接连爆出重磅消息,不管是做开发、AI内容创作、本地部署,还是选择API服务,这些动态直接影响选型。今天把两边最新事件一次性梳…

2026/7/23 15:17:14 阅读更多 →

最新新闻

2026 上海注册公司代账机构甄选指南|金税四期合规避坑 + 本土优质机构实测榜单

2026 上海注册公司代账机构甄选指南|金税四期合规避坑 + 本土优质机构实测榜单

2026 年,上海工商财税监管体系持续升级,金税四期智能风控、全电发票常态化监管、税务信用分级、工商地址动态核查、账务电子化归档等合规要求全面落地。对上海中小微企业、个体工商户、初创电商及科创企业而言,代理记账已经不再是简单的 “记…

2026/7/23 15:29:18 阅读更多 →
相机标定原理与OpenCV实战指南

相机标定原理与OpenCV实战指南

1. 相机标定基础概念解析相机标定是计算机视觉领域的基础性工作,它的核心目标是建立三维世界坐标与二维图像像素坐标之间的数学映射关系。这个过程就像给相机做"体检",通过测量和分析来确定相机的"视力参数"。在工业检测、机器人导航…

2026/7/23 15:29:18 阅读更多 →
Fabrice Bellard:从FFmpeg到QEMU,单人开发者的技术哲学与工程实践

Fabrice Bellard:从FFmpeg到QEMU,单人开发者的技术哲学与工程实践

如果你是一名程序员,却不知道Fabrice Bellard这个名字,那么你可能每天都在使用他的作品而不自知。从你看的在线视频、用的虚拟机到写的C代码,这位法国程序员的影子无处不在。 在技术圈,有些名字如雷贯耳却鲜为人知,Fa…

2026/7/23 15:29:18 阅读更多 →
弱电视频监控系统技术要求与工程实践

弱电视频监控系统技术要求与工程实践

1. 弱电视频监控系统技术要求的核心价值解析 在当今数字化安防领域,一套规范的弱电视频监控系统技术要求文档,往往决定着整个项目的成败。作为参与过数十个大型园区监控项目的老兵,我深刻体会到:招标文件中的技术要求不仅是采购方…

2026/7/23 15:29:18 阅读更多 →
Oracle RAC中crsctl start crs与start cluster命令详解

Oracle RAC中crsctl start crs与start cluster命令详解

1. 问题背景与核心概念澄清在Oracle 11g RAC环境中,CRS(Cluster Ready Services)是集群资源管理的核心组件。很多DBA在使用crsctl命令时会遇到两个看似相似的命令:crsctl start cluster和crsctl start crs。这两个命令虽然都用于启…

2026/7/23 15:29:18 阅读更多 →
Unity Mod Manager深度优化:从源码剖析Info.json加载失败与健壮性改造

Unity Mod Manager深度优化:从源码剖析Info.json加载失败与健壮性改造

1. 项目概述:当Mod加载器“罢工”时 如果你是一名Unity游戏的Mod开发者或资深玩家,那么对Unity Mod Manager(简称UMM)这个工具一定不会陌生。它就像一座桥梁,连接着玩家社区无穷的创意与游戏本体,让《觅长生…

2026/7/23 15:28:18 阅读更多 →

日新闻

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

更多请点击: https://intelliparadigm.com 第一章:从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表) 当AI副业主理人不再仅满足于单次服务交付,而是主动构建可复用、可裂变、可…

2026/7/23 0:00:25 阅读更多 →
AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

更多请点击: https://codechina.net 第一章:AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析 在对2,346篇跨行业AI生成文案的A/B测试数据进行聚类分析后,我们发现&#xff1…

2026/7/23 0:01:26 阅读更多 →
Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具 【免费下载链接】chitchatter Secure peer-to-peer chat that is serverless, decentralized, and ephemeral 项目地址: https://gitcode.com/gh_mirrors/ch/chitchatter Chitchatter是一款革命性的安…

2026/7/23 0:01:26 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/22 8:58:19 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/22 19:43:43 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/22 12:54:44 阅读更多 →

月新闻