Agent评测太贵?CMU发布PACE:不到1%成本摸清模型的Agent能力
一句话讲清楚Agent 评测动辄上千美元、还要搭沙箱等好几天卡内基梅隆大学团队的 PACE 从 19 个便宜原子评测里自动挑出 100 道题花不到完整 Agent 评测 1% 的成本就能预测 GAIA 、 SWE-Bench 等四项基准的模型得分——留一交叉验证平均误差 3.80%两两排序准确率约 84%。论文标题PACE: A Proxy for Agentic Capability Evaluation论文链接https://arxiv.org/abs/2607.02032Github 链接https://github.com/neulab/pace数据集链接https://huggingface.co/datasets/neulab/pace-bench你现在要判断一个新模型能不能上 SWE-Bench 得先搭沙箱、拉仓库、跑多轮工具调用、改代码、等测试——单模型单次完整评测论文估算动辄上千美元还要等上好几天。 GAIA 要开浏览器检索 SWT-Bench 要写能暴露 bug 的测试用例每条轨迹都长环境一换结果还可能飘。贵还不是唯一的问题。评测贵 → 团队跑不起完整基准 → 只能挑子集、降频率、或者干脆不测。最后 leaderboard 上那串数字背后是多少资源在撑大家心里都有数。与此同时 MMLU 、 HumanEval 、 IFEval 这些原子评测一次 API 调用就能打分几分钱一道题开发迭代天天都在跑。 Agent 任务再复杂底层也离不开指令遵循、规划、写代码、工具调用——能不能用一小撮原子题在花大钱跑 Agent 之前先把方向和排序摸清楚PACE 的回答是能。而且整套代理评测花费不到完整 Agent 评测的1%。贵在哪 Agent 评测和原子评测差了两个数量级论文把模型能力拆成 11 类对照了 4 个 Agent 基准和 19 个非 Agent 基准。 Table 1 把能力覆盖、搭建复杂度、题量和单题成本放在一张表里——差距一眼能看清Table 1 Agent 与非 Agent 基准对照。 Setup 栏 H高复杂度环境 L仅需 API 调用 Cost 为 Claude Sonnet 4.5 单题评测成本估算。读这张表三个信号很直观1.四项 Agent 基准 Setup 全是 H红标要搭沙箱、浏览器或完整仓库 19 个原子基准绝大多数是 L 绿标调 API 就能跑。2.单题成本差两个数量级 SWE-Bench Multimodal 约 1.89 美元/题 GAIA 约 0.38 美元/题 IFEval 约 0.006 美元/题 HumanEval 约 0.004 美元/题。3.能力有重叠 SWE-Bench 需要的规划、代码生成、验证测试在 HumanEval 、 DebugBench 等便宜基准里都有对应列——Agent 评测贵但底层能力信号其实已经被原子题测到了。Agent 单题贵两个数量级一套完整评测下来就是「小时级搭环境 数百次 API 调用」。论文的判断是严格 Agent 评测正在变成大团队的特权——资源少的组天然吃亏。PACE 想解决的就是这个在真正开跑完整 Agent 评测之前用极低成本拿到可靠的分数估计和模型排序。PACE 怎么做 100 道原子题 线性回归PACE 从 19 个非 Agent 基准覆盖 11 类能力里自动选出 道题用它们的得分预测目标 Agent 基准上的表现。两个目标目标 A 绝对分数预测模型 在 Agent 基准上的平均分。目标 B 两两排序用得分差 做逻辑回归预测谁更强——工程上往往比精确分数更有用「 A 和 B 该选谁做路由」选题和回归解耦。论文试过 Lasso/Ridge 直接在上万道题里选但标定模型只有 13 个严重欠定。 PACE 改用两条互补的过滤线各选一半PACE 总览 Local 按目标相关性选题 Global 按 SVD 杠杆分数选题再经 Bootstrap 回归预测 Agent 分数和模型排序。■Local按每道题得分与 Agent 总分的 Spearman 相关 排序选最「像」目标基准的题。■Global在源题矩阵上做 SVD 用杠杆分数 乘 选全局信息量高且和目标相关的题。■Bootstrap Agent 标签噪声大对目标实例重采样再拟合回归平均 MAE 能降 0.77 个百分点。主结果预测够准成本够低14 个模型、严格留一交叉验证每次留一个「未来模型」 时Table 2 PACE 在 C100 时的 LOOCV 结果。平均 MAE 3.80% Spearman 0.81 两两排序准确率 84.37%。■平均 MAE 3.80% Spearman0.81——100 道原子题就能逼近 Agent 绝对分和排序。■两两排序准确率 84.37%随机基线 50%。筛 checkpoint 、比两个微调版本这个精度够用。■比直接在源题矩阵上跑 Lasso/Ridge MAE ~6%、 Spearman ~0.55 稳得多。核心卖点同等质量成本约 1/100Figure 1 把 PACE 蓝线和「在 Agent 基准上随机抽子集」红线放在同一张成本-质量图里成本-质量权衡横轴是评测花费美元纵轴分别是 MAE 、 Spearman 、排序准确率。 PACE 在饱和预算以下全线优于随机抽 Agent 子集。论文结论很直白要达到和随机抽 Agent 子集相同的预测质量 PACE 大约只要1/100 的成本。换算到工程场景■完整 Agent 评测上千美元 数天■PACE 代理评测几分钟跑静态题不到 1% 花费附录里 从 25 扫到 500 是性价比甜点——再往上边际收益很小。对大多数开发阶段 100 道题够做决策了。顺带看清每个 Agent 基准要什么能力PACE 不只能省钱选出来的 100 道题还是一张「能力指纹」Figure 3 C100 时四项 Agent 目标的能力需求分布。指令遵循和推理四项都拉满其余因目标而异。■GAIA指令遵循 验证测试 IFEval 、 PlanBench 为主■SWE-Bench Verified规划、代码生成、验证、错误恢复■SWE-Bench Multimodal长上下文聚合最重多模态反而占比不高■SWT-Bench验证测试 规划几乎拉满边界代理不是替代是筛子PACE 有两个前提要心里有数1.标定模型得代表未来模型——新架构、新训练范式超出标定分布误差会上去得定期刷新标定集。2.预测的是特定 harness 下的分数——论文用 OpenHands SDK 换工具定义或重试策略排序可能漂移。即便如此 PACE 的定位很清楚完整 Agent 评测该跑还得跑但在花几千刀之前先用不到 1% 的成本把方向和排序摸清楚——筛 checkpoint 、比版本、决定值不值得上完整 SWE-Bench 。对资源有限的团队这比硬刷 leaderboard 务实得多。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻

CozyPixels壁纸分类完全手册:从抽象艺术到赛博朋克的视觉之旅

CozyPixels壁纸分类完全手册:从抽象艺术到赛博朋克的视觉之旅

CozyPixels壁纸分类完全手册:从抽象艺术到赛博朋克的视觉之旅 【免费下载链接】CozyPixels 🎨 Aesthetic wallpaper collection gathered over a year! Catppuccin, Nord, One Dark themes & cozy vibes. Free for everyone to enjoy 🌟 …

2026/9/3 5:02:09 阅读更多 →
pwned-search开发者指南:构建自己的密码安全检查工具

pwned-search开发者指南:构建自己的密码安全检查工具

pwned-search开发者指南:构建自己的密码安全检查工具 【免费下载链接】pwned-search Pwned Password API lookup 项目地址: https://gitcode.com/gh_mirrors/pw/pwned-search pwned-search是一个基于Pwned Password API lookup的密码安全检查工具&#xff0c…

2026/8/20 9:29:04 阅读更多 →
打破技术壁垒!拖拽配置 LLM,业务 AI 智能体搭建门槛清零

打破技术壁垒!拖拽配置 LLM,业务 AI 智能体搭建门槛清零

当大语言模型(LLM)从概念炒作走向产业落地,一个核心痛点始终困扰着企业:AI 能力的技术门槛与业务需求的快速响应之间存在难以逾越的鸿沟。过去,搭建一个适配业务场景的 AI 智能体,需要算法工程师、开发人员…

2026/9/4 2:20:53 阅读更多 →

最新新闻

MULTIMODAL GENERALIZED CATEGORY DISCOVERY

MULTIMODAL GENERALIZED CATEGORY DISCOVERY

1、摘要提出多模态GCD任务,理论分析认为核心在于模态对齐,所以在特征层和输出空间用对比学习和蒸馏技术进行对齐特征空间用对比学习对齐输出空间用蒸馏技术对齐实验上取得好结果2、引言介绍新类发现任务,一部分数据类别已知,新输入…

2026/9/4 18:01:43 阅读更多 →
以太网PHY芯片RTL8211FS(I)-VS简介(一)

以太网PHY芯片RTL8211FS(I)-VS简介(一)

RTL8211系列芯片是高级程度的以太网收发器。兼容10Base-T,100Base-T,1000Base-T的IEEE802.3标准。它提供必需的物理层功能,实现发送和接收以太网数据包,物理层可以是五类非屏蔽双绞线。1.特点Rtl8211fs-VS为基于ieee1588和802.1as…

2026/9/4 18:01:43 阅读更多 →
【每日计划与反思】2026.9.2

【每日计划与反思】2026.9.2

一. 计划:1. L1课程完成(1*)原理解读2. 视频看完(1*)3. 整理上线东西4. jvm知识学习,二. 计划反思:1. 完成,原理解读70%2. 60%3. 完成4. 完成三. 感悟:1. 同一时间段要专…

2026/9/4 18:01:43 阅读更多 →
秋叶ComfyUI-V17中文整合包:AI绘画节点式工作流一键部署与实战指南

秋叶ComfyUI-V17中文整合包:AI绘画节点式工作流一键部署与实战指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/4 18:01:43 阅读更多 →
【单片机毕业设计】融合语音识别与多传感采集的 STM32 智能书桌设计 基于 STM32 的坐姿矫正与环境光照自适应控制系统实现(018406)

【单片机毕业设计】融合语音识别与多传感采集的 STM32 智能书桌设计 基于 STM32 的坐姿矫正与环境光照自适应控制系统实现(018406)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于嵌入式单片机,Java、小程序技术领域和毕业项目实战 ✌️…

2026/9/4 18:01:43 阅读更多 →
204、【Agent】【OpenCode】TUI 内部:SDK 客户端与事件流

204、【Agent】【OpenCode】TUI 内部:SDK 客户端与事件流

【声明】本博客所有内容均为个人业余时间创作,所述技术案例均来自公开开源项目(如Github,Apache基金会),不涉及任何企业机密或未公开技术,如有侵权请联系删除 标题 204、【Agent】【OpenCode】TUI 内部&am…

2026/9/4 18:00:43 阅读更多 →

日新闻

ESP32S2嵌入式收音机全栈开发实战指南

ESP32S2嵌入式收音机全栈开发实战指南

简介:本资源是一个基于ESP32-S2芯片的嵌入式综合实践项目,面向本科毕业设计、课程设计及实训开发人员,聚焦网络收音机与FM收音机双模功能实现,融合ESP-IDF框架、ESP-ADF音频开发库与LVGL图形界面库,具备完整软硬件协同…

2026/9/4 0:00:28 阅读更多 →
WorkBuddy+Python实战:从零搭建商品库存管理系统

WorkBuddy+Python实战:从零搭建商品库存管理系统

最近想自己动手做一个“商品库存管理系统”的人变多了。很多开网店、做小团队ERP选型、或者刚学Python的读者,不是不想用系统,而是被传统开发路径劝退了:要装数据库,要写后端接口,要学前端页面,还要考虑多人…

2026/9/4 0:00:28 阅读更多 →
旅游情感分析:基于Python的垂直场景深度解析

旅游情感分析:基于Python的垂直场景深度解析

简介:本资源是一份面向计算机专业本科生的毕业设计实践项目,聚焦旅游行业真实场景,解决旅游平台对用户评论情感倾向自动识别与管理的需求。系统基于Python 3.9.11与Anaconda环境构建,集成携程、马蜂窝双平台爬虫模块,并…

2026/9/4 0:00:28 阅读更多 →

周新闻

备战数据库管理工程师校招:索引、事务、备份恢复核心考点解析

备战数据库管理工程师校招:索引、事务、备份恢复核心考点解析

每年校招季我都会接触不少准备数据库方向笔试的同学,看到最多的状态就是:简历上写着“熟悉 MySQL”“了解索引优化”,一碰到数据库管理工程师的笔试卷,却在索引、事务、锁、备份恢复这些题目上翻车。网易这套 2018 校园招聘数据库…

2026/9/4 10:54:27 阅读更多 →
数字电路时序基石:深入理解建立时间与保持时间

数字电路时序基石:深入理解建立时间与保持时间

1. 这不是“背公式”的事:时间参数到底在约束什么你翻过数字电路教材,一定见过这两个词:建立时间(Setup Time)和保持时间(Hold Time)。它们常被并列写在触发器(Flip-Flop&#xff09…

2026/9/4 14:20:02 阅读更多 →
蓝桥杯国赛超声波测距机:从单片机原理到嵌入式系统实战

蓝桥杯国赛超声波测距机:从单片机原理到嵌入式系统实战

1. 项目缘起:从赛题到超声波测距机的诞生第八届蓝桥杯单片机设计与开发国赛的题目,我至今记忆犹新。它没有直接给出一个花哨的名字,而是用“超声波测距机”这个朴实无华的功能描述,精准地勾勒出了考核的核心。对于当时备赛的我而言…

2026/9/3 4:22:59 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/3 4:17:49 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/3 4:18:56 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/4 9:37:01 阅读更多 →