Agent评测太贵?CMU发布PACE:不到1%成本摸清模型的Agent能力
一句话讲清楚Agent 评测动辄上千美元、还要搭沙箱等好几天卡内基梅隆大学团队的 PACE 从 19 个便宜原子评测里自动挑出 100 道题花不到完整 Agent 评测 1% 的成本就能预测 GAIA 、 SWE-Bench 等四项基准的模型得分——留一交叉验证平均误差 3.80%两两排序准确率约 84%。论文标题PACE: A Proxy for Agentic Capability Evaluation论文链接https://arxiv.org/abs/2607.02032Github 链接https://github.com/neulab/pace数据集链接https://huggingface.co/datasets/neulab/pace-bench你现在要判断一个新模型能不能上 SWE-Bench 得先搭沙箱、拉仓库、跑多轮工具调用、改代码、等测试——单模型单次完整评测论文估算动辄上千美元还要等上好几天。 GAIA 要开浏览器检索 SWT-Bench 要写能暴露 bug 的测试用例每条轨迹都长环境一换结果还可能飘。贵还不是唯一的问题。评测贵 → 团队跑不起完整基准 → 只能挑子集、降频率、或者干脆不测。最后 leaderboard 上那串数字背后是多少资源在撑大家心里都有数。与此同时 MMLU 、 HumanEval 、 IFEval 这些原子评测一次 API 调用就能打分几分钱一道题开发迭代天天都在跑。 Agent 任务再复杂底层也离不开指令遵循、规划、写代码、工具调用——能不能用一小撮原子题在花大钱跑 Agent 之前先把方向和排序摸清楚PACE 的回答是能。而且整套代理评测花费不到完整 Agent 评测的1%。贵在哪 Agent 评测和原子评测差了两个数量级论文把模型能力拆成 11 类对照了 4 个 Agent 基准和 19 个非 Agent 基准。 Table 1 把能力覆盖、搭建复杂度、题量和单题成本放在一张表里——差距一眼能看清Table 1 Agent 与非 Agent 基准对照。 Setup 栏 H高复杂度环境 L仅需 API 调用 Cost 为 Claude Sonnet 4.5 单题评测成本估算。读这张表三个信号很直观1.四项 Agent 基准 Setup 全是 H红标要搭沙箱、浏览器或完整仓库 19 个原子基准绝大多数是 L 绿标调 API 就能跑。2.单题成本差两个数量级 SWE-Bench Multimodal 约 1.89 美元/题 GAIA 约 0.38 美元/题 IFEval 约 0.006 美元/题 HumanEval 约 0.004 美元/题。3.能力有重叠 SWE-Bench 需要的规划、代码生成、验证测试在 HumanEval 、 DebugBench 等便宜基准里都有对应列——Agent 评测贵但底层能力信号其实已经被原子题测到了。Agent 单题贵两个数量级一套完整评测下来就是「小时级搭环境 数百次 API 调用」。论文的判断是严格 Agent 评测正在变成大团队的特权——资源少的组天然吃亏。PACE 想解决的就是这个在真正开跑完整 Agent 评测之前用极低成本拿到可靠的分数估计和模型排序。PACE 怎么做 100 道原子题 线性回归PACE 从 19 个非 Agent 基准覆盖 11 类能力里自动选出 道题用它们的得分预测目标 Agent 基准上的表现。两个目标目标 A 绝对分数预测模型 在 Agent 基准上的平均分。目标 B 两两排序用得分差 做逻辑回归预测谁更强——工程上往往比精确分数更有用「 A 和 B 该选谁做路由」选题和回归解耦。论文试过 Lasso/Ridge 直接在上万道题里选但标定模型只有 13 个严重欠定。 PACE 改用两条互补的过滤线各选一半PACE 总览 Local 按目标相关性选题 Global 按 SVD 杠杆分数选题再经 Bootstrap 回归预测 Agent 分数和模型排序。■Local按每道题得分与 Agent 总分的 Spearman 相关 排序选最「像」目标基准的题。■Global在源题矩阵上做 SVD 用杠杆分数 乘 选全局信息量高且和目标相关的题。■Bootstrap Agent 标签噪声大对目标实例重采样再拟合回归平均 MAE 能降 0.77 个百分点。主结果预测够准成本够低14 个模型、严格留一交叉验证每次留一个「未来模型」 时Table 2 PACE 在 C100 时的 LOOCV 结果。平均 MAE 3.80% Spearman 0.81 两两排序准确率 84.37%。■平均 MAE 3.80% Spearman0.81——100 道原子题就能逼近 Agent 绝对分和排序。■两两排序准确率 84.37%随机基线 50%。筛 checkpoint 、比两个微调版本这个精度够用。■比直接在源题矩阵上跑 Lasso/Ridge MAE ~6%、 Spearman ~0.55 稳得多。核心卖点同等质量成本约 1/100Figure 1 把 PACE 蓝线和「在 Agent 基准上随机抽子集」红线放在同一张成本-质量图里成本-质量权衡横轴是评测花费美元纵轴分别是 MAE 、 Spearman 、排序准确率。 PACE 在饱和预算以下全线优于随机抽 Agent 子集。论文结论很直白要达到和随机抽 Agent 子集相同的预测质量 PACE 大约只要1/100 的成本。换算到工程场景■完整 Agent 评测上千美元 数天■PACE 代理评测几分钟跑静态题不到 1% 花费附录里 从 25 扫到 500 是性价比甜点——再往上边际收益很小。对大多数开发阶段 100 道题够做决策了。顺带看清每个 Agent 基准要什么能力PACE 不只能省钱选出来的 100 道题还是一张「能力指纹」Figure 3 C100 时四项 Agent 目标的能力需求分布。指令遵循和推理四项都拉满其余因目标而异。■GAIA指令遵循 验证测试 IFEval 、 PlanBench 为主■SWE-Bench Verified规划、代码生成、验证、错误恢复■SWE-Bench Multimodal长上下文聚合最重多模态反而占比不高■SWT-Bench验证测试 规划几乎拉满边界代理不是替代是筛子PACE 有两个前提要心里有数1.标定模型得代表未来模型——新架构、新训练范式超出标定分布误差会上去得定期刷新标定集。2.预测的是特定 harness 下的分数——论文用 OpenHands SDK 换工具定义或重试策略排序可能漂移。即便如此 PACE 的定位很清楚完整 Agent 评测该跑还得跑但在花几千刀之前先用不到 1% 的成本把方向和排序摸清楚——筛 checkpoint 、比版本、决定值不值得上完整 SWE-Bench 。对资源有限的团队这比硬刷 leaderboard 务实得多。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻

CozyPixels壁纸分类完全手册:从抽象艺术到赛博朋克的视觉之旅

CozyPixels壁纸分类完全手册:从抽象艺术到赛博朋克的视觉之旅

CozyPixels壁纸分类完全手册:从抽象艺术到赛博朋克的视觉之旅 【免费下载链接】CozyPixels 🎨 Aesthetic wallpaper collection gathered over a year! Catppuccin, Nord, One Dark themes & cozy vibes. Free for everyone to enjoy 🌟 …

2026/8/1 22:25:07 阅读更多 →
pwned-search开发者指南:构建自己的密码安全检查工具

pwned-search开发者指南:构建自己的密码安全检查工具

pwned-search开发者指南:构建自己的密码安全检查工具 【免费下载链接】pwned-search Pwned Password API lookup 项目地址: https://gitcode.com/gh_mirrors/pw/pwned-search pwned-search是一个基于Pwned Password API lookup的密码安全检查工具&#xff0c…

2026/8/1 22:25:07 阅读更多 →
打破技术壁垒!拖拽配置 LLM,业务 AI 智能体搭建门槛清零

打破技术壁垒!拖拽配置 LLM,业务 AI 智能体搭建门槛清零

当大语言模型(LLM)从概念炒作走向产业落地,一个核心痛点始终困扰着企业:AI 能力的技术门槛与业务需求的快速响应之间存在难以逾越的鸿沟。过去,搭建一个适配业务场景的 AI 智能体,需要算法工程师、开发人员…

2026/8/1 22:25:07 阅读更多 →

最新新闻

基于改进雪雁算法的多仓库路径优化实践

基于改进雪雁算法的多仓库路径优化实践

1. 项目背景与问题定义大规模多仓库多旅行商问题(Large-Scale Multi-Depot Multiple Traveling Salesman Problem, LS-MDMTSP)是传统路径优化问题的重要扩展。我在物流调度项目中首次接触这个问题时,发现它比单仓库版本复杂得多——想象一下某…

2026/8/1 23:10:21 阅读更多 →
R语言自动化提取KEGG通路基因列表:从KEGGREST包到批量处理实战

R语言自动化提取KEGG通路基因列表:从KEGGREST包到批量处理实战

1. 项目概述:从KEGG通路到基因列表的自动化提取在生物信息学分析中,我们常常需要基于特定的生物学通路来筛选基因,进行后续的富集分析、表达量可视化或构建调控网络。KEGG(Kyoto Encyclopedia of Genes and Genomes)数…

2026/8/1 23:09:21 阅读更多 →
Shell脚本实现文件夹文件合并器:自动化处理日志与文本文件

Shell脚本实现文件夹文件合并器:自动化处理日志与文本文件

1. 项目概述:为什么我们需要一个“文件夹文件合并器”?在日常工作中,尤其是处理数据、整理日志、汇总代码片段或者收集零散文档时,我们经常会遇到一种情况:一个文件夹里躺着几十甚至上百个文本文件,比如log…

2026/8/1 23:09:21 阅读更多 →
HarmonyOS NEXT 企业级记账APP:预算提醒与预算进度

HarmonyOS NEXT 企业级记账APP:预算提醒与预算进度

预算提醒与预算进度 本文是《HarmonyOS NEXT 企业级开发实战:30篇打造智能记账APP》系列的第 17 篇,对应 Git Tag v0.1.7。承接前序开发,本篇实现预算进度可视化与阈值提醒:BudgetViewModel 在加载时计算 usage 进度与 isOverrun …

2026/8/1 23:09:21 阅读更多 →
学术智能体如何革新文献检索与论文写作

学术智能体如何革新文献检索与论文写作

1. 项目概述:学术研究者的智能助手革命 这个名为"千笔专业学术智能体"的平台,正在学术圈掀起一场静默的革命。作为一名常年泡在文献堆里的研究者,我最初接触这个工具时,最震撼的是它彻底改变了传统文献检索和论文写作的…

2026/8/1 23:08:20 阅读更多 →
5个实战场景深度解析:N_m3u8DL-RE流媒体下载器的高效应用

5个实战场景深度解析:N_m3u8DL-RE流媒体下载器的高效应用

5个实战场景深度解析:N_m3u8DL-RE流媒体下载器的高效应用 【免费下载链接】N_m3u8DL-RE Cross-Platform, modern and powerful stream downloader for MPD/M3U8/ISM. English/简体中文/繁體中文. 项目地址: https://gitcode.com/GitHub_Trending/nm3/N_m3u8DL-RE…

2026/8/1 23:08:20 阅读更多 →

日新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/1 0:00:48 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/1 0:00:48 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/1 0:00:48 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/8/1 13:02:46 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/8/1 5:19:34 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/8/1 10:33:33 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/1 0:00:48 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/1 0:00:48 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/1 0:00:48 阅读更多 →