[论文学习]OSReward:为跨平台计算机使用奖励模型建立标准化评估
OSReward为跨平台计算机使用奖励模型建立标准化评估论文重点OSReward是一个针对计算机使用智能体CUA轨迹验证任务的标准化评估基准由来自香港大学、南京大学、新加坡国立大学等多所顶尖机构的23位研究者共同完成。研究发现当前最先进的视觉语言模型VLM作为CUA轨迹的评判者存在系统性的宽松偏差leniency bias——倾向于将失败轨迹误判为成功而少数足够可靠的模型又因成本过高而无法规模化部署。为此研究团队构建了OS-Shepherd系列开源奖励模型9B和35B在匹配商业级评判模型性能的同时将成本降低至前者的30-60分之一。核心研究内容问题定义计算机使用智能体CUA正在快速渗透数字世界的各个角落——网页、移动应用、桌面软件。一个CUA轨迹记录了智能体的动作、状态和推理过程验证该轨迹是否完成了任务指令是CUA评估、数据筛选和强化学习的核心环节。然而无论是人工编写的验证器还是人类标注者都无法在大规模场景下提供这种验证。因此该领域越来越依赖VLM作为CUA轨迹的“评判者”。但一个根本性的问题始终未被认真审视这些VLM评判者到底有多可靠创新方法OSReward的核心创新体现在三个层面1. 基准构建OSReward Benchmark不同于复用现有Agent基准中的现成轨迹这种做法会将评判者错误与轨迹本身缺陷混为一谈OSReward从零搭建了专用的跨平台数据基础设施在网页、移动端和桌面端四个平台上运行多种Agent主干模型执行人工验证的指令再通过多阶段人工标注生成高质量的“金标准”标签。2. 挑战集设计OSReward进一步衍生出两个子集——OSReward-Hard专注于真正困难的案例标注者自身都存在分歧的轨迹用于诊断评判模型的错误模式OSReward-Multi则在二分类判定之上叠加了细粒度的效率和对齐评分。3. 开源奖励模型OS-Shepherd基于评估发现的洞见团队构建了包含10万条推理标注轨迹评判的开放语料库OS-Shepherd-100K并采用两阶段训练策略训练出OS-Shepherd-9B和OS-Shepherd-35B两款开源奖励模型。研究成果研究团队对27个模型进行了迄今为止最全面的VLM评判者评估。核心发现包括准确性上限在OSReward完整集上只有最前沿的闭源模型接近90%的二分类准确率Claude-Opus-4-8达到89.7%但到了OSReward-Hard上最佳评判者准确率跌破70%平均仅52%。系统性宽松偏差所有VLM评判者共享一个令人不安的特征——对失败轨迹过于宽容尤其是当智能体“声称”任务完成但实际失败时评判者极易被误导。开源与闭源的鸿沟闭源模型在几乎所有维度上领先开源模型差距在小规模开源VLM上最为显著。但OS-Shepherd在OSReward-Hard的成本-准确率前沿上以极低成本达到了接近最昂贵商业模型的表现。实际落地应用的可能性OSReward的价值具有多重落地场景CUA训练与评估为CUA的强化学习提供可靠且低成本的奖励信号使规模化训练成为可能。数据筛选与质量把控在构建CUA训练数据集时自动过滤低质量轨迹。模型选型参考为开发者提供了一个标准化的评判模型对比平台。开源生态建设OS-Shepherd系列模型和OS-Shepherd-100K数据集已全部开源极大降低了CUA研发的门槛。技术细节数据采集与标注流程OSReward的数据构建采用了严格的端到端流程环境准备在桌面和移动端搭建专用的执行环境远超一般基准的覆盖范围。指令编写针对各平台生成经过人工验证的指令集。Agent执行在多种Agent主干模型上执行指令收集完整轨迹包含截图、动作序列和推理过程。多阶段人工标注每条预筛选的轨迹由三位独立标注者进行标注标注者之间存在分歧的案例被归入OSReward-Hard。评价指标体系研究采用了多维度的评价指标二分类准确率Binary Accuracy最基本的评判指标。成功召回率Success Recall真正成功的轨迹中被正确接受的比例——低值表示评判者过于严格。失败召回率Fail Recall真正失败的轨迹中被正确捕获的比例——低值表示评判者过于宽松。平衡准确率Balanced Accuracy上述两者的均值避免了类别不平衡OSReward中成功/失败比例为43%/57%对结果的扭曲。在OSReward-Multi中成功轨迹还会在对齐度Alignment和效率Efficiency两个维度上接受3级评分0/0.5/1。两阶段训练策略OS-Shepherd的训练采用了针对宽松偏差的专门设计第一阶段建立准确的轨迹评判能力。第二阶段直接针对“虚假成功false success”——即研究揭示的最严重失败模式——进行优化。成本-性能分析研究的一个重要贡献是绘制了OSReward-Hard上的成本-准确率前沿cost-accuracy frontier。分析显示可靠的评判模型极为昂贵而低成本的开放模型又表现不佳。OS-Shepherd恰好填补了这一空白——以远低于前沿模型的成本达到了接近其准确率的水平。研究设定硬件与软件配置模型规模OS-Shepherd提供9B和35BMoE架构两个版本。推理设置研究中固定了帧数、红色点击标记等参数并在消融实验中逐一扰动分析。解码策略采用贪心解码greedy decoding。数据规模OSReward基准包含1,019条跨平台轨迹。OSReward-Hard284条高难度案例。OS-Shepherd-100K从超过30万个评判实例中筛选出的近10万条训练样本。实验设计研究对27个VLM模型进行了系统评估涵盖了从开源到闭源、从小型到超大规模的各类模型。实验设计特别注意了训练集与测试集的严格分离——OS-Shepherd的训练语料与OSReward基准完全不相交。综合分析核心贡献的学术价值OSReward的贡献远不止于提供一个基准。它系统地揭示了一个此前被忽视但至关重要的问题VLM作为评判者的可靠性远未达到理想状态。这一发现对CUA领域的发展具有警示意义——如果连任务完成与否的判断都不可靠那么基于此的评估、数据筛选和强化学习都可能建立在不稳固的基础之上。尤为值得关注的是宽松偏差的系统性。研究发现这种偏差并非某个模型的偶然缺陷而是跨模型、跨平台的普遍现象。这意味着简单的“换一个更好的模型”无法解决问题——需要从根本上重新思考评判模型的设计和训练范式。方法论上的创新OSReward在方法论上提供了一个值得借鉴的范式先系统性地诊断问题再有针对性地构建解决方案。研究团队没有止步于“发现VLM评判者不可靠”这一结论而是基于诊断结果构建了OS-Shepherd-100K训练语料和两阶段训练策略。这种“诊断→数据→模型”的闭环思路为AI安全和对齐研究提供了可复用的方法论参考。开源生态的意义OSReward团队将代码、基准、数据集和模型权重全部开源。考虑到CUA是当前AI领域最热门的赛道之一这一决定具有重要的生态价值——它使得中小型团队也能开展CUA相关研究而无需承担高昂的商业API调用成本。OS-Shepherd将成本降低至商业模型的1/30到1/60这一数量级的差距足以改变整个领域的研究范式。局限性与展望从论文摘要和初步分析来看OSReward仍存在一些值得关注的局限性动态验证的缺失当前基准基于静态轨迹的离线评判而实际的CUA强化学习需要在线奖励信号——这一差距如何弥合尚不明确。人类标注的质量边界即使是多阶段人工标注“金标准”本身也受限于人类标注者的判断能力——OSReward-Hard正是标注者分歧的集合说明有些案例连人类也难以达成共识。跨平台泛化能力虽然OSReward覆盖了四个平台但CUA的应用场景仍在快速扩展基准的覆盖面能否跟上领域发展仍需观察。实践应用对研究者的建议评估CUA时请勿盲信VLM评判者OSReward的研究表明即使是GPT-5.5、Claude-Opus-4-8等前沿模型在困难案例上的准确率也仅徘徊在70%左右。建议在研究设计中加入人工抽检或交叉验证机制。优先使用OS-Shepherd作为奖励模型对于需要规模化部署CUA奖励信号的场景OS-Shepherd-35B在成本-性能权衡上表现最优。如果资源有限9B版本也是一个合理的选择。关注宽松偏差的缓解在构建自己的评判模型时应有意识地在训练数据中增加失败案例的比重特别是那些“看似成功实则失败”的边界案例。对工程师的建议直接使用开源资源OSReward的代码、模型权重和数据集均已开源可立即集成到现有CUA开发流程中。成本优化策略如果当前使用GPT-4o或Claude等商业模型进行轨迹评判迁移到OS-Shepherd可将成本降低30-60倍同时保持相近的准确率。利用OSReward-Hard进行压力测试在部署CUA系统前可使用OSReward-Hard子集对评判模型进行压力测试识别其在困难案例上的表现短板。对决策者的建议重视CUA的可验证性问题OSReward揭示的评判者可靠性问题提醒我们CUA的“自动化”不能以牺牲“可验证性”为代价。在将CUA投入关键业务场景前应建立多层次的质量把控机制。投资开源基础设施建设OSReward的成功表明开源社区能够以远低于商业方案的成本提供高质量的AI基础设施。在AI研发投入上支持开源生态可能比单纯采购商业API更具长期价值。参考资料原始论文https://arxiv.org/abs/2607.28609项目主页https://os-copilot.github.io/OSReward-Home/论文PDFhttps://arxiv.org/pdf/2607.28609

相关新闻

[论文学习]一人掌控N个智能体:校准偏差与相关性置信度下LLM智能体集群的审计预算分配

[论文学习]一人掌控N个智能体:校准偏差与相关性置信度下LLM智能体集群的审计预算分配

One Human, N Agents: Audit-Budget Allocation for LLM Agent Fleets under Miscalibrated, Correlated Confidence 论文重点 本文针对“一人监督N个LLM智能体”这一现实困境,构建了预算受限下的噪声审计模型。研究发现:当智能体自报置信度存在对抗性…

2026/8/3 23:24:22 阅读更多 →
如何在3分钟内将英雄联盟游戏体验提升到专业级?解锁League-Toolkit的智能革命

如何在3分钟内将英雄联盟游戏体验提升到专业级?解锁League-Toolkit的智能革命

如何在3分钟内将英雄联盟游戏体验提升到专业级?解锁League-Toolkit的智能革命 【免费下载链接】League-Toolkit An all-in-one toolkit for LeagueClient. Gathering power 🚀. 项目地址: https://gitcode.com/gh_mirrors/le/League-Toolkit 你是…

2026/8/3 23:24:22 阅读更多 →
Blender细节进阶:从程序化材质到光影渲染的全流程实战

Blender细节进阶:从程序化材质到光影渲染的全流程实战

1. 项目概述:为什么“细节补充”是Blender进阶的关键如果你已经能用Blender建出基础的模型,会一些简单的材质和动画,但总觉得自己的作品“差点意思”——不够真实、不够精致,或者效率低下,那么你遇到的就是典型的“细节…

2026/8/3 23:23:22 阅读更多 →

最新新闻

提升检测精度的秘密武器:flexible-yolov5中CBAM与DCN插件使用教程

提升检测精度的秘密武器:flexible-yolov5中CBAM与DCN插件使用教程

提升检测精度的秘密武器:flexible-yolov5中CBAM与DCN插件使用教程 【免费下载链接】flexible-yolov5 More readable and flexible yolov5 with more backbone(gcn, resnet, shufflenet, moblienet, efficientnet, hrnet, swin-transformer, etc) and (cbam&#xff…

2026/8/3 23:55:38 阅读更多 →
NumPy数组NaN值检测与替换实战:从定位到填充的完整指南

NumPy数组NaN值检测与替换实战:从定位到填充的完整指南

1. 项目概述:为什么处理Numpy数组中的nan值如此重要? 在数据分析和科学计算的日常工作中,我们几乎每天都会和Numpy的ndarray打交道。无论是从传感器读取的时序数据,还是从数据库导出的用户行为记录,甚至是图像处理中的…

2026/8/3 23:55:38 阅读更多 →
Konacha与Rails Asset Pipeline集成:提升前端测试效率

Konacha与Rails Asset Pipeline集成:提升前端测试效率

Konacha与Rails Asset Pipeline集成:提升前端测试效率 【免费下载链接】konacha Test your Rails applications JavaScript with the mocha test framework and chai assertion library 项目地址: https://gitcode.com/gh_mirrors/ko/konacha Konacha是一款专…

2026/8/3 23:55:38 阅读更多 →
clusterd指纹识别引擎解析:如何精准识别JBoss、Tomcat等应用服务器版本

clusterd指纹识别引擎解析:如何精准识别JBoss、Tomcat等应用服务器版本

clusterd指纹识别引擎解析:如何精准识别JBoss、Tomcat等应用服务器版本 【免费下载链接】clusterd application server attack toolkit 项目地址: https://gitcode.com/gh_mirrors/cl/clusterd clusterd是一款强大的应用服务器攻击工具包,其核心功…

2026/8/3 23:55:38 阅读更多 →
M3U8格式全解析:从播放原理到Vue集成与MP4转换实战

M3U8格式全解析:从播放原理到Vue集成与MP4转换实战

1. 项目概述:从播放失败到永久保存,全面拆解M3U8格式 最近在社区和项目群里,关于M3U8格式的问题又多了起来。有前端开发的朋友在Vue项目里集成播放器时,被跨域和格式兼容性搞得焦头烂额;也有普通用户想下载一个在线视频…

2026/8/3 23:55:38 阅读更多 →
MapView开发指南:自定义图层开发全流程,从BitmapLayer到RouteLayer

MapView开发指南:自定义图层开发全流程,从BitmapLayer到RouteLayer

MapView开发指南:自定义图层开发全流程,从BitmapLayer到RouteLayer 【免费下载链接】MapView A MapView on Android platform. 项目地址: https://gitcode.com/gh_mirrors/mapv/MapView MapView是一款功能强大的Android平台地图视图组件&#xff…

2026/8/3 23:54:37 阅读更多 →

日新闻

3个让你工作效率翻倍的Umi-OCR实战技巧:免费离线文字识别完全指南

3个让你工作效率翻倍的Umi-OCR实战技巧:免费离线文字识别完全指南

3个让你工作效率翻倍的Umi-OCR实战技巧:免费离线文字识别完全指南 【免费下载链接】Umi-OCR OCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。…

2026/8/3 0:00:47 阅读更多 →
[具身智能-181]:PC+服务器+具身机器人:构建具身智能从仿真到量产的闭环迭代混合架构

[具身智能-181]:PC+服务器+具身机器人:构建具身智能从仿真到量产的闭环迭代混合架构

PC服务器具身机器人:构建具身智能从仿真到量产的闭环迭代混合架构一、前言:具身智能需要“混合算力闭环系统”传统人工智能依赖云端静态数据集训练,不具备物理交互能力,无法适应真实世界的不确定性。具身智能(Embodied…

2026/8/3 0:00:47 阅读更多 →
[具身智能-181]:大分布式通信模型对比:看懂为什么 DDS 是 ROS2 底层通信最优解

[具身智能-181]:大分布式通信模型对比:看懂为什么 DDS 是 ROS2 底层通信最优解

前言构建机器人、具身智能这类分布式实时系统,通信底座直接决定整套系统的实时性、容错性、组网能力。分布式领域长期存在 4 类经典通信架构:点对点模式、Broker 中间代理模式、广播模式、以数据为中心(DDS)模式。很多开发者疑惑&…

2026/8/3 0:00:47 阅读更多 →

周新闻

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

1. 从水管网络到最大流:一个核心问题的诞生想象一下,你是一个城市供水系统的总工程师。你的城市有多个水源(水库),需要通过一个复杂的地下管道网络,将水输送到各个居民区。每条管道都有其最大通水能力&…

2026/8/3 4:58:13 阅读更多 →
基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台…

2026/8/3 1:53:31 阅读更多 →
MATLAB xcorr函数详解:从互相关原理到四大实战应用

MATLAB xcorr函数详解:从互相关原理到四大实战应用

1. 从一次信号“找茬”说起:为什么我们需要互相关几年前,我在处理一组声学传感器数据时遇到了一个棘手的问题。我有两个麦克风记录了一段相同的音频信号,理论上它们接收到的声音波形应该非常相似,只是由于麦克风位置不同&#xff…

2026/8/3 4:36:35 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/3 13:07:03 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/3 5:19:38 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/3 8:27:36 阅读更多 →