[论文学习]OSReward:为跨平台计算机使用奖励模型建立标准化评估
OSReward为跨平台计算机使用奖励模型建立标准化评估论文重点OSReward是一个针对计算机使用智能体CUA轨迹验证任务的标准化评估基准由来自香港大学、南京大学、新加坡国立大学等多所顶尖机构的23位研究者共同完成。研究发现当前最先进的视觉语言模型VLM作为CUA轨迹的评判者存在系统性的宽松偏差leniency bias——倾向于将失败轨迹误判为成功而少数足够可靠的模型又因成本过高而无法规模化部署。为此研究团队构建了OS-Shepherd系列开源奖励模型9B和35B在匹配商业级评判模型性能的同时将成本降低至前者的30-60分之一。核心研究内容问题定义计算机使用智能体CUA正在快速渗透数字世界的各个角落——网页、移动应用、桌面软件。一个CUA轨迹记录了智能体的动作、状态和推理过程验证该轨迹是否完成了任务指令是CUA评估、数据筛选和强化学习的核心环节。然而无论是人工编写的验证器还是人类标注者都无法在大规模场景下提供这种验证。因此该领域越来越依赖VLM作为CUA轨迹的“评判者”。但一个根本性的问题始终未被认真审视这些VLM评判者到底有多可靠创新方法OSReward的核心创新体现在三个层面1. 基准构建OSReward Benchmark不同于复用现有Agent基准中的现成轨迹这种做法会将评判者错误与轨迹本身缺陷混为一谈OSReward从零搭建了专用的跨平台数据基础设施在网页、移动端和桌面端四个平台上运行多种Agent主干模型执行人工验证的指令再通过多阶段人工标注生成高质量的“金标准”标签。2. 挑战集设计OSReward进一步衍生出两个子集——OSReward-Hard专注于真正困难的案例标注者自身都存在分歧的轨迹用于诊断评判模型的错误模式OSReward-Multi则在二分类判定之上叠加了细粒度的效率和对齐评分。3. 开源奖励模型OS-Shepherd基于评估发现的洞见团队构建了包含10万条推理标注轨迹评判的开放语料库OS-Shepherd-100K并采用两阶段训练策略训练出OS-Shepherd-9B和OS-Shepherd-35B两款开源奖励模型。研究成果研究团队对27个模型进行了迄今为止最全面的VLM评判者评估。核心发现包括准确性上限在OSReward完整集上只有最前沿的闭源模型接近90%的二分类准确率Claude-Opus-4-8达到89.7%但到了OSReward-Hard上最佳评判者准确率跌破70%平均仅52%。系统性宽松偏差所有VLM评判者共享一个令人不安的特征——对失败轨迹过于宽容尤其是当智能体“声称”任务完成但实际失败时评判者极易被误导。开源与闭源的鸿沟闭源模型在几乎所有维度上领先开源模型差距在小规模开源VLM上最为显著。但OS-Shepherd在OSReward-Hard的成本-准确率前沿上以极低成本达到了接近最昂贵商业模型的表现。实际落地应用的可能性OSReward的价值具有多重落地场景CUA训练与评估为CUA的强化学习提供可靠且低成本的奖励信号使规模化训练成为可能。数据筛选与质量把控在构建CUA训练数据集时自动过滤低质量轨迹。模型选型参考为开发者提供了一个标准化的评判模型对比平台。开源生态建设OS-Shepherd系列模型和OS-Shepherd-100K数据集已全部开源极大降低了CUA研发的门槛。技术细节数据采集与标注流程OSReward的数据构建采用了严格的端到端流程环境准备在桌面和移动端搭建专用的执行环境远超一般基准的覆盖范围。指令编写针对各平台生成经过人工验证的指令集。Agent执行在多种Agent主干模型上执行指令收集完整轨迹包含截图、动作序列和推理过程。多阶段人工标注每条预筛选的轨迹由三位独立标注者进行标注标注者之间存在分歧的案例被归入OSReward-Hard。评价指标体系研究采用了多维度的评价指标二分类准确率Binary Accuracy最基本的评判指标。成功召回率Success Recall真正成功的轨迹中被正确接受的比例——低值表示评判者过于严格。失败召回率Fail Recall真正失败的轨迹中被正确捕获的比例——低值表示评判者过于宽松。平衡准确率Balanced Accuracy上述两者的均值避免了类别不平衡OSReward中成功/失败比例为43%/57%对结果的扭曲。在OSReward-Multi中成功轨迹还会在对齐度Alignment和效率Efficiency两个维度上接受3级评分0/0.5/1。两阶段训练策略OS-Shepherd的训练采用了针对宽松偏差的专门设计第一阶段建立准确的轨迹评判能力。第二阶段直接针对“虚假成功false success”——即研究揭示的最严重失败模式——进行优化。成本-性能分析研究的一个重要贡献是绘制了OSReward-Hard上的成本-准确率前沿cost-accuracy frontier。分析显示可靠的评判模型极为昂贵而低成本的开放模型又表现不佳。OS-Shepherd恰好填补了这一空白——以远低于前沿模型的成本达到了接近其准确率的水平。研究设定硬件与软件配置模型规模OS-Shepherd提供9B和35BMoE架构两个版本。推理设置研究中固定了帧数、红色点击标记等参数并在消融实验中逐一扰动分析。解码策略采用贪心解码greedy decoding。数据规模OSReward基准包含1,019条跨平台轨迹。OSReward-Hard284条高难度案例。OS-Shepherd-100K从超过30万个评判实例中筛选出的近10万条训练样本。实验设计研究对27个VLM模型进行了系统评估涵盖了从开源到闭源、从小型到超大规模的各类模型。实验设计特别注意了训练集与测试集的严格分离——OS-Shepherd的训练语料与OSReward基准完全不相交。综合分析核心贡献的学术价值OSReward的贡献远不止于提供一个基准。它系统地揭示了一个此前被忽视但至关重要的问题VLM作为评判者的可靠性远未达到理想状态。这一发现对CUA领域的发展具有警示意义——如果连任务完成与否的判断都不可靠那么基于此的评估、数据筛选和强化学习都可能建立在不稳固的基础之上。尤为值得关注的是宽松偏差的系统性。研究发现这种偏差并非某个模型的偶然缺陷而是跨模型、跨平台的普遍现象。这意味着简单的“换一个更好的模型”无法解决问题——需要从根本上重新思考评判模型的设计和训练范式。方法论上的创新OSReward在方法论上提供了一个值得借鉴的范式先系统性地诊断问题再有针对性地构建解决方案。研究团队没有止步于“发现VLM评判者不可靠”这一结论而是基于诊断结果构建了OS-Shepherd-100K训练语料和两阶段训练策略。这种“诊断→数据→模型”的闭环思路为AI安全和对齐研究提供了可复用的方法论参考。开源生态的意义OSReward团队将代码、基准、数据集和模型权重全部开源。考虑到CUA是当前AI领域最热门的赛道之一这一决定具有重要的生态价值——它使得中小型团队也能开展CUA相关研究而无需承担高昂的商业API调用成本。OS-Shepherd将成本降低至商业模型的1/30到1/60这一数量级的差距足以改变整个领域的研究范式。局限性与展望从论文摘要和初步分析来看OSReward仍存在一些值得关注的局限性动态验证的缺失当前基准基于静态轨迹的离线评判而实际的CUA强化学习需要在线奖励信号——这一差距如何弥合尚不明确。人类标注的质量边界即使是多阶段人工标注“金标准”本身也受限于人类标注者的判断能力——OSReward-Hard正是标注者分歧的集合说明有些案例连人类也难以达成共识。跨平台泛化能力虽然OSReward覆盖了四个平台但CUA的应用场景仍在快速扩展基准的覆盖面能否跟上领域发展仍需观察。实践应用对研究者的建议评估CUA时请勿盲信VLM评判者OSReward的研究表明即使是GPT-5.5、Claude-Opus-4-8等前沿模型在困难案例上的准确率也仅徘徊在70%左右。建议在研究设计中加入人工抽检或交叉验证机制。优先使用OS-Shepherd作为奖励模型对于需要规模化部署CUA奖励信号的场景OS-Shepherd-35B在成本-性能权衡上表现最优。如果资源有限9B版本也是一个合理的选择。关注宽松偏差的缓解在构建自己的评判模型时应有意识地在训练数据中增加失败案例的比重特别是那些“看似成功实则失败”的边界案例。对工程师的建议直接使用开源资源OSReward的代码、模型权重和数据集均已开源可立即集成到现有CUA开发流程中。成本优化策略如果当前使用GPT-4o或Claude等商业模型进行轨迹评判迁移到OS-Shepherd可将成本降低30-60倍同时保持相近的准确率。利用OSReward-Hard进行压力测试在部署CUA系统前可使用OSReward-Hard子集对评判模型进行压力测试识别其在困难案例上的表现短板。对决策者的建议重视CUA的可验证性问题OSReward揭示的评判者可靠性问题提醒我们CUA的“自动化”不能以牺牲“可验证性”为代价。在将CUA投入关键业务场景前应建立多层次的质量把控机制。投资开源基础设施建设OSReward的成功表明开源社区能够以远低于商业方案的成本提供高质量的AI基础设施。在AI研发投入上支持开源生态可能比单纯采购商业API更具长期价值。参考资料原始论文https://arxiv.org/abs/2607.28609项目主页https://os-copilot.github.io/OSReward-Home/论文PDFhttps://arxiv.org/pdf/2607.28609

相关新闻

[论文学习]一人掌控N个智能体:校准偏差与相关性置信度下LLM智能体集群的审计预算分配

[论文学习]一人掌控N个智能体:校准偏差与相关性置信度下LLM智能体集群的审计预算分配

One Human, N Agents: Audit-Budget Allocation for LLM Agent Fleets under Miscalibrated, Correlated Confidence 论文重点 本文针对“一人监督N个LLM智能体”这一现实困境,构建了预算受限下的噪声审计模型。研究发现:当智能体自报置信度存在对抗性…

2026/9/22 1:46:58 阅读更多 →
如何在3分钟内将英雄联盟游戏体验提升到专业级?解锁League-Toolkit的智能革命

如何在3分钟内将英雄联盟游戏体验提升到专业级?解锁League-Toolkit的智能革命

如何在3分钟内将英雄联盟游戏体验提升到专业级?解锁League-Toolkit的智能革命 【免费下载链接】League-Toolkit An all-in-one toolkit for LeagueClient. Gathering power 🚀. 项目地址: https://gitcode.com/gh_mirrors/le/League-Toolkit 你是…

2026/9/22 0:59:32 阅读更多 →
Blender细节进阶:从程序化材质到光影渲染的全流程实战

Blender细节进阶:从程序化材质到光影渲染的全流程实战

1. 项目概述:为什么“细节补充”是Blender进阶的关键如果你已经能用Blender建出基础的模型,会一些简单的材质和动画,但总觉得自己的作品“差点意思”——不够真实、不够精致,或者效率低下,那么你遇到的就是典型的“细节…

2026/9/21 23:20:28 阅读更多 →

最新新闻

3天搞定博士夫妻相声后端架构:手写实现高并发接口

3天搞定博士夫妻相声后端架构:手写实现高并发接口

3天搞定博士夫妻相声后端架构:手写实现高并发接口 昨晚改代码改到凌晨两点,屏幕上一片红,StackTrace 长得像天书,报错信息全是 NullPointerException 和 OutOfMemoryError…

2026/9/22 3:13:53 阅读更多 →
cf战服性能优化:5个高频面试题背后的实战避坑指南

cf战服性能优化:5个高频面试题背后的实战避坑指南

cf战服性能优化:5个高频面试题背后的实战避坑指南 看了一堆教程还是不会写项目?别怪自己笨,是没人告诉你,cf战服这类高并发场景下的性能瓶颈,往往藏在那些看似不起眼的“高频面试题”里。…

2026/9/22 3:13:53 阅读更多 →
国产男女猛烈无遮挡A片游戏源码解析:3步搞定从零搭建

国产男女猛烈无遮挡A片游戏源码解析:3步搞定从零搭建

国产男女猛烈无遮挡A片游戏源码解析:3步搞定从零搭建 看了一堆教程还是不会写项目?别急,今天咱们直接上干货。很多人卡在“看懂了代码,但自己敲不出来”这一步,核心问题在于缺乏对源码解析的深度理解。 项目目标与场景界定…

2026/9/22 3:12:53 阅读更多 →
搞定苦难辉煌高频面试题:从0到1的性能优化实战

搞定苦难辉煌高频面试题:从0到1的性能优化实战

搞定苦难辉煌高频面试题:从0到1的性能优化实战 学会语法却不知怎么搭项目,这是无数开发者转型期的噩梦。你背下了Python的装饰器、Java的并发包,却在面对一个高并发接口时手足无措,代码跑得慢得像蜗牛。更扎心的是,当你翻开那些【高频面试题…

2026/9/22 3:12:53 阅读更多 →
5个核心点搞定taob1性能优化,拒绝死记硬背

5个核心点搞定taob1性能优化,拒绝死记硬背

5个核心点搞定taob1性能优化,拒绝死记硬背 官方文档动辄几十页,读起来像看天书,面试时却只问最扎心的三个点:瓶颈在哪、怎么改、数据涨了多少。很多人盯着 taob1 相关的底层机制看了半天,脑子还是一团浆糊。其实, taob1…

2026/9/22 3:12:53 阅读更多 →
处理器手机2026最新架构拆解:别只背语法,搞懂指令流水线

处理器手机2026最新架构拆解:别只背语法,搞懂指令流水线

处理器手机2026最新架构拆解:别只背语法,搞懂指令流水线 是不是刚学会几行Python或Java代码,看着手机里的App跑得飞起,自己却连个像样的项目都搭不起来?这种“语法熟、项目懵”的断崖式体验,在2026年的开发圈里太常见了。很多人把…

2026/9/22 3:11:52 阅读更多 →

日新闻

3台商务办公笔记本实测:手写实现环境配置,告别卡半天

3台商务办公笔记本实测:手写实现环境配置,告别卡半天

3台商务办公笔记本实测:手写实现环境配置,告别卡半天 配置环境就卡半天?别怪机器慢,多半是你没选对工具链。在Java、Go或Python的项目现场, 手写实现…

2026/9/22 0:00:41 阅读更多 →
剑帝加点速查手册:3分钟搞懂核心逻辑

剑帝加点速查手册:3分钟搞懂核心逻辑

剑帝加点速查手册:3分钟搞懂核心逻辑 面试被问原理答不上来,是不是常态?别慌。很多开发者对着 GitHub 开源仓库里的代码发呆,看似简单实则暗藏玄机。今天这份【剑帝加点】速查手册,直接带你拆解核心实现,把面试必考的原理讲透。…

2026/9/22 0:00:41 阅读更多 →
手写实现图片压缩网站核心:搞定WebP转换与质量调优

手写实现图片压缩网站核心:搞定WebP转换与质量调优

手写实现图片压缩网站核心:搞定WebP转换与质量调优 复制来的代码跑不通不知道怎么调?别慌,这种“复制粘贴地狱”在开发圈太常见了。尤其是做 图片压缩网站…

2026/9/22 0:00:41 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/21 3:13:20 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/21 2:19:36 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/21 4:51:05 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/21 15:36:51 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/21 15:36:51 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/22 2:43:42 阅读更多 →