DRACO:面向长视界智能体训练的动态评分细则细粒度信用分配
DRACO:面向长视界智能体训练的动态评分细则细粒度信用分配arXiv编号:arXiv:2609.04094v1摘要基于可验证奖励的强化学习(RLVR)在具备程序校验器的任务中效果出色,但绝大多数长视界智能体任务不存在程序式真值校验器。本文研究**无结果真值(outcome(1‑Q_j)blind)**设置:训练全程无法获取任务成功的真值信号,全部训练信号只能来自过程性评判标准。多维度评分细则(rubric)是获取这类奖励的常用手段,但它仅能对整条轨迹输出一个标量奖励;对于数十步的长轨迹,单一标量信号的学习效果很差。本文提出DRACO:Distributing Rubric(1‑Q_j)based Advantage for Credit Optimization(基于评分细则的优势分配信用优化算法)。DRACO在训练过程中动态生成每条轨迹专属评分细则,对完整轨迹完成打分,再将评判结果重分配到对应的执行步骤,在GRPO(Group Relative Policy Optimization)框架内生成差异化的逐步优势值。整套重分配采用闭式解析解,不需要额外训练归因模块。在AppWorld基准上,DRACO相比基座模型提升15.9个点;对比使用稀疏真值奖励训练的GRPO基线,提升5.3个点,整个过程完全不依赖任何程序校验器。在跨域的τ \tauτ-bench基准上,即使不使用顶尖大模型作为评判器,相比基座模型依然提升5.3个点,优于真值奖励训练基线以及其他基于评分细则的训练方案。关键词长视界智能体、信用分配、GRPO、动态评分细则、无结果真值强化学习、过程监督目录引言相关工作2.1 基于评分细则的奖励2.2 步骤级信用分配方法3.1 背景知识:GRPO算法3.2 单条轨迹动态评分细则3.3 基于评分细则的步骤信用分配3.3.1 步骤质量3.3.2 符号保持的步骤权重3.3.3 步骤优势值3.3.4 训练循环实验4.1 实验配置4.1.1 实验设置4.1.2 训练与实现细节4.1.2.1 数据与模型4.1.2.2 RL超参数4.1.3 评测方案4.1.3.1 评测基准4.1.3.2 评测指标4.1.3.3 评测协议4.2 整体实验结果4.2.1 相比基线的性能增益4.2.2 可复现性与任务发现能力4.3 消融实验4.3.1 结果奖励的影响4.3.2 评分细则类型与步骤信用分配4.3.3 自评判器Self(1‑Q_j)judge4.4 分析实验4.4.1 评测开销与episode长度4.4.2 轨迹终止模式4.4.3 静态评分细则会饱和,动态评分细则不会结论局限性伦理声明参考文献附录A 补充实验结果A.1 Self(1‑Q_j)judge变体A.2 与前沿大模型对比附录B 补充分析B.1 自评判器对比前沿评判器B.1.1 标注:应用给定评分细则B.1.2 生成:编写评判标准B.1.3 合并:候选标准合并为打分集合B.2 动态评分细则包含哪些内容B.3 为什么步骤信用分配依赖动态评分细则附录C 评分细则构建附录D 训练超参数D.1 Qwen2.5(1‑Q_j)32B(1‑Q_j)Instruct服务配置D.2 (\tau)(1‑Q_j)bench检索配置附录E 信用重分配完整推导E.1 前置知识:GRPO与token级优势E.2 符号与设定E.3 完整公式推导E.4 各项数学项含义E.5 手工演算示例E.6 真实日志轨迹演算样例E.7 全票通过/失败轨迹会关闭信用区分能力E.8 配置参数E.9 七条数学性质附录F 全套提示词脚本1 引言可验证奖励强化学习RLVR在数学推理、工具调用智能体领域取得巨大成功,该范式依靠程序校验器(单元测试、正则匹配)提供可靠的终端奖励。但大量真实智能体场景不存在可用的程序真值校验器,例如客户服务、开放式研究智能体;要构造这类场景的校验器,难度几乎等同于解决任务本身。本文研究无结果真值(outcome(1‑Q_j)blind)设定:训练阶段完全不能访问任务成功真值,全部训练信号只能来自过程评判标准。该场景比绝大多数强化学习文献的假设条件更难。同时长视界智能体还面临经典信用分配难题:一条轨迹包含几十步互相依赖的工具调用;即便可以拿到轨迹级标量奖励,把同一个标量均匀分配给每一步,统计效率低下甚至会带来负面影响:成功轨迹中存在冗余、碰运气的步骤;失败轨迹中大量步骤其实是正确的。现有工作大多在存在真值结果前提下做步骤级信用分配;缺少面向无结果真值场景的方案:如何把评分细则输出的评判信号,路由分配到每一个执行步骤。DRACO整体两大核心组件动态逐轨迹评分细则生成:训练时针对每一条采样轨迹生成专属评判标准,适配策略模型不断变化的行为;对完整轨迹打分。评分细则条件下的步骤信用重分配:闭式解析解,把整条轨迹的GRPO优势,按照评判器标注的步骤归因结果重新分配到各个步骤;不引入任何可训练归因模块。关键特性:信用重分配严格守恒整条轨迹总梯度推动幅度,不会放大/削弱整条轨迹的总更新强度,只改变内部步骤之间的梯度分配。在AppWorld基准上,DRACO(Qwen3.6(1‑Q_j)27B)相比基座TGC指标提升15.9点;在零样本跨域τ \tauτ-bench同样获得收益。消融实验证明:动态评分细则 + 步骤信用分配两者必须组合,单独一个组件收益有限。静态评分细则随着训练会快速饱和,失去区分信号;动态细则可以持续提供判别性训练信号。本文贡献形式化定义无结果真值场景下,基于评分细则的强化学习问题;梳理该领域现有工作。提出DRACO:动态逐轨迹评分细则 + 闭式步骤信用重分配;给出7条严格证明的数学不变性质;不需要训练额外归因网络。在AppWorld、τ \tauτ-bench开展完整实验、大规模消融;验证动态细则、步骤信用分配、自评判器变体的效果;分析饱和现象、开销、长度特性。公开全套提示词脚本、超参数、演算示例;所有附录提供可复现细节。2 相关工作2.1 基于评分细则的奖励一部分方法在训练过程迭代更新评分细则,每条完整轨迹打分;但是只输出整条轨迹标量,没有细粒度步骤分配,例如DR(1‑Q_j)Tulu、EvoRubric。另一类工作在每一步都调用评判器生成细则,绑定任务分解;开销巨大,每一步都要调用LLM评判。Rubrics(1‑Q_j)to(1‑Q_j)Tokens是为数不多把轨迹级评分映射到token的工作,但依赖固定评判标准,并且需要训练判别器模块。DRACO继承“轨迹完成后打分”范式,增加闭式步骤信用重分配,不需要训练任何归因模块。2.2 步骤级信用分配现有LLM智能体步骤信用分配方案,绝大多数依赖任务真值结果:训练进度估计器、回溯Q值、参考模型似然。少数使用LLM做事后归因,但依然需要真值结果作为监督。DRACO区别:✅ 完全不需要任务真值结果;✅ 不绑定特定动作空间;✅ 信用重分配是闭式解析解,无训练参数。方法无结果真值评分细则奖励动态细则轨迹级打分步骤归因无训练归因模块DR(1‑Q_j)Tulu✓✓✓✓✗(1‑Q_j)EvoRubric✓✓✓✓✗(1‑Q_j)RubricARM✗✓✓✓✗(1‑Q_j)ARCO◐✓✓✗✓✗RubricEM✓✓✓✗✓✓SCRIBE◐◐✓✗✗✗Rubrics(1‑Q_j)to(1‑Q_j)Tokens◐✓✗✓✓✗AgentEvolver✗◐✗✓✓✓HCAPO✗✗✗✓✓✓SALT✗✗✗✓✓✓DRACO(本文)✓✓✓✓✓✓符号说明:✓支持;✗不支持;◐部分支持;(1‑Q_j)不适用。3 方法策略模型π θ \pi_\thetaπθ​执行长视界episode,任务x xx生成轨迹τ = ( s 1 , a 1 , … , s T , a T ) \tau=(s_1,a_1,\dots,s_T,a_T)τ=(s1​,a1​,…,sT​,aT​),包含多轮推理与工具调用。训练全程没有程序校验器;全部奖励来自评判器输出的评分细则。整套方法分为两大模块。3.1 背景知识:GRPO算法对于任务x xx,采样一组G GG条轨迹τ i ∗ i = 1 G {\tau_i}*{i=1}^Gτi​∗i=1G,每条得到标量奖励R i R_iRi​。GRPO在组内做标准化,得到轨迹优势:A ∗ i = R i − mean ⁡ ( R j ) std ⁡ ( R j ) A*{i}=\frac{R_{i}-\operatorname{mean}({R_j})}{\operatorname{std}({R_j})}A∗i=std(Rj​)Ri​−mean(Rj​)​轨迹τ i \tau_iτi​的token序列y i , 1 , … , y i , N i y_{i,1},\dots,y_{i,N_i}yi,1​,…,yi,Ni​​。GRPO将同一个标量A i A_iAi​施加给该轨迹全部token,策略梯度:∇ θ J = E [ ∑ t = 1 N i A i ∇ θ log ⁡ π θ ( y i , t ∣ y i , t , x ) ] \nabla_{\theta}\mathcal{J}=\mathbb{E}\left[\sum_{t=1}^{N_i}A_i\nabla_\theta\log\pi_\theta(y_{i,t}\mid y_{i,t},x)\right]∇θ​J=E[t=1∑Ni​​Ai​∇θ​logπθ​(yi,t​∣yi,t​,x)

相关新闻

LunaTranslator便携版:游戏翻译利器

LunaTranslator便携版:游戏翻译利器

解决 Galgame 玩家及多语言场景用户的翻译需求。其设计初衷是打破语言壁垒,通过整合先进的机器学习技术与多模态文本提取方案,实现游戏、视频、文档等复杂场景的无缝翻译。文本输入 HOOK:支持通过 HOOK 方式获取文本,部分游戏引擎…

2026/9/13 22:50:58 阅读更多 →
Opik Python SDK Check 客户端详解:工作区访问鉴权与当前工作区获取

Opik Python SDK Check 客户端详解:工作区访问鉴权与当前工作区获取

Opik Python SDK Check 客户端详解:工作区访问鉴权与当前工作区获取 【免费下载链接】comet-llm Debug, evaluate, and monitor your LLM applications, RAG systems, and agentic workflows with comprehensive tracing, automated evaluations, and production-re…

2026/9/13 22:49:58 阅读更多 →
marimo 函数复用机制详解:用 setup cell 与 @app.function 将笔记本中的函数与类导出为可导入模块

marimo 函数复用机制详解:用 setup cell 与 @app.function 将笔记本中的函数与类导出为可导入模块

marimo 函数复用机制详解:用 setup cell 与 app.function 将笔记本中的函数与类导出为可导入模块 【免费下载链接】marimo A reactive notebook for Python — run reproducible experiments, query with SQL, execute as a script, deploy as an app, and version …

2026/9/13 22:49:57 阅读更多 →

最新新闻

Iosevka 24.1.4 更新解析:新增字符全览与字形修复背后的源码逻辑

Iosevka 24.1.4 更新解析:新增字符全览与字形修复背后的源码逻辑

Iosevka 24.1.4 更新解析:新增字符全览与字形修复背后的源码逻辑 【免费下载链接】Iosevka Versatile typeface for code, from code. 项目地址: https://gitcode.com/GitHub_Trending/io/Iosevka Iosevka 是一套"由代码生成的代码字体"&#xff0…

2026/9/13 23:55:24 阅读更多 →
ESP32-S2双模收音机:ESP-IDF+ESP-ADF+LVGL实战解析

ESP32-S2双模收音机:ESP-IDF+ESP-ADF+LVGL实战解析

简介:一套围绕ESP32S2的嵌入式收音机项目资料包,基于ESP-IDF、ESP-ADF与LVGL框架实现网络收音机与FM收音机功能,面向毕业设计、课程设计、工程实训等嵌入式开发场景。压缩包共1519个文件、48.96MB,主要内容包括C与H源码、Python辅…

2026/9/13 23:55:24 阅读更多 →
Sa-Token Maven 依赖拉取失败排查指南:从本地缓存、镜像源到父子工程的完整解决方案

Sa-Token Maven 依赖拉取失败排查指南:从本地缓存、镜像源到父子工程的完整解决方案

Sa-Token Maven 依赖拉取失败排查指南:从本地缓存、镜像源到父子工程的完整解决方案 【免费下载链接】Sa-Token ✨ 开源、免费、一站式 Java 权限认证框架,让鉴权变得简单、优雅!—— 登录认证、权限认证、分布式 Session 会话、微服务网关鉴…

2026/9/13 23:55:24 阅读更多 →
STM32工业级环境监测系统设计实战

STM32工业级环境监测系统设计实战

1. 这不是又一个“DHT11读温湿度”的Demo,而是一套可落地的环境质量监测系统你在网上搜“STM32 环境监测”,十有八九点开是:一块STM32F103C8T6最小系统板,接一个DHT11传感器,串口打印几行温度湿度,再配上一…

2026/9/13 23:55:24 阅读更多 →
Telegraf 传输层安全(TLS)配置完全指南:客户端与服务端标准化 TLS 选项详解

Telegraf 传输层安全(TLS)配置完全指南:客户端与服务端标准化 TLS 选项详解

Telegraf 传输层安全(TLS)配置完全指南:客户端与服务端标准化 TLS 选项详解 【免费下载链接】telegraf Agent for collecting, processing, aggregating, and writing metrics, logs, and other arbitrary data. 项目地址: https://gitcode…

2026/9/13 23:55:24 阅读更多 →
5大自动化测试Python框架

5大自动化测试Python框架

大家好, 自二零一八年被评选成为编程语言之后, 于各大排行榜上始终皆是名列前茅的, 当下在Tiobe指数里位居第三, 仅仅次于Java和C。伴随该编程语言的广泛运用, 以其为基础的自动化测试框架也随之产生了, 并且持续发展和丰富。因而, 当开发人员与测试人员针对手头所进行的项目去…

2026/9/13 23:54:24 阅读更多 →

日新闻

AI SDK Harness 依赖更新指南:掌握 harness 包 SDK 依赖的升级、桥接同步与一致性校验

AI SDK Harness 依赖更新指南:掌握 harness 包 SDK 依赖的升级、桥接同步与一致性校验

AI SDK Harness 依赖更新指南:掌握 harness 包 SDK 依赖的升级、桥接同步与一致性校验 【免费下载链接】ai The AI Toolkit for TypeScript. From the creators of Next.js, the AI SDK is a free open-source library for building AI-powered applications and ag…

2026/9/13 0:00:24 阅读更多 →
Refine v5 Ant Design NumberField 组件实战:基于 Intl 的本地化数字格式化

Refine v5 Ant Design NumberField 组件实战:基于 Intl 的本地化数字格式化

Refine v5 Ant Design NumberField 组件实战:基于 Intl 的本地化数字格式化 【免费下载链接】refine A React Framework for building internal tools, admin panels, dashboards & B2B apps with unmatched flexibility. 项目地址: https://gitcode.com/GitH…

2026/9/13 0:00:24 阅读更多 →
Flutter应用改名全指南:从Android到iOS的配置与工具实践

Flutter应用改名全指南:从Android到iOS的配置与工具实践

刚接一个外包项目时,甲方要求把工程里临时用的应用名改成正式产品名。我本来觉得“改名”这种小事,打开配置文件改一行不就完了?结果真动手才发现,Flutter项目里“应用名称”根本不是一处配置,而是一整套散落在 Androi…

2026/9/13 0:00:24 阅读更多 →

周新闻

AI SDK Harness 依赖更新指南:掌握 harness 包 SDK 依赖的升级、桥接同步与一致性校验

AI SDK Harness 依赖更新指南:掌握 harness 包 SDK 依赖的升级、桥接同步与一致性校验

AI SDK Harness 依赖更新指南:掌握 harness 包 SDK 依赖的升级、桥接同步与一致性校验 【免费下载链接】ai The AI Toolkit for TypeScript. From the creators of Next.js, the AI SDK is a free open-source library for building AI-powered applications and ag…

2026/9/13 0:00:24 阅读更多 →
Refine v5 Ant Design NumberField 组件实战:基于 Intl 的本地化数字格式化

Refine v5 Ant Design NumberField 组件实战:基于 Intl 的本地化数字格式化

Refine v5 Ant Design NumberField 组件实战:基于 Intl 的本地化数字格式化 【免费下载链接】refine A React Framework for building internal tools, admin panels, dashboards & B2B apps with unmatched flexibility. 项目地址: https://gitcode.com/GitH…

2026/9/13 0:00:24 阅读更多 →
Flutter应用改名全指南:从Android到iOS的配置与工具实践

Flutter应用改名全指南:从Android到iOS的配置与工具实践

刚接一个外包项目时,甲方要求把工程里临时用的应用名改成正式产品名。我本来觉得“改名”这种小事,打开配置文件改一行不就完了?结果真动手才发现,Flutter项目里“应用名称”根本不是一处配置,而是一整套散落在 Androi…

2026/9/13 0:00:24 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/13 16:51:11 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/12 18:29:34 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/12 19:02:44 阅读更多 →