浙大阿里提出RetireOPD:让AI学生自己决定何时毕业
RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning作者Yan Yu, Zhengxi Lu, Yizhou Liu, Yichen Pan, Aozhe Wang, Qipeng Chen, Hua Yang, Wenqi Zhang, Weiming Lu, Qianglong Chen, Yongliang Shen核心发表机构Zhejiang University、Alibaba Group论文链接arXiv:2609.20784v1发布于arXiv 预印本cs.CL|——| RetireOPD (Ours) | 60 | 92.2 || w/o Alignment Stagnation | 50 | 89.0 || w/o Relative Competence | 100 | 89.0 || w/o Retirement | – | 82.8 || w/o OPD (GRPO-only) | 0 | 75.0 |结论清晰全程保留 OPD 只有 82.8%而完整方法达 92.2%说明及时移除教师监督对后续优化至关重要单独使用 alignment progress第 50 步退休或单独使用 relative competence第 100 步退休都只达到 89.0%两者结合达到最佳说明“差异停滞”与“能力达标”两个判据互补——前者缺位会导致较早切换后者缺位会导致过晚切换而两种偏差都带来约 3 个百分点的损失。此外从退休点继续训练的对照实验进一步佐证了机制比较“继续联合优化”“切换回 OPD”“移除 OPD 仅用 GRPO”三种策略后只有第三种能让成功率从退休点的 76.6% 稳步提升至 93.8%继续联合优化会进入平台并伴随师生差异持续扩大而切回更强教师对齐则会压缩甚至损害任务性能。自适应退休 vs 线性退火。与 ATOD 的对照显示线性退火在训练早期提升迅速但后期趋于平台自适应准则则持续改进。这一结果支持论文的核心论点教师效用并不按预定义时间表衰减用训练动态确定过渡阶段既能保留早期指导又能避免后期约束。退休阈值敏感性。论文在 3B 设置下扫描了能力阈值γ \gammaγ与有符号相对停滞阈值δ \deltaδ。完整方法γ 0.9 , δ 0 \gamma0.9,\delta0γ0.9,δ0在第 60 步退休、成功率 92.2γ 0.8 \gamma0.8γ0.8在第 55 步退休、90.6γ 1.0 \gamma1.0γ1.0在第 95 步退休、91.4δ 0.03 \delta0.03δ0.03在第 65 步退休、89.1δ 0.05 \delta0.05δ0.05在第 95 步退休、91.4。更宽范围的扫描表明对于γ ∈ [ 0.80 , 0.96 ] \gamma\in[0.80,0.96]γ∈[0.80,0.96]与δ ∈ [ − 0.10 , 0.04 ] \delta\in[-0.10,0.04]δ∈[−0.10,0.04]退休步数保持在默认设置± 5 \pm 5±5步以内只有在相对极端的阈值下才会出现明显延迟。综合来看阈值变化把过渡点从第 55 步推到第 95 步而成功率始终落在 89.1%–92.2% 区间且性能并不随过渡步数单调变化——这说明方法不依赖精细调参或某一个精确的切换点。需要说明“Adaptive Retirement vs. Linear Annealing”一节的正文结论在所提供的源码片段中未完整给出此处仅基于图中可确证的“线性退火后期平台、自适应持续改进”这一趋势进行描述。)五、相关工作 / Related WorkRLVR 与稀疏监督。以 GRPO 为代表的 RLVR 范式依托可验证结果奖励训练智能体但每条轨迹只有一个标量奖励信用分配粗粒度。RetireOPD 保留了 RLVR 的奖励信号作为主驱动只是在其之上叠加一层可控的密集监督并在适当时机撤回这层监督。On-Policy Distillation 与 OPSD。OPD 让学生在自身采样分布上接受更强教师的 token 级反馈OPSD 在没有更强外部教师时把同一模型条件于特权信息后作为教师蒸馏到无条件分支。智能体任务中的特权信息通常是检索或事后hindsight技能。已有方法让教师与学生共享同一策略、仅在上下文上分叉并通过 gating、同步或 advantage shaping 在 token 粒度上控制教师信号。RetireOPD 的关键差异在于蒸馏之前用环境奖励单独训练教师使教师与学生解耦避免“技能分支从未被训练去使用技能”的失效模式。蒸馏与 RL 的混合方法。已有混合方案包括退火蒸馏权重、在预定步数从蒸馏切换到 RL、扩展暴露给学生的轨迹视野、在衰减预算下撤回 in-context 技能、以及顺序执行蒸馏与 RL 等。它们的共同点是 transition 在训练前就被固定。更细粒度的在线决策只存在于局部层面例如仅对整条 rollout 失败的 prompt 施加蒸馏或按 token 门控教师信号但没有任何方法真正移除教师。RetireOPD 的差异是从师生差异与学生相对能力出发在线决定全局 transition并最终彻底移除教师此后仅用 GRPO 训练。与教师退火调度的区别。ATOD 一类方法用预定义线性退火表控制蒸馏权重其隐含假设是教师效用随时间线性衰减。RetireOPD 的代之以数据驱动的判据实验显示这一区别在后期性能上有可观差距。六、局限性与展望 / Limitations Future Work需要明确说明的是所提供的源码片段中并未出现独立的 Limitations 章节也未给出作者对局限性的正式声明因此以下内容是基于片段可确证信息的整理以及片段未覆盖项的标注不构成对作者观点的推测。其一理论分析的适用条件较窄。附录的一阶分析忽略有限样本噪声、假设 GRPO clipping 在局部不激活并且“退出优于联合”的结论需要步长η \etaη足够小。这意味着该分析刻画的是局部行为不能保证在训练早期的强随机性与大更新下仍然成立——这也正是方法需要额外引入能力门槛γ \gammaγ来防止过早退出的原因。其二方法的成本结构未被充分讨论。RetireOPD 需要一个完整的 Phase 1 教师训练阶段教师与学生同规模且教师监督期间每次更新都需要一次额外的教师前向传播片段未给出教师训练步数、总体计算开销相对基线的倍数也未讨论技能检索质量SkillBank 与 Keyword Matching对结果的敏感性。这些属于片段未覆盖项。其三超参与实现细节存在未明确之处。方法定义中出现了监控窗口W WW实验实现只说明每H 5 H5H5个 evaluation steps 评估一次退休准则片段未清晰给出W WW的实际取值与两者的关系δ \deltaδ的具体取值在不同片段中也有“未给出”与“默认δ 0 \delta0δ0”的不同表述需要以论文正文为准。其四对照实验存在信息缺口。“Adaptive Retirement vs. Linear Annealing”一节的正文与结论在片段中缺失无法提取该对比的完整数值结论训练动力学四类曲线成功率、差异、熵、奖励的具体数值同样未在片段中给出。其五可扩展性与泛化性有待检验。所有实验均在 Qwen2.5 系列 1.5B–7B 与 ALFWorld、WebShop 两个文本环境上完成未涉及更大规模模型、多模态环境或需要更长交互视野的任务“外部大教师 OPD 效果极差”这一现象虽被报告但其成因分布不匹配、能力差距过大抑或教师本身未适配任务格式在片段中未做进一步分析是有价值的后续研究方向。七、总结 / ConclusionRetireOPD 处理的是自蒸馏式智能体强化学习中两个被长期默认、却并不成立的假设。它先说清“哪个教师”的问题特权信息本身不会自动产生可靠教师只有用环境奖励显式训练 skill-conditioned 教师才能把上下文中的信息优势转化为一致的行为优势这一点在未优化分支 7B 模型仅 23.4% 成功率的反例中体现得尤为鲜明。它再说清“学多久”的问题教师监督是阶段相关的临时脚手架早期能消除 GRPO 的慢启动并突破纯 OPD 的低上限后期却会与奖励驱动优化冲突把学生封顶在教师水平附近。对应的解法是解耦的教师构建加自适应退休。学生先在 GRPO 与 OPD 的联合目标下吸收技能同时以窗口级统计量监控师生差异的相对变化ρ m ( K ) \rho_m^{(K)}ρm(K)​与相对能力η m \eta_mηm​一旦差异停止缩小且学生成功率接近教师成功率的 90%就永久移除教师此后仅用 GRPO 继续训练。论文的局部一阶分析为这一判据提供了形式化依据差异停滞意味着⟨ g , h ⟩ 0 \langle g,h\rangle0⟨g,h⟩0的局部冲突或 OPD 信号枯竭而在冲突成立时退出教师能获得更大的一阶回报提升。实验上RetireOPD 在 Qwen2.5-1.5B/3B/7B 与 ALFWorld、WebShop 上一致超过纯 RL、蒸馏、混合基线乃至其自身的 skill-conditioned teacherALFWorld 成功率相对 RL 基线提升 14.1%–18.8%WebShop 准确率提升 11.8%–19.0%消融则显示两个退休判据互补、阈值在较宽范围内稳定、且自适应退休优于预定义线性退火。一句话概括其洞察教师的价值不在于被赋予了多少特权信息而在于是否能被训练去使用它以及是否知道何时该退场。原文摘要:Multi-turn agents trained with reinforcement learning (RL) receive a single scalar reward per trajectory, which motivates self on-policy distillation (OPD) to supply dense token-level supervision from a self-teacher with privileged task skills, letting a skill-free student internalize them. This recipe, however, is undermined by two findings in agentic tasks: privileged information alone does not always make a teacher reliable, and the benefit of teacher supervision is stage-dependent. We therefore propose RetireOPD (Self-Retiring On-Policy Distillation), which first optimizes a decoupled, skill-conditioned teacher with environment rewards and then trains a skill-free student jointly with RL and OPD. Rather than following a predefined distillation schedule, RetireOPD adopts Adaptive Retirement: the student drops the teacher on its own once their discrepancy stops shrinking and it reaches a target fraction of the teacher’s success rate, after which training proceeds with RL alone. Across Qwen2.5 models from 1.5B to 7B, RetireOPD improves ALFWorld success rate over RL baseline by 14.1% to 18.8% and WebShop accuracy by 11.8% to 19.0%, and surpasses its own skill-conditioned teacher in every setting.PDF链接:https://arxiv.org/pdf/2609.20784v1部分平台可能图片显示异常请以我的博客内容为准

相关新闻

影刀RPA实操指南:TEMU商品数据采集与登录态检测方法

影刀RPA实操指南:TEMU商品数据采集与登录态检测方法

影刀RPA实操指南:TEMU商品数据采集与登录态检测方法 做TEMU跨境的都知道,后台数据每天要在卖家后台、商品列表、库存页面之间来回切,人工看一圈半小时起步,还经常漏掉状态异常的商品。这篇讲两个TEMU运营最需要的自动化能力&#…

2026/9/28 19:51:11 阅读更多 →
用了 Claude Code 半个月,整理了一份「官方+民间」最佳实践:从 CLAUDE.md 到 TaoToken 配置骨架

用了 Claude Code 半个月,整理了一份「官方+民间」最佳实践:从 CLAUDE.md 到 TaoToken 配置骨架

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/30 16:47:58 阅读更多 →
嵌入式C++工程化实战:CMake与Renode构建STM32开发环境

嵌入式C++工程化实战:CMake与Renode构建STM32开发环境

1. 被标题戳中的那一刻:为什么“一行都没让我写”反而是对的看到这个标题的时候我笑了很久——“看了三篇了,一行都没让我写呢”。这句话太真实了,真实到每一个从单片机裸机开发转向嵌入式C的工程师,大概都在某个时刻发出过同样的…

2026/10/1 1:58:40 阅读更多 →

最新新闻

MiniCPM5-2B实战:长上下文、工具调用与LangGraph集成

MiniCPM5-2B实战:长上下文、工具调用与LangGraph集成

做端侧模型的朋友应该都注意到,最近小参数模型这条赛道的更新速度快得让人有点跟不上。OpenBMB 放出来的 MiniCPM5-2B,把“2B 跑赢 4B”“同级开源模型 SOTA”“131K 长上下文”“工具调用”这几个关键词同时摆上桌,这本身就说明这代小模型不…

2026/10/1 5:11:25 阅读更多 →
USACO黄金组真题解析:搜索剪枝与区间DP的算法思维

USACO黄金组真题解析:搜索剪枝与区间DP的算法思维

USACO(美国计算机奥林匹克)黄金组,这个难度区间在我刷题经历里一直是最有训练价值的题库。2005年11月这套真题,我备战算法竞赛时反复啃过好几遍,后来翻大厂笔试真题,发现里面不少思路都能对上号。这篇解析就…

2026/10/1 5:11:25 阅读更多 →
Java函数式接口与@FunctionalInterface注解实战解析

Java函数式接口与@FunctionalInterface注解实战解析

在 Java 8 刚出来的那两年,“函数式接口”这个词频繁出现在各种教程和面试题里。说实话,我第一次接触FunctionalInterface的时候也是一头雾水——一个接口加个注解,怎么就成函数式了?跟 Lambda 表达式又有什么关系?直到…

2026/10/1 5:11:25 阅读更多 →
Java函数式接口与Lambda:从注解到实战的完整解析

Java函数式接口与Lambda:从注解到实战的完整解析

1. 从一段让我挠头的代码说起前几天在给团队做Code Review时&#xff0c;看到一位刚入职的同事写了这么一段&#xff1a;public class UserService {private Map<String, Runnable> actions new HashMap<>();public void register(String actionName, Runnable ac…

2026/10/1 5:11:24 阅读更多 →
FastAPI vs Django:构建AI Agent后端的异步架构实战指南

FastAPI vs Django:构建AI Agent后端的异步架构实战指南

做 AI Agent 后端这件事&#xff0c;我一开始其实是拿 Django 上手的&#xff0c;毕竟业务系统写了多年&#xff0c;模板、ORM、admin 都熟。结果第一版联调的时候就发现问题了&#xff1a;LLM 接口的调用动不动就是几秒的往返时间&#xff0c;Django 的视图在处理这种长耗时 I…

2026/10/1 5:11:24 阅读更多 →
基于Wine与FEX-Emu的跨平台兼容方案:ARM运行x86-64 Windows应用实践

基于Wine与FEX-Emu的跨平台兼容方案:ARM运行x86-64 Windows应用实践

1. 从“Madeira”说起&#xff1a;一个跨平台兼容项目的整体设计思路“Madeira”这个名字乍一看像是个地名&#xff0c;但在跨平台兼容圈子里&#xff0c;它代表的是一个把 Windows 应用搬到非 Windows 环境里跑的项目方向。结合热搜词里的 Wine、FEX-Emu、DXMT、iOS、x86-64 这…

2026/10/1 5:10:24 阅读更多 →

日新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/1 0:00:30 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/1 0:00:30 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/1 1:01:17 阅读更多 →

周新闻

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集&#xff1a;Spirula Studio五种eval_mode策略详解 【免费下载链接】spirula-studio Cross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA. 项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio Sp…

2026/9/30 13:14:22 阅读更多 →
SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南 模板网站太丑不够用?别急着加滤镜,那是治标不治本。很多老板盯着后台流量掉得眼红,却还在纠结首页Banner的圆角是不是3像素。这就像穿着西装去挖土,姿势不对,努力白费。我整理这份 速查手册…

2026/9/30 18:13:06 阅读更多 →
FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏 【免费下载链接】FireRed-OpenStoryline FireRed-OpenStoryline is an AI video editing agent that transforms manual editing into intention-driven directing through natural language …

2026/9/30 13:14:49 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/1 0:00:30 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/1 0:00:30 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/1 1:01:17 阅读更多 →