清华字节Seed发布 Direct-OPD:小模型先做强化学习,强模型也能直接受益
一句话讲清楚Direct-OPD 从小模型强化学习前后的两个检查点中提取策略变化再用这份变化训练更强模型 Qwen3-1.7B 在 AIME 2024 上从 48.3% 提升到 58.3%迁移过程使用 8 张 A100 约四小时。给推理模型做可验证奖励强化学习答案可由规则或判题器自动验对错主要成本来自让模型反复生成完整解题过程。训练对象越大每轮采样越慢后训练的成本也越高。这会带来一个很现实的问题如果已经在 1.5B 模型上跑过一轮强化学习升级到 4B 或 7B 后能不能复用前一次训练的结果常见的知识蒸馏解决不了这个问题。它让学生模仿教师的输出分布前提通常是教师比学生强。这里恰好相反做过强化学习的小模型整体能力可能仍低于待训练的大模型。让强模型照着弱模型学反而可能把原有能力覆盖掉。清华 AIR 与字节跳动 Seed 的联合团队提出 Direct-OPD 。它保留强化学习对小模型造成的策略变化舍弃小模型原有的输出分布。先看直接蒸馏为什么失败论文用 R1-Distill-7B 做了一个很直观的实验。它在 AIME 2024 上的初始成绩是 56.7 已经高于经过强化学习的 JustRL-1.5B 后者为 51.3 。此时如果使用标准的在策略蒸馏让 7B 模型以自己生成的推理前缀为训练状态再拟合 1.5B 教师的 token 分布成绩会一路降到约 50 。左图中标准在策略蒸馏把 R1-Distill-7B 拉低 Direct-OPD 使用强化学习前后的策略变化后训练曲线向上。右图显示同一份变化也能改善 Qwen3-1.7B 、 Qwen3-4B 和 R1-Distill-7B 。强化学习后的模型同时包含小模型原有的偏好以及强化学习后来造成的改变。直接蒸馏无法区分两者实验中因此覆盖了 7B 学生原本更好的部分输出。 Direct-OPD 只使用强化学习前后的概率变化。如何从两个检查点得到奖励信号记小模型强化学习前的策略为 训练后的策略为 。对同一个问题 和回答 两者的对数概率之差是如果 为正说明强化学习提高了这条回答的概率如果为负说明训练在压低它。直觉上这个差值记录了强化学习对回答概率的改动。数学上在带 KL 约束的强化学习中最优策略相对参考策略的对数概率比与训练奖励只差一个缩放系数和同一问题下的常数项。因此 Direct-OPD 无需额外训练奖励模型就能从两个检查点的概率差中得到隐式奖励。训练学生时解题轨迹仍由学生自己生成。模型每生成一个新 token 前面已有的文本就是当前推理前缀。系统从学生在这个前缀下概率最高的 top- 候选中计算每个候选在小模型强化学习前后的对数概率差。这些分数只作用于学生实际生成的推理前缀不要求学生复现小模型的完整推理过程。它们还会逐 token 产生反馈相比答完整道题后才出现的可验证奖励监督更密。理论上的序列策略变化可以精确拆成逐 token 差值之和实际训练却没有计算每个 token 之后的累计回报。论文采用零折扣的局部代理当前位置的候选 token 只使用当下的策略差作为奖励不把后续位置的变化加回来。这降低了计算复杂度也引入了近似当局部变化无法代表整条推理链的质量时代理目标可能失真。更新梯度时 Direct-OPD 也没有只使用采样出来的那一个 token 。它在 top- 候选上按学生概率求期望以减少单次采样的方差。这个概率权重会被停止梯度避免优化器沿着权重本身再产生额外导数。换成更直白的话候选概率只负责决定每个奖励占多大权重不参与这一步的反向传播。论文还用 KL 约束防止学生偏离初始模型过远。不同检查点产生的策略变化尺度不同固定系数很难通用。 Direct-OPD 先用学生概率对每个候选 token 的策略差加权再根据当前批次加权均值的正负调整 KL 系数默认范围为 。弱于学生的模型仍能提供有效监督主实验使用两组强化学习前后检查点。下文 AIME 成绩均为 ave32 每道题采样 32 次后取平均采样温度为 0.7 top- 为 0.95 。它比单次作答稳定但仍会受到采样波动影响。第一组是 R1-Distill-1.5B 和 JustRL-1.5B 第二组是 Nemotron-1.5B 和 QuestA-Nemotron-1.5B 。两组模型来自不同训练流程和数据用来检验方法是否依赖某个特定教师。JustRL 这组策略变化被迁移到三种学生模型后 AIME 2024 和 AIME 2025 的成绩均有提高。两组检查点的完整结果。蓝色行是 Direct-OPD 训练后的成绩绿色数字表示相对初始学生的增量。Qwen3-1.7B 的变化最明显■AIME 2024 48.3 → 58.3 增加 10.0 个百分点■AIME 2025 36.8 → 43.2 增加 6.4 个百分点Qwen3-4B 的初始成绩是 72.5 远高于 JustRL-1.5B 的 51.3 训练后仍能达到 77.6 。 R1-Distill-7B 也从 56.7 提升到 63.1 。这两个学生在训练前已经强于小教师因此可以排除“学生只是追上教师成绩”这一解释。换成 QuestA 的检查点后 Qwen3-1.7B 在 AIME 2024 上从 48.3 提升到 59.0 R1-Distill-7B 从 56.3 提升到 61.2 。效果至少没有被锁定在 JustRL 一种训练配方上。先训练小模型成本是否更低论文进一步比较了两条完整训练路径■直接在 R1-Distill-7B 上做强化学习■先在 R1-Distill-1.5B 上做强化学习再把策略变化迁移到 7B研究者在小模型训练的第 300 、 600 、 900 、 1200 和 1500 步保存检查点。每个检查点都迁移到 7B 再与相同强化学习步数下直接训练 7B 的结果比较。左图按总训练时间比较两条路线中图是五个小模型检查点迁移到 7B 的过程右图在 Qwen3 非思考模式模型上复现了相同趋势。从第 600 步开始小模型强化学习加 Direct-OPD 的路线在相近墙钟时间下大多高于直接训练 7B 。1.5B 模型做 1500 步强化学习使用 32 张 A100 约 160 小时折算约 5120 GPU-hours 。 7B 模型在同样的 32 张 A100 上直接训练约 320 小时即约 10240 GPU-hours 。之后的 Direct-OPD 迁移使用 8 张 A100 约四小时约 32 GPU-hours 。迁移还要同时运行学生、强化学习前的教师和强化学习后的教师。由于两个教师都只有 1.5B 参数大部分长时间采样由小模型完成迁移阶段只占总计算量的一小部分。并非任何小模型检查点都同样有效。第 300 步的策略变化较弱第 900 至 1500 步更稳定。 Direct-OPD 只能迁移已有的策略变化无法保证该检查点记录的变化本身有效。多次强化学习的结果可以继续叠加研究者还把两组策略变化依次用在同一个 Qwen3-1.7B 上。第一阶段使用 JustRL 的变化 AIME 2024 从 48.3 提升到 58.3 第二阶段继续使用 QuestA 的变化最终达到 63.8 。 AIME 2025 则从 36.8 提升到 46.8 。Qwen3-1.7B 先接收 JustRL 的策略变化再接收 QuestA 的策略变化两项基准继续上升。这项实验表明在 JustRL → QuestA 这一种顺序下两组策略变化可以依次训练同一个学生。交换顺序是否仍有效连续加入更多策略变化后是否会互相干扰目前还没有答案。两个阶段的边界由不同批次样本分别评估曲线在切换处的小幅跳变属于采样方差不能全部算作第二阶段带来的变化。学生没有变成小教师的复制品标准在策略蒸馏中师生高概率 token 的重叠率通常会随训练上升。这个指标计算两者最可能选择的 token 集合有多少交集持续上升往往意味着学生越来越接近教师的输出分布。Direct-OPD 的跨模型家族实验却不是这样。迁移到 Qwen3 时学生和小教师的高概率 token 重叠率长期较低准确率仍在提高。学生输出分布的熵也保持稳定没有出现概率集中到少数 token 的坍缩现象。这两项结果排除了“学生只是逐渐复制小教师”以及“模型靠输出分布坍缩获得表面增益”两种解释。迁移到同家族的 R1-Distill-7B 时 token 重叠率会升高迁移到 Qwen3-1.7B 时重叠率保持在较低区域。Direct-OPD 不要求学生采用小模型最偏好的 token 。它只在学生自己的候选 token 中使用小模型强化学习前后的概率变化。训练长度并非越长越好论文测试了 512 、 2k 、 4k 和 6k 四种响应长度。对 Qwen3-1.7B 和 R1-Distill-7B 来说 2k 的验证表现最稳定。固定 KL 系数为 1 时 2k 响应长度在两种学生模型上都较稳定。虽然训练只覆盖前 2k token 研究者在固定的约 16k token 长生成中观察到经过训练的模型其高概率候选持续得到更高的教师策略差分数变化没有停在 2k 位置。这项诊断说明训练影响延伸到了未被直接监督的后续推理前缀。但把训练长度增加到 6k 后验证成绩反而从 48.8 降到 45.6 。论文推测越到生成后段学生访问的推理前缀和候选 token 在两个教师策略下越可能都只有极低概率。此时对数概率差可能很大却未必还代表可靠的改进方向。同样的原因也解释了 KL 的作用。约束太弱学生会走到教师几乎没见过的状态约束太强学生又无法利用策略变化。固定系数在不同师生组合上的最优值并不一致自适应 KL 是为了让训练停留在信号仍可信的范围内。不同师生组合偏好的 KL 系数不同逐 token 奖励更高也不一定对应更高的验证成绩。适用范围与限制Direct-OPD 适合这样的场景团队已经能在小模型上稳定完成强化学习希望把同一种能力迁移给多个更大的模型。小模型与目标模型可以来自不同家族学生初始能力也可以高于小模型。它的可靠性取决于一个前提学生访问的推理前缀和候选 token 在小模型强化学习前后的两个策略下仍有足够概率。任务分布相差太大或学生走到两个教师都极少访问的区域对数概率差就会变成噪声。 6k 响应长度带来的性能下降正是这个前提可能失效的例子。Direct-OPD 减少了在每个大模型上重复进行强化学习探索的成本但没有消除小模型强化学习、检查点筛选和学生迁移的成本。响应长度、检查点选择和 KL 强度仍需逐组验证论文尚未给出跨模型通用配置。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻

ReAct、CoT、ToT:Agent 推理模式的三板斧,你真的理解对了吗

ReAct、CoT、ToT:Agent 推理模式的三板斧,你真的理解对了吗

很多人把 CoT、ReAct、ToT 当成"初级→高级"的升级关系,好像 ToT 一定比 CoT 好。但实际测试下来,80% 的 Agent 任务用 ReAct 就够了,ToT 的成本是 ReAct 的 5-10 倍,效果提升可能只有几个百分点。 阅读提示 适合谁看&a…

2026/7/31 16:23:23 阅读更多 →
深度拆解SkillCorpus:首个大规模智能体开源Skill筛选框架(附下载)

深度拆解SkillCorpus:首个大规模智能体开源Skill筛选框架(附下载)

如今的大模型能力出众,但如果只靠模型自身预训练知识,很难胜任复杂、多步骤、强规范的落地任务。业界想到了一个高效解法,将成套可复用的标准化操作流程封装成SKILL.md格式文件,也就是技能(Skill)。AI 执行…

2026/7/31 16:23:23 阅读更多 →
答辩演讲稿撰写要点及实用范例参考指南

答辩演讲稿撰写要点及实用范例参考指南

做科研最耗人的,从来不是难题本身,而是检索、整理、写作、分析里的重复劳动——2026年,一批更精准、更贴合科研全流程的AI工具已成熟,能帮你把时间还给思考。本文实测7款全新工具,覆盖文献检索、阅读、写作、数据分析、…

2026/7/31 16:22:23 阅读更多 →

最新新闻

计算机毕业设计之超市进销存管理系统

计算机毕业设计之超市进销存管理系统

近年来互联网络的迅猛发展和电子终端设备的普及,赋予了各行业充足的发展空间。超市进销存管理系统相比于传统信息技术,时效性是它最大的特色,已经在电子娱乐、经济等中发挥着举足轻重的作用。2019年疫情的爆发,更是短时间内迅速扩…

2026/7/31 17:12:39 阅读更多 →
STM32与FreeRTOS消息队列实战指南

STM32与FreeRTOS消息队列实战指南

1. STM32与FreeRTOS消息队列基础认知第一次在STM32上接触FreeRTOS的消息队列时,我误以为它只是个简单的数据中转站。直到在工业控制项目中遇到实时数据丢失的问题,才真正理解消息队列在RTOS中的核心价值。消息队列(Message Queue)…

2026/7/31 17:12:39 阅读更多 →
计算机毕业设计之超市货物进销存管理系统的设计与实现

计算机毕业设计之超市货物进销存管理系统的设计与实现

信息技术是当今社会发展的重要方向之一,它已经深入到各个行业中。随着计算机技术的发展,信息技术已经从传统的数据处理转变为网络信息的处理和交互。在管理方面,通过信息管理技术,系统可以快速的处理大量的数据,并且能…

2026/7/31 17:12:39 阅读更多 →
计算机毕业设计之超市货品信息管理系统

计算机毕业设计之超市货品信息管理系统

随着世界经济信息化、全球化的到来和互联网的飞速发展,推动了各行业的改革。若想达到安全,快捷的目的,就需要拥有信息化的组织和管理模式,建立一套合理、动态的、交互友好的、高效的超市货品信息管理系统。当前的信息管理存在工作…

2026/7/31 17:12:39 阅读更多 →
计算机毕业设计之超市管理系统的设计与实现

计算机毕业设计之超市管理系统的设计与实现

系统根据现有的管理模块进行开发和扩展,采用面向对象的开发的思想和结构化的开发方法对超市管理的现状进行系统调查。采用结构化的分析设计,该方法要求结合一定的图表,在模块化的基础上进行系统的开发工作。在设计中采用“自下而上”的思想&a…

2026/7/31 17:12:39 阅读更多 →
Verilog数据倒序输出:从位拼接、generate for到流水线实现详解

Verilog数据倒序输出:从位拼接、generate for到流水线实现详解

1. 项目概述:从需求到实现的逻辑闭环在数字电路设计,尤其是FPGA开发中,我们经常会遇到一个看似简单但考验基本功的操作:数据倒序。比如,你从某个传感器或通信接口接收到一个8位的并行数据data_in[7:0] 8‘b1011_0010&…

2026/7/31 17:11:39 阅读更多 →

日新闻

物理复制比逻辑复制好在哪?数据库复制原理详解

物理复制比逻辑复制好在哪?数据库复制原理详解

数据库复制是把主库数据同步到备库的机制,分为逻辑复制和物理复制两种。逻辑复制传输的是 SQL 语句或行变更事件,物理复制传输的是存储引擎底层的物理日志。阿里云 PolarDB(云原生数据库)采用物理复制,在同步延迟、数据…

2026/7/31 0:00:34 阅读更多 →
BilibiliDown:3分钟学会B站视频下载的终极指南

BilibiliDown:3分钟学会B站视频下载的终极指南

BilibiliDown:3分钟学会B站视频下载的终极指南 【免费下载链接】BilibiliDown (GUI-多平台支持) B站 哔哩哔哩 视频下载器。支持稍后再看、收藏夹、UP主视频批量下载|Bilibili Video Downloader 😳 项目地址: https://gitcode.com/gh_mirrors/bi/Bilib…

2026/7/31 0:00:34 阅读更多 →
有哪些游戏数据AI平台?游戏行业Data+AI融合方案盘点

有哪些游戏数据AI平台?游戏行业Data+AI融合方案盘点

当前,游戏行业的“DataAI融合”已从概念验证进入价值落地阶段。根据IDC 2025年数据,中国AI游戏云市场规模已达18.6亿元;同时,游戏研发环节AI渗透率高达86%,生成式AI内容普及率超过50%。面对庞大的市场,游戏…

2026/7/31 0:00:34 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/31 1:03:03 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/29 14:34:28 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/31 4:19:39 阅读更多 →

月新闻