一句话讲清楚Direct-OPD 从小模型强化学习前后的两个检查点中提取策略变化再用这份变化训练更强模型 Qwen3-1.7B 在 AIME 2024 上从 48.3% 提升到 58.3%迁移过程使用 8 张 A100 约四小时。给推理模型做可验证奖励强化学习答案可由规则或判题器自动验对错主要成本来自让模型反复生成完整解题过程。训练对象越大每轮采样越慢后训练的成本也越高。这会带来一个很现实的问题如果已经在 1.5B 模型上跑过一轮强化学习升级到 4B 或 7B 后能不能复用前一次训练的结果常见的知识蒸馏解决不了这个问题。它让学生模仿教师的输出分布前提通常是教师比学生强。这里恰好相反做过强化学习的小模型整体能力可能仍低于待训练的大模型。让强模型照着弱模型学反而可能把原有能力覆盖掉。清华 AIR 与字节跳动 Seed 的联合团队提出 Direct-OPD 。它保留强化学习对小模型造成的策略变化舍弃小模型原有的输出分布。先看直接蒸馏为什么失败论文用 R1-Distill-7B 做了一个很直观的实验。它在 AIME 2024 上的初始成绩是 56.7 已经高于经过强化学习的 JustRL-1.5B 后者为 51.3 。此时如果使用标准的在策略蒸馏让 7B 模型以自己生成的推理前缀为训练状态再拟合 1.5B 教师的 token 分布成绩会一路降到约 50 。左图中标准在策略蒸馏把 R1-Distill-7B 拉低 Direct-OPD 使用强化学习前后的策略变化后训练曲线向上。右图显示同一份变化也能改善 Qwen3-1.7B 、 Qwen3-4B 和 R1-Distill-7B 。强化学习后的模型同时包含小模型原有的偏好以及强化学习后来造成的改变。直接蒸馏无法区分两者实验中因此覆盖了 7B 学生原本更好的部分输出。 Direct-OPD 只使用强化学习前后的概率变化。如何从两个检查点得到奖励信号记小模型强化学习前的策略为 训练后的策略为 。对同一个问题 和回答 两者的对数概率之差是如果 为正说明强化学习提高了这条回答的概率如果为负说明训练在压低它。直觉上这个差值记录了强化学习对回答概率的改动。数学上在带 KL 约束的强化学习中最优策略相对参考策略的对数概率比与训练奖励只差一个缩放系数和同一问题下的常数项。因此 Direct-OPD 无需额外训练奖励模型就能从两个检查点的概率差中得到隐式奖励。训练学生时解题轨迹仍由学生自己生成。模型每生成一个新 token 前面已有的文本就是当前推理前缀。系统从学生在这个前缀下概率最高的 top- 候选中计算每个候选在小模型强化学习前后的对数概率差。这些分数只作用于学生实际生成的推理前缀不要求学生复现小模型的完整推理过程。它们还会逐 token 产生反馈相比答完整道题后才出现的可验证奖励监督更密。理论上的序列策略变化可以精确拆成逐 token 差值之和实际训练却没有计算每个 token 之后的累计回报。论文采用零折扣的局部代理当前位置的候选 token 只使用当下的策略差作为奖励不把后续位置的变化加回来。这降低了计算复杂度也引入了近似当局部变化无法代表整条推理链的质量时代理目标可能失真。更新梯度时 Direct-OPD 也没有只使用采样出来的那一个 token 。它在 top- 候选上按学生概率求期望以减少单次采样的方差。这个概率权重会被停止梯度避免优化器沿着权重本身再产生额外导数。换成更直白的话候选概率只负责决定每个奖励占多大权重不参与这一步的反向传播。论文还用 KL 约束防止学生偏离初始模型过远。不同检查点产生的策略变化尺度不同固定系数很难通用。 Direct-OPD 先用学生概率对每个候选 token 的策略差加权再根据当前批次加权均值的正负调整 KL 系数默认范围为 。弱于学生的模型仍能提供有效监督主实验使用两组强化学习前后检查点。下文 AIME 成绩均为 ave32 每道题采样 32 次后取平均采样温度为 0.7 top- 为 0.95 。它比单次作答稳定但仍会受到采样波动影响。第一组是 R1-Distill-1.5B 和 JustRL-1.5B 第二组是 Nemotron-1.5B 和 QuestA-Nemotron-1.5B 。两组模型来自不同训练流程和数据用来检验方法是否依赖某个特定教师。JustRL 这组策略变化被迁移到三种学生模型后 AIME 2024 和 AIME 2025 的成绩均有提高。两组检查点的完整结果。蓝色行是 Direct-OPD 训练后的成绩绿色数字表示相对初始学生的增量。Qwen3-1.7B 的变化最明显■AIME 2024 48.3 → 58.3 增加 10.0 个百分点■AIME 2025 36.8 → 43.2 增加 6.4 个百分点Qwen3-4B 的初始成绩是 72.5 远高于 JustRL-1.5B 的 51.3 训练后仍能达到 77.6 。 R1-Distill-7B 也从 56.7 提升到 63.1 。这两个学生在训练前已经强于小教师因此可以排除“学生只是追上教师成绩”这一解释。换成 QuestA 的检查点后 Qwen3-1.7B 在 AIME 2024 上从 48.3 提升到 59.0 R1-Distill-7B 从 56.3 提升到 61.2 。效果至少没有被锁定在 JustRL 一种训练配方上。先训练小模型成本是否更低论文进一步比较了两条完整训练路径■直接在 R1-Distill-7B 上做强化学习■先在 R1-Distill-1.5B 上做强化学习再把策略变化迁移到 7B研究者在小模型训练的第 300 、 600 、 900 、 1200 和 1500 步保存检查点。每个检查点都迁移到 7B 再与相同强化学习步数下直接训练 7B 的结果比较。左图按总训练时间比较两条路线中图是五个小模型检查点迁移到 7B 的过程右图在 Qwen3 非思考模式模型上复现了相同趋势。从第 600 步开始小模型强化学习加 Direct-OPD 的路线在相近墙钟时间下大多高于直接训练 7B 。1.5B 模型做 1500 步强化学习使用 32 张 A100 约 160 小时折算约 5120 GPU-hours 。 7B 模型在同样的 32 张 A100 上直接训练约 320 小时即约 10240 GPU-hours 。之后的 Direct-OPD 迁移使用 8 张 A100 约四小时约 32 GPU-hours 。迁移还要同时运行学生、强化学习前的教师和强化学习后的教师。由于两个教师都只有 1.5B 参数大部分长时间采样由小模型完成迁移阶段只占总计算量的一小部分。并非任何小模型检查点都同样有效。第 300 步的策略变化较弱第 900 至 1500 步更稳定。 Direct-OPD 只能迁移已有的策略变化无法保证该检查点记录的变化本身有效。多次强化学习的结果可以继续叠加研究者还把两组策略变化依次用在同一个 Qwen3-1.7B 上。第一阶段使用 JustRL 的变化 AIME 2024 从 48.3 提升到 58.3 第二阶段继续使用 QuestA 的变化最终达到 63.8 。 AIME 2025 则从 36.8 提升到 46.8 。Qwen3-1.7B 先接收 JustRL 的策略变化再接收 QuestA 的策略变化两项基准继续上升。这项实验表明在 JustRL → QuestA 这一种顺序下两组策略变化可以依次训练同一个学生。交换顺序是否仍有效连续加入更多策略变化后是否会互相干扰目前还没有答案。两个阶段的边界由不同批次样本分别评估曲线在切换处的小幅跳变属于采样方差不能全部算作第二阶段带来的变化。学生没有变成小教师的复制品标准在策略蒸馏中师生高概率 token 的重叠率通常会随训练上升。这个指标计算两者最可能选择的 token 集合有多少交集持续上升往往意味着学生越来越接近教师的输出分布。Direct-OPD 的跨模型家族实验却不是这样。迁移到 Qwen3 时学生和小教师的高概率 token 重叠率长期较低准确率仍在提高。学生输出分布的熵也保持稳定没有出现概率集中到少数 token 的坍缩现象。这两项结果排除了“学生只是逐渐复制小教师”以及“模型靠输出分布坍缩获得表面增益”两种解释。迁移到同家族的 R1-Distill-7B 时 token 重叠率会升高迁移到 Qwen3-1.7B 时重叠率保持在较低区域。Direct-OPD 不要求学生采用小模型最偏好的 token 。它只在学生自己的候选 token 中使用小模型强化学习前后的概率变化。训练长度并非越长越好论文测试了 512 、 2k 、 4k 和 6k 四种响应长度。对 Qwen3-1.7B 和 R1-Distill-7B 来说 2k 的验证表现最稳定。固定 KL 系数为 1 时 2k 响应长度在两种学生模型上都较稳定。虽然训练只覆盖前 2k token 研究者在固定的约 16k token 长生成中观察到经过训练的模型其高概率候选持续得到更高的教师策略差分数变化没有停在 2k 位置。这项诊断说明训练影响延伸到了未被直接监督的后续推理前缀。但把训练长度增加到 6k 后验证成绩反而从 48.8 降到 45.6 。论文推测越到生成后段学生访问的推理前缀和候选 token 在两个教师策略下越可能都只有极低概率。此时对数概率差可能很大却未必还代表可靠的改进方向。同样的原因也解释了 KL 的作用。约束太弱学生会走到教师几乎没见过的状态约束太强学生又无法利用策略变化。固定系数在不同师生组合上的最优值并不一致自适应 KL 是为了让训练停留在信号仍可信的范围内。不同师生组合偏好的 KL 系数不同逐 token 奖励更高也不一定对应更高的验证成绩。适用范围与限制Direct-OPD 适合这样的场景团队已经能在小模型上稳定完成强化学习希望把同一种能力迁移给多个更大的模型。小模型与目标模型可以来自不同家族学生初始能力也可以高于小模型。它的可靠性取决于一个前提学生访问的推理前缀和候选 token 在小模型强化学习前后的两个策略下仍有足够概率。任务分布相差太大或学生走到两个教师都极少访问的区域对数概率差就会变成噪声。 6k 响应长度带来的性能下降正是这个前提可能失效的例子。Direct-OPD 减少了在每个大模型上重复进行强化学习探索的成本但没有消除小模型强化学习、检查点筛选和学生迁移的成本。响应长度、检查点选择和 KL 强度仍需逐组验证论文尚未给出跨模型通用配置。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】