标题Recursive Self-Improvement via On-Policy Distillation for Reasoning来源arXiv, 2609.30652v1️文章简介研究问题在大型语言模型的推理训练中如果负责指导的“特权教师”模型参数被冻结无法学习学生新掌握的纠错能力该如何打破这种限制并避免推理过程变得过于冗长主要贡献论文提出了一种结合动态协同进化DCE和自我精炼简洁学习SRCL的递归框架显著提升了数学推理准确率并减少了输出长度。重点思路动态协同进化DCE摒弃传统方法中冻结教师模型的做法让“特权教师”与学生模型同步更新。每一轮训练后最新的学生模型参数既作为下一轮的学生也初始化为下一轮的教师。这样学生在上一轮学到的反思和纠错行为能直接转化为下一轮教师提供的更高质量的监督信号形成递归式的自我增强。自我精炼简洁学习SRCL针对强化反思可能导致回答啰嗦的问题引入简洁性约束。模型尝试将自己的长回答重写为更短、无冗余反思且答案正确的版本。只有满足简短、结构完整且答案正确的重写版本才会被用于训练从而教会模型在保持推理能力的同时去除不必要的步骤。联合优化机制将DCE的令牌级指导损失与SRCL的重写交叉熵损失相结合。DCE负责提升模型识别错误并进行修正的能力SRCL负责优化推理路径的效率两者互补共同更新模型参数以进入下一个递归循环。分析总结性能显著提升在Qwen3-8B模型上DCESRCL方法在四个竞赛级数学基准测试中的平均准确率达到65.97%比现有的OPSD方法高出35.62个百分点且平均输出长度减少了7.8%。教师进化的有效性实验证明动态更新的教师比冻结教师更能提供有效的纠错指导。随着训练进行动态教师对错误终点的停止概率大幅降低而对反思标记如“Wait”的预测概率显著上升说明教师真正学会了如何引导学生走出错误推理。简洁性与准确性平衡SRCL有效控制了推理成本。在同等预算下DCESRCL不仅准确率高于仅使用DCE或强制延长生成的基线而且生成的Token更少证明了其学到的精简推理路径是真实有效的能力提升而非单纯依靠增加计算量。个人观点论文构建了一个“左右互搏”的闭环学生通过模仿拥有正确答案视角的教师来学习纠错而教师本身又是刚刚学会纠错的学生。