多轮长时序规划的内在机理:单/多教师在线智能蒸馏的预训练到后训练全链路研究
多轮长时序规划的内在机理单/多教师在线智能蒸馏的预训练到后训练全链路研究arXiv原文链接https://arxiv.org/html/2607.24720v1摘要多轮长时序规划是大模型智能体的核心基础能力但业界尚未系统厘清模型从预训练到后训练全流程中长时序规划能力的生成、塑造与融合机制。现有基座模型基于不可控、无透明互联网语料训练难以拆解规划能力的来源与优化路径。本文构建一套完全可控的多轮规划仿真环境从**预训练、单教师后训练GRPO/OPD、多教师蒸馏MOPD**三个阶段系统性剖析长时序规划底层机理完整覆盖对照实验、梯度动力学、参数演化分析预训练阶段显式内部世界建模状态转移思维链相比直接动作预测具备更强泛化能力仅学习原子技能无法自主组合成长时序任务少量长轨迹样本即可激活组合泛化次优轨迹会随时序累积误差严重破坏长规划效果。单教师后训练阶段基于互信息区分通用规划范式低互信息与任务专属规划知识高互信息。GRPO与在线智能蒸馏OPD存在明确适用区间OPD在低质量预训练、长时序任务下有效范围更广规划知识因样本特异性高强化学习小幅更新无法完成跨任务迁移强行蒸馏会破坏模型原有世界建模能力。同时从SVD梯度余弦相似度证明长时序低质数据下GRPO梯度噪声大、易梯度消失OPD全程梯度方向稳定统一。多教师在线蒸馏MOPD多教师融合的核心机制是收敛至多教师共享规划范式分布。当各环境范式兼容共享时可实现跨域泛化范式部分共享可支持持续学习完全冲突范式会引发灾难性遗忘、跨域干扰。本文提供完整可控实验环境、数据集、训练脚本为通用智能体基座长时序规划能力迭代提供标准化理论与工程指导。关键词多轮交互、长时序规划、智能体、预训练、强化学习、GRPO、在线蒸馏OPD、多教师蒸馏MOPD1 引言随着基座模型向实体智能体演进多轮长时序规划成为落地真实通用智能体的必备核心能力OSWorld2、EdgeBench、Long-Horizon-Term-Bench、DeepPlanning等基准均证明当前模型长时序任务存在明显短板。现有优化手段分为三阶段大规模预训练从海量语料习得通用规划范式与任务知识强化学习后训练GRPO/OPD优化规划执行策略多教师模型蒸馏融合整合多领域专家规划能力。行业核心待解问题如何在预训练、强化后训练、多教师蒸馏全链路系统性提升模型长时序规划能力现有模型训练依赖黑盒互联网数据无法拆解能力生成逻辑衍生三个基础研究子问题预训练世界建模、原子技能、轨迹质量如何影响长时序规划习得单教师强化GRPO与OPD分别适配何种规划范式/知识各自适用边界多教师蒸馏多域规划能力融合的生效条件、泛化与遗忘机制本文搭建专属可控规划仿真环境隔离任务长度、数据质量、规划范式、任务知识四大变量分三阶段完成对照实验量化梯度、KL散度、参数PCA等指标完整揭示长时序规划底层训练机理。2 前置理论基础2.1 智能体规划定义给定初始状态s0s_0s0​、目标ggg智能体输出动作序列A{a1,a2...aT}A\{a_1,a_2...a_T\}A{a1​,a2​...aT​}执行后环境状态流转至满足目标的终止态sTs_TsT​。原子技能单步子任务执行流程存储为「任务描述-步骤序列」元组可作为上下文输入或内置到模型思维链世界模型状态转移函数T(st,at)→st1\mathcal{T}(s_t,a_t)\rightarrow s_{t1}T(st​,at​)→st1​内置原子技能规则可在模型内部模拟未来状态推演无需真实环境交互。2.2 单教师在线智能蒸馏 OPDOPD在智能体自探索生成的轨迹上做蒸馏监督对K轮交互轨迹自回归分解token级KL损失提供稠密逐步梯度信号。轨迹定义τ(g,s0,Y^1,s1...Y^K,sK)\tau(g,s_0,\hat{Y}_1,s_1...\hat{Y}_K,s_K)τ(g,s0​,Y^1​,s1​...Y^K​,sK​)每轮kkk内解码tokenttt学生/教师分布pk,t≜πθ(⋅∣Hk,Y^k,t),qk,t≜πteacher(⋅∣Hk,Y^k,t) p_{k,t}\triangleq\pi_{\theta}(\cdot\mid H_{k},\hat{Y}_{k,t}),\quad q_{k,t}\triangleq\pi_{\text{teacher}}(\cdot\mid H_{k},\hat{Y}_{k,t})pk,t​≜πθ​(⋅∣Hk​,Y^k,t​),qk,t​≜πteacher​(⋅∣Hk​,Y^k,t​)全局损失LAgent-OPD(θ)Eτ∼πθ[∑k1K∑t1TkDKL(pk,t∥qk,t)] \mathcal{L}_{\text{Agent-OPD}}(\theta)\mathbb{E}_{\tau\sim\pi_{\theta}}\left[\sum_{k1}^{K}\sum_{t1}^{T_{k}}D_{\text{KL}}(p_{k,t}\parallel q_{k,t})\right]LAgent-OPD​(θ)Eτ∼πθ​​[k1∑K​t1∑Tk​​DKL​(pk,t​∥qk,t​)]OPD两大实现范式PG式OPD将KL对数差作为token级优势回报使用策略梯度更新GKD式OPD直接最小师生token分布KL散度不依赖采样回报。三类OPD变体采样Token OPD仅对轨迹采样token计算损失分PG/GKD两种近似Top-k OPD截断词表仅对top-k高概率token归一化计算KL全词表OPD完整词表计算精确KL损失无截断近似。3 可控规划仿真环境实验基座3.1 分层技能图构建设计三大独立领域奇幻炼金、畜牧养殖、电子组装每领域构建多层有向合成技能图节点代表物品边代表合成规则AND/OR逻辑配方通过贪心最小化算法控制合成步骤复杂度。合成逻辑通用形式v ⟺ (u1,1∧⋯∧u1,k1)∨⋯∨(um,1∧⋯∨um,km) v\iff(u_{1,1}\land\dots\land u_{1,k_1})\lor\dots\lor(u_{m,1}\land\dots\lor u_{m,k_m})v⟺(u1,1​∧⋯∧u1,k1​​)∨⋯∨(um,1​∧⋯∨um,km​​)3.2 图转仿真环境映射抽象技能节点映射为实体物品区分训练/测试物品索引测试集使用全新物品组合杜绝数据泄露。3.3 任务难度分级按合成最小步数分为短(1-5步)、中(6-8步)、长(≥9步)三类初始库存混入干扰物品提升规划噪声。3.4 数据集划分预训练、后训练、测试集完全隔离测试集使用从未见过的物品组合评估组合泛化。3.5 评测指标avg88次独立采样平均通过率pass88次采样中至少一次成功的任务占比辅助指标训练损失、KL散度、参数余弦相似度、梯度SVD子空间对齐度。4 预训练长时序规划能力的原生习得本章从**数据格式世界建模、数据分布原子技能组合、数据质量次优轨迹**三个维度拆解预训练对长时序能力的影响。4.1 世界建模对泛化的提升核心设置两组对照直接预测模型仅输出动作无状态推演思维链世界建模CoT显式写出每一步状态变化内置转移函数。模型基线随机初始化Qwen2.5-100M独立训练BPE分词器。实验结论全难度区间带世界建模模型avg8、pass8显著更高长时序任务提升幅度最大45.8% avg8直接预测训练前期收敛更快、token开销更低但性能天花板极低世界建模前期训练慢最终泛化上限更高。核心结论内部世界建模是长时序组合泛化的核心基础牺牲少量训练效率换取极强复杂任务适配能力。4.2 原子技能无法自主组合泛化变量控制预训练数据按短/中/长轨迹比例划分多组对照仅短、短少量中、短少量长、全时序混合。实验结果仅训练短时序原子样本时模型短任务通过率93.12%中长时序任务近乎0仅学会单步操作无法自主串联多步骤仅混入5%长轨迹样本中长期任务通过率大幅跳升中任务pass8从0.83%→51.88%。核心结论原子技能无法自发组合成长时序规划预训练必须混入少量长轨迹样本激活多步串联推理能力。4.3 次优轨迹严重破坏长时序规划变量控制预训练数据混合不同比例最优/次优规划轨迹4最优、4最优4次优、4最优8次优。实验结论短时序任务受次优数据影响轻微中、长时序任务性能断崖下跌原因是长序列中错误步骤会持续累积放大一旦前期决策偏移后续所有操作全部失效单纯增加推理采样次数无法弥补次优预训练带来的底层能力缺陷。5 GRPO与OPD后训练规划能力定向塑造本章通过互信息区分两类规划要素规划范式P跨任务通用推理骨架KaTeX parse error: Cant use function \( in math mode at position 1: \̲(̲I(T;P)\)互信息低规划知识K任务专属合成配方KaTeX parse error: Cant use function \( in math mode at position 1: \̲(̲I(T;K)\)互信息极高。5.1 互信息理论定义KaTeX parse error: Cant use function \( in math mode at position 2: \̲(̲I(T;P)\)H(P)-H…同一任务下规划知识不确定性下降幅度远大于规划范式因此KaTeX parse error: Cant use function \( in math mode at position 1: \̲(̲I(T;K)\) \gg \(…。5.2 规划范式的优化边界与梯度分析5.2.1 准确率分区实验划分三大优化区间无需优化区各类范式性能接近强化学习无收益有效优化区范式性能差异大RL可筛选最优推理骨架不支持区长时序稀疏回报下GRPO信用分配失效。对照算法多轮GRPO仅最终二元奖励、Top-k OPD稠密逐步KL监督核心数据结论高质量预训练4Opt场景GRPO/OPD收益接近低质预训练4Opt:4Sub / 4Opt:8SubOPD提升幅度远超GRPOGRPO缺陷长时序稀疏回报下梯度噪声大、甚至梯度消失OPD全程梯度方向稳定更新一致性更强。5.2.2 梯度SVD余弦相似度分析对模型权重更新矩阵做SVD分解计算各阶段梯度主向量与最终收敛梯度的余弦相似度GR在长时序次优数据下前期梯度与最终目标相似度极低更新方向散乱OPD全时序、全数据配比下梯度相似度维持高位优化路径稳定。小节结论通用规划范式适配OPD做后训练长时序低质场景优先选择OPDGRPO仅适合短时序、高质量预训练数据。5.3 任务专属规划知识蒸馏局限核心现象师生底层知识冲突时蒸馏失效同一目标存在两套完全不同的合成路径RecipeA / RecipeB学生预训练基于A教师基于B即便教师100%正确率OPD训练后模型全域性能大幅下跌原因OPD前期仅优化通用推理范式后期强制替换专属任务知识但RL梯度更新幅度太小无法完全覆盖原有知识造成新旧规则冲突域内性能崩塌。KL动态验证训练前期模型优先对齐通用规划范式KL快速下降训练后期需要逐样本微调专属知识KL下降停滞无法完成知识替换。小节结论OPD仅适合师生底层规划知识同源场景师生配方/流程完全不同时蒸馏会破坏原有域内能力。6 多教师在线蒸馏MOPD多域规划能力融合MOPD定义串行使用多名域专家教师依次对学生执行OPD蒸馏目标是融合多领域规划能力分为三大场景共享兼容范式跨域泛化部分共享范式持续学习无共享冲突范式灾难性遗忘。6.1 场景一共享兼容规划范式跨域泛化各领域教师底层推理骨架一致仅物品合成知识不同。实验现象仅用炼金教师训练畜牧、电子领域未训练任务同步大幅提升MOPD核心逻辑反向KL会自动收敛至所有教师公共范式分布不会逐一枚举所有教师特有模式前提目标域预训练数据中必须存在对应基础范式MOPD无法凭空生成从未见过的推理结构。6.2 场景二部分共享、存在冲突范式持续学习各领域存在公共基础范式同时各自包含专属分支推理逻辑。实验现象学习新领域后旧领域性能小幅下降但维持可用公共骨架保留仅域专属分支被微调可实现多任务持续学习。6.3 场景三完全无共享冲突范式灾难性遗忘各领域推理逻辑完全互斥无公共基础范式。实验现象学习新教师后之前领域性能断崖下跌模型过拟合最新教师独有的推理模式覆盖原有全部规划逻辑。6.4 MOPD参数动力学分析PCA投影模型全部参数对比Instruct基线、各阶段MOPD、独立教师模型距离所有MOPD中间检查点始终贴近原始基线模型每一轮教师蒸馏仅小幅调整参数不会出现大规模权重偏移不同教师带来的更新方向差异大因此可兼容多领域知识无冲突场景下。7 相关工作长时序智能体基准OSWorld2、EdgeBench、Long-Horizon-Term-Bench、DeepPlanning等现有评测仅做效果对比未可控拆解规划生成机理单/多轮OPD蒸馏现有研究侧重单轮推理蒸馏本文拓展至多轮交互智能体系统对比GRPO与OPD边界多教师模型融合MiMo、GLM、Nemotron等采用多教师融合但未区分范式兼容/冲突三种场景缺少底层参数与分布解释世界建模与组合泛化过往工作验证世界建模收益但未通过分层可控数据集量化次优轨迹、长样本占比带来的性能变化。8 结论预训练阶段内置状态转移世界建模大幅提升长时序泛化仅原子技能无法自主组合少量长轨迹样本即可激活多步推理次优轨迹会累积时序误差严重损害复杂任务效果。单教师后训练规划范式低互信息适合OPD强化优化长时序、低质预训练场景OPD优于GRPO任务专属知识高互信息难以通过RL蒸馏替换师生底层流程冲突会破坏原有域能力。多教师MOPD融合能力取决于各领域规划范式重合度兼容范式实现跨域泛化部分共享支持持续学习完全冲突范式引发灾难性遗忘MOPD仅收敛至多教师公共推理分布无法生成预训练不存在的全新规划骨架。工程落地指导简单短时序任务可使用GRPO长时序、数据质量参差不齐场景优先OPD多域融合前需确认各任务底层推理范式是否兼容。附录A 预训练完整配置A.1 基础模型架构基于Qwen2.5架构100M参数超参数取值层数12隐藏维度768FFN维度3072RoPE θ1e6最大上下文2048词表大小3000精度bfloat16A.2 环境技能图统计三大领域统一层级结构每层40分类、每类20实例物品合成分1~5层层数越高合成步骤越多。A.3 数据集划分预训练/后训练/测试严格分离区分short/mid/long三档难度提供完整样本数量、平均步骤统计表。A.4 SFT语料配置区分有无CoT思维链两大类数据集统计输入、输出token均值全部实验统一训练超参batch128、梯度累积2、lr1e-4、余弦调度、9000步、bf16全参数微调。资源汇总论文HTML原文https://arxiv.org/html/2607.24720v1论文PDFhttps://arxiv.org/pdf/2607.24720项目主页https://quester-one.github.io/PlanPhysWebsite/完整实验代码仓库https://github.com/Quester-one/PlanPhysCode预训练/后训练模型权重https://huggingface.co/MultimodalAgent/TianyiMen_PlanPhys_Models全套合成规划数据集https://huggingface.co/datasets/MultimodalAgent/TianyiMen_PlanPhys_Datasets

相关新闻

剪映团队协作与多端同步实战指南

剪映团队协作与多端同步实战指南

1. 剪映入门:短视频制作的新手友好工具剪映作为一款国产短视频编辑软件,凭借其简洁的界面设计和强大的功能集成,已经成为短视频创作者的首选工具之一。我最初接触剪映是在2020年,当时需要为一个企业活动制作宣传视频,从…

2026/7/28 20:13:05 阅读更多 →
CPP内存区

CPP内存区

全局区:静态变量包括static的全局和局部,常量包括:字符串常量和const修饰的变量。

2026/7/28 20:13:05 阅读更多 →
python核心技术与实战(十五):合理利用assert

python核心技术与实战(十五):合理利用assert

15. 合理利用assert15.1 什么是assertassert expression1assert expression1,expression215.2 assert的用法例1例2例315.3 assert的错误示例例1例215.1 什么是assert assert语句是一个debug的好工具,主要用于测试一个条件是否满足: 满足&am…

2026/7/28 20:13:05 阅读更多 →

最新新闻

JAVA毕业设计-基于 SpringBoot+Vue 的眼科复诊随访服务管理平台前后端分离的眼科患者跟踪治疗随访管理系统 (源码+LW+部署文档+全bao+远程调试+代码讲解等)

JAVA毕业设计-基于 SpringBoot+Vue 的眼科复诊随访服务管理平台前后端分离的眼科患者跟踪治疗随访管理系统 (源码+LW+部署文档+全bao+远程调试+代码讲解等)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/7/28 20:23:10 阅读更多 →
Flow Matching 训练的输入分布问题:从 VAE Latent 统计性质到归一化工程实践——以 VoxFlash-TTS 为例

Flow Matching 训练的输入分布问题:从 VAE Latent 统计性质到归一化工程实践——以 VoxFlash-TTS 为例

Flow Matching 训练的输入分布问题:从 VAE Latent 统计性质到归一化工程实践——以 VoxFlash-TTS 为例 在语音生成和图像生成领域,Flow Matching 作为一种新兴的生成模型训练范式,正逐渐取代扩散模型成为研究热点。然而,在实际应…

2026/7/28 20:23:10 阅读更多 →
高2018级NOIP模拟赛20190831

高2018级NOIP模拟赛20190831

文章目录写在前面考试T1 FFF团T2 maple做数学题T3 数字写在前面 爆long long 的孩子你伤不起 我发现我做题稳扎稳打的好习惯没有了,这可不是什么好事 不能只注重刷题数量 emm,友链:他们的总结 考试 T1 FFF团 我的blog - MZOJ #70 FFF团 …

2026/7/28 20:23:10 阅读更多 →
AI副业启动前必须验证的3个信号,少1个=3个月内必然放弃(附自查清单)

AI副业启动前必须验证的3个信号,少1个=3个月内必然放弃(附自查清单)

更多请点击: https://codechina.net 第一章:AI副业启动前必须验证的3个信号,少1个3个月内必然放弃(附自查清单) 在投入时间与金钱启动AI副业前,仅靠“感兴趣”或“听说很赚钱”远远不够。大量实践者在第6–…

2026/7/28 20:23:10 阅读更多 →
思源宋体:免费开源中文排版终极解决方案,7种粗细轻松驾驭

思源宋体:免费开源中文排版终极解决方案,7种粗细轻松驾驭

思源宋体:免费开源中文排版终极解决方案,7种粗细轻松驾驭 【免费下载链接】source-han-serif-ttf Source Han Serif TTF 项目地址: https://gitcode.com/gh_mirrors/so/source-han-serif-ttf 还在为中文设计项目寻找专业字体而烦恼吗?…

2026/7/28 20:23:10 阅读更多 →
如何快速永久保存B站缓存视频:m4s-converter终极指南

如何快速永久保存B站缓存视频:m4s-converter终极指南

如何快速永久保存B站缓存视频:m4s-converter终极指南 【免费下载链接】m4s-converter 一个跨平台小工具,将bilibili缓存的m4s格式音视频文件合并成mp4 项目地址: https://gitcode.com/gh_mirrors/m4/m4s-converter 你是否曾经遇到过这样的情况&am…

2026/7/28 20:22:09 阅读更多 →

日新闻

告别臃肿!3步让你的暗影精灵笔记本重获新生

告别臃肿!3步让你的暗影精灵笔记本重获新生

告别臃肿!3步让你的暗影精灵笔记本重获新生 【免费下载链接】OmenSuperHub Control Omen laptop performance, fan speeds, and keyboard lighting, and unlock power limits. 项目地址: https://gitcode.com/gh_mirrors/om/OmenSuperHub 你是否也曾为官方Om…

2026/7/28 0:00:43 阅读更多 →
RAG必踩坑!财报法规检索不准?这款开源工具让答案浮出水面,准确率飙升98.7%!

RAG必踩坑!财报法规检索不准?这款开源工具让答案浮出水面,准确率飙升98.7%!

做 RAG 的人应该都踩过这个致命的坑:把几百页的财报、法规、技术手册扔给向量库,问一个具体问题,搜出来的全是沾边但没用的内容 —— 关键信息要么被硬切块拆碎了,要么藏在几十条结果的最下面。语义相似≠真正相关,这个…

2026/7/28 0:00:43 阅读更多 →
抖音视频文案提取工具全指南:免费2026版、手机App、在线工具一网打尽

抖音视频文案提取工具全指南:免费2026版、手机App、在线工具一网打尽

2026年做短视频运营,从抖音上扒文案早就不是偷偷抄笔记的事了。我刚开始做内容的时候,每天刷半小时抖音,手动把爆款视频的口播敲进备忘录,一条2分钟的视频得花十来分钟,碰到语速快的还要反复回听。后来试了一圈工具&am…

2026/7/28 0:00:43 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/28 12:04:22 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/28 8:29:16 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/28 5:03:42 阅读更多 →

月新闻