摘要本文解读 ICLR 2026 论文《Test-Time Mixture of World Models for Embodied Agents in Dynamic Environments》。该论文提出TMoW测试时混合世界模型通过融合多粒度原型路由、测试时原型细化与蒸馏混合模型增广让基于语言模型的具身智能体在不重训基座的前提下适配未见与持续演化的域其特别之处在于把混合专家里「训练后固定」的路由函数变成推理期可以被改写的量世界模型于是从训练时定死的专家池变成部署后还能持续并入、持续重组的可插拔资产。实验表明未见域零样本适应平均提升 27.21% SR、待定步数减少 3.45 步真机未见域成功率从 7.80% 提升到 74.64%为具身智能体的模块化适配与持续学习提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果结果对比总结关键发现局限性常见问题FAQTMoW 与经典混合专家MoE的核心区别是什么测试时原型细化更新了什么为什么它不需要训练为什么 top-K 的 K 不能取大一些新领域必须重训整个系统吗TMoW 能用在真实机器人上吗参考链接论文基本信息项目内容标题英文Test-Time Mixture of World Models for Embodied Agents in Dynamic Environments标题中文TMoW测试时混合世界模型让具身智能体持续适配动态环境作者Jinwoo Jang, Minjong Yoo, Sihyung Yoon, Honguk Woo通讯作者机构成均馆大学Sungkyunkwan University计算机科学与工程系 · CSI Agent Group会议ICLR 2026arXiv2601.22647项目网站论文未提供代码或项目页截至发布时背景与动机语言模型驱动的具身智能体正在走进家庭、工厂与虚拟仿真环境但它们的架构是单体式的能力在训练时冻结领域知识埋在数十亿共享参数里。环境一旦变化——新房间、新物体布局、新的任务组合——智能体往往只剩「重训」这一条路而重训意味着高昂的算力与数据采集成本。上下文学习如 LLM-Planner虽然绕开了参数更新却把代价转移到了推理端上下文窗口被撑大延迟随示例数量上升。混合专家MoE本该是结构化的解法它通过稀疏激活专家模块实现领域特化。问题在于路由函数——决定「哪个输入交给哪个专家」的那条映射——在训练完成后就固定了。论文把这一点明确认作一条负载假设load-bearing assumption只要路由冻结把系统迁移到未见域就只能靠端到端重训或者昂贵的知识蒸馏专家的模块性因此无法转化为部署后的可扩展性。论文的出发点由此确立动态环境需要的不是更多的专家而是一条可以被测试时改写的路由。沿着这条线索论文点名了几条直接对手路线SayCanPay 用可学习的代价模型做启发式规划是零样本适应上的 SOTA 基线FLARE 在上下文学习之上加了一个环境自适应的重规划模块LLM-Planner 代表少样本上下文学习路线以及同一课题组此前的 WorMIICML 2025它第一次做到了在测试时检索并植入单个领域世界模型。TMoW 的前进方向很清楚WorMI 只能「换一个」而 MoE 的路由又太硬——那就让路由本身在推理期动起来并且一次混合多个世界模型。研究主线从问题到结论图 8TMoW 研究主线——问题 → 动机 → 设计 → 方法 → 结论Mermaid 流程图。基准/方法设计TMoW 的结构可以概括成一句话基座冻结知识装进适配器路由由原型决定适配靠改写原型。世界模型 适配器 原型。基座模型 $\mathcal{M}$ 固定论文用 Llama-3.2-1B每个领域一个 LoRA 适配器 $m_{j}$rank 32一个领域对应一个世界模型。逐层混合。每个 Transformer 层的输出由基座层输出与加权适配器之和给出即 $\mathbf{y}^{l} \mathcal{M}^{l}(\mathbf{y}^{l-1}) \sum_{j} w_{j}^{l} m_{j}^{l}(\mathbf{y}^{l-1})$。混合发生在每一层而不是只在输入处选一次专家。多粒度原型。用消息传递网络MPNN把观测图与指令编码成逐层原型 $p_{j}^{l}$它从物体级的局部交互特征一路演化为场景级的全局结构特征。为避开 MPNN 加深后的过平滑论文只在第 0/4/8/12 层使用 GCN其余层用多层感知机。指令条件化。邻接聚合被一个上下文感知的边矩阵调制指令通过交叉注意力进入聚合权重因此「同一个房间里不同的任务」会得到不同的混合。图 1现有 MoE 在训练后使用固定路由适配未见域代价高昂、需要重训左TMoW 用原型化路由与路由函数的测试时训练无需演示即可让混合体反映新域特征右。分类全景TMoW 把「域相似度」拆成可计算的三件事再据此决定混合比例图 9分类全景——多粒度原型空间的三个层次与逐层路由分数的生成路径Mermaid 分类图。方法细节路由怎么算。给定指令与观测MPNN 产出域嵌入 $e^{l}$第 $j$ 个世界模型在第 $l$ 层的路由分数是它与该层原型的余弦相似度 $w_{j}^{l} \mathrm{sim}(e^{l}, p_{j}^{l})$分数向量经过 top-$K$ 稀疏化与带温度 $\tau$ 的 softmax 归一化只保留最相关的 $K$ 个世界模型参与混合。这种逐层设计让「部分域的相似性」可被利用厨房与办公室在物体层面完全不同却在空间结构层面高度相似早层可以共享知识、深层则保持专用。细化怎么改。遇到未见域时原型按相似度做加权插值更新$\tilde{p}{j}^{l} (1 - \alpha\,s{j}^{l})\,p_{j}^{l} \alpha\,s_{j}^{l}\,\Delta p_{j}^{l}$其中 $s_{j}^{l}$ 是当前域嵌入与原型的相似度细化项 $\Delta p_{j}^{l}$ 由原型与原型之间的相似度加权求和得到。注意这里的含义细化不学习新参数而是把既有世界模型里「没被用上」的知识重新拉进未见域的决策所以它可以发生在推理期作者把它称为「唤醒」而不是「学习」。增广怎么造新模型。当新域与已见域差异过大时用路由权重初始化一个新适配器 $m_{new}^{l} \sum_{j} \bar{w}{j}^{l} m{j}^{l}$在少样本演示上以 teacher-forcing 损失 $\mathcal{L}_{\mathrm{TF}}$ 微调再连同它自己的多粒度原型一起并入混合体——新世界模型零改结构地进入下一轮路由。图 2TMoW 总体框架三条核心流程把「测试时重配置混合」与「少样本扩展」统一在同一个可插拔的 MoE 世界模型结构里。图 3多粒度原型中的图表示——随着层数加深节点表示从局部物体特征演化为全局场景结构。训练与实现细节来自附录。框架用 Python 3.12 实现硬件是 Intel i9-10980XE 加两块 NVIDIA RTX A6000。世界模型训练配置为 batch 16、LoRA rank 32、2000 步、初始学习率 $1\times10^{-5}$TMoW 路由器则是 batch 1、10000 步、学习率 $1\times10^{-4}$少样本学习率 $1\times10^{-7}$cosine 调度、200 步 warmup、温度 $1.0$。路由器本身的预训练使用对比学习损失由实例级对比损失与域感知对比损失按系数 $\lambda$ 加权组合前者学增强不变的表示后者让同域图聚簇。实验设计与结果评测设置。论文在三个室内仿真、一个户外仿真与一台真机上验证VirtualHome 有 78 个任务16 见 / 62 未见与 20 个场景10 / 10445 条演示ALFWorld 沿用 CL-ALFRED 的划分6 个任务类4 / 2与 4 个场景类3 / 11304 条演示RLBench 是 4 个任务类3 / 1与 6 个场景类4 / 2见域共 163 条 episode真机用 Franka Research 38 个场景4 / 4、29 条 episode。指标是成功率 SR越高越好与待定步数 PS越低越好全部报告 5 个随机种子的 95% 置信区间。基线的语言模型规模并不吃亏ZSP、LLM-Planner、FLARE 与 SayCanPay 的 Say 模型用 Llama-3.2-3B而 LLMFT、SayCanPay 的 Pay 模型与 TMoW 用更小的 Llama-3.2-1B。图 4三个评测环境从左到右依次为 VirtualHome 的俯视场景、ALFWorld 的室内任务仿真与 RLBench 的桌面操作场景域由任务与场景的组合定义任务类别与布局都划分成见域与未见域。主结果未见域全面领先。表 1 转写自论文 Table 1 的未见域部分。场景未见域方法SR ↑PS ↓VirtualHomeSayCanPay49.53%18.55VirtualHomeTMoW本文80.16%13.20ALFWorldSayCanPay42.04%40.64ALFWorldTMoW本文68.83%37.44RLBenchSayCanPay38.54%10.76RLBenchTMoW本文62.75%8.95见域上 TMoW 同样全胜VirtualHome 从 64.14% 提升到 83.61%ALFWorld 从 51.48% 到 72.05%RLBench 从 68.08% 到 71.89%。汇总起来未见域平均提升 27.21% SR、待定步数减少 3.45 步14.81%见域平均提升 14.61% SR、待定步数减少 4.42 步35.31%。真机场景仿真到现实的迁移成立。设置FLARESayCanPayTMoW本文见域 SR ↑57.10%52.90%91.46%见域 PS ↓7.267.004.23未见域 SR ↑36.04%7.80%74.64%未见域 PS ↓7.879.714.89真机见域平均提升 34.36% SR未见域平均提升 38.60% SR、待定步数减少 2.98 步。值得注意的是未见域的相对优势比见域更大38.60% 对 34.36%物理环境里的不确定性并没有削弱可改写的路由反而放大了它的价值。图 5真机场景示例——机器人在桌台、货架与储物单元之间执行家庭操作场景布局、物体类型与初始状态都被刻意变化。消融三个机制各自承重。变体SR ↑PS ↓TMoW-Object只用物体级65.25%16.72TMoW-Scene只用场景级8.74%27.38TMoW-NoRefine不细化73.30%14.85TMoW完整80.16%13.20TMoW-Scratch从零训练59.84%18.16去掉物体级细节成功率掉 15.49 个百分点只用场景级特征直接塌到 8.74%。测试时细化贡献 7.65% SR蒸馏增广相对从零训练提升 18.39% SR而且少用 40% 的数据。top-$K$混合有上限。设置SR ↑PS ↓TMoW-Top-165.43%17.34TMoW-Top-3默认80.16%13.20TMoW-Top-577.52%15.19TMoW-Top-766.01%17.67单专家Top-1只有 65.43%说明多模型共同贡献是必要的但 K 增大到 5、7 之后性能反而回落甚至逼近单专家水平——无关的世界模型带来的是噪声而不是知识稀疏化不是可选项。路由熵可观测的适配健康度。论文给出了一个漂亮的分层现象早层熵高多个世界模型近似均分局部物体级知识被最大化共享深层层熵低全局场景表示趋向专用。测试时细化抬升了所有层的平均熵说明它纠正了原型与未见域的初始错位。更进一步未见域上成功 episode 的路由熵均值是 0.23高于失败案例的 0.20——分布式路由与任务成功同向熵因此成了一个可诊断的信号。图 6原型细化前后的路由分数热图——见域变化很小但略有多样化未见域的变化非常明显更多世界模型被激活。持续扩展与细化率。分阶段并入新世界模型时新域与既有域的成功率同步上升且既有域没有遗忘说明存在正向的知识迁移。细化率 $\alpha$ 的分析则给出一个下限$\alpha$ 太小时细化近似噪声性能低于基线一旦 $\alpha \ge 0.5$模型稳定超过基线并更快收敛。图 7左为持续扩展场景——每阶段并入新世界模型后新域与既有域同步提升且无遗忘右为未见域上成功与失败 episode 的路由熵分布。扩展实验来自附录。ALFWorld 的少样本扩展上TMoW 在 1-shot 与 5-shot 的平均成功率达到 71.58%对比 SayCanPay 的 47.71%平均提升 23.87% SR、待定步数减少 8.30 步VirtualHome 的少样本平均为 82.59% SR平均提升 25.66% SR。论文还把方法搬到 CARLA 户外驾驶Town05/06 为未见域与视觉语言模型输入两种设置上。扩展设置对照SR ↑PS ↓ALFWorld 少样本1-shot / 5-shot 平均SayCanPay47.71%38.28ALFWorld 少样本1-shot / 5-shot 平均TMoW71.58%29.98CARLA 户外未见域FLARE18.34%27.51CARLA 户外未见域TMoW47.49%12.03VirtualHome 文本输入真值TMoW80.16%13.20VirtualHome VLM 视觉输入TMoW75.05%13.93延迟方面TMoW 平均 700.12 ms快于 FLARE 的 917.44 ms 与 SayCanPay 的 2470.30 ms其中测试时细化只引入 43.40 ms 的开销而 TMoW-NoRefine 是 656.72 ms——也就是说让路由动起来几乎不花额外的推理时间。结果对比总结图 10结果对比总结——三组最能说明测试时混合价值的数字Mermaid 流程图。关键发现改编排、不训参数未见域平均提升 27.21% SR、待定步数减少 3.45 步见域平均提升 14.61% SR。适配发生在推理期基座参数全程冻结。粒度不能单点只用物体级特征成功率为 65.25%只用场景级仅 8.74%完整多粒度是 80.16%——多粒度的作用是同时保留「可共享」与「需专用」。细化确实承重去掉测试时细化从 80.74% 掉到 73.30%-7.65% SR而细化的平均开销只有 43.40 ms。扩展比训练便宜蒸馏增广相对从零训练提升 18.39% SR且少用 40% 数据少样本扩展1/5-shot在 VirtualHome 平均提升 25.66% SR。混合规模存在上限Top-1 为 65.43%Top-3 为 80.16%Top-5 回落到 77.52%Top-7 掉到 66.01%路由熵与成功同向成功 0.23 / 失败 0.20。从创新模式与写作视角看这项工作同时命中「审计并扭转负载假设」把「路由训练后固定」点名叫破、「重新表述为可解对象」把选世界模型重述为原型相似度这一可算量与「通过条件化适配而非重训练」基座冻结、条件化适配器组合三类模式叙事上它是问题先行、先承认 MoE 优点再指出路由刚性、最后用三点机制清单兑现承诺。需要提醒的是论文的公式说明里有一处where悬空的句子、算法伪代码保留了\color{teal}调试着色结论部分的评测覆盖声明也漏掉了 RLBench 与真机且没有提供代码或项目页链接——这些是阅读时需要自己核对的细节。局限性能力上限绑定基座模型作者明确指出TMoW 的性能受限于用于规划的底层语言模型本文用 Llama-3.2-1B 作基座。强非平稳环境未覆盖世界模型路线在多智能体这类「他人行为持续改变环境动力学」的场景中可能失效。评测面偏小、方差偏大真机只有 29 条 episodeALFWorld 少样本的待定步数置信区间达到 ±15.56均值 34.23单格结果的稳定性有限。依赖输入图质量换成视觉语言模型的视觉输入后VirtualHome 成功率从 80.16% 降到 75.05%差距来自物体检测与关系抽取的噪声。作者展望下一步是提升路由决策的安全性与可解释性并把框架扩展到多智能体系统以支持安全攸关场景下的可靠部署。常见问题FAQTMoW 与经典混合专家MoE的核心区别是什么经典 MoE 的路由函数训练完成后固定换域只能重训或蒸馏TMoW 把路由函数搬到测试时更新——原型在推理期被细化、混合权重随之改变基座参数始终冻结。论文实测未见域平均提升 27.21% SR。测试时原型细化更新了什么为什么它不需要训练它只更新原型不更新模型参数。细化项由原型与原型之间的相似度加权求和得到再把未见域的嵌入按相似度插值进去式中的细化率 $\alpha$经验阈值 $\alpha \ge 0.5$。本质是把既有世界模型里未被利用的知识重新拉进未见域的决策因此可以在推理期完成平均只增加 43.40 ms。为什么 top-K 的 K 不能取大一些因为无关世界模型带来的是噪声。Top-1 只有 65.43% SRTop-3 达到 80.16%但 Top-5 回落到 77.52%Top-7 掉到 66.01%。这也解释了为什么论文把 top-$K$ 稀疏化与 softmax 归一化当作必要组件而不是可选项。新领域必须重训整个系统吗不需要。如果新域只是需要重新组合已有世界模型测试时原型细化就够了如果差异过大用少样本演示蒸馏出一个新适配器即可它由路由权重初始化微调后连同原型直接并入混合体——论文实测这条路径相对从零训练提升 18.39% SR并且少用 40% 的数据。TMoW 能用在真实机器人上吗可以。真机实验用 Franka Research 3 在 8 个场景、29 条 episode 上评测见域成功率 91.46%、未见域 74.64%显著高于 FLARE未见域 36.04%与 SayCanPay7.80%。不过任务面偏小且换成视觉输入后仍会有感知噪声带来的性能损失80.16% → 75.05%。参考链接论文 arXiv 摘要页arXiv:2601.22647B 站视频讲解横屏 P1 竖屏 P2SayCanPay: Hazra et al.,Heuristic Planning with Large Language Models using Learnable Domain Knowledge, AAAI 2024WorMI同组前作: Yoo et al.,World Model Implanting for Test-time Adaptation of Embodied Agents, ICML 2025, arXiv:2509.03956MuSix同组后续工作: Jang et al.,Multi-scale Mixture of World Models for Embodied Agents in Evolving Environments, arXiv:2607.00457MixLoRA参数高效 MoE 基础: Li et al., arXiv:2404.15159给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件