如果要让机械臂把咖啡机旁的杯子移到桌上需要经历哪几个步骤在模型驱动规划中它需要先生成多条候选动作再交给世界模型预演根据预演结果决定如何执行动作。其中视频世界模型通常会接收当前画面以及关节角、末端位姿、夹爪状态等数值动作生成执行动作后的未来视频。可问题在于对视觉模型来说要建立某组数字和画面动作之间的对应关系需要额外的学习。并且这种学习依赖特定机器人产生的训练数据换一台机器人这些数据的结构还会全部改变。既然视觉模型更熟悉画面为什么不干脆把动作也「画」给它看近日斯坦福大学、马里兰大学帕克分校和哈佛大学的研究团队发布论文《Masked Visual Actions for Unified World Modeling》。第一作者为 Hadi Alzayer李飞飞、吴佳俊、张吕敏等研究者参与。研究团队提出 Masked Visual Actions将机器人的候选动作渲染成像素级运动轨迹再让视频模型补全环境的响应改变输入的实体后同一个模型还能在两个方向上工作给出机器人怎么动预测环境会如何变化给出目标物体怎么动生成机器人可能采取的行为。模型微调用了约 15 小时的机器人交互数据同一个模型可以支持正向预测、逆向生成、多种机器人本体、策略评估和模型规划。在 RoboCasa 任务中视频模型辅助规划带来了 7 至 26 个百分点的成功率提升模型预测的策略表现与真实仿真结果达到 0.982 的相关系数逆向动作提取管线在 CoffeeServeMug 任务上取得 90% 的成功率。翻译成视频就容易看懂了视频世界模型直接预测未来图像或视频常见工作方式可以概括为当前图像数值动作序列 → 未来视频。数值动作能够精确控制机器人却与视频模型熟悉的像素信息存在表示差异。从一串动作数据到最终画面中间还隔着多层转换动作数据 → 机器人姿态 → 相机投影 → 画面运动 → 环境响应。Masked Visual Actions 提前完成了这层转换。训练数据通过两种方式构造。一种是直接从真实视频中分割机械臂另一种是根据机器人状态、URDF 模型和相机参数渲染其运动。前者保留真实视觉信息后者方便在推理时自由输入新的动作轨迹。视频模型接收初始画面和这段机器人轨迹再补全物体与环境的变化。相比末端执行器点或机器人骨架完整掩码还包含机器人的形状、占用空间、遮挡关系和潜在接触边界模型能够直接「看」到动作过程。这种表示也带来了更好的跨机器人本体泛化能力。在 DROID 训练分布内完整掩码、末端执行器位置和机器人骨架都能较好地控制视频生成差距并不明显。在训练分布内三种视觉条件表现接近但当测试对象换成训练中未见过的自定义夹爪或直接换成 BEHAVIOR 中的双臂机器人后差距迅速拉开。换成双臂机器人后完整像素掩码对机器人形态的保持明显更稳定。末端点和骨架只提供稀疏的运动信息模型容易将新机器人改写成训练时见过的形态甚至凭空生成另一台机器人直接接收原始动作状态的 Ctrl-World在双臂机器人上也容易生成静止或损坏的画面。Masked Visual Actions 则直接给出新本体的完整轮廓与运动因此能够较稳定地保留机器人形态并继续预测它与环境的交互。换句话说不同机器人的关节数量、动作维度和控制方式可以完全不同但进入视频模型后都被转换成了同一种信息这让跨机器人本体泛化成为可能。两种填空方式零样本切换逆向建模在此之前已经有一些尝试证明了「把 URDF 机器人渲染成掩码并用作视频模型条件」这一思路的可行性例如BridgeV2W 将机器人动作渲染成像素对齐的本体掩码再注入预训练视频模型。这种表示能缩小动作坐标空间与视频像素空间之间的差距并支持不同机器人本体。与之相比Masked Visual Actions 把问题进一步抽象为一段交互视频中可以提供任意一部分实体的运动参考再让模型补全其余实体。用填空题类比BridgeV2W 的题目基本固定为已知机器人动作填写环境部分。Masked Visual Actions 则把它概括成已知交互中的部分实体填写剩余部分。于是模型获得了一种逆向使用方式希望物体这样运动机器人应该怎么动实际上论文中的模型主要使用机器人掩码进行正向训练推理时却能直接接收目标物体轨迹零样本转向逆向建模。作者认为这种能力来自视觉条件与视频模型内部表征之间的对齐。在更完整的机器人系统中这两种推理也许可以连续配合。机器人接到 “把杯子放到桌上” 的任务后逆向推理先提出可能的动作方案正向模型再预演这些方案的结果系统选择可靠轨迹并执行。完成一小段动作后摄像头重新观察场景再进入下一轮规划。更少的数据更彻底的接口统一研究团队基于 Wan-Fun-Control 2.2 14B 进行 LoRA 微调数据来自 DROID 真实机器人视频和 RoboCasa 仿真环境包含成功与失败轨迹。其中失败样本十分关键。世界模型需要学会错误动作会产生什么结果否则它可能对每一条候选轨迹都生成一个看似成功的未来。论文中还提到模型微调使用了约 15 小时的机器人交互数据。附录显示训练数据约包括 1000 条 DROID 演示和 4000 条 RoboCasa 样本。模型使用 8 张 H200 训练约 10000 步耗时 4 天。这套系统依赖 14B 基础模型和较强硬件整体并不轻量。它的数据效率主要体现在不需要从头训练机器人世界模型而是通过少量机器人样本激活视频模型已有的运动、接触与物体交互知识并覆盖了多种能力预测机器人动作产生的环境变化根据目标物体运动生成机器人行为适应训练中未出现的机器人本体以及从生成视频中提取可执行行为等。实验结果实验中先由 Diffusion Policy 为同一场景采样多条候选动作后视频模型生成对应未来Gemini 3.1 Pro 再从任务进度、物理真实性和接触情况等方面评价每段视频最后选择最优动作执行。模型规划在关闭微波炉、打开抽屉、打开洗碗机、关闭冰箱等任务中加入视频模型规划后成功率获得了 7 至 26 个百分点的提升。候选数量增加时整体表现也随之提高。这相当于为机器人增加推理时计算原有策略负责提出方案视频模型负责预演视觉语言模型负责筛选。策略参数保持不变系统通过比较更多未来提高决策质量。策略评估作者将同一套机器人策略分别放进 RoboCasa 仿真环境和视频世界模型中执行。模型生成视频中的成功率与真实仿真结果达到 0.982 的相关系数。在真实机器人实验中生成视频所体现的任务进度与实际演示也较为接近。模型仍然存在明显的乐观倾向常常想象出比现实更多的任务进展。因此它更适合作为策略开发早期的低成本筛查工具距离替代仿真器和实机测试还有较大距离。逆向动作提取在 CoffeeServeMug 任务中系统输入杯子的目标运动视频模型生成机械臂完成操作的过程逆动力学模型再提取可执行动作。完整管线取得 90% 的成功率高于论文中对比的 Diffusion Policy、ACT 和 SmolVLA。这里的 90% 来自 “视频模型逆动力学模型” 的组合。视频模型提供行为过程逆动力学模型负责把过程还原为控制数据。总结Masked Visual Actions 将机器人动作、环境响应和结果评价放入同一个视觉空间并将正向预测与逆向生成统一为条件视频补全。它也清楚地展示了视频模型在机器人系统中的一种分工方式策略提出动作视频模型预演未来视觉语言模型评价结果控制器完成实际执行。现阶段这套方法仍受到基础视频模型能力的限制。模型学习的是交互相关性缺少严格的因果与物理约束仍会出现无接触运动、物体瞬移和任务结果凭空完成等现象。视频生成的速度和成本也限制了实时闭环控制。逆向流程还需要额外的逆动力学模型最终执行始终依赖数值动作和底层控制器。