目录1. 研究背景2. 数据处理流水线2.1.视频来源与收集2.2. 视频过滤、分割与标注2.3 统一动作空间和坐标系2.4. 统一多视角输入3. VPP模型策略3.1 模型三阶段训练3.2 VLM用于高级规划4. 实验以及结果4.1 视频预测质量分析4.2 策略执行结果分析5. 总结论文Video Prediction Policy 2: Predict Better, Act Better机构星动纪元、清华大学等主页Video Prediction Policy 2: Predict Better, Act Better1. 研究背景目前许多 WAMs 建立在视频基础模型之上试图将视频模型中海量的物理动力学先验知识 (priors about physical dynamics)迁移到策略学习中但现有 WAMs 面临严重的泛化瓶颈分布外 (OOD) 表现差现有 WAMs 通常只在狭窄的已见任务集上表现良好在未见过的、分布外的场景中会产生不可靠的未来运动预测进而导致错误的动作。基准测试暴露问题在标准评估套件上成功率近乎完美的机器人策略包括 WAMs在面对扰动任务配置和新技能组合时性能会大幅下降论文指出导致这些局限性的两个关键因素基础视频模型优化目标偏差基础视频模型主要针对创意内容生成和美学质量进行优化而非精确的物理动力学。因此它们往往无法忠实遵循操作指令。引入动作组件导致泛化退化将动作特定组件或训练目标引入预训练的视频基础模型中会大幅降低其泛化能力。为了解决上述问题提出了VPP2 (Video Prediction Policy 2)旨在视频预测和动作生成上实现强大的零样本泛化。其方法论分为三个核心步骤训练可泛化的视频基础模型 (Train a generalizable video foundation)手段为每个视频片段标注详细描述明确操作过程、活动末端执行器、目标物体。核心技术事件级视频预测训练 (event-level video prediction training)。详细描述和完整的事件级轨迹预测能显著减少未来预测的不确定性鼓励从语义描述到视觉轨迹的一致映射从而提高泛化能力。蒸馏单步视觉规划器 (Post-train Distill)后训练视频模型以预测固定视野的未来块 (fixed-horizon future chunks)。应用一致性蒸馏 (consistency distillation)技术获得用于实时机器人执行的单步视觉规划器。引入动作专家模块 (Introduce action expert)采用混合Transformer (Mixture-of-Transformers, MoT)架构。学习一个隐式逆动力学模型其条件是基于预测的未来。执行阶段搭配一个VLM 规划器将开放式指令翻译成明确的子任务指令。2. 数据处理流水线2.1.视频来源与收集为了对开源视频基础模型进行持续的预训练作者构建了一个大规模、多样化的操作视频集合。数据主要跨越三个类别机器人操作数据集 (Robot manipulation datasets)真实的机器人执行任务的视频。人类活动数据集 (Human activity datasets)记录人类进行类似操作活动的视频。通用视频数据集 (General-purpose video datasets)互联网上的通用视频。由于通用视频数据包含大量无关内容作者应用了广泛的过滤流水线类似于 LVP 的方法仅保留描绘与操作相关的活动的视频。数据集来源如下表所示2.2. 视频过滤、分割与标注分为三个精细的步骤旨在将原始长视频转化为适合模型训练的“事件级”片段1. 过滤与初始分割 (Filtering Initial Segmentation)去除损坏数据首先剔除损坏的轨迹如相机故障、突然的中断/不连续。语义连贯片段分割将剩余轨迹分割成1到12秒的语义连贯片段。边界识别利用与自然过渡相关的启发式线索来识别片段的候选边界。这些线索包括人手或末端执行器速度的局部极小值 (local minima)通常意味着动作的停顿或转换。夹爪或手指张开或闭合的时刻。VLM 细化分割使用视觉语言模型 (VLM) 进一步细化分割结果。VLM 会合并相邻的合适片段并调整片段的起始和结束点以确保语义的完整性。2. 详细标注 (Captioning)分割完成后为每个视频片段生成详细的文本描述 (detailed captions)。这些描述必须包含以下关键信息描述任务正在执行什么操作。明确活动末端执行器 (active end effectors)是机械臂的夹爪还是人手等。明确目标物体 (target objects)操作的具体对象是什么。表征相机视角和运动 (characterize the camera views and motion)视频的拍摄角度和镜头运动情况。2.3 统一动作空间和坐标系问题不同的机器人数据集通常采用不一致的坐标系和相机视角。这导致视觉上相似的动作在不同数据集中有着完全冲突的动作表示论文聚焦于自我中心的双臂数据集 (egocentric bimanual datasets)包括 ALOHA 风格、人形风格和人类自我中心数据集。这些数据占总数据的 80% 以上且具有相似的双臂结构和相机视角。为了统一这些数据作者在两个层级上显式地对齐了坐标系1. 工作空间对齐 (Workspace alignment)应用一个世界坐标系变换2. 末端执行器对齐 (End-effector alignment)应用一个局部变换数学公式表达如下2.4. 统一多视角输入作者将它们排列成一个“T型复合图像 ,主视角 (Primary view)放置在左侧。辅助视角 (Auxiliary views)两个辅助视角垂直堆叠在右侧。如果某个数据集提供的辅助视角少于两个则使用黑色占位图 (black placeholder images)填充缺失的槽位3. VPP模型策略基础模型建立在预训练的视频基础模型 Wan2.1-I2V-14B 之上。架构采用混合Transformer (Mixture-of-Transformers, MoT)架构引入动作专家 (Action Expert)。3.1 模型三阶段训练训练被组织为三个阶段如图 4 所示以最大化策略的泛化能力。阶段一事件级视频模型持续预训练为了将预训练的视频生成模型适配到机器人操作领域 每个训练样本覆盖一个完整的操作子任务 (manipulation subtask)将子任务描述与从初始观察到子任务完成的视觉演变对齐给定演示轨迹在整个事件中均匀采样 N个未来帧其中T是最终帧索引使用视频编码器 E 获取潜在表示构建插值潜在变量优化目标是最小化预测流速与实际流速之间的误差c 包括子任务指令和初始观测值O0训练细节预测 49 帧分辨率 416x240持续训练 30,000 步批次大小 1,024学习率 1e-5。实验表明此阶段后的模型在遵循操作指令方面超越了 64B 的 Cosmos3 模型。阶段二块级视频模型后训练与蒸馏阶段 1 虽然泛化好但采样帧的时间间隔不固定导致与下游动作对齐困难。阶段 2 旨在解决时序一致性和推理速度问题。1. 块级视频模型后训练 (Chunk-level Post-training)目的预测固定时长 (fixed-duration)的未来视频块建立一致的时间尺度。设置人类手部操作预测 2 秒机器人操作预测 8 秒。数学表达设预测视野为 H 秒数据集帧率为 f fps则采样帧之间的标称间隔为 δf H/N。目标视频块为优化依然使用阶段 1 的流匹配目标但现在的数据是固定时间间隔的视频块2. 一致性蒸馏 (Consistency Distillation)目的将块级视频模型蒸馏为单步生成 (single-step generation)模型以满足实时推理需求。方法强制相邻流时间的终端预测保持一致性Fθ是学生模型Fθˉ是教师模型EMA参数。通过这种约束学生模型学会了在单次前向传播中从噪声直接生成清晰的视频潜在变量 Fθ(ϵ,0,c)。阶段 三动作专家预训练这是将视觉预测转化为实际机器人动作的最后一步动作专家的预训练数据基础使用经过前文所述“统一工作空间和末端执行器坐标系”处理过的双臂数据集架构一个0.9B 参数 (0.9B-parameter)的扩散 Transformer采用标准的混合 Transformer (MoT) 架构条件机制动作专家的生成条件是单步视频潜在变量注意力掩码 (Attention Mask)它允许视频 token和动作 token之间进行特定的交叉注意力计算确保动作生成能够充分利用视频预测的上下文信息。训练策略因为动作专家是新初始化的所以在动作训练的早期阶段冻结视频 DiT 的基础参数仅使用LoRA 微调来适配视频骨干网络推理延迟 将视频输入分辨率降低至 17×416×240并利用阶段 2 蒸馏出的单步生成 (one-step generation)模型视频模型生成耗时约0.12 秒动作专家生成动作块基于视频潜变量5 步去噪约0.1 秒每个动作块的总延迟约 0.22 秒。总结阶段 1 通过海量事件级数据让视频模型理解操作任务的物理规律和语义强泛化。阶段 2 通过固定时长后训练和一致性蒸馏让模型具备实时预测长视野未来的能力高效率。阶段 3 训练动作专家基于视频模型的单步预测结果直接输出可执行的动作块强执行3.2 VLM用于高级规划采用分层架构VLM充当高层规划器将模糊的人类指令拆分为明确子任务指令专注于将明确的指令映射为轨迹 (trajectories)。同时VLM 规划器不仅要输出子任务还要生成与训练时使用的标注模板相匹配的详细子任务描述。VLM 可以本地部署也可以通过 API 调用前沿的大模型如 GPT-4V 等4. 实验以及结果4.1 视频预测质量分析定量比较与基线模型Wan-2.1-I2V-14B-480pVPP2 的基础模型。LVP同样将 Wan-2.1-I2V-14B-480p 适配到操作任务的模型。Cosmos3-Nano-16B在机器人操作数据上广泛训练的模型。Cosmos3-Super-Image2Video-64BCosmos 3 系列中最强的模型64B参数。VPP2-Fixed-Step (消融实验)预测固定时长的未来块而不是完整的事件Event。作者指出这种方法可能会导致预测的未来与描述整个事件的指令错位。测试方法从先前的工作中随机抽取测试用例在办公环境和机器人工作空间中拍摄照片并搭配自由选择的操作指令分析模型视频预测的指令遵循成功率评估方法GPT 评估器、人类评估者结果如下所示4.2 策略执行结果分析真实世界 ALOHA 机器人的零样本性能实验设置直接将 VPP2 部署在训练期间见过的机器人本体ALOHA上无需任何特定任务的微调 (without task-specific fine-tuning)。对比基线 在相同数据上训练的 π0.5π0.5 (Intelligence et al., 2025) 和 Fast-WAM (Wan-14B 版本)VPP2 在真实世界的零样本操作任务中具有压倒性优势LIBERO 基准测试作者在标准的 LIBERO 仿真基准上进行了测试在三种不同条件下评估LIBERO-ID (分布内)测量标准的分布内操作性能。LIBERO-Pro (分布外泛化)评估位置 (Position) 和任务 (Task) 扰动下的泛化能力。LIBERO-OOD (组合泛化)评估在空间、物体和目标维度上重新组合已知元素形成未见任务配置的能力。RoboDojo 基准测试测试结果如下结合子任务规划的 VPP2作者进一步探索了 VPP2 与 VLM视觉语言模型结合的潜力训练将演示轨迹分割成片段并将每个片段与一个子任务指令配对训练出“子任务条件策略”。测试VLM 利用视觉观察和执行反馈来选择下一个让 VPP2 执行的子任务。5. 总结引入了视频预测策略2VPP2这是一种WAM能够实现在视频预测和动作生成方面的强大零样本泛化。整个流程如下(1)事件级视频预训练整理了一个大规模、多样化的操控视频数据集以继续对基础视频模型进行预训练。我用详细的描述标注视频片段并进行事件级视频预训练以促进在开放式操控任务上的泛化能力。(2)单步视觉规划对视频模型进行训练后处理并将其蒸馏为一个具有固定预测时域的单步视觉规划器。(3)动作学习通过混合专家MoT架构引入动作模块以学习隐式逆动力学模型。