VPP2:预测得更好,行动得更好
目录1. 研究背景2. 数据处理流水线2.1.视频来源与收集2.2. 视频过滤、分割与标注2.3 统一动作空间和坐标系2.4. 统一多视角输入3. VPP模型策略3.1 模型三阶段训练3.2 VLM用于高级规划4. 实验以及结果4.1 视频预测质量分析4.2 策略执行结果分析5. 总结论文Video Prediction Policy 2: Predict Better, Act Better机构星动纪元、清华大学等主页Video Prediction Policy 2: Predict Better, Act Better1. 研究背景目前许多 WAMs 建立在视频基础模型之上试图将视频模型中海量的物理动力学先验知识 (priors about physical dynamics)迁移到策略学习中但现有 WAMs 面临严重的泛化瓶颈分布外 (OOD) 表现差现有 WAMs 通常只在狭窄的已见任务集上表现良好在未见过的、分布外的场景中会产生不可靠的未来运动预测进而导致错误的动作。基准测试暴露问题在标准评估套件上成功率近乎完美的机器人策略包括 WAMs在面对扰动任务配置和新技能组合时性能会大幅下降论文指出导致这些局限性的两个关键因素基础视频模型优化目标偏差基础视频模型主要针对创意内容生成和美学质量进行优化而非精确的物理动力学。因此它们往往无法忠实遵循操作指令。引入动作组件导致泛化退化将动作特定组件或训练目标引入预训练的视频基础模型中会大幅降低其泛化能力。为了解决上述问题提出了VPP2 (Video Prediction Policy 2)旨在视频预测和动作生成上实现强大的零样本泛化。其方法论分为三个核心步骤训练可泛化的视频基础模型 (Train a generalizable video foundation)手段为每个视频片段标注详细描述明确操作过程、活动末端执行器、目标物体。核心技术事件级视频预测训练 (event-level video prediction training)。详细描述和完整的事件级轨迹预测能显著减少未来预测的不确定性鼓励从语义描述到视觉轨迹的一致映射从而提高泛化能力。蒸馏单步视觉规划器 (Post-train Distill)后训练视频模型以预测固定视野的未来块 (fixed-horizon future chunks)。应用一致性蒸馏 (consistency distillation)技术获得用于实时机器人执行的单步视觉规划器。引入动作专家模块 (Introduce action expert)采用混合Transformer (Mixture-of-Transformers, MoT)架构。学习一个隐式逆动力学模型其条件是基于预测的未来。执行阶段搭配一个VLM 规划器将开放式指令翻译成明确的子任务指令。2. 数据处理流水线2.1.视频来源与收集为了对开源视频基础模型进行持续的预训练作者构建了一个大规模、多样化的操作视频集合。数据主要跨越三个类别机器人操作数据集 (Robot manipulation datasets)真实的机器人执行任务的视频。人类活动数据集 (Human activity datasets)记录人类进行类似操作活动的视频。通用视频数据集 (General-purpose video datasets)互联网上的通用视频。由于通用视频数据包含大量无关内容作者应用了广泛的过滤流水线类似于 LVP 的方法仅保留描绘与操作相关的活动的视频。数据集来源如下表所示2.2. 视频过滤、分割与标注分为三个精细的步骤旨在将原始长视频转化为适合模型训练的“事件级”片段1. 过滤与初始分割 (Filtering Initial Segmentation)去除损坏数据首先剔除损坏的轨迹如相机故障、突然的中断/不连续。语义连贯片段分割将剩余轨迹分割成1到12秒的语义连贯片段。边界识别利用与自然过渡相关的启发式线索来识别片段的候选边界。这些线索包括人手或末端执行器速度的局部极小值 (local minima)通常意味着动作的停顿或转换。夹爪或手指张开或闭合的时刻。VLM 细化分割使用视觉语言模型 (VLM) 进一步细化分割结果。VLM 会合并相邻的合适片段并调整片段的起始和结束点以确保语义的完整性。2. 详细标注 (Captioning)分割完成后为每个视频片段生成详细的文本描述 (detailed captions)。这些描述必须包含以下关键信息描述任务正在执行什么操作。明确活动末端执行器 (active end effectors)是机械臂的夹爪还是人手等。明确目标物体 (target objects)操作的具体对象是什么。表征相机视角和运动 (characterize the camera views and motion)视频的拍摄角度和镜头运动情况。2.3 统一动作空间和坐标系问题不同的机器人数据集通常采用不一致的坐标系和相机视角。这导致视觉上相似的动作在不同数据集中有着完全冲突的动作表示论文聚焦于自我中心的双臂数据集 (egocentric bimanual datasets)包括 ALOHA 风格、人形风格和人类自我中心数据集。这些数据占总数据的 80% 以上且具有相似的双臂结构和相机视角。为了统一这些数据作者在两个层级上显式地对齐了坐标系1. 工作空间对齐 (Workspace alignment)应用一个世界坐标系变换2. 末端执行器对齐 (End-effector alignment)应用一个局部变换数学公式表达如下2.4. 统一多视角输入作者将它们排列成一个“T型复合图像 ,主视角 (Primary view)放置在左侧。辅助视角 (Auxiliary views)两个辅助视角垂直堆叠在右侧。如果某个数据集提供的辅助视角少于两个则使用黑色占位图 (black placeholder images)填充缺失的槽位3. VPP模型策略基础模型建立在预训练的视频基础模型 Wan2.1-I2V-14B 之上。架构采用混合Transformer (Mixture-of-Transformers, MoT)架构引入动作专家 (Action Expert)。3.1 模型三阶段训练训练被组织为三个阶段如图 4 所示以最大化策略的泛化能力。阶段一事件级视频模型持续预训练为了将预训练的视频生成模型适配到机器人操作领域 每个训练样本覆盖一个完整的操作子任务 (manipulation subtask)将子任务描述与从初始观察到子任务完成的视觉演变对齐给定演示轨迹在整个事件中均匀采样 N个未来帧其中T是最终帧索引使用视频编码器 E 获取潜在表示构建插值潜在变量优化目标是最小化预测流速与实际流速之间的误差c 包括子任务指令和初始观测值O0训练细节预测 49 帧分辨率 416x240持续训练 30,000 步批次大小 1,024学习率 1e-5。实验表明此阶段后的模型在遵循操作指令方面超越了 64B 的 Cosmos3 模型。阶段二块级视频模型后训练与蒸馏阶段 1 虽然泛化好但采样帧的时间间隔不固定导致与下游动作对齐困难。阶段 2 旨在解决时序一致性和推理速度问题。1. 块级视频模型后训练 (Chunk-level Post-training)目的预测固定时长 (fixed-duration)的未来视频块建立一致的时间尺度。设置人类手部操作预测 2 秒机器人操作预测 8 秒。数学表达设预测视野为 H 秒数据集帧率为 f fps则采样帧之间的标称间隔为 δf H/N。目标视频块为优化依然使用阶段 1 的流匹配目标但现在的数据是固定时间间隔的视频块2. 一致性蒸馏 (Consistency Distillation)目的将块级视频模型蒸馏为单步生成 (single-step generation)模型以满足实时推理需求。方法强制相邻流时间的终端预测保持一致性Fθ是学生模型Fθˉ是教师模型EMA参数。通过这种约束学生模型学会了在单次前向传播中从噪声直接生成清晰的视频潜在变量 Fθ(ϵ,0,c)。阶段 三动作专家预训练这是将视觉预测转化为实际机器人动作的最后一步动作专家的预训练数据基础使用经过前文所述“统一工作空间和末端执行器坐标系”处理过的双臂数据集架构一个0.9B 参数 (0.9B-parameter)的扩散 Transformer采用标准的混合 Transformer (MoT) 架构条件机制动作专家的生成条件是单步视频潜在变量注意力掩码 (Attention Mask)它允许视频 token和动作 token之间进行特定的交叉注意力计算确保动作生成能够充分利用视频预测的上下文信息。训练策略因为动作专家是新初始化的所以在动作训练的早期阶段冻结视频 DiT 的基础参数仅使用LoRA 微调来适配视频骨干网络推理延迟 将视频输入分辨率降低至 17×416×240并利用阶段 2 蒸馏出的单步生成 (one-step generation)模型视频模型生成耗时约0.12 秒动作专家生成动作块基于视频潜变量5 步去噪约0.1 秒每个动作块的总延迟约 0.22 秒。总结阶段 1 通过海量事件级数据让视频模型理解操作任务的物理规律和语义强泛化。阶段 2 通过固定时长后训练和一致性蒸馏让模型具备实时预测长视野未来的能力高效率。阶段 3 训练动作专家基于视频模型的单步预测结果直接输出可执行的动作块强执行3.2 VLM用于高级规划采用分层架构VLM充当高层规划器将模糊的人类指令拆分为明确子任务指令专注于将明确的指令映射为轨迹 (trajectories)。同时VLM 规划器不仅要输出子任务还要生成与训练时使用的标注模板相匹配的详细子任务描述。VLM 可以本地部署也可以通过 API 调用前沿的大模型如 GPT-4V 等4. 实验以及结果4.1 视频预测质量分析定量比较与基线模型Wan-2.1-I2V-14B-480pVPP2 的基础模型。LVP同样将 Wan-2.1-I2V-14B-480p 适配到操作任务的模型。Cosmos3-Nano-16B在机器人操作数据上广泛训练的模型。Cosmos3-Super-Image2Video-64BCosmos 3 系列中最强的模型64B参数。VPP2-Fixed-Step (消融实验)预测固定时长的未来块而不是完整的事件Event。作者指出这种方法可能会导致预测的未来与描述整个事件的指令错位。测试方法从先前的工作中随机抽取测试用例在办公环境和机器人工作空间中拍摄照片并搭配自由选择的操作指令分析模型视频预测的指令遵循成功率评估方法GPT 评估器、人类评估者结果如下所示4.2 策略执行结果分析真实世界 ALOHA 机器人的零样本性能实验设置直接将 VPP2 部署在训练期间见过的机器人本体ALOHA上无需任何特定任务的微调 (without task-specific fine-tuning)。对比基线 在相同数据上训练的 π0.5π0.5​ (Intelligence et al., 2025) 和 Fast-WAM (Wan-14B 版本)VPP2 在真实世界的零样本操作任务中具有压倒性优势LIBERO 基准测试作者在标准的 LIBERO 仿真基准上进行了测试在三种不同条件下评估LIBERO-ID (分布内)测量标准的分布内操作性能。LIBERO-Pro (分布外泛化)评估位置 (Position) 和任务 (Task) 扰动下的泛化能力。LIBERO-OOD (组合泛化)评估在空间、物体和目标维度上重新组合已知元素形成未见任务配置的能力。RoboDojo 基准测试测试结果如下结合子任务规划的 VPP2作者进一步探索了 VPP2 与 VLM视觉语言模型结合的潜力训练将演示轨迹分割成片段并将每个片段与一个子任务指令配对训练出“子任务条件策略”。测试VLM 利用视觉观察和执行反馈来选择下一个让 VPP2 执行的子任务。5. 总结引入了视频预测策略2VPP2这是一种WAM能够实现在视频预测和动作生成方面的强大零样本泛化。整个流程如下(1)事件级视频预训练整理了一个大规模、多样化的操控视频数据集以继续对基础视频模型进行预训练。我用详细的描述标注视频片段并进行事件级视频预训练以促进在开放式操控任务上的泛化能力。(2)单步视觉规划对视频模型进行训练后处理并将其蒸馏为一个具有固定预测时域的单步视觉规划器。(3)动作学习通过混合专家MoT架构引入动作模块以学习隐式逆动力学模型。

相关新闻

读懂GitHub日榜:从star增量到开源项目筛选实战

读懂GitHub日榜:从star增量到开源项目筛选实战

1. 日榜是怎么“算”出来的:Trending的收录与刷新逻辑1.1 公开活动窗口而非绝对热度我每天固定有一个动作:打开开源社区的日榜页面,花两分钟扫一遍当天多出来的那些仓库。很多刚接触的人会以为热榜上架的是“全网最火”的项目,其实…

2026/10/11 14:43:43 阅读更多 →
Spring Boot HTTPS配置实战:从SSL证书到双向认证与客户端调用

Spring Boot HTTPS配置实战:从SSL证书到双向认证与客户端调用

1. 为什么非要给Spring Boot套上HTTPS:一次对接把我从HTTP逼到了TLS 好几年前做某内部模拟项目的时候,我图省事,Spring Boot的接口全用HTTP。当时觉得反正在内网,拿到地址就能调,结果对接方的安全清单直接红字标注&…

2026/10/11 14:43:43 阅读更多 →
高频量化回测系统:从tick数据到真实撮合引擎

高频量化回测系统:从tick数据到真实撮合引擎

简介:本资源是一份面向量化交易初学者与进阶开发者的Python实战指南,聚焦高频交易策略的完整回测系统搭建,覆盖从环境配置、数据获取、策略设计到绩效评估与实盘模拟的全链路。文档结构严谨,含11大章节共142页,系统讲解…

2026/10/11 14:43:42 阅读更多 →

最新新闻

小区物业管理系统源码毕设实战:从架构到部署避坑全指南

小区物业管理系统源码毕设实战:从架构到部署避坑全指南

简介:这是一套小区物业管理系统的完整源码包,附带毕业论文,适合需要开发同类管理系统的程序员、计算机相关专业学生作为毕业设计或项目参考。资源包共含125个文件、大小约1.8MB,其中20个asp文件构成前台与后台核心功能&#xff0c…

2026/10/11 16:21:35 阅读更多 →
35个MCP工具大揭秘:Blitz如何让任意AI客户端完整驱动App Store Connect

35个MCP工具大揭秘:Blitz如何让任意AI客户端完整驱动App Store Connect

【免费下载链接】blitz-mac Native macOS App Store Connect tool with MCP. Submit iOS apps to App Store with AI agents 项目地址: https://gitcode.com/gh_mirrors/bl/blitz-mac 点击查看 免费下载 Blitz 是一款 macOS 原生应用,让 Claude Code、…

2026/10/11 16:21:35 阅读更多 →
鼠标宏科普:G502压枪宏的Lua脚本原理与DPI灵敏度调参指南

鼠标宏科普:G502压枪宏的Lua脚本原理与DPI灵敏度调参指南

简介:一份面向FPS玩家的罗技G502鼠标压枪宏配置包,适用于CS:GO、PUBG、Apex等全自动武器频繁交战的射击场景。资源共4个文件、约38KB,其中macro-G502.lua为核心宏脚本,提供可导入G-Hub的按键序列;G502-config.xml为预置…

2026/10/11 16:21:35 阅读更多 →
餐饮采购系统数据库建设:从Word清单到可计算结构化数据

餐饮采购系统数据库建设:从Word清单到可计算结构化数据

简介:本资源是一份面向餐饮信息化系统开发者、数据库设计人员及供应链管理从业者的专业文档,聚焦餐饮食品采购系统中核心的原材料清单数据库建设方案。文档系统梳理了蔬菜类食材的标准化编码体系(如VG/Asparagus, Green Large)、规…

2026/10/11 16:21:35 阅读更多 →
电信系下场开源,PaddleOCR 还坐得住吗:国产文档解析的版图要重排

电信系下场开源,PaddleOCR 还坐得住吗:国产文档解析的版图要重排

电信系下场开源,PaddleOCR 还坐得住吗:国产文档解析的版图要重排 【免费下载链接】TeleOCR 项目地址: https://ai.gitcode.com/XingChen-AGI/TeleOCR 2026 年 8 月,一个最初以 "NaviDC-OCR" 为名的模型静悄悄放出权重与技术…

2026/10/11 16:21:35 阅读更多 →
Oracle EBS R12月结关账顺序与子账对账SQL实战指南

Oracle EBS R12月结关账顺序与子账对账SQL实战指南

简介:本资源是一份面向Oracle EBS R12财务实施顾问、系统运维人员及财务信息化从业者的专业培训课件,聚焦财务月结核心流程与实操要点,系统解决多模块协同关账、数据一致性校验及常见异常排查等关键问题。课件为单个PPTX文件(2.9M…

2026/10/11 16:20:35 阅读更多 →

日新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 10:45:37 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:53 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:54 阅读更多 →