把动作「画」给视频世界模型,跨本体双向推演,李飞飞参与
如果要让机械臂把咖啡机旁的杯子移到桌上需要经历哪几个步骤在模型驱动规划中它需要先生成多条候选动作再交给世界模型预演根据预演结果决定如何执行动作。其中视频世界模型通常会接收当前画面以及关节角、末端位姿、夹爪状态等数值动作生成执行动作后的未来视频。可问题在于对视觉模型来说要建立某组数字和画面动作之间的对应关系需要额外的学习。并且这种学习依赖特定机器人产生的训练数据换一台机器人这些数据的结构还会全部改变。既然视觉模型更熟悉画面为什么不干脆把动作也「画」给它看近日斯坦福大学、马里兰大学帕克分校和哈佛大学的研究团队发布论文《Masked Visual Actions for Unified World Modeling》。第一作者为 Hadi Alzayer李飞飞、吴佳俊、张吕敏等研究者参与。研究团队提出 Masked Visual Actions将机器人的候选动作渲染成像素级运动轨迹再让视频模型补全环境的响应改变输入的实体后同一个模型还能在两个方向上工作给出机器人怎么动预测环境会如何变化给出目标物体怎么动生成机器人可能采取的行为。模型微调用了约 15 小时的机器人交互数据同一个模型可以支持正向预测、逆向生成、多种机器人本体、策略评估和模型规划。在 RoboCasa 任务中视频模型辅助规划带来了 7 至 26 个百分点的成功率提升模型预测的策略表现与真实仿真结果达到 0.982 的相关系数逆向动作提取管线在 CoffeeServeMug 任务上取得 90% 的成功率。翻译成视频就容易看懂了视频世界模型直接预测未来图像或视频常见工作方式可以概括为当前图像数值动作序列 → 未来视频。数值动作能够精确控制机器人却与视频模型熟悉的像素信息存在表示差异。从一串动作数据到最终画面中间还隔着多层转换动作数据 → 机器人姿态 → 相机投影 → 画面运动 → 环境响应。Masked Visual Actions 提前完成了这层转换。训练数据通过两种方式构造。一种是直接从真实视频中分割机械臂另一种是根据机器人状态、URDF 模型和相机参数渲染其运动。前者保留真实视觉信息后者方便在推理时自由输入新的动作轨迹。视频模型接收初始画面和这段机器人轨迹再补全物体与环境的变化。相比末端执行器点或机器人骨架完整掩码还包含机器人的形状、占用空间、遮挡关系和潜在接触边界模型能够直接「看」到动作过程。这种表示也带来了更好的跨机器人本体泛化能力。在 DROID 训练分布内完整掩码、末端执行器位置和机器人骨架都能较好地控制视频生成差距并不明显。在训练分布内三种视觉条件表现接近但当测试对象换成训练中未见过的自定义夹爪或直接换成 BEHAVIOR 中的双臂机器人后差距迅速拉开。换成双臂机器人后完整像素掩码对机器人形态的保持明显更稳定。末端点和骨架只提供稀疏的运动信息模型容易将新机器人改写成训练时见过的形态甚至凭空生成另一台机器人直接接收原始动作状态的 Ctrl-World在双臂机器人上也容易生成静止或损坏的画面。Masked Visual Actions 则直接给出新本体的完整轮廓与运动因此能够较稳定地保留机器人形态并继续预测它与环境的交互。换句话说不同机器人的关节数量、动作维度和控制方式可以完全不同但进入视频模型后都被转换成了同一种信息这让跨机器人本体泛化成为可能。两种填空方式零样本切换逆向建模在此之前已经有一些尝试证明了「把 URDF 机器人渲染成掩码并用作视频模型条件」这一思路的可行性例如BridgeV2W 将机器人动作渲染成像素对齐的本体掩码再注入预训练视频模型。这种表示能缩小动作坐标空间与视频像素空间之间的差距并支持不同机器人本体。与之相比Masked Visual Actions 把问题进一步抽象为一段交互视频中可以提供任意一部分实体的运动参考再让模型补全其余实体。用填空题类比BridgeV2W 的题目基本固定为已知机器人动作填写环境部分。Masked Visual Actions 则把它概括成已知交互中的部分实体填写剩余部分。于是模型获得了一种逆向使用方式希望物体这样运动机器人应该怎么动实际上论文中的模型主要使用机器人掩码进行正向训练推理时却能直接接收目标物体轨迹零样本转向逆向建模。作者认为这种能力来自视觉条件与视频模型内部表征之间的对齐。在更完整的机器人系统中这两种推理也许可以连续配合。机器人接到 “把杯子放到桌上” 的任务后逆向推理先提出可能的动作方案正向模型再预演这些方案的结果系统选择可靠轨迹并执行。完成一小段动作后摄像头重新观察场景再进入下一轮规划。更少的数据更彻底的接口统一研究团队基于 Wan-Fun-Control 2.2 14B 进行 LoRA 微调数据来自 DROID 真实机器人视频和 RoboCasa 仿真环境包含成功与失败轨迹。其中失败样本十分关键。世界模型需要学会错误动作会产生什么结果否则它可能对每一条候选轨迹都生成一个看似成功的未来。论文中还提到模型微调使用了约 15 小时的机器人交互数据。附录显示训练数据约包括 1000 条 DROID 演示和 4000 条 RoboCasa 样本。模型使用 8 张 H200 训练约 10000 步耗时 4 天。这套系统依赖 14B 基础模型和较强硬件整体并不轻量。它的数据效率主要体现在不需要从头训练机器人世界模型而是通过少量机器人样本激活视频模型已有的运动、接触与物体交互知识并覆盖了多种能力预测机器人动作产生的环境变化根据目标物体运动生成机器人行为适应训练中未出现的机器人本体以及从生成视频中提取可执行行为等。实验结果实验中先由 Diffusion Policy 为同一场景采样多条候选动作后视频模型生成对应未来Gemini 3.1 Pro 再从任务进度、物理真实性和接触情况等方面评价每段视频最后选择最优动作执行。模型规划在关闭微波炉、打开抽屉、打开洗碗机、关闭冰箱等任务中加入视频模型规划后成功率获得了 7 至 26 个百分点的提升。候选数量增加时整体表现也随之提高。这相当于为机器人增加推理时计算原有策略负责提出方案视频模型负责预演视觉语言模型负责筛选。策略参数保持不变系统通过比较更多未来提高决策质量。策略评估作者将同一套机器人策略分别放进 RoboCasa 仿真环境和视频世界模型中执行。模型生成视频中的成功率与真实仿真结果达到 0.982 的相关系数。在真实机器人实验中生成视频所体现的任务进度与实际演示也较为接近。模型仍然存在明显的乐观倾向常常想象出比现实更多的任务进展。因此它更适合作为策略开发早期的低成本筛查工具距离替代仿真器和实机测试还有较大距离。逆向动作提取在 CoffeeServeMug 任务中系统输入杯子的目标运动视频模型生成机械臂完成操作的过程逆动力学模型再提取可执行动作。完整管线取得 90% 的成功率高于论文中对比的 Diffusion Policy、ACT 和 SmolVLA。这里的 90% 来自 “视频模型逆动力学模型” 的组合。视频模型提供行为过程逆动力学模型负责把过程还原为控制数据。总结Masked Visual Actions 将机器人动作、环境响应和结果评价放入同一个视觉空间并将正向预测与逆向生成统一为条件视频补全。它也清楚地展示了视频模型在机器人系统中的一种分工方式策略提出动作视频模型预演未来视觉语言模型评价结果控制器完成实际执行。现阶段这套方法仍受到基础视频模型能力的限制。模型学习的是交互相关性缺少严格的因果与物理约束仍会出现无接触运动、物体瞬移和任务结果凭空完成等现象。视频生成的速度和成本也限制了实时闭环控制。逆向流程还需要额外的逆动力学模型最终执行始终依赖数值动作和底层控制器。

相关新闻

深度学习在鞋类自动分类中的实践与优化

深度学习在鞋类自动分类中的实践与优化

1. 项目背景与核心价值去年帮导师带本科生毕业设计时,遇到一个特别有意思的选题——用深度学习做鞋类自动分类。这个看似简单的任务背后,其实藏着计算机视觉领域的多个技术挑战。从学生提交的初版代码来看,准确率始终卡在75%上下,…

2026/7/24 16:05:43 阅读更多 →
基于LangChain与LangGraph的智能安全日志分析实践

基于LangChain与LangGraph的智能安全日志分析实践

1. 项目背景与核心价值去年在帮某金融机构做安全日志分析时,我深刻感受到传统SOC(安全运营中心)的痛点:每天要处理TB级日志,安全团队淹没在告警海洋中,真实威胁往往被大量误报掩盖。当时我们尝试用规则引擎…

2026/7/24 16:05:43 阅读更多 →
YOLOv10在香蕉成熟度检测中的应用与实践

YOLOv10在香蕉成熟度检测中的应用与实践

1. 项目背景与核心价值在生鲜供应链和零售行业,香蕉成熟度的准确判断一直是个痛点问题。传统人工分拣方式效率低下且主观性强,不同质检员对颜色标准的判断可能存在明显差异。我们团队开发的这套基于YOLOv10的香蕉成熟度检测系统,通过计算机视…

2026/7/24 16:05:43 阅读更多 →

最新新闻

GitHub中文插件:3分钟告别英文界面,打造专属中文GitHub环境

GitHub中文插件:3分钟告别英文界面,打造专属中文GitHub环境

GitHub中文插件:3分钟告别英文界面,打造专属中文GitHub环境 【免费下载链接】github-chinese GitHub 汉化插件,GitHub 中文化界面。 (GitHub Translation To Chinese) 项目地址: https://gitcode.com/gh_mirrors/gi/github-chinese 还…

2026/7/24 16:13:45 阅读更多 →
DownKyi终极教程:如何轻松下载B站8K超高清视频的完整指南

DownKyi终极教程:如何轻松下载B站8K超高清视频的完整指南

DownKyi终极教程:如何轻松下载B站8K超高清视频的完整指南 【免费下载链接】downkyi 哔哩下载姬downkyi,哔哩哔哩网站视频下载工具,支持批量下载,支持8K、HDR、杜比视界,提供工具箱(音视频提取、去水印等&am…

2026/7/24 16:13:45 阅读更多 →
Django毕设项目: 基于 Django 的宿舍后勤服务管理系统 校园宿舍数据统计可视化管理系统(源码+文档,讲解、调试运行,定制等)

Django毕设项目: 基于 Django 的宿舍后勤服务管理系统 校园宿舍数据统计可视化管理系统(源码+文档,讲解、调试运行,定制等)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/7/24 16:13:45 阅读更多 →
SAR ADC评估板实战指南:从硬件配置到性能分析

SAR ADC评估板实战指南:从硬件配置到性能分析

1. 项目概述:从芯片到系统,如何用好一块ADC评估板 在信号链设计的江湖里,模数转换器(ADC)的地位,就好比是连接现实世界与数字王国的“翻译官”。无论是工业传感器输出的微弱电流,还是医疗设备捕…

2026/7/24 16:13:45 阅读更多 →
GPT2模型原理与PyTorch实现详解

GPT2模型原理与PyTorch实现详解

1. GPT2模型概述GPT2是OpenAI在2019年推出的基于Transformer架构的语言模型,作为GPT系列的第二代产品,它在自然语言处理领域具有里程碑意义。这个模型最引人注目的特点是其强大的文本生成能力,能够根据给定的提示(prompt&#xff…

2026/7/24 16:13:45 阅读更多 →
企业级AI模型落地实战手册(2024最新版):从LLM到多模态,7类业务场景匹配矩阵首次公开

企业级AI模型落地实战手册(2024最新版):从LLM到多模态,7类业务场景匹配矩阵首次公开

更多请点击: https://kaifayun.com 第一章:企业AI模型选择建议 企业在构建AI能力时,模型选择不应仅聚焦于“最新”或“最大”,而需围绕业务目标、数据特征、运维成本与合规要求进行系统性权衡。盲目采用超大规模闭源模型可能导致…

2026/7/24 16:12:45 阅读更多 →

日新闻

用Highcharts 创建可拖拽三维散点立方体3D图表

用Highcharts 创建可拖拽三维散点立方体3D图表

该案例基于Highcharts scatter3d 三维散点图实现空间立方体散点可视化,核心特色:三维 X/Y/Z 三轴空间,所有散点分布在 0~10 立方体空间内;散点使用径向渐变实现立体 3D 圆球质感;支持鼠标 / 触屏拖拽画布,…

2026/7/24 0:00:29 阅读更多 →
AppCertDlls:进程创建路径上的 DLL 入口

AppCertDlls:进程创建路径上的 DLL 入口

AppCertDlls:进程创建路径上的 DLL 入口 AppCertDlls 位于 HKLM\System\CurrentControlSet\Control\Session Manager\AppCertDlls。本文的程序功能是只读列出这个键在 64 位和 32 位注册表视图中的全部值,并显示每条值的来源、名称、类型和可安全显示的数…

2026/7/24 0:00:29 阅读更多 →
我的编程之路:第一篇博客

我的编程之路:第一篇博客

大家好,我是一名编程初学者,同时这也是我编程学习之路上的第一篇博客。在这里,我想要向大家介绍我的一些想法和规划。a.自我介绍我是一个刚刚接触编程的新手,目前在学习c语言,我对编程世界充满了强烈的好奇。当然&…

2026/7/24 0:00:29 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/24 3:59:20 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/24 1:23:39 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/23 17:49:47 阅读更多 →

月新闻