LaWAM:用于高效动态-觉察机器人策略的潜世界行动模型
26年6月来自清华、吉林大学、南开、北大、哈工大、中关村学院、正行创新Striding AI公司和无问芯穹Infinigence AI公司的论文“LaWAM: Latent World Action Models for Efficient Dynamics-Aware Robot Policies”。视觉-语言-动作模型VLAs利用大规模的视觉-语言预训练来实现语义机器人控制但通常缺乏对机器人动作如何改变场景的明确前瞻性。世界-动作模型WAMs通过将策略建立在预测未来的基础上来解决这一限制但现有方法通常依赖计算开销高且像素级冗余大的视频生成。LaWAM一种潜世界动作模型它通过紧凑的潜视觉子目标而不是重建的未来视频将预测动态信息呈现给机器人策略。LaWAM的核心是潜动作条件的潜世界模型LaWM。通过在预训练视觉基础模型的潜空间中训练潜动作模型并重用其前向解码器来预测场景演化的未来观测特征从而获得LaWM。然后LaWAM基于这些预测的潜视觉子目标来调节动作生成从而实现动态-觉察的机器人控制。LaWAM在LIBERO98.6%成功率、RoboTwin91.22%成功率以及真实世界的操作任务中达到了最先进或具有竞争力的成功率同时保持低延迟推理。LaWAM每次动作预测只需187毫秒其时钟墙延迟相比像素空间的WAMs低了最多24倍。如图 2 给出完整的两阶段预训练流程概述。首先将 LaWM 训练为一个潜动作条件的世界模型然后通过潜动作蒸馏对 LaWAM 进行预训练以实现子目标条件的动作生成。总体而言这一训练流程使用大约 3,000 小时的机器人视频和 1,500 小时的第一人称人类视频。在测试时策略会预测一个潜动作LaWM 会在一次前向传递中将其解码为潜视觉子目标然后动作专家根据当前上下文和预测的子目标生成动作片段。在针对不同基准的后续训练后LaWAM 在模拟基准和真实机器人任务中对强大的 VLA 和 WAM 基线表现出最先进或具有竞争力的成功率这些任务包括 LIBERO [21]、RoboTwin [22] 以及真实世界的抓取与放置、抽屉开启和毛巾折叠任务参数量为 23 亿。除了准确性之外图 1 显示 LaWAM 将非迭代潜在预测与一个紧凑的 2.3 亿参数 LaWM 相结合使用的世界建模参数比 50 亿参数的 WAN 主干 [23] 少约 95%。LaWAM 每次动作片段预测运行时间为 187 毫秒且实现的实际延迟比像素空间的 WAM 低多达 24 倍。第一阶段学习 LaWM 作为潜动作模型的前向解码器。每个训练样本包含一个当前观测 o 和一个在物理时间间隔 τ 后采样的远景观测 o_T。在将它们编码为 (u, u_T) 后逆动力学编码器推断潜动作 z ∼ q_φ (z | u, u_T)。然后解码器使用 (u, z) 来预测远景特征u ̃_T LaWM_ω(u, z)。这个训练设置给 LaWM 一个简单的角色在给定当前潜变量状态和潜变量动作的情况下预测未来的潜变量状态。目标 u_T 直接监督解码器而推断出的潜变量动作 z 则作为第二阶段策略先验的教师信号。在这个预训练阶段加入一个辅助信号。一个轻量级的预测器 g 将当前末端执行器状态 s 和潜变量动作 z 映射到未来状态 s_T鼓励 z 编码实际动作而不仅仅是视觉外观的变化。预训练完成后会丢弃这个辅助头只保留解码器作为 LaWM后验编码器仅用于生成策略训练的教师潜变量动作。第二阶段把预训练的 LaWM 变成了测试时的策略接口。第一阶段的 IDM 编码器在部署时不能使用因为它需要未来的特征 u_T 。因此训练策略先验 p_θ (zˆ | o, l) 来根据当前的观察和指令预测潜动作。预测的潜动作会传入预训练的 LaWM 解码器从而生成 uˆ_T LaWM_ω(u, zˆ)让策略能够对块级视觉未来进行潜预测而不需要生成未来的像素。动作专家通过交替DiTAlternate-DiT设计[5]使用这种预测的未来。一条流从VLM骨干网络传递语义上下文而另一条流则携带由(u, uˆ_T)形成的潜动态上下文。在这两条流之间交替让专家在去噪动作块时将任务意图与预测的场景演变结合起来。图3展示最终的块级执行动作专家生成一个基于预测潜子目标的机器人运动块而执行的动作会朝向相应的子目标区域移动。第二阶段训练结合潜动作蒸馏、子目标监督和动作流匹配。进一步应用知识隔离KI[37]以避免动作专家的梯度覆盖预训练的 LaWM 动力学。对于混合频率的机器人数据LaWAM 保持每个数据集的原生控制频率并使用物理时间编码。潜世界模型架构LaWM 在精炼的 DINOv3 ViT-B/16 编码器 [17] 的特征上运行。它的逆动力学编码器和解码器都是 24 层的 Transformer 模块。编码器采用了 V-JEPA2 风格的时空设计 [46]来自当前和远景观测的视觉补丁被展平成一个单独的 token 序列并共同处理以推断潜动作后验。与 Genie [16] 中使用的加性 token 注入不同解码器通过自适应层归一化对潜动作 z 进行条件处理这在跨实体设置中更稳定加性注入可能会因为潜动作范数的波动而导致视觉 token 的整体偏移并引发损失的急剧上升。辅助状态预测器使用轻量级 MLP 头来处理不同机器人实体间的状态语义不一致在 LaWM 训练后会被弃用。潜世界动作模型架构LaWAM 遵循 Qwen-GR00T 架构。用 Qwen3-VL 的前 16 层 Transformer 作为 VLM 主干并用四个 Alternate-DiT 模块实例化动作专家总共对应 16 层 Transformer。隐藏维度为 1024。策略输入序列包含主视角观测、任务指令、潜动作查询 token、可选辅助视角图像以及动作查询 token。所有非查询 token 都充当上下文。通过这种排序和因果注意力掩码潜在动作查询可以收集驱动 LaWM 所需的信息而动作查询仍然可以关注用于控制的完整语义上下文。动作专家通过 Alternate-DiT [5] 接收 LaWM 子目标它不仅在视觉流和语言流之间交替而是在完整的 VLM 隐状态和由当前潜视觉特征 u 与预测子目标特征 uˆ_T 构建的动态流之间交替。所有机器人动作标签都被转换为末端执行器 (EEF) 表示。在策略训练和评估期间不会提供本体感知状态输入这有助于避免对特定轨迹的状态轨迹过拟合并提高空间泛化能力 [47]。所有实验均使用仅 RGB 观测图像尺寸调整为 256 × 256。混合频率数据的物理时间对齐机器人数据集和下游实体可能在不同的控制频率下运行因此相同的动作 token 索引不一定表示相同的物理时间间隔。LaWAM 通过保持每个数据集或实体分支在其原生控制频率同时用固定物理间隔 τ 定义每个动作块来处理这个问题。这使得即使不同分支的离散动作 token 数量不同远景也对应一致的真实时间长度。混合频率训练实验这个实验旨在分离物理时间编码在混合源预训练中的作用。在那种情况下不同的控制频率会导致相同的离散动作索引对应不同的物理时间。在完整的预训练混合数据中直接量化这个效果是困难的因为数据集规模、体现方式、任务分布、摄像机设置和语言覆盖率都在同时变化。因此构建了一个受控的 LIBERO 分析并从零开始训练 LaWAM这样控制频率就是主要的操控变量。从相同的原生 20 Hz LIBERO 轨迹开始通过时间下采样创建 10 Hz 和 5 Hz 版本然后在组合的 5/10/20 Hz 数据上共同训练 LaWAM。这样可以保持各分支之间的任务分布、体现方式、视觉域和语言指令不变同时只改变离散动作索引与经过的物理时间之间的映射。由于低频分支是从相同的 20 Hz 演示中派生出来的混合频率训练并没有引入额外的专家轨迹在这个受控环境下原生 20 Hz 模型因此作为上限参考而不是较弱的数据基线。目标是测试物理时间编码是否能够通过解决混合频率训练带来的控制频率模糊问题从而恢复接近这个参考的性能。训练详情LaWM训练。对于LaWM训练用连续潜动作并利用16个H100 GPU优化等式4实现10万步采用AdamW学习率3×10⁻4权重衰减10⁻²全局批处理大小为10²⁻¹。将KL正则化权重设为β 10−5。固定的物理时间视角为机器人远程操作视频的1.2秒自我中心的人类视频为0.4秒。在 DINOv3 编码之前会对编码器和解码器的视图应用不同的随机裁剪和色彩增强同时保持每个编码器剪辑内的增强时间一致;这让LaWM不太愿意记忆具身特定的像素布局。LaWAM策略训练与评估。第二阶段策略集成使用带有显式语言指令的机器人轨迹。以自我为中心的人类视频通过LaWM先前学习的动态做出贡献但由于通常缺乏明确机器人预期行为的任务描述因此不被用于策略集成。轻量级查询聚合块在潜在动作蒸馏前将潜在动作查询映射到 zˆ。在所有实验中都设 λ_distill λ_wm 0.1。在基准测试专属的后训练之前在64个H100 GPU上运行20万步的LaWAM策略集成预训练阶段整体批处理规模为1024。在此阶段动作专家的学习率为10⁻⁴而其他模块则使用3×10⁻⁹的学习率。对于每个基准的后训练用带余弦衰减的学习率为10⁻4。除非另有说明所有政策均通过10个去噪步骤进行评估。为了测量推理延迟在A100 GPU上运行1000次重复动作块预测并报告平均墙钟延迟。论文中报道的WAM参数计数排除了视频扩散VAE和文本编码器后者大小可达10B参数。与最新的VLA、潜作用和WAM基线进行比较尽可能使用原始论文中的数据其他时间则取出最强的复现数据。真实世界实验协议用两个物理机器人平台如图所示。抓取与搬运以及抽屉开启任务在配备平行夹爪和外部RGB摄像头的Franka Emika Panda机械臂上进行摄像头用于观察工作空间而折叠毛巾任务则在Quanta X1双臂机器人上进行。为每个Franka任务训练了150次真实演示为折叠毛巾训练了280次演示并在30次真实实验中评估每个任务覆盖已知环境和未知测试环境。为了保证对比的可控性每个任务使用的初始配置只生成一次然后在LaWAM和所有基准方法中保持固定以确保所有方法都在相同的物理条件下进行评估。

相关新闻

Creo二次开发:基于元素树的特征程序化创建与复制技术详解

Creo二次开发:基于元素树的特征程序化创建与复制技术详解

1. 项目缘起:为什么需要从元素树创建特征?在Creo的二次开发世界里,我们常常会遇到一个看似简单却颇为棘手的需求:如何在不依赖用户交互界面的情况下,程序化地、精确地复现一个已有的特征?比如,你…

2026/8/7 5:05:54 阅读更多 →
C++大整数加法实现:突破内置类型限制的竖式模拟算法详解

C++大整数加法实现:突破内置类型限制的竖式模拟算法详解

1. 项目概述:当数字溢出时,我们该怎么办?在C编程的日常里,int、long long这些内置数据类型是我们的得力干将,处理日常计算游刃有余。但你是否遇到过这样的场景:需要计算两个天文数字的加法,比如…

2026/8/7 5:05:54 阅读更多 →
UE4打包后视频播放失败?三步搞定Movies文件夹配置

UE4打包后视频播放失败?三步搞定Movies文件夹配置

1. 项目概述:从编辑器到打包,视频播放为何“失声”?在虚幻引擎4(UE4)项目中集成视频播放功能,是很多开发者都会遇到的需求,无论是用于播放开场动画、UI背景还是场景内的电视屏幕。在编辑器里&am…

2026/8/7 5:05:54 阅读更多 →

最新新闻

C语言五子棋AI实战:从随机到搜索算法的智能实现

C语言五子棋AI实战:从随机到搜索算法的智能实现

1. 项目概述:从棋盘到智能的C语言之旅五子棋,这个规则简单却变化无穷的棋盘游戏,一直是检验AI策略的经典沙盒。你可能玩过不少五子棋游戏,但有没有想过亲手用C语言,从零开始构建一个能与你对弈的AI?这听起来…

2026/8/7 5:46:22 阅读更多 →
腾讯云服务器部署幻兽帕鲁私服:从零搭建与运维指南

腾讯云服务器部署幻兽帕鲁私服:从零搭建与运维指南

1. 从零到一:为什么要在云上搭建《幻兽帕鲁》私服?如果你和我一样,是个《幻兽帕鲁》的深度玩家,肯定经历过官方服务器的“折磨”:高峰期排队、延迟飘红、偶尔的服务器维护,还有最要命的——和陌生玩家共享世…

2026/8/7 5:46:22 阅读更多 →
从图解到代码:深入理解LSTM门控机制与梯度流设计

从图解到代码:深入理解LSTM门控机制与梯度流设计

1. 从“黑盒”到“白盒”:为什么我们需要重新理解LSTM如果你接触过深度学习,尤其是序列建模,那么LSTM(长短期记忆网络)这个名字你一定不陌生。它被誉为解决RNN梯度消失问题的“神器”,是自然语言处理、时间…

2026/8/7 5:46:22 阅读更多 →
华为S2700/S6700交换机小型园区网络配置实战与排错指南

华为S2700/S6700交换机小型园区网络配置实战与排错指南

1. 项目概述:为什么小型园区网络值得单独聊聊最近在帮一个朋友的公司做网络改造,他们租了一栋三层小楼,大概一百来号人,典型的“小型园区”场景。朋友之前用的是几台家用路由器桥接,网络卡顿、无线掉线是家常便饭&…

2026/8/7 5:46:22 阅读更多 →
PCB屏蔽罩设计实战:从电磁屏蔽原理到EMC测试避坑指南

PCB屏蔽罩设计实战:从电磁屏蔽原理到EMC测试避坑指南

1. 项目概述:为什么屏蔽罩是PCB设计的“隐形守护者”在硬件工程师的日常里,PCB设计总是充满了各种权衡与妥协。信号要快,干扰要少,空间要省,成本要控。当你埋头于差分对等长、电源完整性仿真这些“高大上”的课题时&am…

2026/8/7 5:46:22 阅读更多 →
Unity Slider自定义事件:实现拖拽实时反馈与UI事件系统扩展

Unity Slider自定义事件:实现拖拽实时反馈与UI事件系统扩展

1. 项目概述:为什么Unity的Slider需要自定义事件?如果你在Unity里做过UI,尤其是用过Slider(滑动条),大概率遇到过这样的场景:你想在滑块值变化的每一帧都做点事情,比如实时更新一个数…

2026/8/7 5:45:21 阅读更多 →

日新闻

为什么scrcpy成为Android投屏的终极解决方案:完整实战指南

为什么scrcpy成为Android投屏的终极解决方案:完整实战指南

为什么scrcpy成为Android投屏的终极解决方案:完整实战指南 【免费下载链接】scrcpy Display and control your Android device 项目地址: https://gitcode.com/GitHub_Trending/sc/scrcpy 想要将Android手机屏幕完美投射到电脑上,享受大屏操作的自…

2026/8/7 0:00:19 阅读更多 →
如何在5分钟内掌握Tom Select:打造现代化表单选择器的终极指南

如何在5分钟内掌握Tom Select:打造现代化表单选择器的终极指南

如何在5分钟内掌握Tom Select:打造现代化表单选择器的终极指南 【免费下载链接】tom-select Tom Select is a lightweight (~16kb gzipped) hybrid of a textbox and select box. Forked from selectize.js to provide a framework agnostic autocomplete widget wi…

2026/8/7 0:00:19 阅读更多 →
5分钟快速上手:NSZ压缩工具终极指南,轻松管理Switch游戏文件

5分钟快速上手:NSZ压缩工具终极指南,轻松管理Switch游戏文件

5分钟快速上手:NSZ压缩工具终极指南,轻松管理Switch游戏文件 【免费下载链接】nsz NSZ - Homebrew compatible NSP/XCI compressor/decompressor 项目地址: https://gitcode.com/gh_mirrors/ns/nsz 你是否在为Nintendo Switch游戏文件占用大量存储…

2026/8/7 0:00:19 阅读更多 →

周新闻

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

1. 从水管网络到最大流:一个核心问题的诞生想象一下,你是一个城市供水系统的总工程师。你的城市有多个水源(水库),需要通过一个复杂的地下管道网络,将水输送到各个居民区。每条管道都有其最大通水能力&…

2026/8/6 22:02:27 阅读更多 →
基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台…

2026/8/6 22:02:27 阅读更多 →
MATLAB xcorr函数详解:从互相关原理到四大实战应用

MATLAB xcorr函数详解:从互相关原理到四大实战应用

1. 从一次信号“找茬”说起:为什么我们需要互相关几年前,我在处理一组声学传感器数据时遇到了一个棘手的问题。我有两个麦克风记录了一段相同的音频信号,理论上它们接收到的声音波形应该非常相似,只是由于麦克风位置不同&#xff…

2026/8/6 22:02:27 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/5 23:28:39 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/6 22:02:28 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/5 23:46:51 阅读更多 →