【免费下载链接】boundless-world-modelHigh-fidelity world models for general embodied intelligence, such as data engines and world simulators.项目地址https://gitcode.com/gh_mirrors/bo/boundless-world-model点击查看免费下载Boundless-World-ModelBWM是一个基于 Wan2.2 的高保真具身智能世界模型它把机器人的动作序列注入扩散模型从而看见并预测机械臂操作的未来画面可用作数据引擎与世界仿真器。本文用极少量代码拆透 BWM 的adaln全局调制与noise逐帧注入两种动作注入机制讲清它们注入在哪、注入什么、各自适合什么场景。一、世界模型是什么让扩散模型预测操作的下一个画面普通文生视频模型靠文字提示词生成画面。而具身世界模型多了一个关键输入——动作。想象一个会读心的导演你给他两段信息开场画面机器人此刻看到的第一帧图像动作剧本接下来每一帧机械臂末端往哪走、夹爪开或合。导演就能脑补出接下来几十帧的画面——物体被拿起、盖子被打开、碗被叠好。这个根据动作推演未来的能力就叫世界模型它是训练机器人策略、生成训练数据的廉价高保真仿真器。BWM 的技术底座是Wan2.2-TI2V-5B视频扩散模型DiT 架构并额外挂了一个动作编码器负责把动作剧本翻译成扩散模型听得懂的语言。整个动作注入流程由 wan_video_action.py 中的流水线组装完成其设计遵循Unit 只负责准备条件、model_fn负责张量计算的解耦原则详见 docs/pipeline_unit_design.md。二、动作编码器把 14 维机械臂动作翻译成扩散模型能懂的语言14 维动作向量这一帧机器人该做什么BWM 默认用eef_delta双臂末端增量表示动作每帧是一个14 维向量双臂的末端位姿增量平移 旋转与夹爪开合状态。数据加载与归一化由 operators.py 中的LoadCobotAction完成——它读取 Parquet 中的动作并用demo/stat.json里的分位数统计把数值缩放到 [-1, 1]让不同机器人数值范围差异不影响训练。两条 MLP逐帧上下文 与 分组调制核心是 wan_video_action_encoder.py 中的WanVideoActionEncoder。它把 14 维动作映射到1536 维与 Wan DiT 的隐藏维度一致内部有两条不同的 MLP 通路通路输入输出作用action_mlp1单帧 14 维动作逐帧 1536 维嵌入细粒度每帧做什么上下文action_mlp24 帧动作拼接56 维分组 1536 维嵌入粗粒度这一段做什么调制为什么要4 帧一组因为 VAE 会把4 个视频帧压缩成 1 个潜帧。81 帧视频 → 21 个潜帧动作也按 4 帧一组对齐到 21 个潜帧才能和时间轴一一对应。这个双路编码设计是理解后文两种注入模式的关键源码注释详见 docs/wan_video_action_encoder_notes.md。三、noise 模式逐帧动作注入空间对齐的细粒度控制noise逐帧注入的思路非常直接把每一帧的动作嵌入直接加到视频潜变量上动作和画面在空间、时间上严格对齐。# noise 模式把逐帧动作广播到每个空间 patch再叠加到潜变量 x action_emb rearrange(action_emb, b f d - b d f 1 1) action_emb repeat(action_emb, b d f 1 1 - b d f h w, hh, ww) x x action_emb它就像逐帧下命令第 5 帧的潜变量只听第 5 帧动作的话。动作信号从视频最底层潜空间入口就进入了网络因此对逐帧轨迹的精细对齐非常有利。优点粒度最细动作与画面一一对应适合需要精确逐帧控制的轨迹。代价每帧都引入独立信号长时程一致性更依赖网络自身。训练配置见 train_action_noise.yaml。四、adaln 模式全局动作注入用 AdaLN 调制整个网络adaln全局/分组调制换了个注入点不让动作直接碰潜变量而是让它调制网络本身。先理解一个概念——AdaLN自适应层归一化扩散模型的每个 Transformer 块内部都有 LayerNormAdaLN 会根据条件动态生成 LayerNorm 的缩放scale和平移shift参数。在视频 DiT 里这个条件默认是扩散时间步 t。BWM 的天才之处在于把动作嵌入直接加到时间嵌入 t 上让动作搭着时间的车一起调制网络的每一层。在 Wan2.2 发布版实现里encode_ti2v2产出的两路嵌入分别走两条通道见 wan_video_action.py# adaln 模式动作进入上下文 时间调制两条通道 context torch.cat([context, action_emb], dim1) # 细粒度走 cross-attention t t action_mod_emb # 全局走 AdaLN 时间调制action_emb逐帧上下文拼进 cross-attention 的上下文让每帧都能读到自己的动作意图action_mod_emb分组调制加到时间嵌入 t 上经time_projection生成 6 组 AdaLN 参数非侵入式地调制网络每一层的 scale/shift。优点非侵入式不改 DiT 结构全局一致性强长时程 rollout 更稳定是 BWM 数据引擎的主力模式。代价单点注入偏全局逐帧细节靠上下文通路补强。训练配置见 train_action_adaln.yaml推理配置见 infer.yaml。更多 AdaLN 时间嵌入、动作加性的详细逐行注释见 docs/wan_video_action_notes.md。五、对比选型noise 与 adaln 到底怎么选维度noise逐帧注入adaln全局/分组调制注入位置潜变量入口x x action_emb时间嵌入t驱动 AdaLN 调制控制粒度逐帧、空间严格对齐全局 4 帧分组对齐潜帧是否改结构否加性注入否非侵入调制细粒度轨迹强靠 cross-attention 补强长时程一致性依赖网络自身更强适合长 rollout典型配置action_mode: noiseaction_mode: adaln一句话选型想抠逐帧轨迹精度用 noise想要长时程稳定、省显存跑数据引擎用 adaln。两者都通过同一个参数action_mode一键切换。六、一键切换 action_mode从 YAML 配置到推理运行切换注入模式不需要改代码只需改配置里的一个字段。action_mode支持noise/adaln/none三档定义见 parsers.py训练python scripts/train.py --config configs/train/train_action_adaln.yaml推理先按scripts/local.example.sh配好权重路径再bash scripts/infer_example.sh推理时动作由 WanVideoUnit_ActionEmbedder 单元统一调用编码器并自动把动作帧对齐到历史帧 未来帧的自回归窗口scripts/infer.py 中的_run_autoregressive会滚动扩展未来帧让 BWM 逐段续写整条操作视频。七、效果验证动作注入如何让 BWM 登顶 WorldArena正是这套双注入机制让 BWM 在CVPR 2026 WorldArena Challenge中表现突出——在开源模型里拿下 Track 1 与 Track 2 数据引擎的榜首BWM-fast 更是登上 Track 1 总成绩第二从榜单可以看到高保真动作注入直接支撑了数据引擎这一世界模型核心任务——用低成本动作条件生成替代昂贵的真机采集。八、小结三种世界模型任务对应三种注入策略回到开头的问题——机器人动作如何注入扩散模型BWM 给了两种工程上都很优雅的解法noise把动作加到潜变量上逐帧空间对齐细粒度控制adaln把动作加到时间嵌入上经 AdaLN 非侵入式调制整个网络全局稳定。两者共用同一个动作编码器与action_mode开关按任务需求逐帧精度 vs 长时程数据引擎灵活切换。想动手上手可从 README.md 的 Quick Start 装环境、跑推理再对照 configs/README.md 调整实验超参——这套动作注入扩散模型的完整链路就是你理解具身智能世界模型的一把钥匙。赞分享【免费下载链接】boundless-world-modelHigh-fidelity world models for general embodied intelligence, such as data engines and world simulators.项目地址https://gitcode.com/gh_mirrors/bo/boundless-world-model点击查看免费下载相关推荐PipelineUnit设计模式拆解Boundless-World-Model如何用责任链让扩散模型预处理模块化PipelineUnit设计模式拆解Boundless World Model如何用责任链让扩散模型预处理模块化 Boundless World Model解剖 WanVideoActionEncoderBoundless-World-Model 如何将 14 维机器人动作序列压缩为 1536 维嵌入解剖 WanVideoActionEncoderBoundless World Model 如何将 14 维机器人动作序列压缩为 1536 维嵌入 BoundCog Model Source 详解模型作者如何用 cog.yaml、Runner 与类型注解定义机器学习模型Cog Model Source 详解模型作者如何用 cog.yaml、Runner 与类型注解定义机器学习模型 本篇指南围绕 Cog 的模型源ModelMLOps容器模型推理服务开发工具创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考