机器人动作如何注入扩散模型?Boundless-World-Model 的 adaln 与 noise 双注入机制全拆解
【免费下载链接】boundless-world-modelHigh-fidelity world models for general embodied intelligence, such as data engines and world simulators.项目地址https://gitcode.com/gh_mirrors/bo/boundless-world-model点击查看免费下载Boundless-World-ModelBWM是一个基于 Wan2.2 的高保真具身智能世界模型它把机器人的动作序列注入扩散模型从而看见并预测机械臂操作的未来画面可用作数据引擎与世界仿真器。本文用极少量代码拆透 BWM 的adaln全局调制与noise逐帧注入两种动作注入机制讲清它们注入在哪、注入什么、各自适合什么场景。一、世界模型是什么让扩散模型预测操作的下一个画面普通文生视频模型靠文字提示词生成画面。而具身世界模型多了一个关键输入——动作。想象一个会读心的导演你给他两段信息开场画面机器人此刻看到的第一帧图像动作剧本接下来每一帧机械臂末端往哪走、夹爪开或合。导演就能脑补出接下来几十帧的画面——物体被拿起、盖子被打开、碗被叠好。这个根据动作推演未来的能力就叫世界模型它是训练机器人策略、生成训练数据的廉价高保真仿真器。BWM 的技术底座是Wan2.2-TI2V-5B视频扩散模型DiT 架构并额外挂了一个动作编码器负责把动作剧本翻译成扩散模型听得懂的语言。整个动作注入流程由 wan_video_action.py 中的流水线组装完成其设计遵循Unit 只负责准备条件、model_fn负责张量计算的解耦原则详见 docs/pipeline_unit_design.md。二、动作编码器把 14 维机械臂动作翻译成扩散模型能懂的语言14 维动作向量这一帧机器人该做什么BWM 默认用eef_delta双臂末端增量表示动作每帧是一个14 维向量双臂的末端位姿增量平移 旋转与夹爪开合状态。数据加载与归一化由 operators.py 中的LoadCobotAction完成——它读取 Parquet 中的动作并用demo/stat.json里的分位数统计把数值缩放到 [-1, 1]让不同机器人数值范围差异不影响训练。两条 MLP逐帧上下文 与 分组调制核心是 wan_video_action_encoder.py 中的WanVideoActionEncoder。它把 14 维动作映射到1536 维与 Wan DiT 的隐藏维度一致内部有两条不同的 MLP 通路通路输入输出作用action_mlp1单帧 14 维动作逐帧 1536 维嵌入细粒度每帧做什么上下文action_mlp24 帧动作拼接56 维分组 1536 维嵌入粗粒度这一段做什么调制为什么要4 帧一组因为 VAE 会把4 个视频帧压缩成 1 个潜帧。81 帧视频 → 21 个潜帧动作也按 4 帧一组对齐到 21 个潜帧才能和时间轴一一对应。这个双路编码设计是理解后文两种注入模式的关键源码注释详见 docs/wan_video_action_encoder_notes.md。三、noise 模式逐帧动作注入空间对齐的细粒度控制noise逐帧注入的思路非常直接把每一帧的动作嵌入直接加到视频潜变量上动作和画面在空间、时间上严格对齐。# noise 模式把逐帧动作广播到每个空间 patch再叠加到潜变量 x action_emb rearrange(action_emb, b f d - b d f 1 1) action_emb repeat(action_emb, b d f 1 1 - b d f h w, hh, ww) x x action_emb它就像逐帧下命令第 5 帧的潜变量只听第 5 帧动作的话。动作信号从视频最底层潜空间入口就进入了网络因此对逐帧轨迹的精细对齐非常有利。优点粒度最细动作与画面一一对应适合需要精确逐帧控制的轨迹。代价每帧都引入独立信号长时程一致性更依赖网络自身。训练配置见 train_action_noise.yaml。四、adaln 模式全局动作注入用 AdaLN 调制整个网络adaln全局/分组调制换了个注入点不让动作直接碰潜变量而是让它调制网络本身。先理解一个概念——AdaLN自适应层归一化扩散模型的每个 Transformer 块内部都有 LayerNormAdaLN 会根据条件动态生成 LayerNorm 的缩放scale和平移shift参数。在视频 DiT 里这个条件默认是扩散时间步 t。BWM 的天才之处在于把动作嵌入直接加到时间嵌入 t 上让动作搭着时间的车一起调制网络的每一层。在 Wan2.2 发布版实现里encode_ti2v2产出的两路嵌入分别走两条通道见 wan_video_action.py# adaln 模式动作进入上下文 时间调制两条通道 context torch.cat([context, action_emb], dim1) # 细粒度走 cross-attention t t action_mod_emb # 全局走 AdaLN 时间调制action_emb逐帧上下文拼进 cross-attention 的上下文让每帧都能读到自己的动作意图action_mod_emb分组调制加到时间嵌入 t 上经time_projection生成 6 组 AdaLN 参数非侵入式地调制网络每一层的 scale/shift。优点非侵入式不改 DiT 结构全局一致性强长时程 rollout 更稳定是 BWM 数据引擎的主力模式。代价单点注入偏全局逐帧细节靠上下文通路补强。训练配置见 train_action_adaln.yaml推理配置见 infer.yaml。更多 AdaLN 时间嵌入、动作加性的详细逐行注释见 docs/wan_video_action_notes.md。五、对比选型noise 与 adaln 到底怎么选维度noise逐帧注入adaln全局/分组调制注入位置潜变量入口x x action_emb时间嵌入t驱动 AdaLN 调制控制粒度逐帧、空间严格对齐全局 4 帧分组对齐潜帧是否改结构否加性注入否非侵入调制细粒度轨迹强靠 cross-attention 补强长时程一致性依赖网络自身更强适合长 rollout典型配置action_mode: noiseaction_mode: adaln一句话选型想抠逐帧轨迹精度用 noise想要长时程稳定、省显存跑数据引擎用 adaln。两者都通过同一个参数action_mode一键切换。六、一键切换 action_mode从 YAML 配置到推理运行切换注入模式不需要改代码只需改配置里的一个字段。action_mode支持noise/adaln/none三档定义见 parsers.py训练python scripts/train.py --config configs/train/train_action_adaln.yaml推理先按scripts/local.example.sh配好权重路径再bash scripts/infer_example.sh推理时动作由 WanVideoUnit_ActionEmbedder 单元统一调用编码器并自动把动作帧对齐到历史帧 未来帧的自回归窗口scripts/infer.py 中的_run_autoregressive会滚动扩展未来帧让 BWM 逐段续写整条操作视频。七、效果验证动作注入如何让 BWM 登顶 WorldArena正是这套双注入机制让 BWM 在CVPR 2026 WorldArena Challenge中表现突出——在开源模型里拿下 Track 1 与 Track 2 数据引擎的榜首BWM-fast 更是登上 Track 1 总成绩第二从榜单可以看到高保真动作注入直接支撑了数据引擎这一世界模型核心任务——用低成本动作条件生成替代昂贵的真机采集。八、小结三种世界模型任务对应三种注入策略回到开头的问题——机器人动作如何注入扩散模型BWM 给了两种工程上都很优雅的解法noise把动作加到潜变量上逐帧空间对齐细粒度控制adaln把动作加到时间嵌入上经 AdaLN 非侵入式调制整个网络全局稳定。两者共用同一个动作编码器与action_mode开关按任务需求逐帧精度 vs 长时程数据引擎灵活切换。想动手上手可从 README.md 的 Quick Start 装环境、跑推理再对照 configs/README.md 调整实验超参——这套动作注入扩散模型的完整链路就是你理解具身智能世界模型的一把钥匙。赞分享【免费下载链接】boundless-world-modelHigh-fidelity world models for general embodied intelligence, such as data engines and world simulators.项目地址https://gitcode.com/gh_mirrors/bo/boundless-world-model点击查看免费下载相关推荐PipelineUnit设计模式拆解Boundless-World-Model如何用责任链让扩散模型预处理模块化PipelineUnit设计模式拆解Boundless World Model如何用责任链让扩散模型预处理模块化 Boundless World Model解剖 WanVideoActionEncoderBoundless-World-Model 如何将 14 维机器人动作序列压缩为 1536 维嵌入解剖 WanVideoActionEncoderBoundless World Model 如何将 14 维机器人动作序列压缩为 1536 维嵌入 BoundCog Model Source 详解模型作者如何用 cog.yaml、Runner 与类型注解定义机器学习模型Cog Model Source 详解模型作者如何用 cog.yaml、Runner 与类型注解定义机器学习模型 本篇指南围绕 Cog 的模型源ModelMLOps容器模型推理服务开发工具创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

FyAgent发布流水线揭秘:macOS公证、Windows签名与构建证明的CI/CD完整实践

FyAgent发布流水线揭秘:macOS公证、Windows签名与构建证明的CI/CD完整实践

【免费下载链接】fyagent For You Agent——AI 时代的个人随身数字人格。把你的模型、AI 账号、技能、提示词和工作方式,带到每一个 AI 工具里。 项目地址: https://gitcode.com/gh_mirrors/fy/fyagent 点击查看 免费下载 FyAgent 是一款 AI 时代的个人…

2026/10/11 18:49:04 阅读更多 →
YUM报错cannot find a valid baseurl?CentOS 7仓库下线修复指南

YUM报错cannot find a valid baseurl?CentOS 7仓库下线修复指南

遇到 YUM 报错 cannot find a valid baseurl for repo: base/7/x86_64?先别急着重装系统。这个报错看起来就像一行冷冰冰的地址失效提示,但真正经历的都知道,它背后是 CentOS 7 官方仓库整体下线后引发的一连串连锁反应。我最近半年在测试机、…

2026/10/11 18:49:04 阅读更多 →
开源工具拼一个「课堂计时器」:显示屏、翻页笔、提示音全套

开源工具拼一个「课堂计时器」:显示屏、翻页笔、提示音全套

培训机构的课堂要控制节奏:25分钟教学、10分钟练习、5分钟互动——老师拿手机看时间既不专业也容易忘。用开源工具拼了一套课堂计时系统,成本为零。 一、需求清单 📌 教室前屏显示当前环节与剩余时间 📌 老师手里的「遥控器」切换…

2026/10/11 18:49:04 阅读更多 →

最新新闻

PyTorch实现Unet多类别语义分割:从数据准备到部署

PyTorch实现Unet多类别语义分割:从数据准备到部署

简介:这是一份面向PyTorch学习者的Unet多类别语义分割实战代码包,帮助读者在自己的数据集上完成模型构建、训练与评估,适合有一定深度学习基础、希望快速上手图像分割任务的开发者。资源共46个文件,以19个Python源码和24个编译后的…

2026/10/11 19:40:37 阅读更多 →
Vue2调试利器:vue-devtools 5.4.3 插件安装与实战指南

Vue2调试利器:vue-devtools 5.4.3 插件安装与实战指南

简介:vue-devtools 5.4.3 Chrome 扩展包专为 Vue 2 项目调试设计,可在浏览器中直接查看组件层级、实时修改组件数据、追踪事件与路由变化,弥补 Chrome 原生开发者工具对 Vue 特性支持的不足。面向从 Vue 入门到中高端项目开发的人群&#xff…

2026/10/11 19:40:37 阅读更多 →
日志查看工具logviewer:秒开超大日志,高效排障实战

日志查看工具logviewer:秒开超大日志,高效排障实战

简介:这是一款面向开发、运维与系统管理人员的轻量级日志查看工具,专为处理超大日志文件而优化。传统文本编辑器打开数GB日志常常卡顿甚至崩溃,而该工具实测可流畅加载4G以上日志,作者用46G大文件验证也无明显压力,无论…

2026/10/11 19:40:37 阅读更多 →
vllm-metal 架构揭秘:MLX 与 PyTorch 如何统一在一条 Lowering 路径下

vllm-metal 架构揭秘:MLX 与 PyTorch 如何统一在一条 Lowering 路径下

【免费下载链接】vllm-metal Community maintained hardware plugin for vLLM on Apple Silicon 项目地址: https://gitcode.com/gh_mirrors/vl/vllm-metal 点击查看 免费下载 vllm-metal 是面向 Apple Silicon Mac 的 vLLM 社区硬件插件:它让 vLLM 以 …

2026/10/11 19:40:37 阅读更多 →
上海24小时自助健身房系统开发实战指南与案例解析

上海24小时自助健身房系统开发实战指南与案例解析

上海 24 小时自助健身房系统开发实战指南与案例解析 随着城市化进程的加快,健身需求日益增长,24 小时自助健身房逐渐成为一种新兴的健身模式。上海作为一线城市,对智能健身设备和自助服务系统的需求尤为突出。本文将围绕“上海 24 小时自助健…

2026/10/11 19:40:37 阅读更多 →
AI编程的真正瓶颈:协议、语境与交互的三重切换成本

AI编程的真正瓶颈:协议、语境与交互的三重切换成本

1. 切换成本:被所有人忽略的AI编程“隐性税”“模型越强,写代码越快”——这话听上去很美,但我在过去两年里带过三支不同技术栈的开发团队,从某高校实验室的算法验证项目,到某公司落地的跨平台业务系统,再到…

2026/10/11 19:39:35 阅读更多 →

日新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 10:45:37 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:53 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:54 阅读更多 →