【免费下载链接】boundless-world-modelHigh-fidelity world models for general embodied intelligence, such as data engines and world simulators.项目地址https://gitcode.com/gh_mirrors/bo/boundless-world-model点击查看免费下载如果你用视频生成模型做自回归滚动推理rollout多半见过这种翻车现场开头几秒还很正常十几秒后物体开始漂移、穿模甚至凭空消失。Boundless-World-Model简称 BWM就是一个专治这个问题的开源项目——它是构建在 Wan2.2-TI2V-5B 之上的、动作条件化的高保真机器人操作世界模型在 CVPR 2026 WorldArena 挑战赛中拿下开源组双料第一。它长时程物理一致性的秘密就藏在两个设计里历史帧锚定与低噪声条件注入。本文用尽量少的公式把这两大机制讲透。先搞懂问题自回归滚动为什么必然翻车世界模型的核心任务给定初始画面 动作序列预测未来会发生什么。单次预测 81 帧约 3 秒不难难的是把几十秒的任务连续拼出来。自回归推理的致命伤是误差累积第 1 段用真实初始帧做条件预测未来帧 → 预测帧带一点偏差第 2 段用预测帧当条件继续预测 → 偏差被当作真实输入循环若干次后小偏差被反复放大变成物体形变、位置漂移、接触关系崩坏。BWM 的解法是把模型改造成条件预测器不预测从初始帧出发的一切而是预测给定最近的 h 帧历史 对应动作接下来会发生什么。每一段都锚定在已验证的真实画面上误差没有机会滚雪球。接下来看两个锚定机制的具体实现。秘密一历史帧注入——让过去逐字进入模型历史帧机制的主战场在 wan_video_action/pipelines/wan_video_action.py核心流程分三步第一步编码进潜空间。WanVideoUnit_ImageEmbedderFused单元取输入视频的前num_history_frames帧用 VAE 编码成潜在变量然后逐字替换当前段潜变量最前面的 h 个帧干净历史潜变量 z ──► 覆盖 latents[:, :, :history_t]也就是说历史帧不是贴在图片角落的参考图而是直接占据预测序列最前面的时间位置与未来帧共享同一套时空注意力。第二步去噪全程锁死历史段。扩散模型的 50 步去噪循环里每走一步就把干净的历史潜变量贴回潜变量前部_restore_history_condition_latents。历史段永远不沾噪声去噪只发生在未来帧上。第三步解码后像素级还原。视频解码完成后输出的前 h 帧直接用原始输入像素覆盖。三重保险之下历史画面在像素级、潜变量级、去噪流程级三个层面都被锁定模型被逼着只负责一件事把未来帧预测对。自回归主循环在 scripts/infer.py 的_run_autoregressive中每一段只取上一段末尾的最后几帧 未来动作作为输入预测完拼接再滚向下一段——历史帧正是这样一段一段接力下去的。动作条件则由 wan_video_action/models/wan_video_action_encoder.py 的WanVideoActionEncoder编码以 AdaLN 调制的方式注入 DiT与时间步嵌入共同生成 scale/shift 参数实现对整段视频生成的全局动作控制。秘密二低噪声条件注入——历史帧该加多少噪声这里有个微妙的坑历史帧如果给完全干净的信号模型训练时几乎没见过这种输入分布可能学不会尊重它如果加太多噪声锚定信息又会被抹掉。BWM 的答案是加一点点。推理管线里有一个开关use_history_condition_noise_in_inference在 scripts/infer.py 调用pipe(...)时置为True开启后_prepare_history_condition_latents会取去噪调度表倒数第 50 个时间步——也就是整条去噪路径上噪声水平最低的那一档——只对历史帧加这一层极薄的噪声。用一张对比图理解噪声水位帧段噪声水位模型看到什么历史帧极低≈收尾步几乎干净的过去未来帧满噪声纯随机信号等待生成训练侧同样配套configs/train/train_action_adaln.yaml 里的max_timestep_boundary/min_timestep_boundary控制扩散时间步的采样边界让模型在训练时见过历史帧带低噪声的条件组合。推理时的低噪声注入正好落在模型最擅长处理的低噪声区域。一句话总结这个机制第 1 帧保持纯净第 2~h 帧抹上最低档的薄噪声未来帧从满噪声起步——模型由此学会把带薄噪声的真实画面和满噪声的随机信号区分开历史帧才能被真正当成可信的锚而不是待消除的噪声。两大秘密如何联手撑起长时程一致性历史帧 内容锚告诉模型过去真实发生的是什么物体身份、叠放状态、铰链角度都锁在这几帧里低噪声 信号标签告诉模型这段潜变量几乎是干净的让它用正确的方式读取锚点逐段滚动每段输出成为下一段的历史误差被历史锁死截断没有滚雪球的机会。效果如何看数据在 WorldArena 榜单开源组中BLM 总分 64.54 分位列第一其中物理一致性Physics Adherence68.96 分、3D 精度97.28 分均为开源最高轻量版 BWM-Fast 则拿下总分榜第二。仓库 README.md 中收录了更多长时程定性演示开微波炉、开笔记本这类铰链运动能长时间保持打开状态不反弹换手麦克风的双臂同步不穿模还有分布外泛化实验——即使初始帧是 GPT-Image-2 画出来的全新场景BWM 依然能跟随动作序列保持连贯交互说明它学到的是物理 动作的规律而不是背住了特定场景的纹理。快速上手零配置跑一次长时程仿真仓库里已内置演示数据克隆后即可运行git clone https://gitcode.com/gh_mirrors/bo/boundless-world-model cd boundless-world-model pip install diffsynth2.0.11 pip install -r requirements.txt cp scripts/local.example.sh scripts/local.sh # 修改其中的 MODEL_PATHS 与 CKPT_PATH bash scripts/infer_example.sh演示数据demo.jsonl元数据、stat.json归一化统计、parquet 动作文件都在 demo/ 目录下视频动作数据加载逻辑见 wan_video_action/data/。项目结构速览与延伸阅读目录 / 文件作用wan_video_action/pipelines/wan_video_action.py推理管线历史帧注入与低噪声条件注入的实现位置wan_video_action/models/wan_video_action_encoder.py动作编码器AdaLN 动作条件注入scripts/infer.py / scripts/train.py自回归推理主循环 / 训练入口configs/train/ 与 configs/infer/infer.yaml训练与推理配置模板docs/wan_video_action_notes.md前向传播逐步注释时间步编码、动作注入、RoPEdocs/wan_video_action_encoder_notes.md动作编码器结构详解docs/pipeline_from_pretrained.md模型加载调用链分析两个机制都不复杂——没有新模块、没有额外训练阶段只是对条件帧给多少噪声、锁不锁这两个老问题的精细回答。但正是这两处毫厘之间的拿捏换来了长时程滚动下物体不漂移、接触不崩坏、状态不反弹的物理一致性。如果你也在做视频世界模型或机器人仿真这两个技巧尤其是历史帧低噪声注入非常值得抄进自己的项目里。赞分享【免费下载链接】boundless-world-modelHigh-fidelity world models for general embodied intelligence, such as data engines and world simulators.项目地址https://gitcode.com/gh_mirrors/bo/boundless-world-model点击查看免费下载相关推荐Boundless-World-Model自回归Rollout深度剖析57帧滑动窗口如何生成不漂移的长时序操作视频Boundless World Model自回归Rollout深度剖析57帧滑动窗口如何生成不漂移的长时序操作视频 Boundless World ModelChatHub学生折扣如何用教育优惠解锁所有AI助手ChatHub学生折扣如何用教育优惠解锁所有AI助手 如果你是一名学生或教育工作者想要同时使用ChatGPT、Claude、Bard等多个AI助手却担心订AI 应用前端交互助手创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考