【多篇论文阅读】Interactive World Models
Vid2World: Crafting Video Diffusion Models to Interactive World Models类型判断改造原理/配方不是从零新架构。本质是给已有双向 video Diffusion 补两样能力——只能看过去、能跟帧级 action 走。题目: Vid2World: Crafting Video Diffusion Models to Interactive World Models时间: 2025.05单位: Tsinghua University; Chongqing University英文关键词: video Diffusion transfer, causalization, causal action guidance1段话总结论文干了什么把互联网预训练的全序列 video Diffusion实验用 DynamiCrafter改成可逐步自回归、按 action 反事实推演的 interactive world model。配方就两步结构训练目标因果化帧级 action 注入 独立 dropout从而在逐步 rollout 时做 classifier-free action guidance。存在问题领域 world model 数据贵、画质粗现成 video Diffusion 画质好但双向看未来、条件通常是整段文本既不能在线交互也不能精细控每一步 action。解决方法原理Video Diffusion → Interactive World Model Causalization Action Conditioning。Causalization结构temporal attention 加因果 mask非因果 temporal conv 不用简单 shift会错位而用 mixed weight transfer——时间维对齐位置保留原权重多出来的“过去侧”位置用核均值初始化尽量保住预训练。Causalization目标训练用 Diffusion Forcing每帧独立噪声水平对齐推理时「历史干净、只去噪当前帧」。Action每个 action 经轻量 MLP 对齐到对应帧训练时每个 timestep 的 action 独立以概率 p 置 ∅逼模型同时学有/无最新 action 的 score推理用ε(1λ)ε_cond−λ ε_uncond做 Causal Action Guidance。相比其他方法的创新之处把「被动全序列 Diffusion → 交互 world model」拆成可操作的两段改造并给出保权重的 conv 迁移与面向逐步交互的 action CFG不是再挂一个 ControlNet/adapter 了事。基于前人的哪些方法DynamiCrafter作为被改造的预训练 video Diffusion 底座继承其互联网视频先验。Diffusion Forcing直接采用其「每帧独立噪声」训练方式使全序列 Diffusion 能做自回归 rollout。Classifier-free guidance把 CFG 从类别/文本条件延伸到因果逐步生成下的「最新一帧 action」条件。实验exp1:设置RT-1 上同底座 transfer 后做视频预测含 NAR / 自回归数据RT-1结论画质与相似度明显强于其他 transfer自回归也可稳定逐步生成exp2:设置CS:GO 上与 DIAMOND 比 16 帧 action-conditioned 预测数据Dust II 人类对局 holdout结论FVD/FID 大幅领先说明改造后的 video Diffusion 可当高保真游戏 world model提到的同类工作Genie(2024): 无标视频学可控环境DIAMOND(2024): 自回归 Diffusion 游戏 world modelAVID(2024): 冻结 video 模型上 action adapterDiffusion Forcing(2024): 分帧噪声支撑 AR Diffusion相关性最高的工作Diffusion Forcing(2024)DIAMOND(2024)AVID(2024)MIRA: Multiplayer Interactive World Models with Representation Autoencoders类型判断完整新模型系统大规模数据开源。该记清三段结构Representation Codec → Latent DiT World Model → 四人 tile 条件以及「多人」到底多在哪。题目: MIRA: Multiplayer Interactive World Models with Representation Autoencoders时间: 2026.07单位: General Intuition; Kyutai; Epic Games英文关键词: multiplayer world model, representation autoencoder, Rocket League1段话总结论文干了什么在 Rocket League 上做四人、强物理交互的实时 world model四视角四路 action 联合进 latent Diffusion单卡 B200 约 20fps约 1 万小时 bot 数据与代码开源。核心不是“多加几路输入”而是在共享场景里把变化正确归因到对应玩家并跨视角一致。存在问题多数 world model 单 agent其他人当环境纹理多人设定下易误归因、忽略某玩家、纠缠多人效果像素空间又慢又难学动力学。解决方法模型结构三块CodecRepresentation Autoencoder冻结 DINOv3-L 多中间层聚合 → 线性 bottleneck空间↓2×2、时间↓2→10Hz、通道→32→ 时空 ViT decoder空间全注意、时间因果先空间上采样再注意。重建L1LPIPSP-DINO。世界模型只在 latent 上预测。Latent World Modelflow-matching DiT因子化时空 attentionDiffusion Forcing每帧独立 τ抗自回归漂移PSD/shortcut 式 few-step 蒸馏到 1–2 步实时action 与 τ 经 AdaLN。Multiplayer四玩家 latent 沿高度 tile空间 attention 一次跨四视角各玩家键盘 action 分路 embed 后按固定顺序拼进条件广播到所有位置让模型自己学“谁的操作影响谁的画面”训练 action dropout。先单玩家预训练再 warm-start 四人优于直接四人训。推理真 clip warmup → 固定长度 rolling window KV cache每 latent 解出 2 帧 → 20fps。相比其他方法的创新之处把 multiplayer 从“单控接口看多人画面”推到「四路 action 同时条件 四视角联合生成」的强物理 3D 竞技设定系统消融证明预训练表征 latent、Forcing、二人阶段迁移的必要性用 physics probe 测动力学而不只看脸。基于前人的哪些方法Representation Autoencoder / DINOv3用冻结自监督特征建可重建、又利于动力学预测的 latent作为 WM 的预测空间。DIAMOND 路线的 latent Diffusion 游戏 WM继承「在压缩空间里做 action-conditioned 下一帧」的实时游戏模拟范式扩展到四人。Diffusion Forcing用于训练期混合干净/带噪历史降低自回归误差累积。Shortcut / consistency 类蒸馏把多步 flow 压成 1–2 步支撑实时。实验exp1:设置5B 四人模型按四路 GT action 长程 rollout测分布质量、物理 probe、可控性、实时性数据~10k hours Rocket League bot 对局结论单卡实时约 20fps跨视角事件一致物理读出与真值可对齐分布质量至少稳到测过的 5 分钟实践可小时级不塌提到的同类工作DIAMOND(2024): 单玩家实时游戏 WMGenie / Genie 3(2024/2025): 可控生成环境WHAM(2025): 四人对局数据条件仍是单玩家控制MultiWorld 等(2026): 多智能体条件场景动力学通常更弱相关性最高的工作DIAMOND(2024)Genie(2024)WHAM(2025)Infinite Worlds with Versatile InteractionsLingBot-World 2.0 / Infinity类型判断系统升级 ABC 组合。相对 1.0拼的是更稳的因果预训练MoBA 实时蒸馏consistencyDMD 更富交互数据/动作 Director–Pilot agentic harness。重点记「组合了什么、各块改了什么」。题目: Infinite Worlds with Versatile Interactions时间: 2026.07单位: Robbyant / LingBotHao Ouyang 等英文关键词: causal world model, long-horizon anti-drift, agentic harness1段话总结论文干了什么开源交互世界模型升级版因果 DiT 骨干拉长程不漂再蒸馏出 720p60fps 实时学生动作从导航扩到攻击/弓箭/法术/射击与文本改环境外挂 VLM Director 视频 Pilot让模型能持续规划角色行为并往世界里塞新事件提供 14B 与单卡 1.3B。存在问题自回归误差反馈多数只能稳秒到分钟高保真交互算力贵常砍分辨率/帧率/控制纯生成器不会“自己玩、自己补内容”。解决方法组合清单数据引擎第一人称 游戏/UE 合成 网页视频 → 技术分VLM profiling → 全局 caption chunk 多轨局部标注运动/交互/环境对齐推理时随时间变的条件。预训练新骨干 trick因果 flow matching相机 PlückerAdaLNchunk-wise prompt。MoBA mask在 teacher forcing 上拼一块双向 attention减轻“越看历史越偷懒、画质崩”的过拟合同时保留 AR 能力cross-attn 对应下三角防未来泄漏。后训练实时抗漂consistency distillation 压步数DMD 在长self-rollout分布上对齐专门打累积漂移。Agentic harness组合创新点VLM 当 Director 出 event proposalDiT 当 Pilot 落地物理/像素支持直接语义交互、SAM 跟踪物体交互、文本注入天气/实体。部署编译/并行/异步 VAE、时空 refiner、动态 KV、多玩家 UI。相比其他方法的创新之处把“能生成”升级成“能长住 能实时 能被 agent 驱动续写”MoBA 与 self-rollout DMD 针对长程漂在 world model 里系统引入 coding-agent 式 harness。宣称通用域 hour-level 且开源较稀缺。基于前人的哪些方法LingBot-World 1.0直接升级的前代开源交互世界系统数据/因果生成/实时交互骨架。Causal flow-matching DiT作为可 action/prompt 条件的世界骨干训练范式。Consistency distillation把多步教师压成少步实时学生。DMD用分布匹配继续提保真并在本文里接到长 self-rollout 上抑漂移。实验exp1:设置蒸馏实时模型与主流交互 WM 比画质、长程稳定、实时与交互丰富度并做约 1 小时不间断会话数据自建混合交互场景结论画质达最强闭源量级且开源720p60fps 量级实时小时级 rollout 无明显全程崩坏提到的同类工作Genie 3(2025): 强闭源交互世界LingBot-World(2026): 前代Matrix-Game 3.0 / HY-World 1.5(2025/2026): 游戏或通用交互生成HappyOyster: 闭源对照相关性最高的工作LingBot-World(2026)Genie 3(2025)Matrix-Game 3.0(2026)StatePlay: State-Aware Game World Models for Mechanics-Consistent Generation类型判断完整新模型结构小规模配套数据。该记清视觉专家 状态专家 joint attention状态用回归而不是套 flow matching。题目: StatePlay: State-Aware Game World Models for Mechanics-Consistent Generation时间: 2026.07单位: Tencent; NTU; NUS; A*STAR英文关键词: game mechanics, state-aware, Mixture-of-Transformers1段话总结论文干了什么在 Street Fighter 3 上做 state-aware game world model除画面外显式预测 timer / 双方 HP / 气条并用状态信息约束出画减少 0 血还打、气不满放大招等规则违规。配套采了 state–frame–action 对齐的 1 万段 5s 数据。存在问题现有 game WM 多在像素上学“看起来像”内部规则状态难从画面可靠推出生成常违反 mechanics缺公开的状态同步数据与耦合设计。解决方法模型结构底座 Wan2.2-TI2V-5B 视觉分支~5Bflow matching 轻量状态分支~0.76B。两侧各自 self-attn中间joint attentionMoT 式画面 query 状态用规则信息导生成状态 query 画面用视觉动态助状态推演。Action 投影后同时加进两支文本NPC 策略进视觉 cross-attn。损失视觉 flow matching 状态 Smooth L1 回归状态低维、规则硬不适合乱加噪的 FM再加权求和。推理给首帧状态后续状态从噪声预测并与帧联合去噪。数据亮点emulator 读 5 维状态Gemini 平衡 win/lose/macro success/fail/normal状态关键样本占 40%NPC 策略文本三类。相比其他方法的创新之处把“内部状态”从评测旁路拉进生成主环相对 shared 骨干与“状态也走 FM”MoT回归在 mechanics fidelity 上明显更强文中相对无状态最强基线约 18.6%。基于前人的哪些方法Wan2.2作为视觉生成骨干与 VAE/text encoder提供画面分支。World Action ModelWAM/ MoT 联合建模思路借鉴「多模态分专家 交叉交互」来同时建模另一路信号此处把 action 换成 game state。ReactiveGWM沿用其 SF 数据采集与 NPC 策略标注流水线扩展为同步状态标注。实验exp1:设置在同一 state-aware 数据上StatePlay vs 微调后的无状态 game WM主看 mechanics fidelity、状态对齐、画质与控制数据自建 SF310k 训练 / 100 测试 clips结论state alignment≈0.947mechanics 约 82%/78%Gemini/GPT相对最强无状态模型约 18.6%画质与控制不牺牲提到的同类工作Genie(2024): 交互游戏环境ReactiveGWM(2026): 同域最强无状态基线LingBot-World 2.0(2026): 通用交互零样本 mechanics 仍弱From Pixels to States(2026): 有状态标注未闭环证明如何抬 mechanicsWildWorld(2026): 带 action/state 的动态世界数据相关性最高的工作ReactiveGWM(2026)Genie(2024)From Pixels to States(2026)

相关新闻

Iris Shaders 完整新手指南:从零部署现代着色器 Mod 到帧率调优

Iris Shaders 完整新手指南:从零部署现代着色器 Mod 到帧率调优

Iris Shaders 完整新手指南:从零部署现代着色器 Mod 到帧率调优 【免费下载链接】Iris A modern shaders mod for Minecraft compatible with existing OptiFine shader packs 项目地址: https://gitcode.com/gh_mirrors/iri/Iris Iris Shaders 是一款为 Min…

2026/8/26 20:03:45 阅读更多 →
AgentScope Java 2.0 技能仓库(Skill Repository)完全实战指南

AgentScope Java 2.0 技能仓库(Skill Repository)完全实战指南

一、背景与设计理念 在构建企业级 AI Agent 应用时,智能体能力的可复用性、版本化管理与动态分发是工程化落地的核心瓶颈。传统做法往往将 Prompt、工具定义硬编码在业务代码中,导致: 技能无法跨项目复用修改一个 Prompt 需要重新编译部署多人…

2026/8/26 20:03:45 阅读更多 →
1.3 C++踩坑排雷手册——严格别名规则:不同类型指针不重叠,编译器据此优化

1.3 C++踩坑排雷手册——严格别名规则:不同类型指针不重叠,编译器据此优化

1.3 C实战100例——严格别名规则:不同类型指针不重叠,编译器据此优化 受众 初级/中级工程师,能敲命令、会看报错信息即可。默认具备基础Linux操作能力。 场景锚定 场景:你的 C 程序在 -O2 优化级别下运行结果与 -O0 不一致&#x…

2026/8/26 20:03:45 阅读更多 →

最新新闻

神经外科手术导航建模:临床决策支持系统的核心逻辑

神经外科手术导航建模:临床决策支持系统的核心逻辑

1. 这不是一道“纯数学题”:神经外科手术定位导航的本质是临床决策支持系统2024年认证杯SPSSPRO杯数学建模B题(第一阶段)的标题里,“神经外科手术的定位与导航”这九个字,远比“数学建模B题”五个字沉重得多。它不是在…

2026/8/26 21:50:56 阅读更多 →
蓝桥杯C/C++省赛实战避坑指南:从建模到VSCode配置

蓝桥杯C/C++省赛实战避坑指南:从建模到VSCode配置

1. 这不是“标准答案集”,而是一份省赛现场复盘手记 十五届蓝桥杯省赛B组(C/C组)刚结束不到72小时,我坐在实验室窗边,咖啡凉了半杯,电脑屏幕上还开着未关闭的IDE和几份刚导出的考生代码片段。这不是一份冷冰…

2026/8/26 21:50:56 阅读更多 →
HiPHI开源617.5小时人体运动数据,如何驱动人形机器人具身智能?

HiPHI开源617.5小时人体运动数据,如何驱动人形机器人具身智能?

诺亦腾机器人发布 HiPHI,开源 617.5 小时高精度人体运动数据,这个消息放在具身智能的语境里,比“又有一个数据集开源了”要重要得多。过去半年,人形机器人赛道最明显的变化,是大家的关注点从模型架构竞争,慢…

2026/8/26 21:50:56 阅读更多 →
无线追踪设备实战:从BLE+GPS到Wi-Fi定位与低功耗设计

无线追踪设备实战:从BLE+GPS到Wi-Fi定位与低功耗设计

1. 项目概述与需求拆解1.1 无线追踪设备到底是什么你可能在快递物流、宠物防丢、车辆管理、资产管理这些场景里见过它,甚至自己就买过一个小标签贴在钥匙串上。Wireless Tracking Device(无线追踪设备)本质上是一个集成了定位模块、无线通信模…

2026/8/26 21:50:56 阅读更多 →
基于OpenGL的捏脸系统实现:从混合形状到实时渲染

基于OpenGL的捏脸系统实现:从混合形状到实时渲染

1. 项目概述:从“画脸”到“捏脸”的图形学跨越在三维图形应用里,角色创建系统,或者说“捏脸系统”,一直是个既基础又充满挑战的模块。说它基础,是因为几乎所有涉及角色定制的游戏或应用都绕不开;说它挑战&…

2026/8/26 21:50:56 阅读更多 →
反激变换器设计实战:从拓扑原理到调试技巧全解析

反激变换器设计实战:从拓扑原理到调试技巧全解析

1. 从零开始认识反激变换器很多人第一次接触开关电源设计,最先碰到的拓扑就是反激变换器(Flyback Converter)。它在小功率AC-DC和DC-DC应用里占据统治地位,从手机充电器到工业控制板载电源,从LED驱动到辅助供电&#x…

2026/8/26 21:49:55 阅读更多 →

日新闻

Python random 模块常用函数详解:从入门到实战

Python random 模块常用函数详解:从入门到实战

目录 1. 引言2. 准备工作3. 基础随机函数4. 序列相关函数5. 随机种子与复现6. 实战案例7. 注意事项8. 常见问题与排查9. 总结 1. 引言 摘要: 本文系统介绍 Python 标准库 random 模块中最常用的随机数生成函数。内容涵盖基础随机函数(random()、unifor…

2026/8/26 0:00:40 阅读更多 →
《Microsoft Sql server 2008 Internals》读书笔记--第三章Databases and Database Files(2)

《Microsoft Sql server 2008 Internals》读书笔记--第三章Databases and Database Files(2)

《Microsoft Sql server 2008 Internals》索引目录: 《Microsoft Sql server 2008 Internals》读书笔记--目录索引 在上篇文章中,主要介绍了创建数据库的基本语法和FileGroup的初步知识。需要注意的是: 关于FileGroup 如果你的系统是用Raid设备直接存…

2026/8/26 1:18:18 阅读更多 →
政务AI智能体怎么建?三种模式、三步路径与四个误区

政务AI智能体怎么建?三种模式、三步路径与四个误区

政务AI智能体已经从概念试点阶段,转入了政务服务的常态化落地应用;在实际使用过程中,它能自主理解办事需求、辅助完成填报申报、开展材料预审,并联动多个系统协同作业,真正嵌入到政务办理的全流程当中。但在落地推进过…

2026/8/26 1:18:18 阅读更多 →

周新闻

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/26 14:45:33 阅读更多 →
SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/26 17:46:43 阅读更多 →
Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/26 14:46:37 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/26 3:50:20 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/26 17:46:39 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/26 1:24:05 阅读更多 →