快速上手LingBot-VA10分钟部署机器人视频-动作世界模型18GB显存即可跑通推理【免费下载链接】lingbot-va[RSS 2026] Causal video-action world model for generalist robot control项目地址: https://gitcode.com/gh_mirrors/li/lingbot-vaLingBot-VA 是一个面向通用机器人控制的因果视频-动作世界模型Causal Video-Action World Model它能同时预测未来视频帧并生成机器人动作指令。本文是一份面向新手的完整部署指南只需 18GB 显存的单卡 GPU约 10 分钟即可完成环境配置并跑通图像到视频-动作I2VA生成推理。 LingBot-VA 是什么一个模型同时看懂世界与生成动作与传统的VLA 策略模型不同LingBot-VA 采用自回归AR扩散框架把世界建模与动作推理统一在同一条交错序列中核心亮点有 3 个统一的视频-动作建模视觉动态预测与动作生成在架构层面统一但概念上保持区分高效执行双流 Mixture-of-TransformersMoT架构 异步执行 KV Cache推理速度快长时序与泛化能力在长程任务成功率和新场景泛化上有显著提升。实测性能同样亮眼在RoboTwin 2.050 个任务平均上 Easy / Hard 成功率分别达到92.9% / 91.6%成为首个突破 90% 门槛的方法在LIBERO基准上平均分达到98.5均超过 π₀.5、X-VLA 等强基线。 第一步环境准备与模型下载约 5 分钟硬件与软件要求项目要求说明GPU 显存18GBI2VA 推理约 18GB开启 offloadRoboTwin 评测约 24GBPython3.10.16版本需严格一致PyTorch2.9.0搭配 CUDA 12.6依赖安装pip flash-attn完整清单见 requirements.txt克隆仓库并安装依赖git clone https://gitcode.com/gh_mirrors/li/lingbot-va cd lingbot-va pip install torch2.9.0 torchvision0.24.0 torchaudio2.9.0 --index-url https://download.pytorch.org/whl/cu126 pip install websockets einops diffusers0.36.0 transformers4.55.2 accelerate msgpack opencv-python matplotlib ftfy easydict pip install flash-attn --no-build-isolation 如果flash-attn因 PEP 517 构建问题失败参考 INSTALL.md 中的 No-Build-Isolation 方案重试即可。下载预训练模型模型托管在 HuggingFace 与 ModelScope 的robbyant组织下按需选择其一即可模型名称适用场景lingbot-va-base共享骨干基础模型后训练起点lingbot-va-posttrain-robotwinRoboTwin 平台后训练权重仿真评测推荐lingbot-va-posttrain-libero-longLIBERO-Long 后训练权重下载后把 wan_va/configs/va_robotwin_cfg.py 中的wan22_pretrained_model_name_or_path从/path/to/pretrained/model修改为你的实际模型目录。⚠️ 关键配置attn_mode 与显存优化新手必看这是最容易踩坑的一步配置错了会直接报错。1. 设置attn_mode训练/推理必须不同LingBot-VA 通过from_pretrained加载注意力模式读取自模型目录下的transformer/config.json需要手动编辑使用模式attn_mode取值训练flex仅训练可用推理 / 评测torch或flashattn用flex会报错2. 18GB 显存跑通的秘密开启 offload服务器端会把 VAE 和文本编码器卸载到 CPU 以节省显存相关逻辑在 wan_va/wan_va_server.py 中。默认配置 wan_va/configs/shared_config.py 中enable_offload False低显存用户请改为Trueva_shared_cfg.enable_offload True开启后单卡 18GB 显存即可跑通图像到视频-动作的推理。 10 分钟跑通图像到视频-动作生成推理不想搭仿真环境先从 I2VA 模式入手给定机器人初始图像 一段文字指令模型直接生成未来的视频帧 动作序列。示例输入图像在 example/robotwin/ 目录含顶部视角与左右腕部摄像头图像任务提示为拿起白色马克杯旋转后挂到深灰色架子上。NGPU1 CONFIG_NAMErobotwin_i2av bash script/run_launch_va_server_sync.sh运行逻辑由 script/run_launch_va_server_sync.sh 启动分布式进程配置项输入图像路径、推理 chunk 数、提示词定义在 wan_va/configs/va_robotwin_i2va.py。生成完成后结果视频会保存到visualization/demo.mp4——你会看到模型预演出机器人未来动作的画面这就是世界模型的直观体现。 进阶RoboTwin 与 LIBERO 仿真评测LingBot-VA 采用Server-Client 架构模型服务Server与仿真环境Client通过 WebSocket 通信依赖相互隔离也支持多卡分布式推理。RoboTwin-2.0 评测约 24GB 显存先按 RoboTwin 官方文档装好仿真环境Vulkan 依赖 克隆 RoboTwin 仓库然后# 终端 1启动推理服务器 bash evaluation/robotwin/launch_server.sh # 终端 2运行评测客户端以 adjust_bottle 任务为例 task_nameadjust_bottle bash evaluation/robotwin/launch_client.sh results/ ${task_name}服务器入口见 evaluation/robotwin/launch_server.sh客户端参数引导系数、测试轮数等见 evaluation/robotwin/launch_client.sh。多卡评测可使用对应的launch_server_multigpus.sh/launch_client_multigpus.sh结果保存在results/目录。⚠️ 推理服务器与客户端必须在同一台机器上运行。LIBERO 评测装好 LIBERO 仿真环境后两条命令即可# 服务器 bash evaluation/libero/launch_server.sh # 客户端 bash evaluation/libero/launch_client.shLIBERO 使用 128×128 的双视角观测agentview 眼在手配置在 wan_va/configs/va_libero_cfg.py示例图像见 example/libero/。 可选用你自己的机器人数据后训练如果你有自采的机器人操作数据LingBot-VA 支持基于FSDP 分布式训练的后训练数据对接LeRobot 格式原始数据 → 转换为 LeRobot 格式含meta/episodes.jsonl中的action_config动作分段与文字描述用 Wan2.2 VAE 提取视频隐变量输出到latents/目录动作统一映射为30 维标准格式左右臂末端 7 维 ×2 关节 7 维 ×2 夹爪 1 维 ×2缺失维度补 0。训练一条命令启动NGPU8 CONFIG_NAMErobotwin_train bash script/run_va_posttrain.sh数据准备细节与字段规范可参考 README.md 的 Post-Training 章节训练入口在 wan_va/train.py。❓ 常见问题速查问题解决方法推理时报注意力相关错误检查模型transformer/config.json中attn_mode是否为torch或flashattn显存不足OOM在 wan_va/configs/shared_config.py 中设置enable_offload Trueflash-attn安装失败按 INSTALL.md 使用--no-build-isolation重试找不到模型权重确认配置中wan22_pretrained_model_name_or_path已改为本地真实路径写在最后从克隆仓库到看到第一段未来预演视频LingBot-VA 的部署门槛并不高单卡 18GB 显存、10 分钟上手、两条命令完成仿真评测。作为一个把世界建模与动作生成统一起来的因果视频-动作模型它为通用机器人控制提供了一条值得尝试的新路线。项目基于 Apache 2.0 协议开源见 LICENSE.txt欢迎在此基础上探索你自己的机器人任务。【免费下载链接】lingbot-va[RSS 2026] Causal video-action world model for generalist robot control项目地址: https://gitcode.com/gh_mirrors/li/lingbot-va创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考