深入理解Xiaomi-Robotics-0-LIBERO的动作生成机制:从输入编码到控制命令的全流程
深入理解Xiaomi-Robotics-0-LIBERO的动作生成机制从输入编码到控制命令的全流程【免费下载链接】Xiaomi-Robotics-0-LIBERO项目地址: https://ai.gitcode.com/hf_mirrors/XiaomiRobotics/Xiaomi-Robotics-0-LIBEROXiaomi-Robotics-0-LIBERO是小米机器人技术团队开发的开源项目专注于机器人动作生成与控制。本文将详细解析其核心动作生成机制从输入编码到控制命令输出的完整流程帮助新手开发者快速掌握项目核心技术。动作生成系统架构概览Xiaomi-Robotics-0-LIBERO采用模块化设计主要由视觉语言模型VLM和动作生成模块DiT两部分组成。系统架构如图所示输入数据 → 视觉语言编码器 → 状态与动作投影 → DiT解码器 → 动作输出核心实现位于modeling_mibot.py文件中其中MiBoTForActionGeneration类整合了完整的动作生成流程。关键组件介绍Qwen3VL视觉语言模型负责处理多模态输入图像/视频文本指令DiT解码器基于扩散模型的动作生成核心状态/动作投影器实现状态与动作空间的维度转换时间嵌入模块为扩散过程提供时间步信息输入编码多模态信息处理系统支持图像、视频和文本指令等多种输入形式通过统一的编码流程转换为模型可处理的特征向量。视觉输入处理图像和视频输入通过Qwen3VLVisionModel类进行处理图像分块嵌入使用Qwen3VLVisionPatchEmbed将图像分割为固定大小的块并投影到特征空间位置编码通过fast_pos_embed_interpolate方法生成空间位置信息视觉注意力Qwen3VLVisionAttention模块提取图像特征关键代码实现# 图像特征提取流程 hidden_states self.patch_embed(hidden_states) # 分块嵌入 pos_embeds self.fast_pos_embed_interpolate(grid_thw) # 位置编码 hidden_states hidden_states pos_embeds # 添加位置信息文本指令编码文本指令通过Qwen3VLTextModel处理采用Transformer架构词嵌入embed_tokens将文本转换为向量表示** Rotary位置编码**Qwen3VLTextRotaryEmbedding处理序列位置信息自注意力机制Qwen3VLTextAttention捕获文本上下文关系状态与动作空间转换机器人状态和动作需要经过投影处理以适应模型输入输出要求。状态投影环境状态通过MLPProjector转换为与模型隐藏层维度匹配的特征self.state_projector MLPProjector( input_dimconfig.state_dim, output_dimconfig.dit_config.hidden_size, num_layers2 )动作投影与输出动作空间转换包括编码输入到模型和解码模型输出到动作两个过程# 动作输入投影 self.action_projector MLPProjector( input_dimconfig.action_dim, output_dimconfig.dit_config.hidden_size, num_layers2 ) # 动作输出解码 self.action_output_layer MLPProjector( input_dimconfig.dit_config.hidden_size, output_dimconfig.action_dim, num_layers2 )DiT动作生成核心扩散模型DiT是动作生成的核心通过逐步去噪过程生成平滑的机器人动作序列。时间嵌入扩散过程的时间步信息通过TimestepEmbedder编码class TimestepEmbedder(nn.Module): def forward(self, t): t_freq self.timestep_embedding(t, self.frequency_embedding_size) t_emb self.mlp(t_freq) return t_emb[:, None]解码器层结构DecoderLayer整合了注意力和MLP模块支持动作序列生成class DecoderLayer(nn.Module): def forward(self, hidden_states, past_key_values, position_embeds, t_embeds, attn_maskNone): # 注意力子层 residual hidden_states hidden_states self.input_layernorm(hidden_states) hidden_states modulate(hidden_states, shift_msa, scale_msa) hidden_states self.attn(hidden_states, past_key_values, position_embeds, attn_mask) hidden_states residual gate_msa * hidden_states # MLP子层 residual hidden_states hidden_states self.post_layernorm(hidden_states) hidden_states modulate(hidden_states, shift_mlp, scale_mlp) hidden_states self.mlp(hidden_states) hidden_states residual gate_mlp * hidden_states return hidden_states扩散过程实现动作生成采用逐步去噪的扩散过程从随机噪声开始迭代优化x torch.randn_like(action_mask) # 初始随机噪声 dt 1.0 / num_steps for step in range(num_steps): t torch.ones((x.shape[0], 1, 1), devicex.device, dtypex.dtype) * step / num_steps v dit_forward_fn(x, t) # 预测噪声 x x v * dt # 更新动作完整动作生成流程综合上述模块完整的动作生成流程如下输入处理多模态输入图像/视频文本通过VLM编码状态编码机器人当前状态通过状态投影器转换初始噪声生成随机动作噪声作为扩散起点迭代去噪DiT模型逐步优化动作序列动作输出生成最终机器人控制命令核心代码入口在MiBoTForActionGeneration类的forward方法torch.no_grad() def forward(self, state, action_mask, num_steps5,** kwargs): vlm_outputs self.vlm(**kwargs, use_cacheTrue) # VLM编码 state_embed self.state_projector(state) # 状态投影 # 扩散过程 x torch.randn_like(action_mask) # 初始噪声 for step in range(num_steps): t torch.ones((x.shape[0], 1, 1), devicex.device) * step / num_steps v self.dit_forward(x, t, ...) # 噪声预测 x x v * (1.0/num_steps) # 迭代更新 return ActionGenerationOutput(actionsx)快速上手与实践环境准备首先克隆项目仓库git clone https://gitcode.com/hf_mirrors/XiaomiRobotics/Xiaomi-Robotics-0-LIBERO基本使用示例动作生成的基本调用方式from modeling_mibot import MiBoTForActionGeneration import torch # 加载模型 model MiBoTForActionGeneration.from_pretrained(./) # 准备输入 state torch.randn(1, 10, 64) # 示例状态 action_mask torch.ones(1, 20, 7) # 动作掩码 # 生成动作 outputs model(statestate, action_maskaction_mask, num_steps5) print(生成的动作序列:, outputs.actions.shape)总结与扩展Xiaomi-Robotics-0-LIBERO通过视觉语言模型与扩散模型的结合实现了从多模态指令到机器人动作的端到端生成。核心优势包括多模态理解同时处理视觉和文本输入平滑动作生成扩散模型确保动作序列的连续性灵活扩展模块化设计支持不同机器人平台适配未来可以通过以下方向进一步优化增加动作约束条件提高安全性优化扩散过程减少计算量增强环境交互反馈机制通过本文的解析相信您已经对Xiaomi-Robotics-0-LIBERO的动作生成机制有了全面了解。更多细节请参考项目源代码和技术文档。【免费下载链接】Xiaomi-Robotics-0-LIBERO项目地址: https://ai.gitcode.com/hf_mirrors/XiaomiRobotics/Xiaomi-Robotics-0-LIBERO创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

njs学习资源大全:从官方示例到社区最佳实践

njs学习资源大全:从官方示例到社区最佳实践

njs学习资源大全:从官方示例到社区最佳实践 【免费下载链接】njs-examples NGINX JavaScript examples 项目地址: https://gitcode.com/gh_mirrors/nj/njs-examples njs(NGINX JavaScript)是一个强大的工具,它允许开发者使…

2026/8/6 21:02:03 阅读更多 →
【AI在线咨询落地实战指南】:20年IT专家亲授5大避坑法则与3周上线速成路径

【AI在线咨询落地实战指南】:20年IT专家亲授5大避坑法则与3周上线速成路径

更多请点击: https://codechina.net 第一章:AI在线咨询落地的核心价值与战略定位 AI在线咨询已从技术概念演进为关键业务基础设施,其核心价值不仅体现在响应效率提升,更在于重构客户信任路径与服务成本结构。当企业将AI咨询能力嵌…

2026/8/6 21:02:03 阅读更多 →
发电企业的数据,为什么“存得多”却“用得少”?

发电企业的数据,为什么“存得多”却“用得少”?

在数字化转型的浪潮中,发电企业无疑是走在最前列的行业之一。SIS系统实时采集机组运行数据,MIS系统管理设备台账和检修记录,燃料系统跟踪煤质化验和库存变化,财务系统核算成本和经营指标,大大小小七八套系统&#xff0…

2026/8/6 21:02:03 阅读更多 →

最新新闻

企业该把多少工作交给 AI 自动完成?

企业该把多少工作交给 AI 自动完成?

企业交给 AI 自动完成的工作量,应由任务风险、结果可验证性、权限范围和失败后的可逆性共同决定。规则稳定、结果能校验、失败容易撤回的步骤可以自动运行;涉及付款、合同生效、客户权益或生产数据写入的动作,应保留审批或复核节点。自动化比…

2026/8/6 22:39:44 阅读更多 →
Oraxen资源包混淆与保护:防止纹理盗用的安全策略

Oraxen资源包混淆与保护:防止纹理盗用的安全策略

Oraxen资源包混淆与保护:防止纹理盗用的安全策略 【免费下载链接】oraxen Oraxen is a minecraft plugin that allows to easily use Minecraft 1.14 features in order to create new items with custom textures. It handles the resourcepack generation, upload…

2026/8/6 22:39:44 阅读更多 →
Tempesta TLS性能深度测评:比Nginx/OpenSSL快40-80%的秘密

Tempesta TLS性能深度测评:比Nginx/OpenSSL快40-80%的秘密

Tempesta TLS性能深度测评:比Nginx/OpenSSL快40-80%的秘密 【免费下载链接】tempesta Web application acceleration, advanced DDoS protection and web security 项目地址: https://gitcode.com/gh_mirrors/te/tempesta Tempesta FW 是一款开源的 Web 应用…

2026/8/6 22:39:44 阅读更多 →
Java AWT鼠标事件全解析

Java AWT鼠标事件全解析

要执行这些 Java AWT 程序,你需要将它们分别保存为独立的 .java 文件,并使用 javac 和 java 命令进行编译和运行。以下是每个程序的执行步骤和功能说明。 1.程序清单 1: MouseEventsDemo.java 此程序演示了鼠标事件处理,包括点击、进入、退…

2026/8/6 22:39:44 阅读更多 →
没注册的商标被抢注怎么办?在先权利如何保护未注册商标(一)

没注册的商标被抢注怎么办?在先权利如何保护未注册商标(一)

商标没下证、没注册成功,就完全不受法律保护吗?现实里大量商家、工作室、个人原创设计的logo、图文标识,长期使用、慢慢做出名气,结果因为晚一步注册,被别人抢先申请、直接夺走。很多人自认倒霉,觉得自己没证就没话语…

2026/8/6 22:39:44 阅读更多 →
Growler路由系统详解:构建RESTful API的终极指南

Growler路由系统详解:构建RESTful API的终极指南

Growler路由系统详解:构建RESTful API的终极指南 【免费下载链接】Growler A micro web-framework using asyncio coroutines and chained middleware. 项目地址: https://gitcode.com/gh_mirrors/gr/Growler Growler是一个基于asyncio协程和链式中间件的微型…

2026/8/6 22:38:43 阅读更多 →

日新闻

深入解析LimboAI C++内核:架构设计与性能优化实战

深入解析LimboAI C++内核:架构设计与性能优化实战

1. 项目概述:为什么我们需要深入LimboAI的C内核?如果你是一名使用Godot引擎的游戏开发者,尤其是对AI行为逻辑有较高要求的项目,那么LimboAI这个名字你大概率不会陌生。它作为Godot 4生态中一个备受瞩目的行为树与状态机插件&#…

2026/8/6 0:00:06 阅读更多 →
Unity 2D游戏敌人AI系统:基于PlayMaker状态机与2D Toolkit的实战开发

Unity 2D游戏敌人AI系统:基于PlayMaker状态机与2D Toolkit的实战开发

1. 项目概述与核心思路大家好,我是老张,一个在游戏开发一线摸爬滚打了十多年的老码农。今天咱们接着聊《空洞骑士》风格2D动作游戏的Demo制作。上一期我们搭好了基础框架,处理了角色移动和碰撞,这一期,我们要让游戏世界…

2026/8/6 0:00:06 阅读更多 →
被动防火门市场前景发展趋势

被动防火门市场前景发展趋势

被动防火门依靠材质结构、密闭构造阻隔烟火蔓延,无需电控启动,是建筑被动消防系统核心构件,行业依托新规管控、城市更新、工业安全升级迎来稳定扩容,整体朝着合规化、专项化、低碳化、智能化方向发展。现阶段 GB12955‑2024 新版国…

2026/8/6 0:00:06 阅读更多 →

周新闻

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

1. 从水管网络到最大流:一个核心问题的诞生想象一下,你是一个城市供水系统的总工程师。你的城市有多个水源(水库),需要通过一个复杂的地下管道网络,将水输送到各个居民区。每条管道都有其最大通水能力&…

2026/8/6 22:02:27 阅读更多 →
基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台…

2026/8/6 22:02:27 阅读更多 →
MATLAB xcorr函数详解:从互相关原理到四大实战应用

MATLAB xcorr函数详解:从互相关原理到四大实战应用

1. 从一次信号“找茬”说起:为什么我们需要互相关几年前,我在处理一组声学传感器数据时遇到了一个棘手的问题。我有两个麦克风记录了一段相同的音频信号,理论上它们接收到的声音波形应该非常相似,只是由于麦克风位置不同&#xff…

2026/8/6 22:02:27 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/5 23:28:39 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/6 22:02:28 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/5 23:46:51 阅读更多 →