具身操作数据金字塔:综述
26年7月来自北京大学、南洋理工、香港科技大学、新加坡国立、香港中文大学、香港大学、杜克大学、加州伯克利分校、乔治城大学、南京大学和上海交通大学的论文“Data Pyramid for Embodied Manipulation: A Survey”。这篇综述的主要价值是把具身操作的数据来源、采集方式、监督信号和模型用途放进同一个框架。它提供了一张较完整的数据地图但尚未给出经过充分验证的“最优数据配方”。1论文围绕一个核心问题展开训练具身基础模型究竟需要什么数据机器人需要把感知与物理执行连接起来理解当前状态、选择动作、预测动作后果并根据实际反馈调整行为。因此仅有图像识别、语言理解或视频预测能力仍不足以支持可靠操作。论文的组织逻辑是数据从哪里来 → 能提供什么监督 → 如何转换和对齐 → 支持什么模型能力。全文主要分为三部分如图 1 所示第 2—6 节五类数据的来源、采集流程、表示方式、规模与局限。第 7 节这些数据如何支持具身大脑、视觉—语言—动作模型和世界—动作模型。第 8 节触觉、失败恢复、规模化采集、跨本体对齐、灵巧操作和数据配比六个研究方向。这里的“本体”指机器人的身体与控制配置例如机械臂结构、手指自由度、传感器和执行器。2数据金字塔的核心是规模化能力与机器人对齐程度之间的权衡。第 3—6 页论文用两个主要维度组织金字塔数据规模化的演化如图 2 所示可扩展性增加数据时需要付出多少硬件、人力、环境复位、维护和安全监督成本。机器人对齐程度数据中的观测、表示和监督信号能在多大程度上直接支持真实机器人的学习与执行。另外四个维度用于补充判断质量、多样性、可复用性、物理保真度。它们分别关注数据是否可靠且有信息量、覆盖范围是否足够广、能否跨任务和平台迁移以及是否真实反映接触、摩擦、柔顺性和控制延迟等物理因素。金字塔从顶部到底部依次为这个层次不能直接当作数据质量排名。 作者明确说明排序是多个维度的综合概括并非每项属性都严格单调。例如仿真能够提供明确的机器人动作而普通人类视频通常不能但人类视频中的交互发生在真实物理世界。如图 3 所示数据使用的演化3五层数据分别解决不同问题也各自保留了难以替代的作用。真实机器人数据提供完整的实际执行经验。第 7—14 页其核心优势在于观测、动作和物理后果来自同一个真实系统包含实际的传感噪声、控制延迟、摩擦和硬件限制。论文梳理了三类采集方式自动采集规则脚本、轨迹回放、自主策略执行。人工示范拖动示教、主从遥操作、VR手机控制、视觉动作映射、穿戴设备。人在回路中的纠正机器人自主执行操作者在出错时介入形成针对性的恢复数据。发展趋势包括从单臂走向双臂、移动操作、人形机器人和灵巧手以及从视觉和关节状态扩展到触觉、力力矩、音频等模态。按论文表 1 的口径DROID 约有 7.6 万条轨迹、350 小时数据AgiBot World Beta 达到约 100 万条轨迹、2,976 小时。这体现了规模增长但论文也强调重复同一种任务的轨迹并不等价于更广的能力覆盖。这一层最重要的启示是真实数据的价值既来自准确的成功示范也来自部署时实际遇到的偏差、失败与纠正。UMI 把数据采集与目标机器人解耦同时保留较明确的动作结构。第 14—16 页UMI即 Universal Manipulation Interface通常让人直接操作便携式夹爪或灵巧接口同步记录相机观测、末端位姿、夹爪开合部分系统还记录触觉和力。其典型流程是人操作采集装置 → 恢复末端运动轨迹 → 表示为相对位姿和夹爪命令 → 映射到目标机器人的控制接口。这里的关键设计是末端中心的相对动作表示记录工具如何移动减少对某一种机械臂关节结构的依赖。FastUMI-100K 等工作体现了这一范式的规模化潜力。但“采集时不需要机器人”不意味着“部署时无需适配”。人的活动范围、工具形状、相机位置以及接触方式仍可能与目标机器人不同追踪误差和同步误差也会污染动作标签。UMI 通常还缺少目标机器人的关节状态与执行器动力学。因此它适合扩大真实场景下的动作示范覆盖仍需真实机器人数据验证和校准。第一第三人称人类数据提供最丰富的人类交互经验但需要把视频加工成有效监督。第 16—22 页第一人称视频贴近操作者视角能记录日常操作第三人称视角补充被遮挡的手、身体和环境信息。论文把监督构建分为四类代表性资源包括 Ego4D、Ego-Exo4D、HOT3D、EgoDex 等。例如论文表 3 将 EgoDex 的规模列为约 829 小时。这里需要区分两个事实交互本身发生在真实世界从视频恢复出的手部姿态、接触和机器人动作却可能有误差。 遮挡、运动模糊、尺度不确定性和人机结构差异会沿着处理流程累积。论文因此倾向于将人类视频视为任务意图、抓取选择、接触顺序和工具使用策略的来源再用机器人数据落实具体执行。如图 4 所示这些数据的动作-轨迹多样性如图 5 所示 UMI 数据和真实机器人数据的概述如图 6 所示以自我为中心和以环境为中心的数据采集基础设施与监督表征概览。仿真数据提供可控、可重复、可并行生成的交互经验。第 22—29 页论文把仿真体系拆成三个相互关联的部分机器人及其传感器、执行器、控制接口。物体、材质和场景资产。物理引擎与渲染系统。数据生成方法包括人工示范、规则与运动规划、种子轨迹扩增、强化学习策略执行以及语言模型辅助的任务和环境生成。MimicGen 一类方法从少量示范扩展出更多轨迹RoboTwin、RoboCasa、ManiSkill 等代表不同的任务与仿真生态。仿真还可以直接提供物体位姿、分割、接触状态、奖励和成功标签等难以在现实中获得的信息。如图 7 所示仿真基础设施和数据采集流水线论文对仿真差距的划分很有用观测差距纹理、光照、深度噪声、遮挡和传感器响应不同。运动学差距关节限制、坐标系、控制接口与标定不同。动力学差距摩擦、柔顺性、延迟、形变、惯性等不匹配。此外论文将世界模型作为“学习得到的模拟器”讨论用于训练、评估和合成交互数据。但它明确提醒生成视频看起来合理并不能保证动作后果真实、轨迹可执行或策略评估可靠。通用数据为操作建立感知和认知基础。第 29—35 页如图 8 所示通用数据类别概述这一层覆盖的内容远超普通图文问答视觉语言数据物体、功能、指令和常识理解。分割、定位与可供性数据找到可抓取区域、把手、按钮和放置位置。三维数据深度、方向、距离、空间关系和可达性。规划数据将目标分解为步骤和子目标。时序数据定位事件、追踪状态变化、利用历史观测。物理与失败推理数据预测结果、解释失败、提出恢复方案。抓取数据提供抓取姿态、接触位置和质量等监督。例如执行“打开抽屉”需要识别抽屉、定位把手、估计空间关系、理解动作顺序再把这些信息转成控制命令。不同通用数据分别补足其中的前置能力。不过这一层的定义较宽部分内容已经包含直接的操作监督这也是后面需要讨论的分类问题。4论文进一步说明同一种数据进入不同模型后会承担不同角色。第 35—43 页这是功能上的侧重划分具体模型之间存在交叉。论文关于数据利用的两个技术要点尤其值得保留。第一没有动作标签的视频仍然可以参与策略训练。一种方法学习“潜在动作”即从前后观测中提取紧凑的变化表示另一种方法恢复可解释的几何信息例如点轨迹、物体运动场、手部或腕部运动。这些表示可以扩大预训练规模但仍需要动作解码、重定向或机器人示范把它们连接到真实控制。视频中发生了什么与机器人应当执行什么之间仍有距离。第二跨机器人训练需要同时解决动作语义和几何坐标问题。论文归纳了三种动作接口本体专用适配器或动作头保留各机器人的原生接口共享中间表示。统一维度并补零方便联合训练但相同位置未必具有相同物理含义。语义动作槽位预先规定各部分表示机械臂、末端、夹爪或手指缺失部分使用掩码。此外还要统一或明确机器人基座、相机、手腕等参考系以及单位、旋转表示、绝对增量动作和工具中心点。把数据文件整理成同一种格式只解决了存储问题监督是否兼容还取决于这些物理语义。5这篇综述最值得记住的要点可以归纳为六条。数据源之间存在互补关系。 通用数据支持理解人类数据扩展交互先验UMI 提供结构化示范仿真提供可控经验真机数据落实实际执行。数据规模必须结合有效覆盖来看。 更多小时、帧数或轨迹不一定增加新的任务、状态、接触方式和恢复策略。动作对齐是跨数据源学习的核心瓶颈。 坐标、控制语义、机器人结构和接触差异都可能形成冲突监督。人类视频正在成为重要的预训练来源。 它的价值取决于能否提取可迁移的信息并控制姿态恢复和动作映射的误差。世界模型同时是数据使用者和数据生成者。 它可以形成“学习—生成—再训练”的循环但需要真实交互约束生成误差。多源混合的优势尚不能一概而论。 作者在第 36 页和第 45 页明确承认现有证据不足以证明数据来源越多越好也没有确定普适的最佳比例。最后一点限定了整篇论文结论的强度它解释了为什么各种数据可能有用但没有证明某个组合在所有条件下最优。6作者指出的领域问题集中在“采什么、怎么采、怎么用”。第 43—45 页其中“失败数据”尤其容易被误解。论文主张保留并结构化利用失败经验而失败检测、原因诊断、价值判断和恢复策略学习需要不同的标签与训练目标。7综述本身以下问题最值得指出。第一五层分类混合了采集来源、采集接口和训练用途边界不够统一。真实机器人和仿真主要按来源划分UMI 按采集接口划分第一第三人称数据带有视角与主体属性通用数据则很大程度上按监督用途划分。具体表现是RoboNet 同时出现在真实机器人数据表 1 和通用数据表 6。DexGraspNet 2.0 同时出现在仿真数据表 5 和通用数据表 6。通用数据还包含机器人视频、抓取姿态及动作相关标签。同一数据集支持多种用途完全合理但这意味着五层不能直接作为互斥的统计分类。更清楚的方式是分别标注采集来源、监督形式、机器人对齐程度、训练用途并说明跨层复用关系。第二金字塔直观但不足以支持严格的数据优先级判断。作者已经承认排序并非严格单调这一点是审慎的。然而六个评价维度没有统一度量也没有给出聚合权重。实际价值还取决于任务针对特定机器人和任务的仿真数据可能比一般人类视频更直接高噪声、覆盖狭窄的真机数据也未必具有更高训练价值。因此金字塔适合帮助读者认识数据生态不能直接推出采购、采集或训练预算的分配顺序。第三对“规模”的整理比对“有效信息量”的分析充分。图 2 使用示范数、视频小时数和问答对数量等不同单位作者说明了口径差异但缺少进一步标准化。还需要区分独立采集的经验与重复、重叠片段。完整操作轨迹与单个抓取候选。原始数据与经过扩增、重定向的派生数据。名义数据量与通过质量检查的可用数据量。这些数量都能描述规模却不能直接换算为学习价值。综述若增加有效样本量、独立场景覆盖、接触事件覆盖以及单位成本收益会更有指导性。第四图 4 对轨迹多样性的展示只能提供有限证据。图 4 用关键帧的三维空间分布作为轨迹多样性的代理。图注说明使用了启发式关键帧提取和可比初始配置但展示任务包括货架整理、折衣服、放锅、倒酒等任务本身就不同。因此空间分布的差异可能来自任务需求、工作空间和身体结构。更分散的点云无法单独证明策略更多样、接触模式更丰富或泛化效果更好。这张图适合作为现象展示若要支撑类别比较还需要控制任务、坐标尺度和样本量并结合行为与接触层面的指标。第五模型数据表能说明“用了什么”尚不能充分说明“为什么有效”。表 7 主要通过图标标注数据来源缺少统一整理的采样比例、损失权重和数据质量筛选方法。各来源进入预训练、联合训练或后训练的阶段。总训练预算与各来源带来的边际收益。骨干模型已经继承的通用预训练数据。尤其需要谨慎理解“仅使用机器人数据”它可能描述某个具身训练阶段而模型骨干仍继承了通用图文或视频预训练能力。论文已承认缺少严格消融作为综述可以进一步建立证据矩阵区分哪些结论来自受控比较哪些仅来自不同系统的报告。第六文献覆盖广但检索与证据分级不够可复现。正文没有明确呈现系统性的检索来源、关键词、纳入排除标准和筛选流程也没有统一区分独立验证结果、作者报告结果及开放可复现程度。这不影响其作为叙述性综述的价值但读者难以判断覆盖是否完整哪些判断证据较强哪些主要反映研究趋势。第七尚缺少贯穿五层数据的统一评估与数据管理框架。论文分别讨论了各层局限也讨论了世界模型评估但没有形成一套统一协议回答数据改善了同分布成功率还是陌生物体、场景、任务和机器人上的泛化对长时任务、错误恢复和接触稳定性有何影响相同采集成本和训练预算下哪一类数据的收益更大跨数据集是否存在重复、训练测试泄漏或共同来源人类视频与派生数据的来源、使用权限和处理过程是否清晰可追溯若要把这篇综述进一步发展成可操作的方法论最需要补上的是按任务和机器人条件设计的等预算实验以及从数据来源、转换过程到真实部署收益的可追溯记录。这样才能把“各层可能有用”推进到“在什么条件下、用多少、通过什么方式有用”。

相关新闻

AI自动跟进客户购建站横评:外贸智能体对比AI智能回复询盘与询盘独立站选型指南篇

AI自动跟进客户购建站横评:外贸智能体对比AI智能回复询盘与询盘独立站选型指南篇

内容摘要:外贸企业用AI处理买家询盘已成主流。本文横向评测五家主流服务商,结论是:选对询盘智能体可使首响压缩至30秒、回复准确率超90%,中小团队人效提升约3倍。不同业务诉求对应不同选型,盲目堆功能反而低效。海外买…

2026/10/9 2:49:45 阅读更多 →
3款开源足迹工具横评 你的老账号还躺在多少网站上

3款开源足迹工具横评 你的老账号还躺在多少网站上

title: “3款开源足迹工具横评 你的老账号还躺在多少网站上” date: 2026-10-06 categories: [网络安全, 开源工具, 隐私保护] tags: [GitHub, 数字足迹, 隐私自查, 工具横评]#GitHub#开源工具#数字足迹#隐私自查01 一、先说个我刚做完的实验 写这篇之前,我把 GitHu…

2026/10/9 2:49:45 阅读更多 →
锁住一行以后,谁还能继续?用三个会话观察InnoDB锁等待

锁住一行以后,谁还能继续?用三个会话观察InnoDB锁等待

锁住一行以后,谁还能继续? 只记住“InnoDB支持行锁”还不足以解释一次阻塞:锁着的时候能不能读?能不能更新另一行?屏幕不动究竟是在等锁,还是SQL本来就慢? 这次不先罗列锁的分类。我只建两条记…

2026/10/9 2:48:45 阅读更多 →

最新新闻

用Iris数据集快速跑通SVM分类全流程

用Iris数据集快速跑通SVM分类全流程

简介:本资源是一份面向机器学习初学者与课程实践者的Python支持向量机(SVM)教学实践包,聚焦经典Iris鸢尾花数据集的二分类与多分类建模任务,完整覆盖算法实现、结果可视化与实验分析全流程。压缩包共16个文件&#xff…

2026/10/9 3:23:07 阅读更多 →
Ubuntu 22.04 安装 NVIDIA Container Toolkit 实现 Docker GPU 调用完整指南

Ubuntu 22.04 安装 NVIDIA Container Toolkit 实现 Docker GPU 调用完整指南

Ubuntu 22.04 LTS 上安装 NVIDIA Container Toolkit,是我这几年搭深度学习环境时每次都要打交道的环节。简单说,这个东西就是让 Docker 容器能直接调用宿主机 GPU 驱动、CUDA 运行时的桥梁——装好了,你就可以在容器里跑 PyTorch、跑训练脚本…

2026/10/9 3:23:07 阅读更多 →
VMware Workstation 跑 Linux 虚拟机:从选型到排错的全实战指南

VMware Workstation 跑 Linux 虚拟机:从选型到排错的全实战指南

在 VMware Workstation Pro 里跑 Linux 虚拟机,我算了算也有好几年了。最近整理硬盘时翻出一堆当时排查问题随手存的截图和操作记录,想着干脆整理成一篇使用记录,给自己留个档,也给刚入坑的朋友一点参考。这篇文章不是什么官方教程…

2026/10/9 3:23:07 阅读更多 →
XSS攻击与CSP防御实战:从绕过原理到纵深防线落地

XSS攻击与CSP防御实战:从绕过原理到纵深防线落地

1. 从“一个合法请求”讲起:XSS攻击的原理解读与类型辨析很多刚接触前端安全的人,第一眼看到XSS(跨站脚本攻击)这个词,会下意识觉得“这不就是往页面里塞一段脚本吗,有什么难的”。但真正在企业级项目里排查…

2026/10/9 3:23:07 阅读更多 →
嵌入式Bootloader链接脚本.sct实战解析

嵌入式Bootloader链接脚本.sct实战解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 3:23:07 阅读更多 →
Java设计模式实战:策略模式如何用Spring Boot告别if-else

Java设计模式实战:策略模式如何用Spring Boot告别if-else

1. 策略模式到底在解决什么问题先看一段代码。我接手过一个商城项目,第一版订单结算长这样:根据用户类型算折扣,金牌、银牌、普通用户各一套规则,后面又加了节日促销、新人首单、会员日翻倍。半年之后,calculate方法变…

2026/10/9 3:22:06 阅读更多 →

日新闻

Java时间API实战:LocalDate、Date与ZonedDateTime的转换与避坑指南

Java时间API实战:LocalDate、Date与ZonedDateTime的转换与避坑指南

Java时间API这个话题,隔三差五就会在群里被翻出来讨论一次。上周还有个同事线上处理一个订单超时问题,排查到最后发现是ZonedDateTime序列化后时区丢了,用户在下单当天晚上看到的时间整整差了8个小时。这类问题几乎每个做Java开发的人都遇到过…

2026/10/9 0:00:49 阅读更多 →
EasyTier实践:从NAT穿透到子网代理的异地组网部署与排错

EasyTier实践:从NAT穿透到子网代理的异地组网部署与排错

前几个月我手头有好几台机器需要互相访问:办公室台式机、家里 NAS、还有一台云主机。如果只是偶尔传个文件倒还好,问题是工作场景经常要在几处环境之间来回切换,每次都先登录跳板机再层层代理,实在折腾。我先后试过端口映射、自建…

2026/10/9 0:00:49 阅读更多 →
AI Agent工程实战:从七要素到七个决策点的系统设计指南

AI Agent工程实战:从七要素到七个决策点的系统设计指南

AI Agent 这个词在过去一年里被反复提及,但真正动手搭过一套能跑起来的 Agent 系统的人都知道,从"知道它是什么"到"让它稳定干活"之间隔着一整套工程决策。我前后参与过几个 Agent 项目的落地,从最初用现成框架拼装&…

2026/10/9 0:01:50 阅读更多 →

周新闻

KT148A语音芯片外挂8002D功放的工程实践指南

KT148A语音芯片外挂8002D功放的工程实践指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/8 15:26:32 阅读更多 →
LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/8 15:26:40 阅读更多 →
ARM架构深度解析:从RISC设计理念到交叉编译实战

ARM架构深度解析:从RISC设计理念到交叉编译实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/8 10:10:36 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/8 21:13:17 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/8 15:26:17 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/7 13:34:55 阅读更多 →