《VLA 系列》Human-to-Robot Transfer | 人类视频共训练 | 跨本体涌现迁移 | 论文解析
人类视频数量大、场景丰富采集成本也比机器人遥操作低得多但人和机器人长得不一样、运动方式不一样动作空间更不一样。过去的方法通常要做视觉域对齐、手部重定向或专门的跨本体模块。这篇论文给出的结论反而很简单当 VLA 已经在足够多的场景、任务和机器人本体上预训练后不需要额外设计显式对齐损失仅通过人类数据与机器人数据共微调人类示范中的新场景、新物体和新任务知识就能迁移到机器人。先说结论方法以 π0.5 为基座把人类视为训练混合中的一种新本体而不是额外接一个 human-to-robot 转换网络。人类视频并非裸视频作者使用头戴相机和双腕相机恢复头部 6D 轨迹、双手 3D 关键点并密集标注子任务文本。训练同时使用高层子任务预测和低层动作预测低层动作既监督离散 FAST token也监督连续 Flow Matching 动作头。迁移并不会在小模型或低多样性预训练阶段自然发生。预训练覆盖达到 75%、100% 以及更多机器人本体后人类数据带来的增益才明显出现。四项泛化任务中Spice 从 32% 提升到 71%Dresser 从 25% 提升到 50%鸡蛋颜色分类准确率从 57% 提升到 78%。论文https://arxiv.org/abs/2512.22414官方项目页https://www.pi.website/research/human_to_robotπ0.5 基座代码https://github.com/Physical-Intelligence/openpi需要提前说明论文没有给出这套人类数据处理、共训练配方和 benchmark 的官方源码。1、论文真正解决的是数据能否被模型吃进去把人类视频用于机器人学习难点通常被概括为 domain gap人手和机械臂外观不同人的头部运动和移动底盘不同人也没有与机器人夹爪完全对应的控制量。小规模方法往往要人为缩小这个差异例如遮挡手部、生成机器人外观、做动作重定向或只提取关键点、可供性和奖励等中间信号。这篇工作的出发点不同。作者把问题改写成当 VLA 已经通过大规模、多任务、多场景、多本体预训练学到足够通用的表示后它能否像大语言模型利用异构指令数据一样自行利用人类示范图 1 的重点不是两条曲线都随着预训练增强而上升而是两条曲线之间的距离。蓝线是不加入人类数据的机器人微调黄线是人类与机器人共微调。预训练较弱时两者几乎没有差别预训练多样性跨过一定范围后黄线才明显高于蓝线。换句话说预训练规模不仅提高了基础成功率还改变了模型利用新数据源的能力。2、π0.5 ego 如何统一人类和机器人数据2.1 几个容易混淆的概念概念论文中的含义是否在机器人推理时使用π0.5预训练 VLA 基座包含视觉语言骨干与动作专家是π0.5 egoπ0.5 在人类第一视角数据和相关机器人数据上共微调后的模型是人类 embodied data带头部/手部运动信号和子任务标注的第一视角视频不是普通无标注网络视频仅训练使用高层子任务对当前阶段的短文本描述如拿起香料瓶”先由模型预测再作为低层动作条件低层动作一段未来末端位姿、底盘运动及机器人夹爪控制是embodiment-agnostic representation对同一任务的人类观测和机器人观测形成更接近的隐表示是论文分析结果不是额外模块作者做的主要工作是把人类数据加工到与机器人数据大致相容的观测、语言和动作表示中再使用同一套训练目标。图 3 把训练和测试的边界画得很清楚。每项实验都选择一个机器人数据没有覆盖、但人类数据覆盖的新概念新房间、新物体或新的任务语义。微调数据中人类目标任务与最相近的机器人任务按 50:50 混合最终只在仅出现在人类示范中的目标条件上测试机器人。2.2 人类数据如何采集和加工作者让采集者佩戴一个头部相机和两个腕部相机按机器人遥操作数据的 episodic 形式重复完成任务。四项任务的人类数据分别为Bussing 3 小时、Spice 3 小时、Dresser 3 小时、Sort Eggs 5 小时合计 14 小时。原始视频要经过三步加工使用视觉 SLAM 恢复头戴相机相对固定世界坐标系的 6D 位姿e t ∈ R 6 e_t\in\mathbb{R}^{6}et​∈R6。在头部相机坐标系中恢复双手各 17 个 3D 关键点h t e ∈ R 3 × 17 h_t^e\in\mathbb{R}^{3\times17}hte​∈R3×17。对每段示范进行密集子任务标注分别描述两只手正在完成的短时原子动作。这里有一个很重要的工程前提论文虽然强调不做显式迁移学习但并不是完全不做对齐。它仍然通过相机配置、3D 跟踪、相对位姿和任务标注完成了数据接口层的弱对齐被省掉的是专门的域适配网络、额外对齐损失和人工机器人化视觉转换。2.3 动作空间如何对齐机器人动作不使用关节角而使用更容易和人手对应的末端位姿。对长度为H HH的动作块a t : t H [ a t , a t 1 , … , a t H ] a_{t:tH}[a_t,a_{t1},\ldots,a_{tH}]at:tH​[at​,at1​,…,atH​]其中H HH是动作块长度a i a_iai​表示相对于当前状态s 0 s_0s0​的未来 6DoF 位姿或其他控制量。使用相对运动而不是绝对世界坐标可以减小不同房间、不同初始位置和不同本体之间的坐标差异。机器人侧每个时间步包含左臂 6DoF 夹爪、右臂 6DoF 夹爪、2 维底盘动作共 16 维因此动作块为a ∈ R H × 16 a\in\mathbb{R}^{H\times16}a∈RH×16。人类侧则用手掌、中指和无名指的 3D 关键点定义一个近似末端位姿。两只手各提供 6DoF头部相机轨迹提供 6DoF一共 18 维。作者没有估计人的夹爪开合机器人夹爪能力完全从机器人数据中学习。2.4 模型结构高层语言和低层动作一起迁移模型先根据图像和高层任务指令预测短时子任务再把这个子任务作为低层动作生成条件。对于整理梳妆台高层输出可能是把项链放进首饰盒低层动作专家再生成双臂和底盘的连续动作块。这种分层设计让人类数据可以从两个层面提供监督高层迁移学到哪些物体应该放到哪里、任务下一步是什么。低层迁移学到接近物体、搬运和放置时的相对运动模式。它仍然是 VLA不是 World Model 或 World-Action Model。模型没有预测未来图像也没有用未来视觉子目标驱动动作未来预测仅指动作块预测。3、训练流和推理流3.1 训练流VLA 的基本监督样本写成D ( o t , l t , a t : t H ) \mathcal{D}\left(o_t,l_t,a_{t:tH}\right)D(ot​,lt​,at:tH​)其中o t o_tot​是当前多视角视觉观测和可用状态l t l_tlt​是任务语言a t : t H a_{t:tH}at:tH​是未来动作块。策略学习的是π θ ( a t : t H ∣ o t , l t ) \pi_\theta(a_{t:tH}\mid o_t,l_t)πθ​(at:tH​∣ot​,lt​)θ \thetaθ表示模型参数。这个式子的直观含义是看到当前环境并理解任务后一次预测接下来一段动作而不是只预测单步控制。论文的共微调流程可以概括为从人类视频提取头部 6D 轨迹、双手 3D 关键点和相对动作并添加子任务文本。从机器人数据选择语义上最近的任务例如用把鸡蛋放进纸盒对应人类的按颜色分拣鸡蛋。按 50:50 采样人类目标任务与最近邻机器人任务。对高层子任务做自回归 next-token predictionp θ ( l t subtask ∣ o t , l t ) p_\theta(l_t^{\text{subtask}}\mid o_t,l_t)pθ​(ltsubtask​∣ot​,lt​)l t subtask l_t^{\text{subtask}}ltsubtask​是当前短时子任务文本。它既是训练标签也会在推理时成为低层策略的条件。对低层动作同时训练离散 FAST token 预测和连续 Flow Matching 动作预测π θ ( a t : t H ∣ o t , l t subtask ) \pi_\theta(a_{t:tH}\mid o_t,l_t^{\text{subtask}})πθ​(at:tH​∣ot​,ltsubtask​)Flow Matching 中训练代码将真实动作a aa与高斯噪声ϵ \epsilonϵ混合x τ τ ϵ ( 1 − τ ) a x_\tau\tau\epsilon(1-\tau)axτ​τϵ(1−τ)au τ ϵ − a u_\tau\epsilon-auτ​ϵ−aL FM E [ ∥ v θ ( x τ , o , l , τ ) − u τ ∥ 2 2 ] \mathcal{L}_{\text{FM}}\mathbb{E}\left[\left\|v_\theta(x_\tau,o,l,\tau)-u_\tau\right\|_2^2\right]LFM​E[∥vθ​(xτ​,o,l,τ)−uτ​∥22​]这里τ ∈ ( 0 , 1 ) \tau\in(0,1)τ∈(0,1)是生成模型内部的噪声时间不是机器人真实物理时间x τ x_\tauxτ​是被加噪的动作块u τ u_\tauuτ​是目标速度场v θ v_\thetavθ​是动作专家预测的速度。训练目标是让模型学会把纯噪声沿速度场逐步推回到可执行动作分布。3.2 推理流机器人测试时不需要人类视频、未来图像、人体 3D 关键点或 SLAM 轨迹。推理链路是输入机器人当前的多相机观测和用户任务指令。高层策略预测当前子任务文本。子任务文本与当前观测一起条件化低层动作专家。动作专家从高斯噪声出发经过多步 Flow Matching 积分得到连续动作块。机器人执行动作块获取新观测后继续闭环预测。openpi当前 JAX 实现中sample_actions(..., num_steps10)默认使用 10 个积分步并明确采用τ 1 \tau1τ1为噪声、τ 0 \tau0τ0为目标动作的约定。这个噪声时间不要与动作块跨度或控制频率混为一谈。论文没有报告本文实验的端到端推理延迟和实际控制频率不能从默认代码配置反推真机设置。4、迁移为什么会随预训练多样性出现作者构造了六档初始化0% 仅有 VLM 初始化25%、50%、75%、100% 逐步增加目标 ARX 和 mobile ARX 的“场景-任务”组合100% X-emb 再加入大量非目标机器人本体也就是完整 π0.5 预训练混合。图 2 画的不是最终成功率而是“人类 机器人微调”相对“仅机器人微调”的绝对分数增益。0% 和 25% 时几乎没有稳定收益75%、100% 后增益快速增加加入跨本体预训练后总体迁移更强。这说明更强的零样本泛化和更强的人类数据利用能力相关但不是同一个量。附录中的逐任务曲线更能说明问题某些检查点升级并没有提高机器人-only 的目标任务表现却明显提高了加入人类数据后的表现。也就是说预训练多样性可能先改善可迁移性不一定立刻表现为目标任务的零样本成功率。作者进一步对 VLM 最后一层输出的前 200 个 token 做均值池化再用 t-SNE 可视化。预训练较弱时人类和机器人样本分成两个簇随着场景、任务和本体多样性增加两者逐渐重叠。这个结果支持通用预训练产生本体无关表示的解释但它仍然是相关性证据。t-SNE 会扭曲全局距离论文也没有通过干预实验证明表示重叠就是迁移增益的唯一原因。因此更准确的表述是表示对齐与迁移能力同步增强为作者的机制假设提供了证据。5、实验结果到底证明了什么四个 benchmark 各自只让人类数据覆盖一个机器人数据缺失的概念任务泛化轴机器人数据已有能力人类数据新增概念指标Spice新场景在若干房屋整理香料架未见厨房全部香料瓶放入架子的二元成功率Dresser新场景在若干房屋整理梳妆台未见卧室项链和发夹正确归位的二元成功率Bussing新物体清理垃圾和餐具厨房工具等新物体9 个物体正确分类后的归一化得分Sort Eggs新任务抓取鸡蛋并放入纸盒按蛋壳颜色分到两个纸盒并关盒正确放置及关盒的归一化得分每个实验执行 20 到 40 次误差条为 1 个标准误。由于任务评分口径并不完全相同图中的柱高适合展示同一任务内部的增益不适合把 Bussing 的 0.6 与 Spice 的 0.6 当作完全同等难度。具体结果包括Spice 32%→71%Dresser 25%→50%Bussing 53%→63%。Sort Eggs 中仅机器人数据的策略会近似随机地把鸡蛋放入纸盒颜色分类准确率为 57%加入人类分拣示范后达到 78%平均多正确放置 4 个鸡蛋。论文还把人类数据与目标机器人数据、非目标机器人数据做了比较。Sort Eggs 和 Dresser 中相近规模的人类数据接近目标机器人数据的效果Bussing 中目标机器人数据仍明显更强报告的对比为 25% 对 65%。400 条、7.45 小时 UR5 示范迁移到 ARX 后也能超过基线但仍不如目标 ARX 数据。这更像跨本体机器人迁移而不是人类数据可以无条件替代目标机器人数据。5.1 高层和低层都要学在移动操作任务中只让人类数据训练高层或只训练低层都不如两层一起训练。只迁移高层时低层策略可能误解拿起香料瓶去抓托盘上已经放好的瓶子只迁移低层时高层策略又可能在瓶子拿起后仍反复输出同一个子任务。对于 Bussing 和 Sort Eggs评测时没有单独使用高层策略所以它们的增益证明低层动作预测本身也发生了迁移。5.2 腕部相机有帮助但不是所有任务都需要腕部视角在 Dresser 和 Bussing 上有明显收益在 Spice 和 Eggs 上差别较小。工程上比较合理的结论不是必须三相机而是近距离遮挡、精细放置和手部交互更强的任务更依赖腕部可观测性。若要规模化采集应根据任务是否需要近端视角评估传感器成本。6、方法价值、局限与工程判断这篇论文最有价值的地方不是又提出一种人手到机械臂的映射而是指出了一个数据工程方向当基座模型足够通用时人类动作数据可能像新的机器人本体数据一样被统一吸收。这让大规模人类数据的价值从训练视觉表征进一步走向直接改善动作生成。但从工程落地看还不能把结论理解为普通视频都可以直接拿来训练 VLA当前数据是专门采集的 episodic 示范手始终尽量处于视野内并带头部和腕部相机不是开放互联网视频。人类数据需要 SLAM、3D 手部跟踪和密集子任务标注数据处理成本仍然不低。论文只用了 14 小时目标人类数据尚未验证被动、无任务边界、长尾噪声视频的大规模预训练。四项任务集中在双臂/移动操作实验规模不足以给出普适临界点。人类 18 维动作与机器人 16 维动作如何进入统一实现、缺失夹爪标签如何 mask论文和代码都没有公开。人类数据在 Bussing 中仍明显弱于目标机器人数据说明接触细节、本体动力学和夹爪控制不能完全靠跨本体迁移补齐。t-SNE 只能支持表示对齐假设不能证明因果机制。

相关新闻

ArcGIS管网数据生产实战:从表格到拓扑完整流程

ArcGIS管网数据生产实战:从表格到拓扑完整流程

1. 项目概述:从零到一构建管网空间数据在市政、水利、石油化工乃至园区管理的日常工作中,我们常常会遇到一个基础但繁琐的任务:将一堆只有坐标和属性的表格数据,比如阀门位置、水表读数、管线材质规格,变成一张能在GIS…

2026/8/16 3:59:10 阅读更多 →
Go语言钉钉机器人插件ddingtalk实战:从入门到生产级告警系统构建

Go语言钉钉机器人插件ddingtalk实战:从入门到生产级告警系统构建

1. 项目概述与核心价值最近在折腾一个内部告警通知系统,需要把各种服务日志、监控告警实时推送到团队群里。市面上现成的方案要么太重,要么定制化不够灵活。直到我发现了largezhou/ddingtalk这个 OpenClaw 插件,它专门用于深度集成钉钉机器人…

2026/8/16 3:59:10 阅读更多 →
Linux上安装FFmpeg

Linux上安装FFmpeg

FFmpeg 是一套处理多媒体文件的软件。凭借这些强大的库,FFmpeg 能够转换格式、推流以及处理音频和视频文件。许多 Linux 的前端应用都使用 FFmpeg 作为后端支持,所以这些应用对 FFmpeg 的依赖度非常高。举个例子,录屏软件可能会用到 FFmpeg 将…

2026/8/16 3:59:10 阅读更多 →

最新新闻

TwinCAT3界面详解:从核心布局到高效调试的工控IDE指南

TwinCAT3界面详解:从核心布局到高效调试的工控IDE指南

1. 从零开始的TwinCAT3界面初探如果你刚拿到一份新工作,或者接手了一个自动化项目,打开电脑发现桌面上多了一个叫TwinCAT3的蓝色图标,点进去后面对着一堆陌生的窗口和菜单,感觉无从下手——这大概就是很多工控工程师,尤…

2026/8/16 4:52:22 阅读更多 →
Nacos 2.0 连接 127.0.0.1:9848 被拒绝?一文彻底解决 gRPC 端口通信问题

Nacos 2.0 连接 127.0.0.1:9848 被拒绝?一文彻底解决 gRPC 端口通信问题

1. 项目概述:从一条报错信息说起 “Connection refused: no further information: /127.0.0.1:9848” —— 如果你在折腾微服务,特别是和 Nacos 打交道,那么这条报错信息对你来说可能再熟悉不过了。它就像一个不请自来的幽灵,常常…

2026/8/16 4:52:22 阅读更多 →
WRC 2026前瞻:机器人产需共融下的核心能力与开发实践

WRC 2026前瞻:机器人产需共融下的核心能力与开发实践

这次我们来看一个关于机器人行业未来发展的深度话题。标题“WRC 2026前瞻:产需共融,机器人行业即将迎来一次能力大考”已经点明了核心:这不是一个具体的开源工具或模型部署教程,而是一次对行业趋势、技术挑战和未来能力要求的系统…

2026/8/16 4:52:22 阅读更多 →
企业培训PPT制作工具怎么选?2026主流平台功能实测与场景适配总结

企业培训PPT制作工具怎么选?2026主流平台功能实测与场景适配总结

一、行业开篇:企业培训PPT制作的常见痛点企业内部培训、员工赋能、技能宣讲场景中,PPT是标准化知识传递的核心载体。日常办公里,多数HR与培训人员制作课件常会遇到版式不规范、排版耗时久、内容与宣讲稿不匹配、素材复用率低、商用版权存疑等…

2026/8/16 4:52:22 阅读更多 →
2026年最新一体化管理系统/全链路供应链数字化/智能仓配一体化科技企业核心竞争力解构-任

2026年最新一体化管理系统/全链路供应链数字化/智能仓配一体化科技企业核心竞争力解构-任

引言随着数字经济与实体经济深度融合,企业数字化转型已经从“可选项”转变为“必选项”,传统分散式软件部署模式导致的数据孤岛、流程割裂、运维成本高企等痛点愈发凸显,一体化软件作为能够覆盖企业全业务链路、实现数据同源共享的数字化解决…

2026/8/16 4:52:22 阅读更多 →
商贸流通一体化软件开发商推荐|成都任我行快马科技,原厂全链路数字化解决方案服务商

商贸流通一体化软件开发商推荐|成都任我行快马科技,原厂全链路数字化解决方案服务商

一、前言:商贸企业数字化转型痛点,一体化软件成刚需 当下国内商贸流通行业迎来深度数字化变革,食品快消、建材五金、汽配农资、连锁餐饮、日化美妆等赛道企业普遍面临多重经营难题:多套管理系统独立运行,ERP进销存、订…

2026/8/16 4:51:22 阅读更多 →

日新闻

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

如果你是一名开发者,最近可能已经感受到了AI大模型正在从“玩具”变成“生产力工具”的强烈信号。从代码补全到智能Agent,从本地部署到云端API,我们正处在一个技术栈快速重构的节点。然而,面对层出不穷的模型、框架和工具&#xf…

2026/8/16 0:00:54 阅读更多 →
工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/16 0:00:55 阅读更多 →
【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

2026/8/16 0:03:55 阅读更多 →

周新闻

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

如果你是一名开发者,最近可能已经感受到了AI大模型正在从“玩具”变成“生产力工具”的强烈信号。从代码补全到智能Agent,从本地部署到云端API,我们正处在一个技术栈快速重构的节点。然而,面对层出不穷的模型、框架和工具&#xf…

2026/8/16 0:00:54 阅读更多 →
工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/16 0:00:55 阅读更多 →
【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

2026/8/16 0:03:55 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/14 13:40:53 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/14 14:06:45 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/15 2:35:29 阅读更多 →