机器人双手迎来全栈训练系统:灵初智能EgoSteer让灵巧手无所不能
记得何同学做过一个超复杂的流水线项目吗内容来源老师好我叫何同学这个视频发布于 2024 年 1 月当时要实现自动叠纸盒把礼物放进纸盒的自动化操作正是这样一个机械臂和自动化编程组合成的流水线。如果有一个能像人一样灵活的机器手来折叠包装长时间批量地工作何同学团队耗费心力打造的庞大流水线的功能就能够被两个小体积的灵巧手给完美实现。并且也不需要考虑各种流水线上的稳定性灵巧手自己就能够解决遇到的位置偏移变形等问题全面自主。相比复杂的机械臂和自动化灵巧手的自由度和泛用性显然是其不可比拟的。这很难但和人类双手接近的灵巧手已经出现了。这一对双臂灵巧手在精细操作、长程任务和泛化性上均展现出了亮眼的成绩而它来自于灵初智能。在这两个灵巧手准确协同实现精巧操作的背后是一套灵初智能与北大 - 灵初联合实验室共同发布并开源的技术范式称为 EgoSteer是一套双灵巧手通用操作大模型和全栈系统。论文链接https://egosteer.github.io/EgoSteer.pdf项目主页https://egosteer.github.io/#/到目前为止业界能跟随自由语言指令、还能在全新场景里泛化的模型少之又少。π0.7、DreamZero 这些近期在通用性上取得突破的工作把机器人能干的活儿从「一个任务」推到了「一批任务」但它们大多依赖昂贵的真机数据。但我们知道具身灵巧手最好的数据必然来自人类的双手。EgoSteer 是一个里程碑式的进步。它能跟随开放式的自然语言指令完成一百多种语义各异的灵巧操作任务还能用少量示范快速学会复杂的长程任务。该全栈系统已完整开源代码、模型权重数据也将近期开源为双灵巧手通用操作开究提供了一套高质量、可复现、可迭代的全栈基线。数据模型和系统深度技术拆解下面我们从三个层面把它拆开数据、模型和系统闭环。这三块拼在一起才能真正被称为「全栈」系统。近万小时人手视频变成训练数据先说一个反直觉的事实制约灵巧手大模型的瓶颈往往落在数据上。但数据本身其实并不稀缺稀缺的是能拿来训练的数据。第一人称人类视频也就是戴着相机以人的视角拍下的操作画面是天然的富矿。全网这类可用素材大约有 11.6 万小时人手在里面拧、捏、递、叠蕴含着海量的交互知识。问题在于这些视频原始状态下噪声大得惊人镜头剧烈晃动、双手频繁被遮挡、既没有可靠的语言标注也没有精确的动作标注。直接拿去训练模型学到的是一堆彼此矛盾的监督信号下游策略只会被带偏。灵初把处理这些视频的管线单独做成了一个系统叫 EgoSmith。它是一条四阶段的全自动流水线目标是把视频变成带精细语言和动作标注的可训练数据。EgoSmith 概览EgoSmith 能够将噪声较大的第一视角视频整理为高质量的灵巧操作 VLA 数据为语言驱动的机器人预训练提供可规模化的人手交互先验。第一阶段是预过滤。用简单但有效的启发式规则先做一遍粗筛在 128 个采样点的网格上算平均光流光流大的往往对应人在走动、并没有在操作直接丢掉再用 YOLO 检测画面里手的数量、尺度和位置靠几何规则剔除严重遮挡或有旁人乱入的帧只留下手部操作清晰可见的片段。第二阶段是 4D 运动估计把头和手的运动还原到真实物理空间里。EgoSmith 用更轻更稳的 DPVO 做相机跟踪和关键帧深度用 Any4D 做逐帧的度量尺度深度预测两者对齐尺度比之后恢复出更准确的相机轨迹再把相机坐标系下的手部运动转换到统一的世界坐标系。第三阶段是多层级语言标注这是「听懂人话」的基础。先用 Qwen3.5-VL-Plus 把那些没有实质手物交互的片段再滤掉一批剩下的每一段都生成从粗到细的五级语言指令L1 是动词加宾语这样的原子指令L2 是要点摘要L3 以物体为中心L4 以手为中心区分左右手分工L5 则细到分步动作。第四阶段是后过滤做多级质量控制。episode 级看相机平移分布剔除离群、用硬阈值丢掉头部运动过大的片段chunk 级把手腕姿态转到中间帧、把手指关键点投影到逐帧手腕系剔除坐标空间的离群值frame 级算相机、手腕、手指的帧间差分用硬阈值滤掉突变跳变。一层层筛下来那些因为三维重建漂移、尺度不准、跳帧而变得不可靠的片段被系统性地清除。最终产出是一个标准化的数据集横跨 12 个开源数据集9.6K 小时、209 万个片段、10.4 亿帧覆盖 8969 个不同的物体名词和 623 个动作动词。让 VLA 学会「想象」只在训练时出现的世界模型有了干净的数据接下来就是最重要的训练模型环节。EgoSteer 的模型本体是一个基于流匹配flow matching的 VLA但它最有意思的设计是给这个 VLA 挂了一个世界模型专家而这个专家只在训练时存在推理时直接丢掉不带来任何额外的计算负担。EgoSteer 概览一种结合世界模型增强的 VLA 模型用于实现可控的灵巧操作。要理解这个设计的巧思得先看清模型的骨架。EgoSteer 由三部分组成共享一个视觉语言主干第一部分是主干用的是预训练视觉语言模型 Qwen3-VL2B 规模采用因果注意力负责把图像、语言、状态这些多模态输入编码成表示。第二部分是动作专家一个基于 DiT 的模块约 3 亿参数通过流匹配来生成动作块action chunk。它采用联合注意力既看自己也看主干的表示。第三部分是世界模型专家一个轻量的 4 层 Transformer约 7000 万参数。它干的事听起来有点抽象给定当前要执行的动作和相应的相机运动去预测未来那一帧画面的 DINOv3 特征。为什么要预测未来团队的洞察是VLA 天生擅长视觉和语言的理解却缺乏对「下一秒会发生什么」的想象而这种想象的缺失恰恰限制了动作生成的精度。世界模型专家正是在这一环节进行补强。训练时它拿真实动作、相对相机运动和一串可学习的查询 token 作为输入去回归未来帧经 DINOv3 编码后的语义特征。这里有两个值得说的细节。一是它选择回归 DINOv3 特征而放弃直接预测像素因为语义特征天然过滤掉了光照变化和背景噪声比在像素空间里预测图像提供的梯度更稳定、更直接。二是这个专家只有 4 层且以固定间隔去注意主干的层。它存在的价值是让「预测未来」这个目标产生的梯度回流到主干主干对世界的理解变强了动作专家的精度自然跟着水涨船高。到了推理阶段这个专家功成身退一点推理开销都不留。EgoSteer 用一套统一的动作空间手腕位姿用 3D 位置加 6D 旋转表示手部姿态用五根手指指尖在手腕坐标系下的位置表示双臂双手加起来是 48 维。人手数据和机器人数据被强行拉到同一种表示格式下。人类操作的宝贵数据就是通过这套统一表示平滑地流向机器人。最后一个工程细节关乎「流畅」。机器人真机推理时如果每生成一个动作块就停顿一下等下一次推理动作会一顿一顿的。为此 EgoSteer 采用了训练时的 Real-Time ChunkingRTC技术训练时喂给模型一段干净的、带随机延迟的动作前缀作为已知条件只让它去噪后续动作以覆盖推理延迟。人在闭环「无缝接管」失败机器人数据和模型之外全栈系统的第三块是机器人系统 Robot-Stack。它把遥操作数据采集、模型推理部署、人在闭环纠偏这三件事融进了同一套底层控制里。这套设计的第一层价值是一致性。无论机器人是在自主跑模型还是人戴着数据手套在手动遥操作底层共用完全相同的控制环路和 FK/IK 计算逻辑跑在同一批 ROS2 节点上。真正精彩的是「人在闭环纠偏」的接管机制。想象一个场景机器人在执行任务眼看要失败了一位专家需要立刻接管。这个接管的瞬间是个大坑如果直接把人手的绝对姿态映射到机器人上机器人的状态会在交接的一刹那突变物理上就是一个剧烈的抖动轻则任务失败重则损坏器件。灵初的解法非常巧妙称之为「相对动作映射」。操作员踩下脚踏板发出接管信号的那一刻系统记录下机器人当前的末端姿态和人手当前的姿态作为各自的基准。此后系统只把操作员手部的相对运动量叠加到机器人的当前状态上。直观地说操作员只要顺着机器人当下的姿势去比划就能平滑地接过控制权全程没有突变抖动。纠正完成后再踩一次脚踏板控制权无缝交还给模型。接管成功率超过 85%。这套机制的妙处在于它让在线纠偏的数据收集变得极其低门槛。专家可以在机器人失败的任意状态下丝滑接管、示范正确做法而且只有这些「介入片段」会被留下来作为纠偏训练数据。灵初用三轮 DAgger 迭代在 56 个任务上一共只采集了 3.7K 条轨迹、8.3 小时的纠正数据。靠这套控制栈团队以极低的人力成本采集了覆盖 193 个桌面操作任务、187 小时的高质量真机数据涵盖从简单抓放到非抓握、重定向、双手协作、接触密集等 7 大类操作。把数据、模型、系统三块串起来EgoSteer 的训练遵循三个阶段。第一阶段用 9.6K 小时的人类第一人称数据做预训练只用头部相机在 128 张 A800 上训了 175K 步、约 164 小时。第二阶段用 187 小时多样化的真机数据做后训练加上胸部相机形成双视角学习率降到原来的十分之一。第三阶段是多轮人在闭环 DAgger 纠偏。实验结果EgoSteer 的评测拆成了几个彼此独立的维度每一个都在回答一个具体的疑问它到底能不能听懂话、能不能应付没见过的场景、那些精巧的模块是不是真的有用、近万小时人手数据最终换来了什么。可操控性与泛化EgoSteer 全程只用一个共享模型不为任何单一任务做专门微调所有动作都由开放式的自由语言指令直接驱动。评测覆盖 7 大类操作从简单抓放PnP到非抓握推拨、物体重定向、双手协作、接触密集型任务一共 40 个日常复杂任务每个任务在随机杂乱的场景里试验 10 次。最终的整体平均成功率是 75%。EgoSteer 在涵盖 7 个类别的 40 项任务中的可控操作性能。它能够稳健地遵循自由形式的语言指令完成任务实现总体 75% 的成功率展现出良好的泛化能力。EgoSteer 把评测任务切成了三档难度。第一档是训练时见过的任务模型表现稳定。第二档是组合泛化指令把已知技能重新拼装这类需要理解指令结构、重新编排子技能的任务成功率 65%。第三档最难是语义上完全没见过的新任务成功率 62%。一个模型在没见过的语义任务上还能保住六成的成功率说明它学到的是一套可以迁移的操作先验并没有停留在对特定指令的死记硬背。数据规模这个实验证明了人手数据的规模在具身智能模型中依旧非常宝贵。这是一条清晰的 scaling 曲线。团队用从零训练、3K、6K、9.6K 小时四个预训练规模跑了对照随着数据量上去预训练损失收敛得更低真机成功率也稳步爬升到 9.6K 小时时达到 60%而完全从零训练的模型只有约 30%。三十个百分点的差距几乎全部来自预训练数据。横向和同期工作比在一组 10 个相对容易的任务上EgoSteer 平均成功率 74%同期的 Being-H0.5 是 39%π0.5 是 22%。论文的分析是这两个对比模型都吃亏在预训练和后训练阶段的动作表示不一致、输入分辨率更小、缺少部署优化所以只能应付最基本的抓放指令跟随弱、泛化有限、执行也不够精准。预训练价值的终极检验最后一问也是最能体现预训练价值的一问一个在人手视频上预训练好的模型能不能只用少量示范就快速学会一个全新的、跨本体的、复杂的长程任务。两个实验给了答案。在 RealMan 机器人上仅用 120 条示范EgoSteer 就在一个 18 步、耗时 40 秒的折纸盒任务上做到了 75% 成功率。在换了一套本体的 AgiBot G1 机器人上仅用 200 条示范在一个 9 步、耗时 1 分钟的拆蛋糕盒任务上做到了 83%。对照组的结果近乎残酷。同样的数据量下传统模仿学习方法 Diffusion Policy 和 IMLE、以及没有做过预训练的同架构模型在这两个长程任务上的成功率全部是 0%。真正让「少样本学会一个长程任务」成为可能的是近万小时人手视频攒下的操作先验而不单单是模型架构本身。更多技术信息请参阅原论文。

相关新闻

transformers v5.14.1最新发布:修复Inkling集成关键问题,辅助生成与缓存机制两大故障一次解决

transformers v5.14.1最新发布:修复Inkling集成关键问题,辅助生成与缓存机制两大故障一次解决

transformers v5.14.1 已作为最新补丁版本发布,发布时间为 2026年7月22日。从这次更新内容来看,这并不是一次功能扩展型更新,而是一次非常明确、针对性很强的修复型补丁发布。 官方说明指出,这次补丁主要解决了在集成 Inkling 模型…

2026/7/23 12:22:02 阅读更多 →
2026年Product Hunt热榜解析:AI与隐私技术趋势

2026年Product Hunt热榜解析:AI与隐私技术趋势

1. 项目概述 Product Hunt作为全球知名的产品发现平台,每天都有数百款新产品上线。2026年4月13日的热榜特别值得关注,因为这一天集中涌现了一批具有突破性创新的产品。这些产品不仅在技术上有所突破,更在用户体验和商业模式上带来了全新思路。…

2026/7/23 12:22:01 阅读更多 →
原画知识科普:从概念到创作的全面解析

原画知识科普:从概念到创作的全面解析

一、什么是原画?原画(Original Painting/Concept Art),在艺术创作领域,尤其是在动画、游戏、影视等视觉艺术产业中,特指为最终作品(如动画片、游戏角色、电影场景)所绘制的、用于确定…

2026/7/23 12:22:01 阅读更多 →

最新新闻

实验七(三):数据清洗与预处理实操

实验七(三):数据清洗与预处理实操

一、实验研究背景经过实验 7-1 数据清洗、实验 7-2 特征衍生两大前置流程,项目已产出三张规范结构化数据表,但原始存储数据仅为数值记录,无法直观反映自媒体运营背后的业务规律,必须借助可视化图表完成数据转译,以此挖…

2026/7/23 12:43:09 阅读更多 →
图像处理与Linux编程基础

图像处理与Linux编程基础

目录 一、BMP图像 1. 文件整体结构2. 位图头文件数据结构3. 位图信息数据结构4. 调色板5. 位图数据6. 要点 二、JPEG图像 1. 文件格式2. 标记定义 三、YUV图像 1. 文件结构2. 转换公式与要点 四、图像缩放五、makefile编写六、Linux多线程编程 1. 线程的概念2. POSIX线程3. 几…

2026/7/23 12:43:09 阅读更多 →
神经网络基础与实战:从原理到Python实现

神经网络基础与实战:从原理到Python实现

1. 神经网络基础概念解析神经网络作为机器学习领域的重要分支,其灵感来源于生物神经系统的结构和功能。简单来说,神经网络是由大量相互连接的节点(或称"神经元")组成的计算系统,这些神经元通过调整连接权重来…

2026/7/23 12:43:09 阅读更多 →
GEO新手最容易踩的“坑”有哪些?

GEO新手最容易踩的“坑”有哪些?

GEO(生成式引擎优化)正成为数字营销领域的热门话题,随着ChatGPT、文心一言等AI大模型深度嵌入搜索引擎和用户信息获取流程,品牌曝光逻辑发生了根本性转变。很多新手满怀热情入局,却因对规则理解不透彻,反复…

2026/7/23 12:43:09 阅读更多 →
战略规划方法论演进:从Excel到AI决策系统

战略规划方法论演进:从Excel到AI决策系统

1. 项目概述:规划方法论十年演进之路 十年前我刚入行做战略规划时,用的还是Excel表格和PPT模板。如今看着团队用智能算法自动生成的可视化路线图,不禁想梳理这十年间规划方法论发生的革命性变化。从最初的手工填表到现在的动态推演系统&#…

2026/7/23 12:43:09 阅读更多 →
Agent智能体开发实战:从环境搭建到架构设计

Agent智能体开发实战:从环境搭建到架构设计

1. Agent智能体开发概述 Agent智能体开发是当前AI领域最热门的技术方向之一,它让AI系统具备了自主感知、决策和执行的能力。不同于传统的程序化脚本,智能体能够根据环境变化动态调整行为策略,像人类一样完成复杂任务。 我在实际开发中发现&a…

2026/7/23 12:42:09 阅读更多 →

日新闻

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

更多请点击: https://intelliparadigm.com 第一章:从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表) 当AI副业主理人不再仅满足于单次服务交付,而是主动构建可复用、可裂变、可…

2026/7/23 0:00:25 阅读更多 →
AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

更多请点击: https://codechina.net 第一章:AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析 在对2,346篇跨行业AI生成文案的A/B测试数据进行聚类分析后,我们发现&#xff1…

2026/7/23 0:01:26 阅读更多 →
Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具 【免费下载链接】chitchatter Secure peer-to-peer chat that is serverless, decentralized, and ephemeral 项目地址: https://gitcode.com/gh_mirrors/ch/chitchatter Chitchatter是一款革命性的安…

2026/7/23 0:01:26 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/22 8:58:19 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/22 19:43:43 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/22 12:54:44 阅读更多 →

月新闻