机器人双手迎来全栈训练系统:灵初智能EgoSteer让灵巧手无所不能
记得何同学做过一个超复杂的流水线项目吗内容来源老师好我叫何同学这个视频发布于 2024 年 1 月当时要实现自动叠纸盒把礼物放进纸盒的自动化操作正是这样一个机械臂和自动化编程组合成的流水线。如果有一个能像人一样灵活的机器手来折叠包装长时间批量地工作何同学团队耗费心力打造的庞大流水线的功能就能够被两个小体积的灵巧手给完美实现。并且也不需要考虑各种流水线上的稳定性灵巧手自己就能够解决遇到的位置偏移变形等问题全面自主。相比复杂的机械臂和自动化灵巧手的自由度和泛用性显然是其不可比拟的。这很难但和人类双手接近的灵巧手已经出现了。这一对双臂灵巧手在精细操作、长程任务和泛化性上均展现出了亮眼的成绩而它来自于灵初智能。在这两个灵巧手准确协同实现精巧操作的背后是一套灵初智能与北大 - 灵初联合实验室共同发布并开源的技术范式称为 EgoSteer是一套双灵巧手通用操作大模型和全栈系统。论文链接https://egosteer.github.io/EgoSteer.pdf项目主页https://egosteer.github.io/#/到目前为止业界能跟随自由语言指令、还能在全新场景里泛化的模型少之又少。π0.7、DreamZero 这些近期在通用性上取得突破的工作把机器人能干的活儿从「一个任务」推到了「一批任务」但它们大多依赖昂贵的真机数据。但我们知道具身灵巧手最好的数据必然来自人类的双手。EgoSteer 是一个里程碑式的进步。它能跟随开放式的自然语言指令完成一百多种语义各异的灵巧操作任务还能用少量示范快速学会复杂的长程任务。该全栈系统已完整开源代码、模型权重数据也将近期开源为双灵巧手通用操作开究提供了一套高质量、可复现、可迭代的全栈基线。数据模型和系统深度技术拆解下面我们从三个层面把它拆开数据、模型和系统闭环。这三块拼在一起才能真正被称为「全栈」系统。近万小时人手视频变成训练数据先说一个反直觉的事实制约灵巧手大模型的瓶颈往往落在数据上。但数据本身其实并不稀缺稀缺的是能拿来训练的数据。第一人称人类视频也就是戴着相机以人的视角拍下的操作画面是天然的富矿。全网这类可用素材大约有 11.6 万小时人手在里面拧、捏、递、叠蕴含着海量的交互知识。问题在于这些视频原始状态下噪声大得惊人镜头剧烈晃动、双手频繁被遮挡、既没有可靠的语言标注也没有精确的动作标注。直接拿去训练模型学到的是一堆彼此矛盾的监督信号下游策略只会被带偏。灵初把处理这些视频的管线单独做成了一个系统叫 EgoSmith。它是一条四阶段的全自动流水线目标是把视频变成带精细语言和动作标注的可训练数据。EgoSmith 概览EgoSmith 能够将噪声较大的第一视角视频整理为高质量的灵巧操作 VLA 数据为语言驱动的机器人预训练提供可规模化的人手交互先验。第一阶段是预过滤。用简单但有效的启发式规则先做一遍粗筛在 128 个采样点的网格上算平均光流光流大的往往对应人在走动、并没有在操作直接丢掉再用 YOLO 检测画面里手的数量、尺度和位置靠几何规则剔除严重遮挡或有旁人乱入的帧只留下手部操作清晰可见的片段。第二阶段是 4D 运动估计把头和手的运动还原到真实物理空间里。EgoSmith 用更轻更稳的 DPVO 做相机跟踪和关键帧深度用 Any4D 做逐帧的度量尺度深度预测两者对齐尺度比之后恢复出更准确的相机轨迹再把相机坐标系下的手部运动转换到统一的世界坐标系。第三阶段是多层级语言标注这是「听懂人话」的基础。先用 Qwen3.5-VL-Plus 把那些没有实质手物交互的片段再滤掉一批剩下的每一段都生成从粗到细的五级语言指令L1 是动词加宾语这样的原子指令L2 是要点摘要L3 以物体为中心L4 以手为中心区分左右手分工L5 则细到分步动作。第四阶段是后过滤做多级质量控制。episode 级看相机平移分布剔除离群、用硬阈值丢掉头部运动过大的片段chunk 级把手腕姿态转到中间帧、把手指关键点投影到逐帧手腕系剔除坐标空间的离群值frame 级算相机、手腕、手指的帧间差分用硬阈值滤掉突变跳变。一层层筛下来那些因为三维重建漂移、尺度不准、跳帧而变得不可靠的片段被系统性地清除。最终产出是一个标准化的数据集横跨 12 个开源数据集9.6K 小时、209 万个片段、10.4 亿帧覆盖 8969 个不同的物体名词和 623 个动作动词。让 VLA 学会「想象」只在训练时出现的世界模型有了干净的数据接下来就是最重要的训练模型环节。EgoSteer 的模型本体是一个基于流匹配flow matching的 VLA但它最有意思的设计是给这个 VLA 挂了一个世界模型专家而这个专家只在训练时存在推理时直接丢掉不带来任何额外的计算负担。EgoSteer 概览一种结合世界模型增强的 VLA 模型用于实现可控的灵巧操作。要理解这个设计的巧思得先看清模型的骨架。EgoSteer 由三部分组成共享一个视觉语言主干第一部分是主干用的是预训练视觉语言模型 Qwen3-VL2B 规模采用因果注意力负责把图像、语言、状态这些多模态输入编码成表示。第二部分是动作专家一个基于 DiT 的模块约 3 亿参数通过流匹配来生成动作块action chunk。它采用联合注意力既看自己也看主干的表示。第三部分是世界模型专家一个轻量的 4 层 Transformer约 7000 万参数。它干的事听起来有点抽象给定当前要执行的动作和相应的相机运动去预测未来那一帧画面的 DINOv3 特征。为什么要预测未来团队的洞察是VLA 天生擅长视觉和语言的理解却缺乏对「下一秒会发生什么」的想象而这种想象的缺失恰恰限制了动作生成的精度。世界模型专家正是在这一环节进行补强。训练时它拿真实动作、相对相机运动和一串可学习的查询 token 作为输入去回归未来帧经 DINOv3 编码后的语义特征。这里有两个值得说的细节。一是它选择回归 DINOv3 特征而放弃直接预测像素因为语义特征天然过滤掉了光照变化和背景噪声比在像素空间里预测图像提供的梯度更稳定、更直接。二是这个专家只有 4 层且以固定间隔去注意主干的层。它存在的价值是让「预测未来」这个目标产生的梯度回流到主干主干对世界的理解变强了动作专家的精度自然跟着水涨船高。到了推理阶段这个专家功成身退一点推理开销都不留。EgoSteer 用一套统一的动作空间手腕位姿用 3D 位置加 6D 旋转表示手部姿态用五根手指指尖在手腕坐标系下的位置表示双臂双手加起来是 48 维。人手数据和机器人数据被强行拉到同一种表示格式下。人类操作的宝贵数据就是通过这套统一表示平滑地流向机器人。最后一个工程细节关乎「流畅」。机器人真机推理时如果每生成一个动作块就停顿一下等下一次推理动作会一顿一顿的。为此 EgoSteer 采用了训练时的 Real-Time ChunkingRTC技术训练时喂给模型一段干净的、带随机延迟的动作前缀作为已知条件只让它去噪后续动作以覆盖推理延迟。人在闭环「无缝接管」失败机器人数据和模型之外全栈系统的第三块是机器人系统 Robot-Stack。它把遥操作数据采集、模型推理部署、人在闭环纠偏这三件事融进了同一套底层控制里。这套设计的第一层价值是一致性。无论机器人是在自主跑模型还是人戴着数据手套在手动遥操作底层共用完全相同的控制环路和 FK/IK 计算逻辑跑在同一批 ROS2 节点上。真正精彩的是「人在闭环纠偏」的接管机制。想象一个场景机器人在执行任务眼看要失败了一位专家需要立刻接管。这个接管的瞬间是个大坑如果直接把人手的绝对姿态映射到机器人上机器人的状态会在交接的一刹那突变物理上就是一个剧烈的抖动轻则任务失败重则损坏器件。灵初的解法非常巧妙称之为「相对动作映射」。操作员踩下脚踏板发出接管信号的那一刻系统记录下机器人当前的末端姿态和人手当前的姿态作为各自的基准。此后系统只把操作员手部的相对运动量叠加到机器人的当前状态上。直观地说操作员只要顺着机器人当下的姿势去比划就能平滑地接过控制权全程没有突变抖动。纠正完成后再踩一次脚踏板控制权无缝交还给模型。接管成功率超过 85%。这套机制的妙处在于它让在线纠偏的数据收集变得极其低门槛。专家可以在机器人失败的任意状态下丝滑接管、示范正确做法而且只有这些「介入片段」会被留下来作为纠偏训练数据。灵初用三轮 DAgger 迭代在 56 个任务上一共只采集了 3.7K 条轨迹、8.3 小时的纠正数据。靠这套控制栈团队以极低的人力成本采集了覆盖 193 个桌面操作任务、187 小时的高质量真机数据涵盖从简单抓放到非抓握、重定向、双手协作、接触密集等 7 大类操作。把数据、模型、系统三块串起来EgoSteer 的训练遵循三个阶段。第一阶段用 9.6K 小时的人类第一人称数据做预训练只用头部相机在 128 张 A800 上训了 175K 步、约 164 小时。第二阶段用 187 小时多样化的真机数据做后训练加上胸部相机形成双视角学习率降到原来的十分之一。第三阶段是多轮人在闭环 DAgger 纠偏。实验结果EgoSteer 的评测拆成了几个彼此独立的维度每一个都在回答一个具体的疑问它到底能不能听懂话、能不能应付没见过的场景、那些精巧的模块是不是真的有用、近万小时人手数据最终换来了什么。可操控性与泛化EgoSteer 全程只用一个共享模型不为任何单一任务做专门微调所有动作都由开放式的自由语言指令直接驱动。评测覆盖 7 大类操作从简单抓放PnP到非抓握推拨、物体重定向、双手协作、接触密集型任务一共 40 个日常复杂任务每个任务在随机杂乱的场景里试验 10 次。最终的整体平均成功率是 75%。EgoSteer 在涵盖 7 个类别的 40 项任务中的可控操作性能。它能够稳健地遵循自由形式的语言指令完成任务实现总体 75% 的成功率展现出良好的泛化能力。EgoSteer 把评测任务切成了三档难度。第一档是训练时见过的任务模型表现稳定。第二档是组合泛化指令把已知技能重新拼装这类需要理解指令结构、重新编排子技能的任务成功率 65%。第三档最难是语义上完全没见过的新任务成功率 62%。一个模型在没见过的语义任务上还能保住六成的成功率说明它学到的是一套可以迁移的操作先验并没有停留在对特定指令的死记硬背。数据规模这个实验证明了人手数据的规模在具身智能模型中依旧非常宝贵。这是一条清晰的 scaling 曲线。团队用从零训练、3K、6K、9.6K 小时四个预训练规模跑了对照随着数据量上去预训练损失收敛得更低真机成功率也稳步爬升到 9.6K 小时时达到 60%而完全从零训练的模型只有约 30%。三十个百分点的差距几乎全部来自预训练数据。横向和同期工作比在一组 10 个相对容易的任务上EgoSteer 平均成功率 74%同期的 Being-H0.5 是 39%π0.5 是 22%。论文的分析是这两个对比模型都吃亏在预训练和后训练阶段的动作表示不一致、输入分辨率更小、缺少部署优化所以只能应付最基本的抓放指令跟随弱、泛化有限、执行也不够精准。预训练价值的终极检验最后一问也是最能体现预训练价值的一问一个在人手视频上预训练好的模型能不能只用少量示范就快速学会一个全新的、跨本体的、复杂的长程任务。两个实验给了答案。在 RealMan 机器人上仅用 120 条示范EgoSteer 就在一个 18 步、耗时 40 秒的折纸盒任务上做到了 75% 成功率。在换了一套本体的 AgiBot G1 机器人上仅用 200 条示范在一个 9 步、耗时 1 分钟的拆蛋糕盒任务上做到了 83%。对照组的结果近乎残酷。同样的数据量下传统模仿学习方法 Diffusion Policy 和 IMLE、以及没有做过预训练的同架构模型在这两个长程任务上的成功率全部是 0%。真正让「少样本学会一个长程任务」成为可能的是近万小时人手视频攒下的操作先验而不单单是模型架构本身。更多技术信息请参阅原论文。

相关新闻

transformers v5.14.1最新发布:修复Inkling集成关键问题,辅助生成与缓存机制两大故障一次解决

transformers v5.14.1最新发布:修复Inkling集成关键问题,辅助生成与缓存机制两大故障一次解决

transformers v5.14.1 已作为最新补丁版本发布,发布时间为 2026年7月22日。从这次更新内容来看,这并不是一次功能扩展型更新,而是一次非常明确、针对性很强的修复型补丁发布。 官方说明指出,这次补丁主要解决了在集成 Inkling 模型…

2026/9/22 5:38:29 阅读更多 →
2026年Product Hunt热榜解析:AI与隐私技术趋势

2026年Product Hunt热榜解析:AI与隐私技术趋势

1. 项目概述 Product Hunt作为全球知名的产品发现平台,每天都有数百款新产品上线。2026年4月13日的热榜特别值得关注,因为这一天集中涌现了一批具有突破性创新的产品。这些产品不仅在技术上有所突破,更在用户体验和商业模式上带来了全新思路。…

2026/9/23 4:29:49 阅读更多 →
原画知识科普:从概念到创作的全面解析

原画知识科普:从概念到创作的全面解析

一、什么是原画?原画(Original Painting/Concept Art),在艺术创作领域,尤其是在动画、游戏、影视等视觉艺术产业中,特指为最终作品(如动画片、游戏角色、电影场景)所绘制的、用于确定…

2026/9/21 23:33:58 阅读更多 →

最新新闻

大模型同日对撞:Claude Opus 5.5 与 GPT‑6‑Sol、GPT‑6‑Luna 能力、价格与转发落地方案

大模型同日对撞:Claude Opus 5.5 与 GPT‑6‑Sol、GPT‑6‑Luna 能力、价格与转发落地方案

前言 大模型赛道的内卷,在同一天集中爆发。 Anthropic 正式推出 Claude Opus 5.5,作为 Claude 5.5 系列首发模型,它把 Fable 级旗舰能力下放到商用主力产品线,在编码智能体、计算机操作、长文档推理等基准上刷新记录,同…

2026/9/24 4:45:26 阅读更多 →
数字频率计设计(论文+源码)

数字频率计设计(论文+源码)

系统采用STC89C52单片机为控制器,结合NE555信号产生电路、整形电路、LCD液晶显示电路,电源供电等来构成整个系统。在功能上其可以测出正弦波、三角波或方波等波形数字频率并通过LCD1602液晶显示屏显示检测到的即时频率数值。

2026/9/24 4:45:26 阅读更多 →
SSM毕设项目:基于 SSM+Vue 的线上体检预约管理系统的设计与实现 基于 SSM 的居民健康体检档案管理系统的设计与实现 (源码+文档,讲解、调试运行,定制等)

SSM毕设项目:基于 SSM+Vue 的线上体检预约管理系统的设计与实现 基于 SSM 的居民健康体检档案管理系统的设计与实现 (源码+文档,讲解、调试运行,定制等)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/9/24 4:45:26 阅读更多 →
Agent Substrate 仓库 Go 代码风格指南:存在性检查、测试与 TODO 约定全解析

Agent Substrate 仓库 Go 代码风格指南:存在性检查、测试与 TODO 约定全解析

人工智能AI AgentAgent 沙箱云原生容器运行时零信任 【免费下载链接】substrate Agent Substrate: the core system 项目地址: https://gitcode.com/GitHub_Trending/substrate7/substrate 点击查看 免费下载 Agent Substrate(substrate)仓库…

2026/9/24 4:44:25 阅读更多 →
Cortex-M3 HardFault寄存器取证与故障根因分析

Cortex-M3 HardFault寄存器取证与故障根因分析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/24 4:44:25 阅读更多 →
轻量服务器升配实战指南:从配置变更到生产就绪

轻量服务器升配实战指南:从配置变更到生产就绪

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/24 4:44:25 阅读更多 →

日新闻

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为…

2026/9/24 0:00:19 阅读更多 →
单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

简介:一份基于单细胞RNA测序数据的细胞类型注释算法研究Python毕业设计源码,针对计算机相关专业正在做毕设或需要项目实战的学习者,可用于课程设计与期末大作业。项目代码完整、经导师指导评审通过,可直接运行,覆盖数据…

2026/9/24 0:00:19 阅读更多 →
C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

第一次在项目里被反射卡住,是在一个老旧的WinForms模块里:几十个类依赖PropertyChanged通知,运行时反射读属性、发通知,每次启动慢半拍不说,一上.NET Native/AOT裁剪模式几乎全面崩盘。后来我把这段逻辑全部改成C#源生…

2026/9/24 0:00:19 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/23 4:55:02 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/23 4:49:06 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/23 9:53:41 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/23 9:53:40 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/23 9:53:40 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/23 9:53:40 阅读更多 →