π0.7​:一种具备涌现能力的可控通用机器人基础模型
机器人基础模型的演进对通用机器人策略的追求通常被称为机器人基础模型或视觉-语言-动作VLA模型是现代人工智能的核心主题。这些模型旨在为机器人提供与大型语言模型相同的广泛能力和推理水平使其能够在多样化的环境和机器人平台上操作。尽管π0\pi_0π0​、π0.5\pi_{0.5}π0.5​和π0.6\pi_{0.6}π0.6​等早期版本通过集成预训练的视觉-语言架构和分层规划取得了一些进展但它们往往在组合泛化能力上表现不佳——即以新方式组合已知技能来解决不熟悉问题的能力。大多数现有模型需要针对特定任务进行微调才能可靠运行这限制了它们在实际场景中的灵活性。π0.7​模型代表了该领域的进步它侧重于“可控性”和上下文条件设定以克服这些限制。通过扩展在训练和推理过程中提供给模型的信息研究人员开发了一种策略该策略无需专门的后期训练即可展现出涌现能力。这种方法使机器人能够遵循复杂的、开放式的指令并“开箱即用”地在不同机器人本体之间转移灵巧技能跨实体转移。这项工作的意义在于它从僵化的任务定义转向了一种新的范式即机器人可以通过语言和视觉目标进行“指导”。架构与多尺度记忆系统π0.7\pi_{0.7}π0.7​模型是一个拥有50亿参数的VLA建立在一个强大的架构基础之上。它利用一个40亿参数的视觉-语言模型VLM骨干网络该骨干网络从Gemma3初始化包含一个4亿参数的视觉编码器。这个骨干网络负责处理视觉观察和高级指令提供复杂交互所需的语义理解。为了处理时间上下文——这对于需要记住过去状态或序列的任务至关重要——π0.7\pi_{0.7}π0.7​整合了一个名为多尺度具身记忆MEM的系统。MEM系统可以处理来自多个摄像机角度包括前视图和腕部安装视图的最多六个历史帧。这些帧被压缩成固定数量的令牌使模型能够在不以原始数据淹没主Transformer的情况下保持情节的连贯历史。实际的运动控制由一个8.6亿参数的“动作专家”Transformer处理。该专家通过流匹配目标进行训练以预测连续动作这是一种通过学习对动作序列去噪来生成平滑精确轨迹的技术。训练过程的一个关键特性是“知识隔离”KI。在此设置中VLM骨干网络受到离散令牌的监督但来自动作专家的梯度不会回流到骨干网络中。这可以防止运动控制的高频噪声降级VLM中存储的稳定语义知识。通过多模态上下文实现可控性π0.7\pi_{0.7}π0.7​的核心创新在于其扩展的上下文条件设定策略。模型不再只接收简单的语言命令而是在每个时间步ttt接收一个丰富、多模态的提示CtC_tCt​作为条件。这个提示定义为Ct(ℓ^t,gt,m,c) C_t (\hat{\ell}_t, g_t, m, c)Ct​(ℓ^t​,gt​,m,c)其中ℓ^t\hat{\ell}_tℓ^t​代表子任务指令是中间语义步骤例如“去拿把手”而不是仅仅“开门”。gtg_tgt​表示子目标图像描绘了环境的期望未来状态。mmm代表剧集元数据包括质量评分和速度。ccc指定控制模式例如关节级别或末端执行器控制。通过包含子目标图像gtg_tgt​模型接收到空间接地的目标。这些图像在运行时由一个单独的拥有140亿参数的世界模型gψg_\psigψ​生成该模型接收当前观测oto_tot​和指令生成目标的视觉表示gtgψ(ot,ℓ^t,m) g_t g_\psi(o_t, \hat{\ell}_t, m)gt​gψ​(ot​,ℓ^t​,m)这种“目标条件化”GC使得模型即使在语言指令模糊不清时也能理解任务的物理要求。在训练过程中采用了一种名为“提示丢弃”prompt dropout的技术随机省略CtC_tCt​的部分内容。这确保了π0.7\pi_{0.7}π0.7​保持鲁棒性即使人类教练或世界模型只提供部分信息也能正常工作。从次优和多样化数据中学习机器人学习面临的一个主要障碍是高质量演示数据的稀缺。大多数模型都是在“专家”数据上训练的这使得它们在遇到错误或异常状态时变得脆弱。π0.7\pi_{0.7}π0.7​通过有意地整合次优和异构数据来解决这个问题包括失败的剧集、来自先前模型的自主运行以及以自我为中心的人类视频。为了防止这些质量较低的数据混淆模型研究人员使用了剧集元数据mmm。每个训练剧集都标记有“整体质量”1到5分、“整体速度”和“错误”等属性。在训练过程中模型学习这些标签与由此产生的动作之间的相关性。在推理时模型会收到“质量5”和“错误false”的提示有效地“引导”它以专家的精确度执行任务即使它已经见证了许多失败。这种元数据策略还允许无分类器引导CFG。通过对比模型在提示“高速”与“低速”时的输出研究人员可以在动作生成过程中放大期望的行为从而实现更高效、更果断的机器人运动。涌现的灵巧性和指令遵循能力研究人员在各种机器人系统上评估了π0.7\pi_{0.7}π0.7​包括双臂移动机械手和静态六自由度机械臂。最引人注目的发现之一是π0.7\pi_{0.7}π0.7​匹配或超越了“专家”模型的性能——这些模型是专门为洗衣折叠或浓缩咖啡制作等单一任务进行微调的。在涉及多种语言遵循能力的测试中π0.7\pi_{0.7}π0.7​显著优于其前身π0.5\pi_{0.5}π0.5​和π0.6\pi_{0.6}π0.6​。它展示了遵循“复杂指代指令”的能力例如“拿起最大盘子里的水果”。这种能力得益于世界模型当π0.7\pi_{0.7}π0.7​被赋予一个生成的子目标图像被称为π0.7 (GC)\pi_{0.7} \text{ (GC)}π0.7​(GC)时它在这些复杂任务上的成功率显著提高。此外该模型还展示了它能够克服强大的数据集偏差。例如在“反向冰箱到微波炉”任务将物品从冰箱放入微波炉中这与常见的训练模式相悖π0.7 (GC)\pi_{0.7} \text{ (GC)}π0.7​(GC)成功了而标准 VLA 模型则失败了。子目标图像提供了必要的视觉“锚点”以覆盖模型执行更常见反向动作的统计趋势。零样本跨载体迁移真正的基础模型的一个标志是能够将技能迁移到不同的物理形式上。π0.7\pi_{0.7}π0.7​实现了复杂双手任务的零样本迁移。例如它可以在双手 UR5e 机器人系统上折叠毛巾和衬衫尽管它从未针对该特定硬件进行过洗衣数据的训练。该模型不仅仅模仿了其他机器人的动作它还根据新的载体进行了调整。在 UR5e 上折叠时π0.7\pi_{0.7}π0.7​自然地采用了更适合 UR5e 运动学的垂直抓取方式而不是在其他机器人的源数据中观察到的倾斜抓取方式。在这些设置中π0.7 (GC)\pi_{0.7} \text{ (GC)}π0.7​(GC)的表现被发现与首次操作 UR5e 的经验丰富的人类远程操作员相当。组合泛化和人类指导π0.7\pi_{0.7}π0.7​的灵活性允许“通过提示教学”的工作流程。对于模型从未见过的长程任务——例如“烤面包圈”或“装载空气炸锅”——人类可以充当教练提供分步的子任务指令。由于模型理解这些语义子步骤它能够执行任务每个阶段所需的物理动作。有趣的是研究人员发现在模型通过某个任务进行几次指导后生成的数据可以用于训练一个高级语言策略。然后该策略会自动提供子任务指令ℓ^t\hat{\ell}_tℓ^t​从而使π0.7\pi_{0.7}π0.7​能够完全自主地执行曾经未见过的长程任务。结论π0.7\pi_{0.7}π0.7​的开发标志着机器人学界处理通用智能方式的转变。通过专注于利用多模态上下文和多样化甚至是次优的数据的可控架构研究人员创建了一个在任务和载体之间以高成功率泛化的模型。虽然零样本任务的成功率60-80%目前低于训练分布内的任务90%但模型通过语言和视觉目标进行指导的能力为改进提供了明确的途径。用户无需收集数千个新的机器人演示而是可以通过简单的提示和高级指导来潜在地完善机器人行为。这种向更具交互性和灵活性的基础模型迈进使该领域更接近能够适应人类环境不可预测性的机器人。

相关新闻

React组件通信方案全解析:从Props到Redux实战

React组件通信方案全解析:从Props到Redux实战

1. React组件通信的核心价值与场景解析在React应用开发中,组件通信如同城市交通系统——当组件数量较少时,简单的单向道路(props传递)就能满足需求;但当应用规模扩大,就需要建立立交桥(Context&…

2026/10/7 12:24:26 阅读更多 →
程序员刻意练习指南:44天上机训练体系设计

程序员刻意练习指南:44天上机训练体系设计

1. 项目概述"上机练习第44天"这个标题看似简单,却蕴含着程序员成长路径中一个关键阶段。作为一名经历过数百小时编码训练的老手,我深知持续练习对编程能力提升的重要性。这个标题背后反映的是一个系统化的技能提升过程,而非简单的重…

2026/9/30 4:08:01 阅读更多 →
Linux命令实战:从系统状态感知到自动化脚本的进阶指南

Linux命令实战:从系统状态感知到自动化脚本的进阶指南

1. 从“收藏”到“会用”:一份Linux命令清单的自我修养每次看到“史上最全”、“建议收藏”这样的标题,我总会会心一笑。在Linux世界里摸爬滚打十几年,从运维到开发,从服务器到嵌入式,我收藏过的命令清单没有一百也有八…

2026/9/24 21:24:39 阅读更多 →

最新新闻

Star History 月度精选 2025 年 12 月:React 生态四大工具深度解读

Star History 月度精选 2025 年 12 月:React 生态四大工具深度解读

开发工具数据可视化 【免费下载链接】star-history The de facto GitHub star history graph. 项目地址: https://gitcode.com/gh_mirrors/st/star-history 点击查看 免费下载 导读:2025 年 React 正式进入 Linux Foundation,其开源治理走向…

2026/10/7 16:03:29 阅读更多 →
ponytail插件与技能机制详解:从原理到实操的完整指南

ponytail插件与技能机制详解:从原理到实操的完整指南

1. 从“ponytail”这个标题说起:它到底是什么第一次看到“ponytail”这个词,很多人脑子里蹦出来的画面大概是扎起来的马尾辫。但在技术圈和工具链语境里,它早就不是发型那么简单了。最近一段时间,“ponytail skill”“ponytail 插…

2026/10/7 16:03:29 阅读更多 →
Claude Code 命令速查手册:从安装到高效工作流实战

Claude Code 命令速查手册:从安装到高效工作流实战

用 Claude Code 之前,我其实对终端里的 AI 工具是有点不屑的——图形界面不香吗?但真正上手用了两个月之后,我的态度完全变了。这个工具不是简单的“在终端里聊天”,它把 AI 辅助编程做成了像 Git 一样顺手的日常操作。不过正因为…

2026/10/7 16:03:29 阅读更多 →
AI编程踩坑实录:环境、配置与提示词的三重校准

AI编程踩坑实录:环境、配置与提示词的三重校准

1. 这不是AI的问题,是“人机协作界面”没调好我第一次在VS Code里敲下/唤出GitHub Copilot的自动补全,看着它精准生成了三行Python列表推导式——那一刻我真以为自己摸到了编程自由的门槛。结果两小时后,我盯着终端里反复报错的ModuleNotFoun…

2026/10/7 16:03:29 阅读更多 →
Agent-Reach:面向开发者的轻量级API路由CLI工具

Agent-Reach:面向开发者的轻量级API路由CLI工具

1. “Agent-Reach”不是新模型,而是一套面向开发者的工作流调度中枢你搜“Agent-Reach”,满屏跳出的是 CLI、API、Reddit、YouTube、DeepSeek、Codex CLI、ComfyUI、Minimax……但没一个页面说清楚它到底是什么。我花三天时间翻遍 GitHub Trending、Hugg…

2026/10/7 16:03:29 阅读更多 →
Java Socket C/S架构路灯控制系统:协议、线程与避坑指南

Java Socket C/S架构路灯控制系统:协议、线程与避坑指南

简介:基于C/S架构的Java模拟路灯控制系统源码,面向学习套接字编程、需完成Java课程大作业的同学。系统使用Swing图形界面库搭建客户端界面,以套接字方式实现双向通信,支持远程开关路灯,同时采集温湿度等模拟环境信息&a…

2026/10/7 16:02:28 阅读更多 →

日新闻

ROS2机械臂仿真与运动控制:从URDF建模到Gazebo实战全解析

ROS2机械臂仿真与运动控制:从URDF建模到Gazebo实战全解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/7 1:01:58 阅读更多 →
用浏览器直接改ESP32的WiFi密码:NVS键值配置工具设计与实现

用浏览器直接改ESP32的WiFi密码:NVS键值配置工具设计与实现

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/7 1:02:00 阅读更多 →
芯片封装缺陷检测:扫描声学显微镜(SAT)原理与实操指南

芯片封装缺陷检测:扫描声学显微镜(SAT)原理与实操指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/7 1:02:00 阅读更多 →

周新闻

KT148A语音芯片外挂8002D功放的工程实践指南

KT148A语音芯片外挂8002D功放的工程实践指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/7 14:34:12 阅读更多 →
LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/7 14:34:13 阅读更多 →
ARM架构深度解析:从RISC设计理念到交叉编译实战

ARM架构深度解析:从RISC设计理念到交叉编译实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/7 9:29:10 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/7 14:34:12 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/7 11:43:46 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/7 13:34:55 阅读更多 →