Anthropic 机器人实验:Agent 能力为何取决于接口抽象层
谈机器人 Agent 时开发团队很容易先问“该选哪个大模型”。Anthropic 7 月 9 日发布的机器人研究给出了一个更接近工程现实的答案同一个模型看起来强不强很大程度取决于它通过什么接口接触物理世界。让模型直接输出关节力矩、让它写控制器、让它监督预训练策略测到的并不是同一种能力。这项研究的价值不在于宣布通用机器人已经成熟。恰恰相反它展示了当前系统的明显短板也说明了为什么评测不能只盯模型名称和一次成功演示。对开发者更有用的结论是模型、感知工具、策略层、实时控制和安全护栏必须作为一个整体评估。研究是怎样测的研究团队用 MuJoCo 模拟环境和一台真实 Unitree Go2 四足机器人覆盖经典控制、运动与导航、机械臂操作三类任务。机器人形态包括 12 自由度的 Go2、29 自由度的 G1 人形机器人以及固定底座的 7 自由度 Franka Panda 机械臂。模型面对四种控制接口直接输出低层动作、编写 Python 控制器、调用预训练策略并给出高层指令以及自行训练强化学习策略。团队评测了多个 Claude 版本也纳入 GPT、Gemini、Kimi 和 Qwen 等模型多数“模型×实验设置”单元运行 35 次LIBERO-40 操作任务使用 200 次试验高层导航套件使用 100 次试验。这套设计刻意把“模型能力”和“接口提供的能力”拆开。直接控制要求模型持续处理物理状态代码控制把连续反应压缩为一个可执行控制器策略监督则让预训练网络负责低层动作语言模型只决定接受、修改还是拒绝建议。关键结果抽象层改变了能力上限综合图中Claude Mythos Preview 的 Embody 组合分数为 0.389Opus 4 为 0.115。但更值得注意的不是排名而是每根柱子内部的构成代码控制、策略监督和训练监督贡献了很大一部分能力直接控制并没有随模型代际稳定地同步增长。在低层机械臂操作中完整任务成功率仍然很低研究给出的范围是 0% 到 5.5%。较新的模型更常做到“接近目标、发生接触、完成抓取”等中间步骤但一次局部进展不能等同于端到端可靠执行。把预训练视觉—语言—动作策略 MolmoAct 接入后LIBERO-40 的结果发生了明显变化。VLA 单独运行的成功率约为 86%加入语言模型监督后图中较好的 Claude 组合达到 76%另一些组合为 58% 或更低。也就是说高层策略显著抬高了系统能力但语言模型监督也可能因不必要地覆盖正确动作而带来损失。工具的作用也并不均匀。深度图和分割图整体接近中性简单的可查询光标却让 Mythos Preview 在 10 项操作子集上的成功率从 6% 提升到 32%。在四足导航中告诉模型朝向的指南针也比多种复杂视觉叠加更稳定。工程含义很直接增加信息量不一定有用提供可校准、可定位的状态变量往往更关键。推理更久不等于控制更稳研究没有发现“增加推理预算”能普遍改善机器人任务。在部分经典控制任务中更高推理预算反而让新模型退步在 Opus 的高层导航中不同推理设置的差距也很小。作者推测长推理带来的规划收益可能妨碍需要快速反馈的反应式动作。实时性边界尤其重要。四足机器人的低层控制大约需要 83 Hz而研究中的非推理模型调用只有约 0.2—0.4 Hz。为避免只测到 API 太慢团队在许多仿真实验中暂停物理模拟器等待模型返回。因此这些直接控制成绩更像“延迟大幅降低后的能力上限”不能直接外推为今天即可安全部署的实时控制能力。长上下文也不是稳定的补救方案。LIBERO-40 的上下文截断实验保留最初 10 轮和最近 12 轮或 6 轮多数模型并未显著下降个别模型甚至改善。研究者据此判断当前模型更多依赖最近几步进行短期修正而不是形成贯穿整段任务的可靠空间记忆。面向开发者的六层架构把这些结果转成工程方案可以采用“语言模型不进入硬实时闭环”的六层设计层级主要职责必须保留的约束任务契约层把自然语言目标变成对象、区域、时限和完成条件禁止操作对象与最大影响范围必须显式声明感知适配层将图像、力传感器和位姿整理为可校准状态保留原始观测标记时间戳与不确定性LLM 决策层选择子目标判断策略建议是否可信只输出高层意图不直接驱动电机策略执行层用经过验证的控制器完成实时动作动作范围、速度和力限制由策略层强制执行独立安全层做碰撞、越界、超时和急停判断不依赖同一个语言模型自我批准观测与恢复层记录输入、建议、决策、结果和失败原因支持停止、复位、人工接管与可追溯回放这个分层把“会不会做”与“允不允许做”分开。预训练策略可以提供稳定动作语言模型可以处理不完整指令和异常判断但物理边界由独立组件执行。即使模型错误理解一张图系统也不应允许它越过速度、区域或对象白名单。一个仓储分拣场景假设机械臂要把指定料盒从检测区移动到返工区。输入不是一句“把有问题的都拿走”而是一份任务契约允许操作的料盒 ID、目标工位、最大夹持力、有效时间和人工确认条件。感知层同时返回相机画面、料盒位姿、夹爪力反馈与置信度。预训练策略先提出抓取轨迹LLM 只负责三种选择接受、在允许范围内调整高层目标或因观测冲突而拒绝执行。每次交接后验证器检查“对象是否仍是白名单目标、轨迹是否越界、抓取后状态是否符合预期”。若连续两次验证失败、目标丢失或力反馈异常系统立即停止并回到安全位等待人工复核。这个场景对应了研究里的核心发现高层策略可能远强于直接控制但监督者也可能错误覆盖本来正确的动作。因此日志必须同时保存“策略原建议”和“LLM 修改后建议”上线指标也应分别统计接受率、错误覆盖率、人工接管率、越界拦截率和端到端成功率而不是只看模型最终说了什么。评测时至少问五个问题第一模型拿到的是原始像素、文本描述还是带朝向和坐标的结构化状态第二低层动作由谁生成频率是否满足物理闭环第三策略建议正确时LLM 会不会频繁干预策略建议错误时它能否及时拒绝第四测试是否包含遮挡、漂移、反射、目标丢失和初始姿态变化第五失败后能否独立急停、复位并完整回放这五个问题比单一成功率更接近真实部署风险。Anthropic 的真实 Go2 试验中模型曾把玻璃门里的目标倒影当成真实目标也曾错误判断垃圾桶不在行进路径上。研究人员及时停止了机器人。这些案例说明偶尔成功的演示不能替代异常场景和独立安全机制。研究边界这项研究仍有明确限制。大量结果来自仿真真实机器人试验数量较少直接控制实验暂停了模拟器弱化了现实延迟VLA 监督主要依赖一种预训练策略提示模板没有针对各模型单独调优。部分新模型或预览模型的结果也不能代表所有部署环境。此外各控制接口的任务难度和可用信息不同组合分数适合观察整体趋势不适合当作通用机器人排行榜。模型代际与成绩变化是实验相关性不证明某项训练改动造成了提升。开发团队应把论文结果当作评测设计线索而不是产品可用性承诺。结论Anthropic 的实验提示了一条稳健的路线让语言模型负责目标解释、异常判断和策略编排让经过验证的控制器负责实时动作再用独立安全层限制物理影响。模型升级当然重要但接口抽象、可校准状态、权限边界和失败恢复同样决定系统能做什么。当 Agent 开始影响真实设备时最关键的问题不再只是“模型会不会”而是“系统通过什么接口让它做、允许它做到哪里、失败后由谁立即停下”。这才是从演示走向可验证部署的分界线。原文来源Anthropic Research《Claude plays robotics》2026 年 7 月 9 日。https://www.anthropic.com/research/claude-plays-robotics

相关新闻

深入解析SAR ADC典型特性:以ADS8584S为例的高精度数据采集设计指南

深入解析SAR ADC典型特性:以ADS8584S为例的高精度数据采集设计指南

1. 项目概述:为什么我们需要深入理解一颗ADC的“典型特性”?在工业自动化、高端测试仪器或者精密医疗设备的设计中,我们常常会面对一个核心挑战:如何将现实世界中连续变化的物理信号(比如电机电流、传感器电压、生物电…

2026/7/24 13:26:39 阅读更多 →
“为什么大神能‘魔改‘渲染管线,而我只能干瞪眼?“——URP 可编程、可定制(Scriptable)全详解

“为什么大神能‘魔改‘渲染管线,而我只能干瞪眼?“——URP 可编程、可定制(Scriptable)全详解

引子:小明的"我想要一个’描边’效果,可翻遍设置也找不到开关" 小明用上了 URP,画面又快又美,他很满意。可做着做着,一个新需求把他难住了。 他想给游戏里的角色,加一个**卡通描边(Outline)**效果——就像《塞尔达》《原神》里那种,角色轮廓有一圈漂亮的黑…

2026/7/24 13:26:39 阅读更多 →
AM572x GPMC异步接口时序深度解析:NOR/NAND Flash配置实战与避坑指南

AM572x GPMC异步接口时序深度解析:NOR/NAND Flash配置实战与避坑指南

1. 项目概述与GPMC核心价值 在嵌入式系统开发中,处理器与外部存储器的连接速度和可靠性,往往是决定系统性能上限和稳定性的关键。无论是需要快速执行代码的NOR Flash,还是用于大容量数据存储的NAND Flash,一个高效、灵活的内存控制…

2026/7/24 13:26:39 阅读更多 →

最新新闻

LVGL 实战:路径描边动画

LVGL 实战:路径描边动画

LVGL 实战:路径描边动画 环境:LVGL 9.x + PC 模拟器。圆角矩形闭合路径上,虚线底轨 + 彩色描边沿周长生长,循环播放。 效果 深色渐变背景,顶部「Rlxydemo」。中央是一条圆角矩形闭合路径:灰色虚线底轨描出完整轮廓,青蓝→紫色渐变描边从起点沿路径顺时针生长,前端带光…

2026/7/24 13:33:41 阅读更多 →
Amphenol ICC RJE1Y26D57C42401线束组件解析与线束兼容方案

Amphenol ICC RJE1Y26D57C42401线束组件解析与线束兼容方案

在智能制造、通信基础设施以及高性能电子设备快速发展的背景下,设备内部连接结构越来越复杂。线束组件作为电子系统中的基础互连部件,虽然不像芯片、处理器等器件受到广泛关注,但其稳定性直接影响整机运行可靠性。 一套成熟的线束组件&#x…

2026/7/24 13:33:41 阅读更多 →
Keithley 2016-P美国吉时利6.5位音频分析数字多用表

Keithley 2016-P美国吉时利6.5位音频分析数字多用表

Keithley 2016-P是美国吉时利推出的6.5位音频分析数字多用表,将音频带质量检测分析与全功能六位半数字万用表功能整合在半机架尺寸的紧凑仪器中,是2015系列里的高端型号,专为高精度音频相关测试场景设计。核心硬件与性能参数基础分辨率&#…

2026/7/24 13:33:41 阅读更多 →
Three.js 真实火焰教程

Three.js 真实火焰教程

真实火焰 Real Fire ▶ 在线运行案例 案例合集: 三维可视化功能案例(threehub.cn)开源仓库github地址: https://github.com/z2586300277/three-cesium-examples400个案例代码: 网盘链接 你将学到什么 ShaderMaterial 自定义着…

2026/7/24 13:33:41 阅读更多 →
从0到月入10万:用AI自动化搭建私域电商闭环(含5套可复用SOP模板)

从0到月入10万:用AI自动化搭建私域电商闭环(含5套可复用SOP模板)

更多请点击: https://codechina.net 第一章:AI做电商 赚钱方法 人工智能正深度重构电商价值链,从流量获取、商品推荐到客服响应、库存优化,AI已不再是辅助工具,而是直接驱动盈利的核心引擎。商家无需自建大模型&#…

2026/7/24 13:33:41 阅读更多 →
AI论文写作工具评测与宏智树核心优势解析

AI论文写作工具评测与宏智树核心优势解析

1. AI论文写作工具现状与核心痛点当前学术写作领域正经历着前所未有的技术变革,AI辅助写作工具已经从简单的语法检查进化到能够生成完整学术论文的阶段。我测试过市面上主流的9款工具后发现,它们在实际应用中存在三个典型问题:第一是学术规范…

2026/7/24 13:32:41 阅读更多 →

日新闻

用Highcharts 创建可拖拽三维散点立方体3D图表

用Highcharts 创建可拖拽三维散点立方体3D图表

该案例基于Highcharts scatter3d 三维散点图实现空间立方体散点可视化,核心特色:三维 X/Y/Z 三轴空间,所有散点分布在 0~10 立方体空间内;散点使用径向渐变实现立体 3D 圆球质感;支持鼠标 / 触屏拖拽画布,…

2026/7/24 0:00:29 阅读更多 →
AppCertDlls:进程创建路径上的 DLL 入口

AppCertDlls:进程创建路径上的 DLL 入口

AppCertDlls:进程创建路径上的 DLL 入口 AppCertDlls 位于 HKLM\System\CurrentControlSet\Control\Session Manager\AppCertDlls。本文的程序功能是只读列出这个键在 64 位和 32 位注册表视图中的全部值,并显示每条值的来源、名称、类型和可安全显示的数…

2026/7/24 0:00:29 阅读更多 →
我的编程之路:第一篇博客

我的编程之路:第一篇博客

大家好,我是一名编程初学者,同时这也是我编程学习之路上的第一篇博客。在这里,我想要向大家介绍我的一些想法和规划。a.自我介绍我是一个刚刚接触编程的新手,目前在学习c语言,我对编程世界充满了强烈的好奇。当然&…

2026/7/24 0:00:29 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/24 3:59:20 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/24 1:23:39 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/23 17:49:47 阅读更多 →

月新闻