李飞飞教机器人摸麻将挤牙膏,AI终于有“手感”了
视觉负责回答「我要做什么」触觉负责不断修正「我现在做得对不对」2009 年李飞飞团队发布 ImageNet让人工智能第一次有机会通过海量图片认识这个世界。十五年后她在一次演讲中提出「空间智能」认为 AI 的下一步不只是识别一张图片里有什么而是理解物体在哪里、彼此如何关联以及人在其中采取行动后世界会发生什么变化。今年这条研究路线又往前走了一步。6 月李飞飞参与的一项机器人研究 T-Rex 发布研究者为机器人加入高频触觉反馈让它完成翻书页、拿鸡蛋、挤牙膏、抽取薄卡片和拧灯泡等任务。一位因计算机视觉闻名的科学家为什么开始反复谈论触觉、模拟器和机器人这并不意味着视觉已经过时。恰恰相反今天的具身智能厂商仍在给机器人安装更多摄像头、更精确的深度传感器和激光雷达。真正发生的变化是行业逐渐意识到「看」只是智能进入物理世界的第一步一张图片也只是世界留下的表面。AI可能根本没在看今年 3 月李飞飞参与的一项研究做了一个实验研究者向多模态模型提出视觉问题但故意没有真的把图片传进去。按理说模型应该回答「我没有看到图片无法判断」。但不少前沿模型依然开始一本正经地描述图像内容给出完整的分析过程甚至能在部分视觉问答测试中取得很高的分数。比如在一个胸肺 X 光问答基准里模型没有看过任何 X 光片成绩却依然排到了前列。研究者把这种现象称为「幻景推理」模型并不一定在根据视觉证据回答问题而可能是在利用问题里的文字线索和训练数据中的常见搭配猜测一张「通常会和这个问题同时出现的图片」应该长什么样。类似于大模型并不一定知道自己在说什么而是在推测「下一个最有可能出现的字」。题目问「图中车辆正在等待什么信号」即使没有图片人也可能根据常识猜出答案无非是红绿灯。模型吃过足够多的图片说明、诊断报告和问答数据以后也可能绕过真正的视觉观察直接从问题跳到答案。它说得非常像看见了不代表它真的看见了。在聊天窗口里只要答案听起来合理用户未必关心模型究竟是看图得出的还是靠语言猜中的。但进入物理世界以后二者的区别会立刻暴露出来。杯子究竟在桌子的左边还是右距离手臂还有十厘米还是二十厘米? 这些都不是可以靠语言常识蒙混过关的问题尤其是对于机器人而言差几厘米就会直接抓空。这也是为什么今天的机器人身上正在出现越来越复杂的感知系统。宇树 G1 使用深度相机和 3D 激光雷达一种负责判断物体远近一种负责建立周围空间的距离地图。智元灵犀 X2 除了 RGB-D 相机和激光雷达还使用前视双目、后视相机和触摸传感器从不同方向补充环境信息。这些配置看上去像是又一场针对传感器的军备竞赛但它们其实是在弥补视觉的不同盲区。头部摄像头适合观察整个房间但容易在机械臂靠近物体时被自己的手挡住激光雷达能够测量距离和建立地图却看不懂桌上的东西究竟是杯子还是苹果。对人来说转一下头、眯一下眼睛或者伸手试探是几乎不需要思考的动作。机器人却需要把来自不同摄像头、雷达和关节传感器的信息拼在一起才能确定自己面对的是同一个、持续存在的物理空间。所以具身智能首先遇到的问题并不是模型能不能认出一个杯子而是它能不能确认这样一个杯子真的在那里。大多数世界模型其实只是在画世界这两年「模型」成了 AI 行业最热门的词之一。视频生成模型可以根据一句提示词生成一台机器人走进客厅、拿起篮子、凑近玩具再把玩具放进篮子。这些画面中的光影、运动和镜头都可以非常自然观众很容易产生一种感觉既然模型能够生成这段过程它大概已经理解了环境和物体如何运作。但只是从视频来看杯子究竟有多重、柜门的铰链能承受多大的力、机械手碰到杯壁时会不会打滑都不是必须回答的问题只要下一帧看起来合理任务就完成了。实际上对机器人来说这些不足以在镜头中充分展示的细节恰恰决定了任务能不能成功。World Labs 今年把目前被统称为「世界模型」的技术拆成了三类。第一类是渲染器负责生成给人看的像素第二类是模拟器负责表示几何结构、物理属性和动态变化第三类是规划器根据目标决定机器人下一步应该做什么。这个分类维度恰恰说明了刚才我们提出的问题模型如果只是会画出一个世界不等于能够在里面干活。一辆车可以在生成视频里顺利穿过城市但镜头之外的街道是否持续存在建筑有没有稳定的三维结构车轮和地面之间是否真的存在摩擦模型未必知道。对于观众来说像真的已经够了对于机器人来说世界必须可以计算、可以碰撞也必须在它转过身以后继续存在。World Labs 推出的 Marble 已经可以从文字、图片或视频生成可探索的三维环境。除了供人观看的画面它还可以输出碰撞网格让物理引擎判断一个物体能不能穿过墙壁、落到地面后会停在哪里。英伟达的 Cosmos 则把世界生成、视频预测和机器人训练放在同一套 Physical AI 体系中希望用大量合成场景填补真实机器人数据不足的问题。这条路线听起来很宏大落到机器人公司的研发流程里其实非常朴素这就是先让机器人在虚拟世界里反复失败。只不过一台双足机器人学会走路不可能只靠工程师每天把真机推倒几千次。逐际动力的 TRON 1 支持 NVIDIA Isaac、MuJoCo 和 Gazebo 等仿真平台开发者可以先在虚拟环境里测试不同地面、坡度和碰撞情况。智元则发布了 AgiBot Digital World用仿真环境生成操作数据、训练模型并评估机器人策略。逐际动力支持的训练平台在现实中让机器人摔倒一次可能意味着零部件磨损、维修成本和安全风险在模拟器里同一个动作可以由成千上万个虚拟机器人同时尝试。桌子的高度、地面的摩擦系数、物体摆放的位置都可以不断变化机器人不必真的打碎一万只杯子才能学会怎样端稳一只杯子。不过模拟器也不是答案本身虚拟世界中的地面永远比真实地面干净模型设定的摩擦力也不可能覆盖每一种材料。机器人在模拟器里练得再熟进入工厂、商场和家庭以后依然会遇到没有被写进参数表的意外。这就是机器人行业一直面对的「仿真到现实差距」。World Labs 在 7 月 21 日收购 SceniX重要之处也正在这里。它不再只满足于生成一个可以观看和探索的三维空间而是开始把模拟出来的世界与真实机器人的行动反馈连接起来。触觉不只是另一双眼睛即使视觉和模拟已经足够成熟机器人真正碰到物体以后仍然会遇到一类摄像头很难独立解决的问题。拿起鸡蛋时机器人怎样知道手指已经用力过大抽出一张薄卡片时它怎样判断自己捏住的是卡片还是只碰到了桌面拧灯泡时它怎样感知螺纹已经卡住继续旋转可能会损坏物体摄像头可以看到手已经接近目标却很难及时判断接触面正在发生什么。触觉解决的不是「物体在哪里」而是「接触以后发生了什么」。压力是否增加物体是否开始滑动材料有没有变形抓握是否稳定这些信息都发生在视觉画面之下。Figure 今年发布的 Helix 02就把头部摄像头、手掌摄像头、指尖触觉和全身本体感知接入同一套控制系统。当头部摄像头被机械手遮挡时手掌里的摄像头继续提供近距离画面指尖传感器则可以感知低至 3 克的力让机器人从药盒中取出单颗药片、控制注射器推出精确剂量并在杂乱物体中分离出尺寸很小的目标。国内厂商也在快速补上这块感知能力像帕西尼这样的上游厂商则直接把触觉传感器、灵巧手、人形机器人、数据采集和多模态模型组成一条产品链希望把触觉从一个零部件问题变成机器人训练数据的一部分。图片来自帕西尼但给机器人装上传感器并不意味着它自然就会使用触觉很多被称为「常识」的能力并不是来自我们看过多少图片而是来自身体在漫长的接触中学会了让动作适应世界。李飞飞参与的 T-Rex 研究展示了这一步为什么困难。团队收集了 100 小时包含触觉信号的机器人操作数据让机器人完成翻书页、转移鸡蛋、擦盘子、挤牙膏、分离叠放的杯子、摸索麻将、开锁、抽取卡片和拧灯泡等任务。最终T-Rex 在 12 项任务中的平均成功率达到 65%比最强对照模型高出 30 个百分点。研究中一个很有意思的结果是直接把触觉数据塞进现有的视觉—语言—动作模型表现反而很差。原因并不难理解不同感官工作的速度并不相同视觉和语言适合做较慢的全局判断机器人需要先看清桌面理解人的指令再决定应该拿哪一个物体。但一只杯子开始从手指间滑落时它不会等待模型重新看图、分析和规划。触觉必须以更高频率持续工作在滑动刚刚发生的瞬间调整手指力度。T-Rex 因此让视觉和触觉按照不同速度运行。视觉负责回答「我要做什么」触觉负责不断修正「我现在做得对不对」。这不是给机器人增加了另一双眼睛而是给它增加了一条来自现实的即时反馈。过去几年的 AI 竞争主要围绕谁能造出一个更聪明的大脑。具身智能正在把竞争推向一套更完整的系统机器人需要摄像头和雷达确认世界在哪里需要模拟器提前练习行动的后果也需要触觉和力反馈处理真正接触以后出现的意外。李飞飞并非直接从视觉转向触觉她的研究路线更像是在不断扩大「看见」的含义从识别一张图片到理解一个持续存在的空间再到知道自己伸手碰触以后世界会怎样回应。十五年前ImageNet 教会 AI 说出眼前是什么下一代世界模型需要解决的问题是当它真的伸出手以后世界会交还给它什么。原文链接李飞飞教机器人摸麻将挤牙膏AI终于有“手感”了-36氪

相关新闻

OpenClaw AI智能体安全防护与漏洞修复指南

OpenClaw AI智能体安全防护与漏洞修复指南

1. OpenClaw龙虾AI智能体安全现状与核心风险OpenClaw作为新兴的AI智能体平台,其开放架构和插件化设计在带来灵活性的同时,也引入了多重安全隐患。根据近三个月的漏洞扫描数据,部署OpenClaw的环境中有78%存在至少一个高危漏洞配置,…

2026/8/4 11:22:19 阅读更多 →
Obsidian怎么把播客视频转成Markdown笔记?搭建可搜索AI知识库

Obsidian怎么把播客视频转成Markdown笔记?搭建可搜索AI知识库

我一直有个执念,积累的东西不能被锁在工具里。 播客听了、视频看了,要是只存在某个App里,哪天换了工具就全没了。所以我坚持把音视频内容转成 Markdown,存进 Obsidian,搭一个自己能搜、能引用、能长期沉淀的知识库。 这套流程我跑…

2026/8/4 11:22:19 阅读更多 →
小红书视频转文字笔记教程:三步存进个人知识库

小红书视频转文字笔记教程:三步存进个人知识库

小红书刷到一条好视频,收藏了,然后呢。大概率就是躺在收藏夹里吃灰,之后再也没打开过。 我跟你说,这事儿我以前也这样。收藏夹攒了几百条,真正回看的没几条。后来我想明白了,问题不在收藏这个动作&#xff…

2026/8/4 11:22:19 阅读更多 →

最新新闻

ESXi 6.x时间同步配置与NTP服务详解

ESXi 6.x时间同步配置与NTP服务详解

1. ESXi时间同步的重要性与NTP协议基础在虚拟化环境中,时间同步是个容易被忽视但极其关键的基础配置。我管理过上百台ESXi主机的集群,曾因时间不同步导致vMotion迁移失败、日志时间错乱等问题。ESXi作为虚拟化底层平台,其时间准确性直接影响所…

2026/8/4 12:05:05 阅读更多 →
Reloaded-II模组下载终极指南:从失败到成功的完整解决方案

Reloaded-II模组下载终极指南:从失败到成功的完整解决方案

Reloaded-II模组下载终极指南:从失败到成功的完整解决方案 【免费下载链接】Reloaded-II Universal .NET Core Powered Modding Framework for any Native Game X86, X64. 项目地址: https://gitcode.com/gh_mirrors/re/Reloaded-II 你是否曾经满怀期待地打开…

2026/8/4 12:05:05 阅读更多 →
UE5蓝图驱动摄影机路径:动态动画与Sequencer录制实战

UE5蓝图驱动摄影机路径:动态动画与Sequencer录制实战

1. 项目概述:为什么我们需要蓝图驱动的摄影机飞行路径?在虚幻引擎5(UE5)的影视化内容创作中,无论是制作游戏内的过场动画、产品演示、建筑漫游还是虚拟制片预览,一个流畅、可控且富有表现力的摄影机运动都是…

2026/8/4 12:05:05 阅读更多 →
网盘下载加速终极方案:告别限速困扰的完整指南

网盘下载加速终极方案:告别限速困扰的完整指南

网盘下载加速终极方案:告别限速困扰的完整指南 【免费下载链接】Online-disk-direct-link-download-assistant 一个基于 JavaScript 的网盘文件下载地址获取工具。基于【网盘直链下载助手】修改 ,支持 百度网盘 / 阿里云盘 / 中国移动云盘 / 天翼云盘 / …

2026/8/4 12:05:05 阅读更多 →
私域运营中的‘推三返一‘裂变模型设计与实践

私域运营中的‘推三返一‘裂变模型设计与实践

1. 项目概述:什么是"推三返一"裂变模型? "推三返一"是近年来在私域运营领域兴起的一种用户裂变策略,简单来说就是"推荐3人消费,返还1份收益"。这个模式最早出现在2018年左右的社交电商平台&#xf…

2026/8/4 12:05:05 阅读更多 →
Blender场景高效导入UE5:Datasmith插件完整工作流与避坑指南

Blender场景高效导入UE5:Datasmith插件完整工作流与避坑指南

1. 项目概述:为什么需要Datasmith?如果你和我一样,在Blender里吭哧吭哧建好了模型,调好了材质,甚至打好了灯光,准备导入Unreal Engine 5(UE5)大展拳脚时,却发现模型破面、…

2026/8/4 12:04:05 阅读更多 →

日新闻

AI Agent白手起家26: 使用标准事件驱动大模型实践

AI Agent白手起家26: 使用标准事件驱动大模型实践

纲要 练习目标:掌握大模型标准事件的调用回顾 LangChain 中的核心标准事件 invokestreambatchastream_eventswith_structured_output 环境准备实战代码:多种事件调用对比 同步调用与流式输出批量处理异步事件流监听结构化输出 运行说明与预期结果总结与扩…

2026/8/4 0:00:40 阅读更多 →
dealsea是什么?跨境卖家必知的美国deal站入门指南

dealsea是什么?跨境卖家必知的美国deal站入门指南

说实话,第一次听说美国这个老牌折扣网站的跨境卖家,十个有八个会问同一个问题:这个平台到底是干嘛的?我见过一个做家居出口的朋友,他在亚马逊上月销二十万美金,却从来没用过它。我给他看了首页——一屏一屏…

2026/8/4 0:01:40 阅读更多 →
清华大学重磅EST:植物自导电闪蒸焦耳热600°C/2600°C两步法!稀土超积累植物秒级转化为CeO₂-石墨烯电催化剂!

清华大学重磅EST:植物自导电闪蒸焦耳热600°C/2600°C两步法!稀土超积累植物秒级转化为CeO₂-石墨烯电催化剂!

通讯作者:邓兵、刘建国通讯单位:清华大学DOI:https://doi.org/10.1021/acs.est.6c00603研究背景稀土元素(REEs)是清洁能源技术与电子器件不可或缺的核心原料,然而传统提取方式依赖能耗高、排放大的采矿与强…

2026/8/4 0:01:40 阅读更多 →

周新闻

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

1. 从水管网络到最大流:一个核心问题的诞生想象一下,你是一个城市供水系统的总工程师。你的城市有多个水源(水库),需要通过一个复杂的地下管道网络,将水输送到各个居民区。每条管道都有其最大通水能力&…

2026/8/3 4:58:13 阅读更多 →
基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台…

2026/8/4 11:41:39 阅读更多 →
MATLAB xcorr函数详解:从互相关原理到四大实战应用

MATLAB xcorr函数详解:从互相关原理到四大实战应用

1. 从一次信号“找茬”说起:为什么我们需要互相关几年前,我在处理一组声学传感器数据时遇到了一个棘手的问题。我有两个麦克风记录了一段相同的音频信号,理论上它们接收到的声音波形应该非常相似,只是由于麦克风位置不同&#xff…

2026/8/4 5:26:40 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/3 13:07:03 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/4 11:09:16 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/3 8:27:36 阅读更多 →