WRC上听了三小时!越发感觉具身的ChatGPT时刻正在逼近。
19号WRC第一天就去各种探展。当天下午银河通用举办了一场叫“具身智能大模型的进化之路”的论坛。现场来的嘉宾很重磅有银河通用创始人王鹤、王晓刚大晓机器人、王仲远北京智源人工智能研究院院长、朱军老师生数科技、卢宗青老师智在无界、弋力老师清华叉院等。看他们的背景就知道具身基座模型方向的大佬都来了。这也是这个论坛吸引我的点因为具身的下半场竞争主线一定是大脑。原文链接WRC上听了三小时越发感觉具身的ChatGPT时刻正在逼近。上次waic26姚卯青和徐丹飞他们给的共识是具身智能大模型的ChatGPT时刻正在逼近。忙完waic之后好久没来参加论坛了这次完整地听了3个小时。本次论坛形成的共识和waic类似并强调了以物理世界数据飞轮和世界动作模型为代表的技术手段正在开辟出全新的增长曲线。期间还发布了一个《具身智能大模型白皮书》和《具身智能产业指数》。01 共识被一台机器人具象化了共识大家都可能很熟悉。但论坛现场银河最新的双足人形机器人 Galbot ET-1把它具象化了。它给人的第一印象是动作很顺听到语言指令后ET-1会根据环境变化生成身体动作交流时伴随眼神、头部和躯干的细微反馈少了机器人常见的机械停顿。这种丝滑背后对应的是本次同期发布的AstraBrain-Agent。后面是王鹤老师对银河通用技术路线的完整介绍了。他先谈到一个判断当人形机器人在复杂任务中表现出接近人类的能力时具身智能可能迎来自己的AlphaGo时刻。而这个事情上银河选择的测试不是围棋而是网球也就是上面视频开头部分。相比规则明确、状态相对稳定的围棋网球发生在不断变化的物理世界。机器人要实时判断球的速度、旋转和落点同时调整身体姿态、规划击球动作并维持全身平衡。这也是网球比较有意思的地方。它考验的已经不只是某个动作能不能做出来而是视觉感知、环境预测、决策规划和全身控制能否在极短时间内形成闭环。王鹤表示AstraBrain-Agent也是全球首个具备学习能力的智能体边看、边学边做。视频开头的打网球就是ET-1正在学习的任务之一。AstraBrain-Agent在工作时需要同时调用大脑和小脑大脑判断球从哪里来、应该打向哪里小脑则将决策转化为实时、连续的全身动作。击球过程中任何一处延迟都会直接反映在结果上。现场还有一个信息8月22号7点半银河将会是机器人运动会开幕式首个表演网球人机大战。02 当前机器人的能力到哪里了现场王鹤老师把银河的完整技术路线分享了出来。1AstraBrain-WAM 0.5负责理解环境、预测变化并规划动作2AstraBrain-WBC 0.5负责全身实时运动控制3AstraBrain-Dex面向灵巧操作4AstraData承担数据采集和处理5新发布的AstraBrain-Agent则试图让机器人在真实交互中边观察、边学习、边执行。想要判断能力的丝滑度除了高动态的打网球任务银河还展示了转笔和盘核桃。目前转笔已经可以做到将笔抛向空中、接住后继续转动这个是很细致的灵巧任务很多成年人都没法很好完成。盘核桃则依赖多指协调、连续接触和细粒度力控用力大了核桃会碎用力小或者不对核桃可能掉了。这些能力的背后是AstraBrain-Dex灵巧手世界模型通过强化学习和Sim2Real具体完成部署的。王鹤也表示这类任务只能通过强化学习和sim2real之前figure拧瓶盖是遥操但很多动作遥操做不了天花板高度可能就被限制了。03 什么样的模型会是大脑的终局这是论坛最值得讨论的问题之一。VLA是目前具身智能的主流路线。它把视觉、语言和动作放进统一模型让机器人可以根据图像与语言指令直接输出动作。但王鹤认为VLA仍然受到动作数据的限制。模型输出的是Action训练数据也需要包含与机器人本体对应的动作标签。任务和本体一旦变化数据很难直接复用。世界模型解决的是另一个问题。它让模型通过观察环境变化预测接下来可能发生什么。但只会预测未来并不意味着模型知道应该采取什么动作来完成任务。所以银河选择了WAM也就是世界动作模型。WAM把理解、预测和行动放进同一套模型既学习物理世界如何变化也学习为了完成任务应该采取什么动作。而之前Jim Fan给红杉讲的机器人大脑的终局也是WAM。这一点王鹤表示“银河是全球第一个提出WAM概念的arxiv上可以看到首篇论文我还是通讯作者。现在我们用AstraBrain-WAM 0.5验证跨任务、跨场景和跨本体能力”。朱军则从通用世界模型的角度给出了另一套表达通用世界模型理解×预测×行动。他认为技能的形成可以理解为持续预测、行动和修正的过程并将通用世界模型的演进分成生成、交互、行动、自主和组织五个阶段。虽然两种表述使用的概念不同方向却很近。04 数据飞轮对模型能力增长的贡献是怎么样的架构决定模型怎样学习数据决定模型能够学到多少。生数科技的朱军老师在现场展示了一座数据金字塔。越接近真实任务的数据往往价值越高但规模化能力越弱越容易大规模生成的数据又可能与真机部署存在更大距离。所以数据飞轮的价值不能只用“采了多少小时”衡量。真正重要的是仿真、真机和人类视频能否被组织进同一条训练链路并推动机器人完成更多真实任务。银河通用在这个问题上给出的答案则是“虚实融合”。在数据端AstraData银河自己的基础设施负责承接仿真数据、真实机器人数据和Ego数据。模型端WAM-TTT尝试从无标注人类视频中学习任务经验再通过后训练完成具体场景适配。王鹤说通过真机强化银河在全球率先攻克了10分钟超长程做早餐任务的公司。AstraBrain-WAM 0.5和AstraBrain-WBC 0.5也分别在大脑与全身运控方向验证了Scaling Law。相比于dyna-2王鹤说他们在今年2月份就验证了数据与模型的scaling law。之外现场银河还展示了最新的第一视角数据采集方案Astra Set。05 具身大模型的GPT时刻什么时候会来到这个问题上次waic上我们分享过徐丹飞他们给的预测。但这次王鹤现场给出了一个相对具体的判断标准在不依赖额外工程开发的情况下机器人能够对人类级任务实现零样本泛化并达到70%至80%的成功率剩余部分再通过客户侧的轻量适配继续提升。这个标准里关键不只是成功率。ChatGPT带来的变化是普通用户面对一个新问题时不需要重新采集数据、训练模型和开发系统。放到机器人上也应该意味着换一个任务、物体或环境机器人仍然能够调用已有经验解决问题。漂亮Demo是起点真实场景中的持续运行才是答案。真正的ChatGPT时刻需要同时满足泛化能力、任务成功率、部署成本和长期稳定性。至于未来具身可能的市场规模王鹤给了一个描述手机数量 x 汽车价格 x 大模型模式计费倍率。06 其他嘉宾在工程和产业上的分享海外的嘉宾Wolfram Brugard概率机器人的奠基者等分享的技术路线和国内还存在一定的差异他们更关注工业。王田苗教授北航机器人研究所名誉所长带来的主题分享也比较有意思“具身智能下半场如何穿越分化周期”。他指出具身发展刚开始最大瓶颈不仅仅是AI而是核心零部件跟不上大脑与数据的迭代进化。现在行业很多公司都进入了POC阶段但具身大模型解决不了所有case只能处理容错率高一点的场景。07 没有battle圆桌上的一问一答在多位嘉宾分享过之后最后一个环节是圆桌。张直政博士是主持人其他几个嘉宾也都是熟人了可以看下图的介绍。圆桌没有出现预想中的路线battle主要收敛到三个问题上世界模型应该学习什么、预测怎样帮助机器人行动以及模型从实验室走向真实场景还缺哪些关键环节。1世界模型究竟应该学习什么样的表征又怎样从数据中获得因果能力卢宗青老师认为当前大模型对视觉世界的理解仍然不够扎实。视觉表征做不好模型的通用性也很难建立至于因果关系现阶段仍需要依靠更大规模的数据逐渐逼近。王仲远也提到世界模型要预测物理世界前提是从海量数据中学习稳定的环境表征。但数据并非简单地越多越好。王晓刚老师的观点是世界模型仅有生成能力还不足以在物理世界中行动。电影、生成视频以及部分互联网内容并不严格遵循真实世界的物理规律。机器人需要学习真实生活中的视频还需要引入相机位姿等信息才能进一步理解空间与运动之间的关系。弋力老师则把交互和多模态放到了更重要的位置。机器人面对的世界不仅有图像还有动作、触觉和状态变化。如果目标是让机器人真正参与物理交互模型表征就需要包含这些信息并在不同模态之间协同学习。换句话说世界模型需要学习的不是“画面长什么样”而是物体怎样变化、动作会造成什么结果。2预测为什么能够帮助策略学习王晓刚老师认为VLA比较擅长处理目标和环境相对稳定的操作任务。一旦周围环境持续变化或者任务中存在博弈模型就很难及时调整。世界模型的价值在于能够提前展开多个可能的未来机器人可以先“想象”不同动作可能造成的结果再对候选策略进行评价和选择。弋力则进一步给出了三种可能路径1图像生成等优势模态可以带动动作预测2模型也可以在执行动作前先对未来状态进行预判3从长期来看世界模型还能帮助机器人在环境变化中不断修正行为。卢宗青老师后面补充触觉也可以成为重要的监督信号。通过联合建模动作与状态机器人能够更准确地理解一次接触之后会发生什么。3从实验室到真实场景我们需要面对什么挑战研究方向需要对准什么切入点现场嘉宾提到B端和C端面对的是两套不同的评价逻辑。工业场景会把效率、精度和成功率算到小数点后几位有时甚至需要在智能化方案和传统工程方案之间做取舍C端环境更加开放机器人能否持续学习和进化会更重要。弋力老师认为持续学习不只是“继续收集数据”。机器人应该从什么数据中学习、在什么时候学习、用什么方式学习都需要被重新设计。机器人执行失败后系统还要判断问题来自感知、规划、控制还是环境变化并区分任务中不变的规律和不断变化的因素。王仲远老师的判断是具身智能也会经历从专用小模型走向通用大模型的过程。当前专用模型已经能把部分技能做得很好真正缺少的是跨任务和跨场景的泛化能力。卢宗青老师则给出了一个很工程的观察行业对数据的重要性已经形成了基本共识但对训练范式还没有统一答案。不过这并不意味着产业落地必须等待“终局模型”出现。眼下更直接的障碍是行业还缺少一套足够成熟的工具链把模型稳定地部署到不同机器人和真实场景中。这可能也是圆桌最终留下的共识表征、预测能力、持续学习和部署工具链已经成为任何一条技术路线都绕不开的问题。08 写在最后三个小时听下来一个变化已经很明显。具身智能正在进入大脑竞争更为集中的阶段。行业不再满足于让机器人完成一个预先训练好的任务而是开始追问同一个模型能否控制不同机器人已有经验能否迁移到新场景部署产生的数据能否继续推动模型增长。具身智能的ChatGPT时刻大概率不会由某一段突然走红的视频宣布。它更可能出现在这样一个节点机器人进入新场景后不需要重新启动一套完整的工程项目模型能够利用已有经验理解任务通过少量适配完成部署再把执行结果送回数据飞轮。重磅全网首个具身智能开源知识库来啦技术/产业/投融资/上下游推荐阅读真机强化入门的一套完整教程pi*0.6复现方案我们用低成本的机械臂完成pi0/pi0.5/GR00T/世界模型等VLA任务具身智能的WAM与世界模型一份完整指南一览具身智能的行业全局从产品经理的角度出发VLARL方向首个系统教程来啦Online RL/Offline RL/test time RL等好用高性价比面向具身科研领域打造的轻量级机械臂VLA/VLA触觉/VLARL/具身世界模型等具身大脑小脑算法与实战全栈路线来啦~从零训练你的足式机器人让你的足式机器人真正动起来~1v1 科研论文辅导来啦重磅具身智能之心论文辅导来啦近20方向顶会/顶刊/SCI/EI/中文核心/申博等

相关新闻

zi_so_demo.ddls.json 到底是什么,理解 ADT for VS Code 为何给一个 CDS Data Definition 配两份文件

zi_so_demo.ddls.json 到底是什么,理解 ADT for VS Code 为何给一个 CDS Data Definition 配两份文件

附件里正在显示的 ZI_SO_DEMO 和 ZI_SO_DEMO2 很有代表性。一个我们平时认为只有一份 CDS 源代码的 Data Definition,到了 ADT for Visual Studio Code 的资源树里,却展开成了两个文件,一个是 zi_so_demo.ddls.acds,另一个就是红框中的 zi_so_demo.ddls.json。 这两个文件…

2026/8/26 14:59:40 阅读更多 →
面向医院IT-OT环境网络攻击与防御分析的仿真锚定数字孪生测试平台

面向医院IT-OT环境网络攻击与防御分析的仿真锚定数字孪生测试平台

大家读完觉得有帮助记得关注和点赞!!!摘要现代医院日益依赖集成的信息技术(IT)和运营技术(OT)基础设施来支持关键的医疗服务。然而,这种融合扩大了网络安全攻击面,使得在…

2026/8/26 15:23:47 阅读更多 →
洛谷《深入浅出基础篇》题解-2(C语言)

洛谷《深入浅出基础篇》题解-2(C语言)

目录 【算法1-1】模拟与高精度 P1042 [NOIP 2003 普及组] 乒乓球 P2670 [NOIP 2015 普及组] 扫雷游戏 P1563 [NOIP 2016 提高组] 玩具谜题 P1601 高精度加法 P1303 A*B Problem P1009 [NOIP 1998 普及组] 阶乘之和 P4924 [1007] 魔法少女小Scarlet P1328 [NOIP 2014 提…

2026/8/26 15:29:36 阅读更多 →

最新新闻

海思平台不依赖频道文件实现 DVB 直接播放

海思平台不依赖频道文件实现 DVB 直接播放

1. 频道文件与直接调谐的区别传统方案的流程是:搜索频道↓ 导出频道文件↓ 系统预置频道文件↓ 开机导入↓ 根据文件中的 PID 播放频道文件通常包含:频率;符号率;调制方式;节目号;视频 PID;音频…

2026/8/26 18:52:29 阅读更多 →
海思 DVB 播放超时与 C 语言同名函数冲突排查

海思 DVB 播放超时与 C 语言同名函数冲突排查

概要本文记录一次海思 DVB 直接播放失败的定位过程。程序最初出现 HI_UNF_TUNER_SetAttr failed,修正前端参数后又出现 HIADP_Search_GetAllPmt failed 和 DMX_DataRead timeout。进一步分析发现,unf_abs.c 与 hi_adp_demux.c 中存在同名函数&#xff0c…

2026/8/26 18:52:29 阅读更多 →
IoT OTA 灰度发布与回滚:从设备分组到故障收敛

IoT OTA 灰度发布与回滚:从设备分组到故障收敛

一次固件在实验室成功升级,只证明“这台设备在这次条件下写入并启动了新镜像”。它没有证明车队里不同硬件修订、运营商网络、剩余电量、存储磨损、现场外设和长时间离线设备都能安全升级。真正的 IoT OTA 系统不是文件分发器,而是一套限制故障半径、判断…

2026/8/26 18:52:29 阅读更多 →
【超详细】搞懂tar、tgz、zip、rar、7z归档压缩格式,理清跨平台踩坑根源

【超详细】搞懂tar、tgz、zip、rar、7z归档压缩格式,理清跨平台踩坑根源

文章目录1、先分清归档与压缩,很多初学者的概念误区1.1 归档与压缩二者完全是两件独立工作1.2 两套技术路线诞生的历史背景2、tar家族格式完整拆解:tar / tar.gz / tgz / tar.bz2 / tar.xz2.1 tar归档格式,只打包不压缩2.2 gzip介入之后&…

2026/8/26 18:52:29 阅读更多 →
Langchain学习笔记(4) ---rag基础和向量数据库

Langchain学习笔记(4) ---rag基础和向量数据库

一、文档加载与切分二、Embeddingfrom langchain_milvus.vectorstores.milvus import Milvus from utils.rag_factory import get_milvus_client# 获取milvus客户端 vector_store: Milvus get_milvus_client("employee_handbook",is_deleteFalse) results vector…

2026/8/26 18:52:29 阅读更多 →
【Playwright教程】Playwright必备基础知识、核心用途与第一个截图实战

【Playwright教程】Playwright必备基础知识、核心用途与第一个截图实战

🔥 交流讨论:欢迎加入我们一起学习! 🔥 资源分享:软件测试学习提升资料包 🔥 教程推荐:自动化测试从入门到精通全套保姆级教程 📢欢迎点赞 👍 收藏 ⭐留言 学习 Playwri…

2026/8/26 18:51:29 阅读更多 →

日新闻

Python random 模块常用函数详解:从入门到实战

Python random 模块常用函数详解:从入门到实战

目录 1. 引言2. 准备工作3. 基础随机函数4. 序列相关函数5. 随机种子与复现6. 实战案例7. 注意事项8. 常见问题与排查9. 总结 1. 引言 摘要: 本文系统介绍 Python 标准库 random 模块中最常用的随机数生成函数。内容涵盖基础随机函数(random()、unifor…

2026/8/26 0:00:40 阅读更多 →
《Microsoft Sql server 2008 Internals》读书笔记--第三章Databases and Database Files(2)

《Microsoft Sql server 2008 Internals》读书笔记--第三章Databases and Database Files(2)

《Microsoft Sql server 2008 Internals》索引目录: 《Microsoft Sql server 2008 Internals》读书笔记--目录索引 在上篇文章中,主要介绍了创建数据库的基本语法和FileGroup的初步知识。需要注意的是: 关于FileGroup 如果你的系统是用Raid设备直接存…

2026/8/26 1:18:18 阅读更多 →
政务AI智能体怎么建?三种模式、三步路径与四个误区

政务AI智能体怎么建?三种模式、三步路径与四个误区

政务AI智能体已经从概念试点阶段,转入了政务服务的常态化落地应用;在实际使用过程中,它能自主理解办事需求、辅助完成填报申报、开展材料预审,并联动多个系统协同作业,真正嵌入到政务办理的全流程当中。但在落地推进过…

2026/8/26 1:18:18 阅读更多 →

周新闻

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/26 14:45:33 阅读更多 →
SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/26 17:46:43 阅读更多 →
Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/26 14:46:37 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/26 3:50:20 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/26 17:46:39 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/26 1:24:05 阅读更多 →