机器人也有Scaling Law?GE-Act 2.0用数据规模实验给出答案
2024年底到2025年初几乎每个做具身智能的团队都在盯着同一个问题大语言模型里那条“参数越多、数据越多、效果越好”的Scaling Law曲线搬到机器人身上还成不成立因为从直觉上看机器人数据和文本数据完全是两码事——文本满地都是机器人轨迹却要靠真机一步步采贵得离谱还得考虑每个本体、每个场景的差异。所以很多人的默认判断是机器人领域不太可能有统一的Scaling Law更多是小数据、小模型、特定任务的“手工作坊”。直到智元GE-Act 2.0公开的验证结果出来这个判断被正面撞了一下。GE-Act系列是智元机器人推出的动作执行模型2.0版本的核心不是“加了几个新技能”而是用成规模的对照实验把“数据量增长→动作预测能力提升”这条曲线相对完整地拉了出来。它给出的信号很直接机器人侧确实存在和语言模型类似的规律但触发条件和生效范围都有明显的边界。这篇内容我想把它拆开聊一聊重点说清楚GE-Act 2.0到底验证了什么、怎么验证的、哪些经验可以直接抄走以及哪些地方Scaling Law依然水土不服。1. 语言模型靠涨数据机器人为什么一直涨不动1.1 文本与轨迹的本质差异先回顾一下语言模型里Scaling Law为什么有效。GPT系列、Llama系列反复验证过一件事只要你把参数量、训练数据量、计算量按比例放大下一Token预测的损失就会稳定下降下游任务能力随之上升。文本数据的来源是互联网几乎取之不尽而且信息的密度和分布相对统一清洗和去重之后直接喂给模型就行。机器人侧完全不同。一条有效的机器人轨迹数据至少包含视觉观测、本体状态、动作指令三个维度的对齐信息而且必须是真实的物理交互无法靠“爬虫”批量获取。哪怕在仿真环境里用强化学习疯狂采样sim-to-real的gap又会让模型在真机上表现缩水。这就导致机器人行业长期处于“数据饥饿”的状态几千条轨迹就得拿来训练模型一换场景就失灵更别提像GPT那样动辄用几个T的Token去喂。1.2 小数据时代的“手工作坊”困境数据不足直接决定了过去几年端到端机器人策略的研发范式每个团队都在自己的机器人上采数据然后训练一个只适配特定任务、特定环境、特定本体的模型。放在实验室里Demo很强换个光照、挪个桌子位置、换一台机器人成功率断崖式下跌。行业内把这种模式叫“数据烟囱”——每个场景都是一个独立的烟囱数据和模型彼此隔离无法复用。你花了三个月采的抓取数据换一个机械臂型号就基本作废。这种模式下Scaling Law根本无从谈起因为样本量始终没有逼近“规模效应”的临界点模型能力被数据天花板死死压住。1.3 GE-Act 2.0的切入点把动作变成Token把轨迹变成语料智元这代模型能做出验证起点在于它重新定义了机器人数据的组织方式。GE-Act 2.0不再把动作当作连续的浮点数直接回归而是把高频的动作指令离散化成动作Token再以“视觉观测Token 本体状态Token 动作Token”的序列形式做统一建模。这一步的本质是把机器人轨迹数据“改写”成了语言模型熟悉的序列数据格式。一旦动作变成了Token后面所有语言模型的技术积累——自回归、注意力机制、预训练加微调——都能平移过来。AgiBot World数据集智元开源的大规模真机操作数据集也在这个框架下被重新梳理和利用轨迹不再是孤立的“行为包”而是变成了可参与统计规律学习的语料。这里需要强调一下动作离散化不是GE-Act首创但把它和“规模化数据验证”放在一起做系统实验的GE-Act 2.0确实是目前公开信息里做得比较完整的一个。2. GE-Act 2.0的核心改动三段式结构、异构数据融合与稳定训练2.1 三段式架构VLA不是简单把模型拼一起GE-Act 2.0的架构延续了VLAVision-Language-Action的基本思路但拆得更细视觉编码器负责从图像里提取语义和空间信息语言模型主干负责跨模态推理和任务理解动作解码器负责将推理结果映射为具体关节指令。实际操作中真正难的不是选基座模型而是三个模块之间的对齐。视觉编码器输出的特征能不能被语言模型“读懂”语言模型推理出的意图能不能被动作解码器准确翻译成电机指令这中间只要有一个环节特征空间不匹配整个策略就是废的。GE-Act 2.0给我的感受是它在特征对齐上花费的精力不亚于模型结构设计——这恰恰是很多小团队复现VLA类工作最容易栽跟头的地方。2.2 异构数据融合真机数据、仿真数据与视频数据一起训练机器人数据稀缺是事实但稀缺不等于零。智元的做法是把所有能搞到的数据都纳入训练AgiBot World里百万级的真机轨迹、仿真环境里大规模采样得到的虚拟数据、以及互联网上的操作视频。三类数据的格式和分布差异极大混在一起训练如果不做特殊处理模型很容易被高质量真机数据带偏或者被低质量视频数据干扰。GE-Act 2.0的做法是做“数据混合配比”的动态调整——训练早期以真机数据为主让模型先学到正确的物理交互模式训练后期逐步加入仿真数据和视频数据扩大泛化覆盖面。这个节奏和我之前调多模态模型的经验高度一致数据不是越多越好而是在正确的时间点混入正确的数据才有正向收益。2.3 稳定训练的工程细节动作Token怎么定Loss怎么配比动作Token化的第一个问题是“粒度”。Token太粗动作精度不够机器人抓杯子会一把抓空Token太细序列变得很长训练和推理效率都扛不住。GE-Act 2.0在关节空间做离散化时把频率、加速度这些动态特征也纳入编码避免只看位置导致速度突变。第二个问题是Loss配比。语言模型里只预测Token类别但机器人模型要同时预测动作Token类别、回归动作残差、约束平滑性损失。三者的权重如果没有调好模型会出现“预测对了语义、输出了错误轨迹”这种诡异现象——也就是语言上看起来合理但真机一跑就撞。GE-Act 2.0公开的信息里提到它把动作残差回归的权重放在了比较高的位置这个细节我很认同因为实际部署时平滑性往往比语义正确性更重要。3. 智元拿什么证明Scaling Law成立关键对照实验拆解3.1 固定结构涨数据成功率随数据量近似对数线性增长GE-Act 2.0验证Scaling Law的第一个维度是在固定模型结构的前提下把训练数据从少量逐步扩展到全量观察测试任务成功率的变化。结果展示出近似对数线性的增长趋势数据量每提升一个数量级成功率按一定比例稳定爬升而不是在小数据时增长、大数据时迅速饱和。这条结果的重要性被很多人低估了。它说明机器人策略的能力残差还没被压榨完——当前阶段拼的不是模型小聪明而是数据规模和覆盖面。通俗点说大家都在等一个“数据喂进去、能力长出来”的正反馈循环GE-Act 2.0等于往这个循环里又加了一铲子煤。3.2 固定数据涨参数模型变大确实有收益但边际递减显著第二个维度是固定数据量不变只增大模型参数规模。结果符合预期但不如第一个维度振奋参数量增大能带来一定提升尤其对复杂长程任务“先拿A再放到B最后把C推过来”这类效果明显但简单任务上的收益很快趋于饱和。这背后是数据和模型的不匹配模型容量再大如果训练数据提供的信息量不够参数量只会变成“记住了更多无关模式”而不会转化为真正的泛化能力。这也解释了为什么GE-Act 2.0强调数据建设优先于模型扩建——对大多数机器人团队来说与其无脑堆参数不如先把数据工程做扎实。3.3 最关键的验证跨本体迁移能力随着数据规模的提升而增强衡量Scaling Law是否真正生效不能只看同一个机器人上的成功率还得看模型能否泛化到没见过的本体上。GE-Act 2.0在这轮验证里比较了不同数据规模下的跨本体迁移效果数据规模较小时模型换一个机械臂型号成功率直接腰斩数据规模扩大后跨本体的成功率韧性明显增强新本体的少量微调数据就能激活已有能力。这个结果比“同机成功率”更有说服力因为它说明模型学到的不再是“某台机器的特定轨迹”而是跟任务相关的通用操作模式——夹爪怎么靠近、关节怎么协调、碰到阻力怎么调整。这才是真正意义上“可以跨场景复用”的机器人能力也是Scaling Law在机器人侧成立的最有力证据。4. 哪些规律能直接迁移哪些地方Scaling Law会失效4.1 能迁移的规律数据覆盖度决定泛化上限多模态对齐是隐藏瓶颈从GE-Act 2.0的验证里我能抽出的第一个可迁移规律是数据覆盖度决定泛化上限。语言模型里经常说“数据多样性比数据量更重要”机器人侧更是如此。同样是10万条轨迹如果全部是同一个桌子上的抓取操作学到的东西极其有限但如果覆盖了不同桌面高度、不同物体材质、不同抓取姿态哪怕总量少一些模型的泛化能力反而更强。第二个规律是多模态对齐是隐藏瓶颈。GE-Act 2.0能把Scaling Law跑出来前提是它已经解决了视觉、语言、动作三者的特征对齐问题。如果对齐没做好数据量越大模型反而越混乱。我见过太多团队把精力全扑在数据采集上结果喂给模型后训练不收敛最后查出来是特征空间的映射关系没搞定——这个顺序千万别搞反。4.2 会失效的边界任务分布太散、轨迹质量太差、物理边界不明确Scaling Law不是魔法它的成立有几个前提条件一旦越界就会失效。任务分布过于离散数据里如果同时包含“把杯子放到桌上”“给病人翻身”“焊接钢板”这种任务类型差异过大的轨迹模型几乎无法学到共享规律数据再多也只是在压缩一个高熵分布成功率会被极限稀释。轨迹质量参差不齐机器人数据不同于文本一个错误轨迹的负面影响远大于一条垃圾文本——因为机器人一旦执行错误动作就是物理伤害不像文本输出错误可以轻描淡写地跳过。所以数据清洗在机器人领域的重要性远超NLP领域宁缺毋滥。物理边界不明确模型无法从静态轨迹里学到“关节限位”“电机力矩上限”“避撞约束”这些物理边界信息必须靠额外的约束机制比如安全层、运动学过滤来兜底。数据量再大也不能指望模型自己悟出这些规则。长时序因果依赖极强的任务如果任务要求“先看几秒再决定动作”或者“动作A的结果会动态影响动作B的路径”单纯增大数据量很难解决需要额外的记忆机制和推理能力。4.3 与LLM时代Scaling Law的一个重要区别算力不再是唯一杠杆大语言模型时代Scaling Law的叙事核心是“算力越多模型越强”。但在机器人领域算力只是其中一个维度真正卡脖子的是数据从哪里来、数据质量如何保证、数据如何覆盖物理世界的真实分布。GE-Act 2.0的验证恰好说明了这一点它能在有限的公开数据规模下把规律跑出来靠的更多是数据组织和训练策略的优化而不是简单粗暴地堆GPU。这个区别对中小团队其实是个好消息——意味着大家不需要和巨头比算力只要在数据工程和场景理解上做出差异化依然有机会拿到自己的Scaling曲线。5. GE-Act 2.0对从业者的实际影响开发范式、数据集建设与风险预判5.1 从“任务定制”转向“预训练加微调”过去很多机器人团队的开发流程是接到需求→选型硬件→采集该任务的数据→训练专用模型→交付。这个流程的痛点在于每换一个任务就从头来一遍前期数据采集和特征工程的工作完全无法复用。GE-Act 2.0带动的范式转变是先在一个大规模异构数据集上预训练出通用的VLA基座模型再针对具体场景用少量真机数据做微调。也就是说未来机器人开发者的核心竞争力不再是“给某个任务写代码”而是“怎么在基座模型的约束下设计微调数据、怎么评估模型边界、怎么做快速迭代”。这个转移意味着团队的人员结构也要跟着变——纯算法岗的比例会下降数据工程和评测工程的比例会上升。5.2 数据集建设质量、多样性、协议标准缺一不可如果你决定跟进这个方向数据集建设是最值得优先投入的地方。我的建议是抓住三个核心指标质量每条轨迹都要经过自动筛选和人工抽检剔除异常抖动的、动作中途失败的、相机标定明显偏移的样本。脏数据在机器人训练里的危害至少是文本领域的数倍。多样性刻意覆盖不同环境光照、背景、桌面高度、不同物体材质、形状、重量、不同本体不同品牌型号的机械臂和夹爪。多样性带来的泛化收益远比单纯增加同分布轨迹数量来得快。协议标准提前定义好数据格式、坐标系规范、指令接口否则后续做跨本体训练时光数据对齐就能消耗掉大量人力。5.3 风险预判Scaling曲线的“甜蜜区”可能会很快过去GE-Act 2.0证明了机器人Scaling Law在当前数据规模下是增长的但它没有证明这个增长会永远持续下去。从语言模型的经验看数据规模的上限迟早会出现——当你把世界上所有公开的机器人轨迹都扫完了后续增长依然要靠高质量数据生成仿真合成的物理真实感、真机数据的高效自动化采集来续航。另外一个潜在风险是评测基准的不统一。语言模型有MMLU、GSM8K这些通用基准机器人领域目前还非常碎片化——每个团队有自己的任务集、自己的评测环境、自己的成功率定义导致“Scaling Law成立”这个结论在不同的评价体系下可能差异巨大。所以当你看到其他团队宣称“我们也验证了Scaling Law”的时候务必多看一步它的评测任务是什么数据是怎么划分的成功判定的标准是什么这些变量任何一个不同结论的可比性都会大打折扣。最后聊一点个人体会。我在实际看GE-Act 2.0这套验证的时候最受触动的不是“模型有多强”“榜单有多高”而是它第一次把机器人能力增长这件事从一个“靠玄学调参”的领域往“有规律可循”的方向推了一大步。哪怕它的Scaling曲线只能代表特定数据范围、特定任务类型、特定本体形态下的规律也已经比“每个任务都从零开始”要先进整整一个时代。我自己的做法是在跟进GE-Act 2.0结论的同时先把团队内部的数据采集规范和评测基线定下来等基座模型和开源权重逐步成熟就能第一时间接入而不是临时抱佛脚去补数据。这个思路也建议同行们参考——方向已经清晰比拼的是谁先把基础设施铺到位。

相关新闻

蓝牙音箱防护方案:电源、固件、IPX7防水、热设计与射频机械

蓝牙音箱防护方案:电源、固件、IPX7防水、热设计与射频机械

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/19 7:51:31 阅读更多 →
微电网故障穿越仿真与Simulink建模实践

微电网故障穿越仿真与Simulink建模实践

1. 微电网仿真与故障穿越能力分析概述微电网作为分布式能源系统的核心载体,其稳定运行能力直接关系到供电可靠性。故障穿越(Fault Ride Through, FRT)能力是指微电网在电网故障期间维持并网运行的关键特性,这直接决定了系统能否在…

2026/9/19 7:51:31 阅读更多 →
SpringBoot实训管理系统设计与实现:高校毕业设计实战指南

SpringBoot实训管理系统设计与实现:高校毕业设计实战指南

1. 项目背景与选题价值SpringBoot实训管理系统作为高校计算机专业毕业设计的典型选题,完美融合了教学管理实际需求与技术实践价值。我在指导过37个同类项目后发现,这类系统之所以成为"毕业设计爆款",关键在于它同时满足了三个核心诉…

2026/9/19 7:51:31 阅读更多 →

最新新闻

深入解析 Ray 文档的 Sphinx autosummary 自定义模板:class_without_autosummary.rst 的原理与实践

深入解析 Ray 文档的 Sphinx autosummary 自定义模板:class_without_autosummary.rst 的原理与实践

深入解析 Ray 文档的 Sphinx autosummary 自定义模板:class_without_autosummary.rst 的原理与实践 【免费下载链接】ray Ray is an AI compute engine. Ray consists of a core distributed runtime and a set of AI Libraries for accelerating ML workloads. 项…

2026/9/19 8:32:48 阅读更多 →
网盘直链下载指南:3 步装好能取 8 大网盘真实链接的脚本

网盘直链下载指南:3 步装好能取 8 大网盘真实链接的脚本

网盘直链下载指南:3 步装好能取 8 大网盘真实链接的脚本 【免费下载链接】Online-disk-direct-link-download-assistant 一个基于 JavaScript 的网盘文件下载地址获取工具。基于【网盘直链下载助手】修改 ,支持 百度网盘 / 阿里云盘 / 中国移动云盘 / 天…

2026/9/19 8:32:48 阅读更多 →
React项目中为何不能用CDN引入Tailwind?正确接入方式全解析

React项目中为何不能用CDN引入Tailwind?正确接入方式全解析

“React 项目里,直接在 index.html 里加一行 Tailwind CSS 的 CDN 链接,为什么有的页面样式正常,有的样式时灵时不灵?”这是技术群里出现频率极高的问题。我最初接触 Tailwind 时也这么干过,当时觉得既然官方文档都提供…

2026/9/19 8:32:48 阅读更多 →
Flutter与OpenHarmony校园兼职平台开发实践

Flutter与OpenHarmony校园兼职平台开发实践

1. 项目背景与核心价值校园兼职市场一直存在信息不对称的痛点。学生们经常面临兼职信息分散、匹配效率低下、岗位真实性难以验证等问题。而企业端也苦于无法精准触达目标学生群体。这个基于Flutter和OpenHarmony的勤工俭学平台,正是为了解决这些实际问题而生。我在开…

2026/9/19 8:32:48 阅读更多 →
SpringBoot+Vue实现企业HR系统核心模块设计

SpringBoot+Vue实现企业HR系统核心模块设计

1. 项目概述:现代企业HR系统的技术实现方案这个基于SpringBootVue的人力资源管理系统是我去年为一家中型制造企业实施的数字化改造项目核心部分。传统Excel和纸质档案管理方式已经无法满足200人以上规模企业的考勤、绩效和薪资核算需求,我们通过这套系统…

2026/9/19 8:32:48 阅读更多 →
Matter 布尔状态配置集群(Boolean State Configuration Server)在 connectedhomeip 中的实现与接入指南

Matter 布尔状态配置集群(Boolean State Configuration Server)在 connectedhomeip 中的实现与接入指南

Matter 布尔状态配置集群(Boolean State Configuration Server)在 connectedhomeip 中的实现与接入指南 【免费下载链接】connectedhomeip Matter (formerly Project CHIP) creates more connections between more objects, simplifying development for…

2026/9/19 8:31:48 阅读更多 →

日新闻

BP神经网络时序预测:滑窗长度与多窗口平均策略

BP神经网络时序预测:滑窗长度与多窗口平均策略

简介:面向机器学习、深度学习与数据建模学习者的一份完整研究文献,聚焦BP神经网络在农业产量预测中的应用。文档以1980—2018年全国棉花产量为样本,系统讲解数据归一化处理、激活函数原理、多层神经网络结构搭建及训练流程,展示敏…

2026/9/19 0:00:30 阅读更多 →
Transformer训练实时监控实战:基于MindSpore的损失曲线可视化方案

Transformer训练实时监控实战:基于MindSpore的损失曲线可视化方案

上个月调一个Deformable DETR模型,在单卡上要跑将近两天。第二天早上我下意识打开终端翻日志,发现loss从凌晨两点就开始往上爬,一路从0.8涨到1.35,整整六个小时没人发现。那六个小时的训练不仅白跑,还霸占着卡——等于…

2026/9/19 0:00:30 阅读更多 →
OpenCloud 中的 Go 类型安全转换库 spf13/cast:从零值回退到泛型 API 的完整实战指南

OpenCloud 中的 Go 类型安全转换库 spf13/cast:从零值回退到泛型 API 的完整实战指南

OpenCloud 中的 Go 类型安全转换库 spf13/cast:从零值回退到泛型 API 的完整实战指南 【免费下载链接】opencloud 🌤️ OpenCloud is the open source platform for file management, sharing and collaboration. Simple and sovereign. 项目地址: htt…

2026/9/19 0:00:30 阅读更多 →

周新闻

AI SDK Harness 依赖更新指南:掌握 harness 包 SDK 依赖的升级、桥接同步与一致性校验

AI SDK Harness 依赖更新指南:掌握 harness 包 SDK 依赖的升级、桥接同步与一致性校验

AI SDK Harness 依赖更新指南:掌握 harness 包 SDK 依赖的升级、桥接同步与一致性校验 【免费下载链接】ai The AI Toolkit for TypeScript. From the creators of Next.js, the AI SDK is a free open-source library for building AI-powered applications and ag…

2026/9/19 3:59:36 阅读更多 →
Refine v5 Ant Design NumberField 组件实战:基于 Intl 的本地化数字格式化

Refine v5 Ant Design NumberField 组件实战:基于 Intl 的本地化数字格式化

Refine v5 Ant Design NumberField 组件实战:基于 Intl 的本地化数字格式化 【免费下载链接】refine A React Framework for building internal tools, admin panels, dashboards & B2B apps with unmatched flexibility. 项目地址: https://gitcode.com/GitH…

2026/9/19 3:53:08 阅读更多 →
Flutter应用改名全指南:从Android到iOS的配置与工具实践

Flutter应用改名全指南:从Android到iOS的配置与工具实践

刚接一个外包项目时,甲方要求把工程里临时用的应用名改成正式产品名。我本来觉得“改名”这种小事,打开配置文件改一行不就完了?结果真动手才发现,Flutter项目里“应用名称”根本不是一处配置,而是一整套散落在 Androi…

2026/9/19 4:02:43 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/16 22:31:27 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/15 21:39:18 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/16 22:32:59 阅读更多 →