从年前到年后的这一个月具身智能圈子里密集的发布撞车让很多人有点喘不过气。8天之内5个模型接连亮相而且不是那种只有Demo视频的“半成品”是带着完整技术报告、真机测试数据和开源计划的那种。更关键的是这5个模型背后代表的路径差异非常明显有端到端的、有分层模块化的、有主打仿真迁移的、有专注灵巧操作的。我测下来最大的感受是过去两年大家都在吵的技术路线问题答案似乎开始自己浮出来了而且比所有人预想的都要收敛。这篇文章就写写我对这轮密集发布的观察和实测体会。不吹不黑主要是把5个模型的定位差异、技术路线背后的取舍逻辑、以及落到真机部署时的关键细节拆开讲清楚。适合正在做具身智能算法、机器人系统集成或者准备入行这个方向的开发者参考也适合想搞清楚当前行业到底走到哪一步的投资人和产品经理阅读。1. 这轮密集发布释放的信号路线之争正在快速收敛1.1 5个模型的发布节奏与定位速览先说节奏。这8天里几乎是每隔一两天就有一个重磅出来圈子里的讨论方向变化得非常快。发布节点团队代号模型定位核心卖点技术特征第1天M厂商通用操作VLA单模型完成多种长程任务端到端视觉-语言-动作动作token化第2天U团队分层决策系统大模型规划与小模型控制解耦语义规划器底层MPC控制经典分层第4天X实验室灵巧操作专用模型高精度力控与手指级操作高频力反馈强化学习微调第6天O社区仿真迁移开源方案低成本数据工厂与sim2real落地大规模域随机化仿真蒸馏第8天P厂商端侧轻量级操作模型机载芯片实时推理4-6B小参数VLA结构化剪枝这个时间点集中发布肯定不是巧合。各家都憋着牌趁窗口期集中打出来本质上是为了争夺行业话语权。但从我实际测试的角度看真正有信息量的不是“谁发布的”而是这5个模型在技术路径上表现出的共性——它们在架构上长得越来越像了。1.2 为什么说路线之争正在悄悄结束过去两年具身智能的路线分歧主要集中在两个问题上一是端到端学习该不该主导整个控制链路二是数据到底从哪里来。端到端派的基本信念是感知、推理、规划、控制全部学到一个大模型里不做显式模块拆分像人类一样“看到什么就直接做什么”。分层派的思路更接近传统机器人学主张大模型只负责任务规划底层运动控制交给MPC、阻抗控制这类可解析、可保证安全的方法去做。这5个模型给我的最大冲击是标签越来越模糊了。做端到端的在模型里加了显式安全约束层做分层的在底层也塞了大量学习模块。数据策略上更是高度趋同几乎每家都在做“互联网图文预训练高质量遥操作真机数据仿真数据补充”的组合。这说明整个行业正在从“立场之争”转向“工程收敛”——大家发现真正的瓶颈不是哲学问题而是数据效率、部署成本和泛化能力。谁能用更少的数据把任务做稳谁的路就是当前阶段的最优解。2. 技术路线的分水岭端到端VLA为什么能站上主位2.1 VLA架构的核心组成与推理流程这轮发布的5个模型中有3个明确采用了VLAVision-Language-Action架构。我拆开来看它的核心组成其实并不复杂。一个典型的VLA模型包括三部分视觉编码器、语言模型骨干、动作解码头。视觉编码器把相机画面转成特征序列语言模型负责理解指令并桥接视觉特征与语义动作解码头最终输出机器人的动作向量。# VLA模型推理流程伪代码示意 from vla_pipeline import load_vla, collect_obs, safety_filter vla load_vla(vla-base, checkpointep-20) # 1. 采样当前观测RGB图 深度图 本体状态 obs collect_obs(rgb_camera0, depth_camera1, proprio_stateTrue) # 2. 构建语言指令 instruction 把红色方块放到蓝色托盘里 # 3. 生成动作序列输出为固定长度动作token # 维度3位移 3旋转 1夹爪开合 1置信度 actions vla.predict(obs, instruction, num_steps32) # 4. 安全性限幅 平滑滤波后下发 safe_actions safety_filter(actions, max_vel0.5, max_force20) robot.execute(safe_actions)我看几个模型的实现细节真正的分水岭不在整体架构而在两个容易被忽视的地方。第一个是动作表征。有的模型把动作离散成token让语言模型用自回归方式逐个生成动作token有的则直接从语言模型的隐含状态回归连续动作向量。前者跟预训练范式更兼容但存在误差累积后者控制更精细但训练不稳定。我实测下来目前行业主流正在倒向“离散化小步长”的组合——每步动作间隔从原先的50ms缩小到20ms通过频率换精度。第二个是动作空间的选择。关节空间直接控制每个电机动作维度高但灵活末端执行器空间只控制机械臂末端位姿动作维度低、更容易学但需要逆运动学求解。这5个模型里绝大多数选择了末端执行器空间加关节插值的混合方案这正是收敛的一个重要标志。2.2 分层方案在哪里落了下风那分层方案是不是就没有空间了也不是。U团队那个系统在特定场景下表现相当稳特别是面对结构化任务时。它的大模型只负责从自然语言指令中提取任务序列比如“先抓A再放到B最后按按钮”然后底层MPC负责每个子步骤的精确控制。这个路线的优势是规划层可以完全用现成的大语言模型不需要收集大量机器人轨迹数据底层控制有数学保证不会出现端到端模型那种“偶尔抽风”的问题故障可定位哪个环节出了问题一目了然。但它也有绕不过去的短板。分层系统的语义理解与实际物理执行之间存在缝隙——规划层可能给出一个语义正确但在当前环境不可行的子目标而底层控制器无法自主修正。遇到物体位置偏移、抓取姿态不对、夹具打滑这些真实世界的边缘情况时它要么死板重试要么直接报错中断。我在同样一组任务里对比测试了M厂商的端到端VLA和U团队的分层系统。在标准桌面场景、物体位置固定不变的情况下两边成功率都接近90%。一旦我引入随机扰动——比如推一下物体、改变光照、换一个相同形状但不同颜色的杯子——端到端VLA依然能保持70%左右分层系统直接掉到40%以下。这就是为什么我说“路线之争正在悄悄结束”。不是分层方案没人用而是它的适用场景正在被压缩到那些强结构化、低变动的工业场景里。通用机器人底座目前看还是要走端到端这条路。3. 数据策略才是真正的胜负手从数据配方到训练方法3.1 数据从哪里来三类主要来源的配比逻辑5个模型放出来之后我花了不少时间研究它们公开的技术报告发现一个惊人的共性数据配比极其相似。大致都在遵循“遥操作真机数据为主、仿真数据做多样性补充、互联网数据做预训练对齐”的组合方式。数据来源占比建议主要用途采集/获取成本遥操作真机数据30%-50%主任务分布直接决定成功率上限高需要人机器人相机标定仿真合成数据20%-30%场景多样性、光照/角度变化、抗干扰泛化中搭建环境一次性成本高人类操作视频10%-20%预训练阶段的语义对齐、手眼协调先验低互联网海量可爬取互联网图文语料10%-20%视觉-语言理解基础能力极低已有公开权重为什么遥操作数据必须占大头因为它是唯一一种“动作-效果”严格对齐的数据。人类视频虽然量大但动作是隐含的没有机器人关节反馈模型很难直接从中学到控制力仿真数据虽然可以无限生成但物理引擎与真实世界之间的差距永远存在哪怕加了域随机化也只是缓解而已。X实验室那个灵巧操作模型最有意思——他们在遥操作数据里加了力反馈通道。普通VLA只接收视觉和本体状态他们额外把末端六维力/力矩信息也喂给模型。这让模型在插拔、旋拧这类需要手感判断的任务里表现出了明显优势。这说明数据不是越多越好通道丰富度往往比规模更能带来质变。3.2 一个可直接参考的数据采集方案数据这块如果展开讲能写好几篇我直接说一个可以落地参考的方案这是我照着几个模型技术报告里的描述整合出来的。首先采集场景需要一台六轴或七轴机械臂、一到两个RGB-D相机、一个夹爪以及一套遥操作设备。相机不要只放正面侧上方45度角加一个俯视相机是性价比最高的组合可以覆盖大多数桌面操作场景。# 数据采集记录格式JSON Lines每行一条观测记录 # 用于遥操作数据归集视觉观测对齐 / 本体状态 / 动作指令 {timestamp: 1324, rgb: cam0_00001324.png, depth: depth_00001324.npy, proprio: [0.2, -1.4, 0.6, 0.3, 0.0, -0.1, 0.04], action: [0.21, -1.38, 0.62, 0.31, 0.02, -0.09, 0.04, 0.8], instruction: 把红色方块放到蓝色托盘里, metadata: {task_id: 7}}采集过程中要刻意制造变化。同一任务至少采集50条不同扰动下的轨迹物体位置在桌面上随机扰动5至10厘米光照条件每隔一段时间调整一次有时候故意在镜头前晃过一个人影。这些看似浪费时间的做法恰恰是模型真实泛化能力的主要来源。数据规模方面一个单任务要稳定的成功率纯遥操作数据至少需要2000到5000条轨迹。5个模型里任务覆盖最多的那个公开的数据规模接近10万条轨迹耗时超过八个月的持续采集。所以如果你现在打算入局具身智能先想清楚数据从哪来再谈算法创新否则后面全是死局。4. 实操视角从选型到真机部署的关键环节4.1 模型选型的4个关键参数很多人问我现在想跑一台具身智能机器人该选哪个模型、哪套方案。我的建议是先看4个参数不要被Demo演示带节奏。第一个参数是推理频率。真机部署中控制频率低于10Hz基本没有实用价值因为物体稍微动一点模型输出的就是过期动作。M厂商的通用模型在A100上能跑到30HzP厂商的端侧小模型在机载Jetson级别芯片上也能稳定15Hz。而某些开源大模型虽然效果好但推理延迟超过200毫秒这就意味着实际部署时还需要额外的插值和平滑层。第二个参数是动作空间类型。如果模型输出的是关节角序列那部署时不需要逆运动学计算直接下发电机即可简单高效但泛化性差。如果输出的是末端位姿好处是泛化性好、容易迁移到不同构型机器人上但必须配备可靠的IK求解器。项目关节空间动作末端执行器空间动作控制延迟低中需IK求解跨机器人迁移差好样本效率低高维动作难学高低维动作易学当前行业采用率少数主流第三个参数是模型参数量。当前这个阶段7B到13B左右的VLA模型是性价比最高的区间既保留了足够的世界知识和指令理解能力又不至于大到无法部署。4-6B的小模型在简单操作任务上够用但遇到复杂语言指令时明显吃力。第四个参数是数据采集的适配性。很多模型用的是统一格式的训练数据但细节差异很大——比如动作频率是10Hz还是50Hz、是否包含力反馈、是否包含深度图输入。这些直接决定了你要不要重新采集数据才能用这个模型适配成本往往被严重低估。4.2 整体部署流程与实测记录基于这轮5个模型里的一个开源VLA底座我完整跑过一遍从环境搭建到真机部署的流程把关键环节记录下来供参考。硬件环境是七轴机械臂加双目相机一台带推理显卡的工作站和机器人之间走EtherCAT实时总线。软件环境主要准备好Python推理服务、机器人驱动节点、相机驱动和一套标定工具。部署第一步是手眼标定。这一步是后面所有环节的基础环顾误差超过1厘米后面的动作控制精度基本无从谈起。我用的是经典的Eye-to-Hand标定方式通过不同角度拍摄标定板来计算相机到机器人基座的变换矩阵。# 手眼标定结果示例 # 相机到基座的变换矩阵4x4 齐次矩阵缩写表示 calib_result { translation_mm: [320.2, 180.5, 810.4], rotation_rpy_deg: [-35.2, 8.6, 87.4], reprojection_error_px: 0.38 }第二步是把模型封装成推理服务。为了稳定控制机器人的频率我建议把模型推理放到单独的服务进程里通过共享内存或低延迟消息队列与机器人控制进程通信。模型推理加前后处理总体延迟要控制在50毫秒以内否则动作会明显发飘。第三步是安全限幅。不管模型多聪明都要在动作下发前加一层接口保护限制末端最大速度不超过0.5米/秒最大力矩不超过规定阈值同时设定工作空间边界一旦预测动作越界立即进入保持状态并报警。实测下来最影响部署感受的是模型输出的稳定性。即使任务成功率很高偶尔出现的异常预测帧也会让机器人猛抖一下。解决办法是加一个轻量的低通滤波器配合“预测置信度低于阈值则沿用上一帧动作”的策略。这个方法看起来笨但能直接把异常率降低一个数量级。你可以在模型置信度输出和动作平滑层之间加简单的移动平均滤波再设定一个动作跳变检测单步位移超过阈值就丢弃该帧动作。4.3 部署中容易被低估的工程细节真机部署和仿真环境完全是两回事细节决定成败。我从这轮实测里整理了三个容易被低估的工程细节。第一个是相机曝光与白平衡。实验环境里光照不理想时自动曝光会导致画面亮度剧烈波动直接干扰视觉编码器。解决办法是把相机设为固定曝光并且在数据采集阶段就将同样的曝光参数用于真机部署绑定相机ID减少视频流切换带来的差异。第二个是夹爪的标定与磨损。夹爪开合的毫米级误差在抓取环节会被放大——你以为夹到了实际上还差2毫米没碰到物体。做抓取类任务时一定要先做夹爪行程的实测标定并且定期校准因为机械结构磨损会让夹持力产生不可忽略的下降。第三个是环境变化对模型的影响。同一个模型在一个新的实验室、新的光照、新的机器人上成功率掉20个百分点是常态。不是模型没训练好而是分布偏移的问题。应对方式很简单在新环境里补采50条左右的适配数据做微调收入即时见效——这一条建议几乎适用于所有VLA模型。5. 遇到的问题与排查思路实录5.1 常见问题速查表这轮实测下来我陆陆续续遇到不少问题也踩了不少坑。我把典型的整理成速查表方便你直接对照排查。症状表现可能原因排查与解决方向仿真里效果好真机完全失控sim2real gap过大增加域随机化强度、做系统辨识校准语言指令换一种说法就失败指令跟随泛化不足增加指令多样性、加入语义增强数据动作执行过程中高频抖动推理频率低于控制频率提升推理速度、加动作平滑滤波特定角度/位置下抓取失败视觉盲区或标定误差优化相机位姿、重新做手眼标定模型在持续运行后越跑越偏累计误差漂移加闭环状态反馈、定期重置参考点小模型语言理解能力弱参数量不足以表达复杂语义换成大模型或精简指令模板5.2 我踩过的几个典型坑先说语言指令泛化这个坑。我最初测试时只用一种标准句式比如“把A放到B里面”模型表现很好。后来随口改成“帮我把A挪进B”或者“A要放进B里”成功率直接掉了一半。排查后发现是指令数据多样性不够。解决方案是把指令模板从几十个扩展到几百个同时加入同义改写、语序变换和口语化表达这是最直接有效的补强方式。再一个是真机部署时的相机配置问题。有一次我怎么调都发现抓取位置偏了大概2厘米排查了很久才发现是相机曝光参数在推理时被自动调整了环境亮度一变画面亮度就变视觉特征也跟着漂。后来把所有相机参数锁定为固定值才恢复正常。这个问题很隐蔽因为模型层没有任何报错特征也能提出来但输出的动作坐标就是偏的。还有一个是推理服务与控制进程的通信延迟问题。最初我直接用消息队列传输大图像数据一轮推理的总延迟达到了300毫秒远超控制周期。后来把图像压缩成JPEG格式传输同时把推理服务和控制进程放到同一台机器上延迟才压到了50毫秒以内。真机部署对端到端延迟非常敏感这也就是为什么P厂商直接做了端侧部署的轻量模型——它把视觉编码和推理放到机载芯片上省掉了图像传输环节。5.3 我的独家排查顺序如果你遇到一个“模型表现差”的问题不要一上来就怀疑算法我总结了一套低成本排查顺序能帮你少走很多弯路。先查数据通路。确认相机画面是否清晰、动作指令是否成功下发这一步最简单但最常见的坑大概能解决两成问题。再查标定。手眼标定误差、夹爪零漂这些是机械层面的隐蔽问题也能解释掉两成症状。接着查环境差异。训练环境的光照、背景、物体纹理和真机部署是否一致如果差异过大大概率要补适配数据。最后才查模型本身。大多数“模型不行”的结论最后追下来发现是前三个环节出了问题。这条排查顺序看着朴素但我花过不少时间走弯路才总结出来。分享给大家是真的能省时间。6. 路线之争结束之后剩下来的挑战6.1 从模型到产品的距离技术路线收敛不代表事情变简单了相反它把真正的困难暴露得更清晰。模型底座大家都能做出来但数据积累、场景适配和工程可靠性才是决定谁能落地的关键。我看了一圈这轮的5个模型单论Demo演示大家差距其实不大都是“一堆任务中成功演示几个”。但一旦看数据规模、数据质量、真机测试的覆盖范围差距就出来了。M厂商和P厂商之所以底气足是因为它们背后有大规模的采集团队和成体系的测试流程。这些基础设施的成本远大于训练一个大模型本身。一句话总结我的感受具身智能现在不缺模型缺的是数据工厂和可靠的部署体系。模型架构的窗口期正在关闭数据与工程的窗口期才刚刚展开。6.2 下一步值得重点跟的方向我个人判断接下来半年会有三个方向成为新的竞争焦点一是数据自动采集与增强通过自动化的遥操作和仿真迁移把数据成本打下来二是端侧推理优化让模型在机载低功耗芯片上稳定跑到30Hz以上这直接决定机器人能不能脱离工作站独立工作三是长程任务的记忆与纠错目前VLA模型还很难处理超过2分钟的长程任务一旦过程出错自我恢复能力非常弱。这几乎可以确认下一代具身智能产品的核心差异不在模型创新而在数据工程和系统工程的深度。这个领域里算法只是入场券乱局才刚刚开始。