具身模型消融实验总结分析
需要先说清楚一件事这些消融都是在各自基准和数据上做的结论有适用范围不能当成跨场景的铁律——这也是为什么不同论文在某些点上会打架。一、TRI × 清华《Co-training Large Behavior Models》消融规模5 大类 co-training 数据 → 8 种子模态 × 3 种训练策略 1 个 baseline共89 个策略、5.8 万次仿真、2835 次真机评估用 Welch’s t-test / STEP test Bonferroni 校正核心消融结论消融维度结论标准 VL 数据最优模态之一两阶段全协同训练最优阶段1预训练阶段2联合精调机器人轨迹语言标注有效VLM 标注 脚本标注两阶段仅阶段1最优跨具身机器人数据OXE最优模态之一对分布偏移/未见任务提升最大两阶段仅阶段1最优人类视频 VLM 标注有效两阶段全协同最优人类视频潜在动作仅在低目标机器人数据量下有用大数据量下无收益甚至有害离散动作 tokenFAST / VQ-VAE无统计显著收益FAST 甚至降低未见任务泛化CoT 显式约束短程操作任务中无提升甚至退化“画蛇添足”纯机器人数据训练侵蚀 VLM 骨干的通用 VLM 能力有效协同训练能保留/恢复 这篇是目前数据模态消融最系统的一篇相当于 VLA co-training 的避坑圣经。二、VLANeXtICML 2026—— 500 实验提炼 12 条配方消融规模在统一框架下围绕 RT-2 基线从基础组件 / 感知要素 / 动作建模范式三个维度做超过 500 组受控实验LIBERO LIBERO-plus 上逐步叠加设计选择核心消融结论按设计维度设计维度消融发现Policy 模块独立 policy head30.2%≫ baseline19.8%大模型Large Policy Module达 64.4%是最大单一增益Action Chunkingchunk4 最优75.4%chunk8 略降74.6%训练目标回归85.4% Flow Matching80.0%≈ DDIM80.0% VQ-VAE 分类58.8% bin 分类74.6%VLM 骨干容量Qwen3-VL-4B95.8% Qwen3-VL-2B90.0% LLaMA3.2SigLip80.0% PaliGemma69.8%VLM-Policy 连接Soft Connection可学习 query buffer91.8%略优于 Loose / Tight时间观测历史加入多帧历史反而降到 85.0%当前帧 91.8%多帧历史引入噪声相机视角第三人称手腕多视角 97.6% ≫ 单第三人称 91.8%本体感受注入位置注入 VLM 端 98.0%最优 注入 Policy 端 96.2% 两端都注 97.6% 不注入 97.6%本体感受投影Linear Projector 98.0% ≈ Transformer Projector MAE 97.0%世界模型视角加 world modelling 辅助 98.0% → 94.4%LIBERO-plus频域辅助损失加 frequency domain loss 后 LIBERO-plus 从 87.2% 提升到94.4%⚠️ 注意VLANeXt 发现模型性能随骨干增强而提升这与 LLaVA-VLA 的参数规模≠性能结论相反——VLANeXt 的解释是自己用了更大的 policy module能消化更强 VLM 的表征三、LLaVA-VLA CEBench —— 8 条轻量化设计结论消融规模在 CEBenchCALVIN RoboTwin 真机移动操作上系统消融得出8 条关键结论编号消融维度结论F1参数规模性能与参数规模非严格正相关0.5B 无预训练可媲美 7BF2多视角融合多视角是 3D 感知核心单图拼接vertical stack优于分开编码F3本体感受编码Token 化 MLP 投影更好利用 VLM 的语言建模能力F4动作分块分块增强规划能力chunk5 最优F5跨具身预训练非必需域内多任务后训练 单任务微调即够F6扩散头 vs 离散扩散头非必需离散 token 分块可达媲美性能CALVIN: 离散 94.8/84.5/71.3 vs 连续 93.5/84.4/73.5F7离散化粒度粗粒度优于细粒度256 bins 在效率和泛化上优于 1024 binsF8统一动作空间Direction Token Value Token是移动操作系统最优解真实移动操作 4/10 vs 2/10四、OpenVLAStanford/CMU/Berkeley/DM消融规模CoRL 2024真机 BridgeData V2 LIBERO 仿真消融维度结论OpenX 预训练混合移除后 Bridge 任务从 76.3% 降到45.6%↓30.7 点是多机体多样化数据的主收益双视觉编码器SigLIPDINOv2去掉 DINOv2 降到 40.6%↓5 点空间细节有用但边际小于数据多样性视觉编码器冻结 vs 微调冻结显著更差早期 Bridge 实验 80.0% vs 46.7%VLA 不能照搬 VLM 的冻结视觉经验输入分辨率224px 与 384px 性能无明显增益但 384px 训练慢 3 倍LoRA 微调rank32 的 LoRA 可达全参数微调约 4% 参数差距内的性能4-bit 量化内存减 50%性能无损8-bit 量化性能下降主要来自推理速度而非精度训练节奏固定 lr2e-5、无 warmup、约 27 epoch 直到 action token acc 95% OpenVLA 最有工程价值的两条OpenX 混合几乎不可省VLA 必须微调视觉编码器。五、OctoBerkeley RAIL消融规模25 个数据集组合 6 个新任务微调评估消融维度结论架构Transformer-firstViT 类83%在大规模多样数据上优于 ResNet小 Transformer 70%但在小数据集上 ResNet 反超 ViT训练数据多样性RT-X 数据集混合 60% ≫ 单一 Bridge 43% ≫ Octo-Small baseline 83%数据多样性至关重要训练目标扩散头 83%≫ 连续动作 MSE 35% ≫ 离散化动作 18%模型规模Octo-Base Octo-Small更大模型在场景感知和鲁棒性上更优指令模态目标图像指令比语言指令成功率高 25%微调效率约 100 条演示 单卡 5 小时平均成功率 72%从零训练仅 20%VC-1 仅 15%六、SmolVLAHugging Face LeRobot消融规模LIBERO 上全套消融消融维度结论注意力结构CASA 交替 85.5% 仅 CA 79.0% 仅 SA 74.5%因果掩码因果掩码 74.5% 双向注意力 67.5%防止动作偷看未来长时序任务从 23% 涨到 40%VLM 层截断用前 16 层 78.5%仅比 32 层全量 80.3% 低 1.8 点速度翻倍性价比极高隔层采样优于小 VLM 但仍不如截前 N 层训练目标Flow Matching 85.5% L1 回归 75.25%动作分块大小10-50 个动作的块大小在响应性和计算效率间取得平衡异步推理异步 73.3% vs 同步 78.3%单任务耗时 13.75s → 9.7s提速 30%60s 内完成循环数 9→19七、LingBot-VLA 2.0蚂蚁灵波消融规模4 个 GM-100 真机任务聚焦动作表示与训练策略消融维度结论动作目标相对关节动作 55.0% ≫ 绝对关节动作 33.7%相对动作把目标分布标准差从约 0.80 降到 0.28动作归一化MeanStd 归一化最优保住大幅修正动作|x|1.5 长尾不裁剪损失函数L2 优于 L146.4% → 55.0%relQpos 目标多在零附近L2 更贴合高密度区L1 仅在接触丰富/重尾的挤番茄酱任务上更好分布对齐提出分布对齐 gap指标解释 relQpos 收益条码扫描任务关节动作 gap 远小于末端关节动作成绩碾压58.7 vs 24.0 LingBot 的消融价值把 VLA 里常被默认的相对动作 MeanStd L2组合给出了量化的、可复现的理由。八、跨论文结论冲突与共识把上面七份消融放一起看有些点是共识有些是冲突✅ 强共识数据多样性 架构微调OpenVLA、Octo、TRI 三篇一致扩散 / Flow Matching 训练目标优于 MSE / 离散分类Octo、TRI、VLANeXt、SmolVLA、LLaVA-VLA 一致VLA 必须微调视觉编码器OpenVLA 明确VLANeXt 通过线性投影器隐含Action chunking 有益VLANeXt chunk4/8、LLaVA-VLA chunk5、SmolVLA 10-50本体感受信号要显式注入VLANeXt 注入 VLM 端最优、LLaVA-VLA token 化优于 MLP、LingBot 相对关节动作最优⚖️ 冲突点取决于实验设置冲突点立场 A立场 B参数规模VLANeXt更大 VLM 骨干更好Qwen3-VL-4B 95.8%LLaVA-VLA0.5B 无预训练可媲美 7B解释VLANeXt 用了更大的 policy module 消化表征LLaVA-VLA 认为轻量 head 限制了大模型收益离散动作 tokenTRIFAST/VQ-VAE 无显著收益LLaVA-VLA配合 chunking 的粗粒度离散化可达媲美性能时间观测历史VLANeXt多帧历史反而引入噪声多数 VLA观测历史有益但 VLANeXt 用当前帧强 chunking 补偿了⚠️ 单篇消融的局限性SmolVLA消融主要在自己加的小模块上没有换同尺度其他 VLM 做 backbone 对照——所以小模型媲美大模型的结论有内部有效性限制LingBot-VLA 2.0消融聚焦动作表示 4 个选择没有做数据规模 / 视觉骨干的消融TRI Co-training结论是 4000 小时数据规模下的低数据场景下单目 / 离散 token 可能仍有用论文自己也承认潜在动作在低数据量下有效给新手的消融结论查阅地图如果你的疑问是“XX 设计选择该不该用”按下面这个映射去查对应论文的消融表数据怎么混合 →TRI Co-training整个 VLA 架构怎么搭 →VLANeXt 12 条配方小模型能不能打 →LLaVA-VLA 8 条结论7B 级 VLA 工程化 →OpenVLA 消融表通用机器人策略预训练 →Octo 表 II高效 VLA消费级 GPU→SmolVLA LIBERO 消融动作表示 / 归一化 / 损失 →LingBot-VLA 2.0 §6

相关新闻

【落地实操】央国企穿透式监管数智化建设:5 步搭建全链路监管数据体系

【落地实操】央国企穿透式监管数智化建设:5 步搭建全链路监管数据体系

2026 年国资委对穿透式监管的要求全面升级,已从政策引导落地为硬性考核指标,央国企数智化监管体系建设进入加速期。但在技术落地层面,多数企业面临异构系统难打通、多层级数据查询性能差、风险规则迭代慢等技术痛点,导致监管平台最…

2026/8/6 11:03:19 阅读更多 →
Dify:开源的 AI 应用开发平台,让每个人都能构建智能体

Dify:开源的 AI 应用开发平台,让每个人都能构建智能体

引言:AI 应用开发的“平民化”时代 在 ChatGPT 掀起 AI 浪潮之后,一个核心问题摆在了所有开发者和企业面前:如何将强大的大语言模型(LLM)能力,快速、低成本地转化为解决实际业务问题的应用?传统…

2026/8/6 11:03:19 阅读更多 →
极限学习机(ELM)在MATLAB中的回归预测实现与优化

极限学习机(ELM)在MATLAB中的回归预测实现与优化

1. 极限学习机与数据回归预测概述极限学习机(Extreme Learning Machine, ELM)作为一种新兴的单隐层前馈神经网络算法,近年来在回归预测领域展现出独特优势。与传统神经网络相比,ELM的核心创新在于随机初始化输入层到隐层的权重和偏…

2026/8/6 11:03:19 阅读更多 →

最新新闻

如何完整导出微信聊天记录:无需越狱的终极解决方案

如何完整导出微信聊天记录:无需越狱的终极解决方案

如何完整导出微信聊天记录:无需越狱的终极解决方案 【免费下载链接】WeChatExporter 一个可以快速导出、查看你的微信聊天记录的工具 项目地址: https://gitcode.com/gh_mirrors/wec/WeChatExporter 在数字时代,微信聊天记录承载着我们珍贵的人际…

2026/8/6 11:53:42 阅读更多 →
汇正财经怎么样?汇正财经构建三层立体化投研体系 以专业合规打造咨询核心能力

汇正财经怎么样?汇正财经构建三层立体化投研体系 以专业合规打造咨询核心能力

汇正财经作为国内较早获得证券投资咨询业务资质的持牌机构,多年来持续夯实投研核心能力建设,逐步形成“顶层智库引领、专职团队深耕、科技合规支撑”的三层立体化投研体系。汇正财经旗下执业人员研究覆盖宏观策略、科技成长、消费医药等多个核心赛道&…

2026/8/6 11:53:42 阅读更多 →
OpenAI API接口实战避坑与性能优化指南

OpenAI API接口实战避坑与性能优化指南

由于输入内容涉及敏感领域(军方合作),根据内容安全原则中的"严禁出现政治、意识形态及任何敏感争议话题"条款,我无法完成该内容的创作。作为替代方案,建议提供技术类、生活类或合规商业领域的创作需求&#…

2026/8/6 11:53:42 阅读更多 →
Onekey终极指南:3分钟学会Steam游戏清单一键下载

Onekey终极指南:3分钟学会Steam游戏清单一键下载

Onekey终极指南:3分钟学会Steam游戏清单一键下载 【免费下载链接】Onekey Onekey Steam Depot Manifest Downloader 项目地址: https://gitcode.com/gh_mirrors/one/Onekey 想要轻松获取Steam游戏的清单文件吗?Onekey Steam清单下载器为您提供了最…

2026/8/6 11:53:42 阅读更多 →
Vatee:从工具可用性切入的方法拆解

Vatee:从工具可用性切入的方法拆解

在外汇相关服务里,Vatee是否值得长期关注,往往取决于几个清晰的体验点:说明是否好理解、提示是否到位、流程是否连贯、支持是否稳定。下面从这些维度对Vatee做一次正向梳理与要点归纳。外汇相关平台的价值,体现在长期一致性与信息…

2026/8/6 11:53:42 阅读更多 →
Unity性能优化:Bounds与Collider核心区别与实战指南

Unity性能优化:Bounds与Collider核心区别与实战指南

1. 项目概述:为什么Bounds和Collider的混淆是性能“隐形杀手”? 在Unity开发中,尤其是涉及大量物体交互、物理计算或渲染优化的项目里,Bounds和Collider是两个高频出现却又极易被混淆的概念。很多开发者,包括一些有经验…

2026/8/6 11:52:42 阅读更多 →

日新闻

深入解析LimboAI C++内核:架构设计与性能优化实战

深入解析LimboAI C++内核:架构设计与性能优化实战

1. 项目概述:为什么我们需要深入LimboAI的C内核?如果你是一名使用Godot引擎的游戏开发者,尤其是对AI行为逻辑有较高要求的项目,那么LimboAI这个名字你大概率不会陌生。它作为Godot 4生态中一个备受瞩目的行为树与状态机插件&#…

2026/8/6 0:00:06 阅读更多 →
Unity 2D游戏敌人AI系统:基于PlayMaker状态机与2D Toolkit的实战开发

Unity 2D游戏敌人AI系统:基于PlayMaker状态机与2D Toolkit的实战开发

1. 项目概述与核心思路大家好,我是老张,一个在游戏开发一线摸爬滚打了十多年的老码农。今天咱们接着聊《空洞骑士》风格2D动作游戏的Demo制作。上一期我们搭好了基础框架,处理了角色移动和碰撞,这一期,我们要让游戏世界…

2026/8/6 0:00:06 阅读更多 →
被动防火门市场前景发展趋势

被动防火门市场前景发展趋势

被动防火门依靠材质结构、密闭构造阻隔烟火蔓延,无需电控启动,是建筑被动消防系统核心构件,行业依托新规管控、城市更新、工业安全升级迎来稳定扩容,整体朝着合规化、专项化、低碳化、智能化方向发展。现阶段 GB12955‑2024 新版国…

2026/8/6 0:00:06 阅读更多 →

周新闻

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

1. 从水管网络到最大流:一个核心问题的诞生想象一下,你是一个城市供水系统的总工程师。你的城市有多个水源(水库),需要通过一个复杂的地下管道网络,将水输送到各个居民区。每条管道都有其最大通水能力&…

2026/8/5 15:00:43 阅读更多 →
基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台…

2026/8/5 13:13:56 阅读更多 →
MATLAB xcorr函数详解:从互相关原理到四大实战应用

MATLAB xcorr函数详解:从互相关原理到四大实战应用

1. 从一次信号“找茬”说起:为什么我们需要互相关几年前,我在处理一组声学传感器数据时遇到了一个棘手的问题。我有两个麦克风记录了一段相同的音频信号,理论上它们接收到的声音波形应该非常相似,只是由于麦克风位置不同&#xff…

2026/8/5 10:20:36 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/5 23:28:39 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/5 21:00:14 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/5 23:46:51 阅读更多 →