π0VLA论文阅读
模型架构1、Π模型采用了预训练的VLM骨干模型结合了包含多任务的跨体数据集。2、添加了独立的动作专家通过流匹配生成连续动作从而实现精准连续的操作技能。流匹配是连续生成模型属于扩散模型的变体π₀用它来生成机器人连续动作序列。3、为了实现对各类多样化机器人数据源的利用采用了跨 embodiment 训练即将多种机器人类型的数据整合到同一模型中。4、精心设计的训练方案即先让模型在规模庞大、内容多样的语料库上进行预训练再在更细分、经过精心筛选的数据上进行微调以诱导出期望的行为模式。训练方式1、首先进行预训练使用了大规模的混合数据集不同机器人、不同任务其目的是训练一个具备广泛能力和泛化性的基础模型。2、针对复杂灵巧任务采用了两种后训练方式一是利用小到中等规模数据的高效后训练二是针对叠衣服、移动操作等复杂任务采用大规模数据集的高质量后训练。3、对数据内容进行的处理将机器人的关节角度状态q与预测动作设置为训练过程中维度最大的机器人一致实验中是18维机器人关节角度和预测动作的维度是相同的理论上机器人有多少关节就应预测多少个关节的动作。对于配置和空间维度低于18维度的机器人对训练数据进行0填充同样对于图像数量少于三个的机器人对缺失的图像进行掩码mask处理。掩码mask与空白图像的区别如果使用空白图像模型会将空白图像作为信息纳入注意力计算使用mask则直接屏蔽掉这个图像token不影响模型的注意力以及计算损失。为什么不对动作也进行mask?而是进行补零ai的回答是动作属于整个token不同的维度数据属于token内部的形态如果对token内部mask模型会学习到错误的输入输出维度导致损失计算时发生错误但是为了避免模型学习到维度数据为0的地方在计算loss的时候将这部分mask掉不参与计算。数据形式1、对输入模型的数据分布进行建模1机器人观测得到的多张RGB图像2文本语言3关节角度向量。其中图像与关节角度向量首先通过对应编码器进行编码再经过线性投影层映射到与语言标记相同的嵌入空间中。2、动作专家训练通过流匹配进行训练训练中得到50个未来动作块代表50HZ一秒的连续轨迹。

相关新闻

Wand-Enhancer 完全指南:免费解锁 Wand (WeMod) 高级功能与手机远程控制

Wand-Enhancer 完全指南:免费解锁 Wand (WeMod) 高级功能与手机远程控制

Wand-Enhancer 完全指南:免费解锁 Wand (WeMod) 高级功能与手机远程控制 【免费下载链接】Wand-Enhancer Advanced UX and interoperability extension for Wand (WeMod) app 项目地址: https://gitcode.com/GitHub_Trending/we/Wand-Enhancer Wand&#xff…

2026/9/24 20:54:02 阅读更多 →
EmDash Starter-Cloudflare 模板指南:基于 Astro 与 Cloudflare Workers 的最小化 CMS 起步方案

EmDash Starter-Cloudflare 模板指南:基于 Astro 与 Cloudflare Workers 的最小化 CMS 起步方案

CMS后端前端插件系统 【免费下载链接】emdash EmDash is a full-stack TypeScript CMS based on Astro; the spiritual successor to WordPress 项目地址: https://gitcode.com/gh_mirrors/emdas/emdash 点击查看 免费下载 导读 templates/starter-cloudflare 是 …

2026/9/24 20:53:01 阅读更多 →
计算机底层原理实战课:从鼠标点击看懂0和1的运行逻辑

计算机底层原理实战课:从鼠标点击看懂0和1的运行逻辑

1. 这不是“扫盲课”,而是你真正需要的计算机底层认知重建很多人点开“计算机基础入门”时,心里想的是:装个系统、修个蓝屏、配个WiFi,或者至少能看懂同事嘴里蹦出的“端口”“协议”“缓存”——结果翻开教材,第一章就…

2026/9/24 20:53:01 阅读更多 →

最新新闻

Uni LLM Bench:自托管LLM API基准测试平台实战指南

Uni LLM Bench:自托管LLM API基准测试平台实战指南

1. 为什么要自己做一套 LLM API 基准测试平台先说个真实场景。我们团队做多租户平台,上游接了好几家大模型 API,有官方的,也有走聚合网关的。上个月某个渠道换了底层模型,线上监控没做细,等业务方反馈"回答变慢了…

2026/9/24 21:33:32 阅读更多 →
文章AI检测踩坑:改3遍才避开的内容误判逻辑坑点

文章AI检测踩坑:改3遍才避开的内容误判逻辑坑点

上周赶公司内部技术专栏的季度稿,临提交前运营突然说所有稿件必须走统一的合规校验,但凡触发AI生成标记直接打回重写。我之前图省事儿用GPT整理了初稿框架,后面全是自己手敲补的实操细节,以为随便改改就能过,结果第一次…

2026/9/24 21:33:32 阅读更多 →
AI测试开发训练营:六大模块与十大实战项目全解析

AI测试开发训练营:六大模块与十大实战项目全解析

1. 为什么AI测试开发突然成了香饽饽这两年测试圈子里聊得最多的话题,十有八九绕不开AI。前几年大家还在争论自动化测试脚本到底用Python还是Java写更顺手,现在风向已经彻底变了——招聘网站上AI测试工程师的岗位薪资普遍比传统测试高出30%到50%&#xff…

2026/9/24 21:33:31 阅读更多 →
AI编程提效70% vs 40%:智能体编排与上下文缓存实战

AI编程提效70% vs 40%:智能体编排与上下文缓存实战

1. 产能红利的分水岭:为什么有人用AI编程提效70%,有人只拿到40%Uber内部推行AI编程工具后,部分团队的代码交付效率提升了70%,而Meta的试点数据却显示,相当比例的工程师只获得了40%左右的提效。这两个数字放在一起看&am…

2026/9/24 21:33:31 阅读更多 →
AI编程效率差距:上下文缓存、模型路由与智能体工作流实战

AI编程效率差距:上下文缓存、模型路由与智能体工作流实战

1. 两个数字背后的真实差距Uber 内部做过一次很出名的统计:把 AI 编程助手全面铺开之后,大约 70% 的工程师每周都在用,但真正把效率拉开差距的,只有其中一部分人。Meta 那边流出的数字更保守一些,活跃使用率在 40% 上下…

2026/9/24 21:33:31 阅读更多 →
腾讯数字人+大模型知识引擎:RAG驱动的智能交互落地全解析

腾讯数字人+大模型知识引擎:RAG驱动的智能交互落地全解析

最近一直在调研数字人和大模型结合落地的方案,腾讯数字人与大模型知识引擎这两个产品放在一起琢磨,信息量其实非常大。数字人负责“像人”,知识引擎负责“懂人”,两个能力叠在一起,才真正解决了一直以来虚拟客服、虚拟…

2026/9/24 21:32:30 阅读更多 →

日新闻

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为…

2026/9/24 0:00:19 阅读更多 →
单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

简介:一份基于单细胞RNA测序数据的细胞类型注释算法研究Python毕业设计源码,针对计算机相关专业正在做毕设或需要项目实战的学习者,可用于课程设计与期末大作业。项目代码完整、经导师指导评审通过,可直接运行,覆盖数据…

2026/9/24 0:00:19 阅读更多 →
C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

第一次在项目里被反射卡住,是在一个老旧的WinForms模块里:几十个类依赖PropertyChanged通知,运行时反射读属性、发通知,每次启动慢半拍不说,一上.NET Native/AOT裁剪模式几乎全面崩盘。后来我把这段逻辑全部改成C#源生…

2026/9/24 0:00:19 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/24 14:34:13 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/24 9:10:42 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/24 14:33:56 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/24 12:50:34 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/24 14:33:48 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/24 12:49:17 阅读更多 →