莫刻机器人LJM登榜WorldArena第二!阿里云PAI提供全流程训练支撑
当具身世界模型从「生成逼真视频」迈向「理解动作后果」强大的算力底座正是这场技术跃迁的隐形引擎近日具身世界模型权威评测 WorldArena 更新最新榜单由莫刻机器人Muka Robotics打造的具身世界模型 LJMLatent Joint-conditional Model以匿名代号 SisyphusWorld 提交EWMScore_P分数为73.06 位列公开榜单第二仅次于小米 UNIS73.64领先 BWM-Fast、SACWM、DexWorldEngine 等前列模型。这一成果的背后阿里云人工智能平台 PAI 提供高性能真武810E算力与全流程训练支撑助力莫刻机器人以仅 32 卡规模实现有竞争力的性能验证了云上高性能算力在世界模型训练场景的工程可靠性。榜单地址https://huggingface.co/spaces/WorldArena/WorldArenaLJM 登榜从「会生成视频」到「先理解动作再生成未来」当前主流动作条件世界模型常通过线性投影、FiLM/AdaLN、cross-attention 等接口把低维动作直接送入扩散骨干。这些方式可以提高可控性却仍把动作视为外部数值信号模型必须独自从视频损失中反推当前这串数字究竟意味着移动、接触、抓取还是放置。LJM 的核心突破在于不把机器人动作只当作一串附加到扩散模型中的低维数值而是先将语言、视觉历史与未来动作转换为可推理的交互 latent再用它约束后续视频生成。具体而言LJM 将视觉语言模型与视频扩散模型组织为两个协同工作的专家Latent Reasoning Expert推理专家使用 Qwen3-VL-2B 编码语言、历史视觉、当前锚点观察与未来动作输出一组连续 reasoning tokens。这里的「推理」并非生成自然语言思维链而是在连续潜空间中预测机器人将到达什么状态、场景会怎样变化、动作会引发怎样的运动。World Modeling Expert生成专家使用 Wan2.2-TI2V-5B Diffusion Transformer 作为视频世界模型在 VAE latent 空间中执行 flow matching将推理专家给出的交互约束还原为连续未来视频。两个专家通过 Mixture-of-TransformersMoT的 shared attention 逐层交换信息让「理解动作会造成什么」与「把未来渲染成视频」成为同一个联合建模过程。此外LJM 还引入 Value-Driven Temporal ConditioningVTC在固定预算内主动保留信息密度更高的历史状态有效解决了长时记忆漂移问题。WorldArena 公开榜单第二名截至 2026 年 7 月 16 日SisyphusWorldLJM以 73.06 EWMScore_P 位列第二仅与第一名 UNISXiaomi-Robotics-U073.64相差0.58 分。分项结果中LJM 在 3D Accuracy三维准确性取得 92.60 的高分在 Motion Quality运动质量取得 89.17在 Controllability可控性取得 85.93展现出强大的空间认知与动作控制能力。WorldArena 维度分数Visual Quality60.18Motion Quality89.17Content Consistency58.11Physics Adherence58.283D Accuracy92.60Controllability85.93LIBERO 基准四项指标全部最优除 WorldArena 外莫刻机器人进一步基于知名机器人操作基准 LIBERO 评估 LJM 在复杂具身交互场景中的世界建模能力。在 100 个未参与训练的测试 episode 上LJM 在 PSNR、SSIM、FVD 和 LPIPS 四项指标上均取得最优结果全面超越 IRASim、Ctrl-World、WoVR 等对比方法。相较各指标上的最强非 LJM 基线LJM 将 PSNR 从 27.25 提升至 28.60SSIM 从 0.8820 提升至 0.9238同时将 FVD 从 77.09 降至 46.49下降约 39.7%LPIPS 从 0.0639 降至 0.0247下降约 61.3%。这表明 LJM 的收益不仅体现在逐帧重建质量也体现在长时视频的感知与时序一致性。阿里云人工智能平台 PAI32 张真武810E背后的算力底座具身世界模型的训练复杂度远超传统视频生成任务。LJM 需要同时处理语言、视觉、动作三模态的联合建模在 DROID 与 RoboTwin 两个数据集上分阶段训练每个样本由 8 帧历史上下文、1 帧当前锚点和 56 帧未来共 65 帧组成。这对底层计算平台的算力规模、分布式训练稳定性和多专家联合优化能力都提出了很高要求。在 LJM 的研发过程中阿里云人工智能平台 PAI 为莫刻机器人团队提供了全方位的计算服务保障真武810E 算力支撑全流程训练。LJM 的 DROID 预训练与 RoboTwin 继续训练均在 32 张真武810E 上完成全局批大小为 32使用 AdamW 优化器、BF16 混合精度与 ZeRO-3 并行策略。以 32 卡规模取得 73.06 EWMScore_P说明 LJM 并非单纯依赖扩大训练集群换取分数而是通过 latent joint conditioning 与分阶段训练提高了单位计算预算的有效产出也验证了真武810E在大规模具身世界模型训练场景中的工程可靠性。高效的分布式训练与通信优化。PAI 平台原生支持大规模异构算力集群的高效调度与通信优化能够在多节点间实现稳定的梯度同步与数据并行。对于 LJM 这类涉及双专家联合建模、MoT shared attention 逐层交互、大规模视频数据吞吐的复杂架构PAI 提供了坚实的训练底座显著缩短了从实验构想到结果验证的迭代周期。灵活的资源弹性与实验管理。从大规模多模态数据的预处理到 DROID 与 RoboTwin 两阶段训练的无缝衔接再到训练过程中的监控与断点恢复PAI 提供了贯穿模型研发全流程的工具链支持。这让莫刻机器人团队能够将更多精力聚焦于算法创新本身如何让世界模型在生成未来之前先「理解」动作而非基础设施的搭建与运维。面向 Physical AI 场景的深度适配。阿里云 PAI 与 NVIDIA Physical AI 软件栈全面集成提供覆盖数据采集、数据预处理、数据扩增/虚拟数据合成、模型训练、模仿学习/强化学习、仿真测试、闭环验证等全链路平台能力。PAI 在异构计算资源管理、大规模数据流水线编排、多任务训练调度等方面的长期积累为莫刻机器人这类世界模型创新企业提供了有力的工程支撑。从实验室到产业国产世界模型的加速时刻莫刻机器人Muka Robotics致力于打造面向真实物理世界的下一代通用机器人智能体系以视觉基础泛化模型为核心推动机器人突破封闭演示场景、走向开放环境实现真正的具身智能落地。公司由香港科技大学博士池晓威创立。他长期深耕机器人世界模型与多模态生成智能聚焦真实物理场景下机器人的通用感知、智能决策与自主执行等核心能力相关成果发表于 CVPR、ICML、ICRA、AAAI 等国际顶级会议。LJM 的登榜是前沿算法创新与云上高性能平台深度协同的成果。在 WorldArena 榜单前列来自中国团队的身影越来越多。这一趋势表明在全球世界模型竞赛中中国力量正在核心技术层面加速突破从感知到认知不再满足于「看懂画面」而是追求对物理世界的深度理解从仿真到落地切实将模型能力转化为工业制造、仓储物流、智能服务等场景中的实际生产力。随着 2026 年成为世界模型发展元年阿里云将持续深化与世界模型创新力量的合作以 PAI 平台和真武810E算力为核心为世界模型的技术探索与产业落地提供坚实的算力与工程支撑共同推动世界模型从实验室走向真实世界——让模型知道在当前状态下执行这组动作会对未来产生什么样的影响。

相关新闻

英雄联盟Akari助手:你的终极LCU API游戏效率工具,快速提升操作水平

英雄联盟Akari助手:你的终极LCU API游戏效率工具,快速提升操作水平

英雄联盟Akari助手:你的终极LCU API游戏效率工具,快速提升操作水平 【免费下载链接】League-Toolkit An all-in-one toolkit for LeagueClient. Gathering power 🚀. 项目地址: https://gitcode.com/gh_mirrors/le/League-Toolkit 还在…

2026/7/29 18:30:54 阅读更多 →
WechatSogou:如何通过Python高效获取微信公众号数据?

WechatSogou:如何通过Python高效获取微信公众号数据?

WechatSogou:如何通过Python高效获取微信公众号数据? 【免费下载链接】WechatSogou 基于搜狗微信搜索的微信公众号爬虫接口 项目地址: https://gitcode.com/gh_mirrors/we/WechatSogou 在当今信息爆炸的时代,微信公众号已成为企业营销…

2026/7/29 18:30:54 阅读更多 →
Meteor Client完整指南:如何在Minecraft中快速安装和配置这款强大的实用模组

Meteor Client完整指南:如何在Minecraft中快速安装和配置这款强大的实用模组

Meteor Client完整指南:如何在Minecraft中快速安装和配置这款强大的实用模组 【免费下载链接】meteor-client Based Minecraft utility mod. 项目地址: https://gitcode.com/gh_mirrors/me/meteor-client Meteor Client是一款基于Fabric的Minecraft实用模组&…

2026/7/29 18:30:54 阅读更多 →

最新新闻

Google Gemma4开源大语言模型技术解析与应用实践

Google Gemma4开源大语言模型技术解析与应用实践

1. Gemma4项目概述Gemma4是Google最新推出的一款开源大语言模型,作为Gemini技术体系的重要组成部分,它延续了Google在AI领域的技术优势。与市面上其他开源模型相比,Gemma4最显著的特点是采用了创新的26B/A4B混合架构设计,在保持模…

2026/7/29 18:50:01 阅读更多 →
Core ML模型选择:CPM与Hourglass在PoseEstimation-CoreML中的对比测试

Core ML模型选择:CPM与Hourglass在PoseEstimation-CoreML中的对比测试

Core ML模型选择:CPM与Hourglass在PoseEstimation-CoreML中的对比测试 【免费下载链接】PoseEstimation-CoreML The example project of inferencing Pose Estimation using Core ML 项目地址: https://gitcode.com/gh_mirrors/po/PoseEstimation-CoreML Pos…

2026/7/29 18:50:01 阅读更多 →
浙江定制水品牌推荐哪个更值得信赖信赖选购

浙江定制水品牌推荐哪个更值得信赖信赖选购

在浙江,提到定制饮用水,很多人会先想到那些动辄要起订几千瓶、设计周期动辄半个月的大厂。直到一位准备办婚礼的新郎,在婚礼前三天发现水还没备好,急得像热锅上的蚂蚁,朋友推荐了一家刚成立不久的——浙江活养食品有限…

2026/7/29 18:50:01 阅读更多 →
5分钟搞定B站缓存转换:m4s-converter完整使用指南

5分钟搞定B站缓存转换:m4s-converter完整使用指南

5分钟搞定B站缓存转换:m4s-converter完整使用指南 【免费下载链接】m4s-converter 一个跨平台小工具,将bilibili缓存的m4s格式音视频文件合并成mp4 项目地址: https://gitcode.com/gh_mirrors/m4/m4s-converter 你是否曾经在B站缓存了珍贵的学习资…

2026/7/29 18:50:01 阅读更多 →
数据库MySQL基础入门之MySQL隐式转换

数据库MySQL基础入门之MySQL隐式转换

一、问题描述rootmysqldb 22:12: [xucl]> show create table t1\G*************************** 1. row ***************************Table: t1Create Table: CREATE TABLE t1 (id varchar(255) DEFAULT NULL) ENGINEInnoDB DEFAULT CHARSETutf81 row in set (0.00 sec)root…

2026/7/29 18:50:00 阅读更多 →
API测试用例生成:人工写1天,AI 5分钟搞定?Taotoken平台实测3类方案的覆盖率陷阱

API测试用例生成:人工写1天,AI 5分钟搞定?Taotoken平台实测3类方案的覆盖率陷阱

AI时代测试用例生成的革命性实践:从人工到智能的完整转型指南 上周我在生产环境中直接部署了由GPT-5.4生成的测试用例,结果因漏测一个边界条件导致线上故障——这次教训促使我在Taotoken平台开展了为期两周的系统性对比实验,全面评估人工、模…

2026/7/29 18:49:00 阅读更多 →

日新闻

【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

一、本文介绍 🔥本文在RT-DETR多模态融合目标检测中引入RLAB残差线性注意力模块,可在不同模态特征交互阶段进行多次残差细化,使可见光、红外等特征在尺度、语义和空间位置上更好对齐;随后将细化特征与解码器输出拼接并生成Q、K、V,通过线性注意力自适应强化关键通道、目…

2026/7/29 0:00:23 阅读更多 →
AI编程系列02:合并知识功能,给 AI 问数和 RAG 场景打基础

AI编程系列02:合并知识功能,给 AI 问数和 RAG 场景打基础

AI编程系列02:合并知识功能,给 AI 问数和 RAG 场景打基础 在上一期「AI编程系列」中,我们学习了如何构建一个基础的 AI 问答系统,通过简单的输入输出让模型回应问题。但现实世界中的 AI 应用往往需要处理更复杂的场景:…

2026/7/29 0:00:23 阅读更多 →
AI智能体开发实战:从工具调用到企业级部署

AI智能体开发实战:从工具调用到企业级部署

1. 从被动问答到主动执行:AI Agent的范式转变过去两年,大语言模型最显著的应用形态是聊天机器人——用户提问,AI回答。但真正的生产力革命发生在2023年下半年:当AI学会主动调用工具完成任务时,生产力工具的历史被彻底改…

2026/7/29 0:00:23 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/28 12:04:22 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/29 14:34:28 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/29 15:00:03 阅读更多 →

月新闻