具身智能之Room-to-Room详解:让智能体听懂“上楼后右转”——如何定义视觉语言导航
写在前面【从零走向AGI】旨在深入了解通用人工智能AGI的发展路径从最基础的概念起逐步构建完整的知识体系。项目地址https://github.com/AI-mzq/From-Zero-to-AGI.git魔方AI空间猫先生从零走向AGI面试面经AIGC算法岗/开发岗面试面经交流社群涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源欢迎大家加入https://t.zsxq.com/YtJ09导读2018 年 CVPR Spotlight 论文《Vision-and-Language Navigation》提出了Room-to-RoomR2R智能体身处一栋此前未见过的真实建筑只有第一视角视觉观察和一段自然语言路线说明需要自己判断该移动到哪里、何时转向、何时停止。它也由此确立了今天常说的Vision-and-Language NavigationVLN任务。R2R 的影响不只是一份路线数据。论文同时给出 Matterport3D Simulator以 90 栋真实室内建筑、10,800 个全景视点和 194,400 张 RGB-D 图像构成可复现实验环境在其上收集 7,189 条路径、21,567 条众包指令。每条指令平均 29 个词要求跨多个房间完成导航而不是在单张图里回答一个对象或颜色问题。基线模型在当时并不复杂ResNet-152 提取当前图像特征LSTM 编码指令再由带语言注意力的 LSTM 解码器输出六个离散动作。重要的发现反而是它的失败方式student-forcing 在已见验证建筑中成功率为 38.6%在未见建筑中降到 21.8%测试集仅为 20.4%。R2R 把“看懂语言”推进成了开放环境中的感知、记忆、规划和停止决策也把泛化问题放到了台前。猫先生认为R2R 最持久的贡献是给“按语言行动”设定了一个足够干净、却不轻松的最低门槛图像来自真实建筑行动会改变后续观察目标环境必须未见过。后续 VLN、具身问答、VLA 与世界模型研究都能在这里找到一个早期的任务原点。论文标题Vision-and-Language Navigation: Interpreting visually-grounded navigation instructions in real environments论文地址https://arxiv.org/abs/1711.07280项目主页https://bringmeaspoon.orgMatterport3Dhttps://niessner.github.io/Matterport/原文脉络论文先将 VLN 与视觉问答并列说明两者都可视作视觉落地的序列到序列转换但 VLN 的输出会改变相机位置。随后介绍真实图像驱动的 Matterport3D Simulator第 4 节定义 R2R 的任务、采集流程、数据划分和指标第 5 节给出 Seq2Seq 导航 agent 与两种训练方式第 6 节用 Seen/Unseen 的差异衡量泛化最后总结模拟器和数据集的边界。1-2. 从视觉问答到移动视角为什么导航不能只看一张图早期语言导航常在合成环境、标签化世界或视觉受限的场景中进行。这样的设置容易复现却把“语言如何对应真实、开放视觉世界”的难题提前简化掉了。R2R 要求模型面对的每一张观察都来自真实建筑墙面纹理、家具、光照和空间布局没有被手工限定为一个小词表。图 1R2R 任务样例。智能体在真实建筑视图中读取多步路线语言蓝色圆盘表示当前可达的离散导航位置。图 1 中的指令包含“上楼”“经过钢琴”“穿过拱门”“在走廊尽头右转”“在鹿角旁停下”等连续约束。模型必须把词语指向画面中的物体和空间关系同时将自己的移动历史保留下来“钢琴”已经经过、“拱门”尚未出现都会改变当前动作的含义。图 2论文将 VLN 与 VQA 对比。两者都把语言和视觉编码成序列但 VLN 输出的是会改变后续相机视角的动作序列。VQA 通常从固定图像和问题生成一段文字答案VLN 则在每个时间步选择动作动作又决定下一帧看见什么。这造成两层困难一是部分可观测模型不能只凭当前帧知道自己位于路线的哪一段二是误差会积累早期选错门或转错方向后面即便“看懂了”也可能回不到正确路径。3. Matterport3D Simulator 与 R2R把语言、视角和可达路径连起来3.1 用真实全景图搭建可复现的建筑环境Matterport3D 提供 90 个建筑尺度的真实室内场景。每个场景由密集采样的全景 RGB-D 视点组成平均相邻视点距离约 2.25 米。R2R 没有直接让 agent 在连续三维空间中任意滑动而是把每个全景视点作为图上的节点把可通行关系作为边。图 3一层建筑局部的导航图。蓝线连接可通行全景视点楼梯连接不同楼层模型只能在当前可见方向上的邻接视点之间移动。这种离散化并非只为降低计算量。它保证 agent 不会穿墙也避免不同方法因连续物理引擎细节而难以比较。每一步模拟器给出当前 RGB 观察和下一步可达视点集合图的边长代表直线距离超过 5 米的边会被移除并人工检查网格缺失导致的错误连通。原始环境仍保留相机朝向和俯仰。为了建立第一个易比较的基线作者将模型动作进一步简化为left、right、up、down、forward、stop六类转向和俯仰各为 30 度forward前往视野中心方向最近的可达视点。这个动作空间比今天常见的候选视点打分更粗糙却把“显式停下”变成了任务的一部分。3.2 R2R 数据路径不是唯一答案抵达目标才是数据采集从导航图中选择起点与终点保留长度至少 5 米、边数为 4 至 6 的最短路径。得到的 7,189 条路径平均长度约 10 米每条路径由众包标注者写出三条说明因此总计 21,567 条指令。标注者能沿给定路径飞行浏览也能在每个视点环顾四周但被告知不必逐边复刻演示路线只要让机器人到达相同目标即可。指令平均 29 个词词表约 3.1K 个词但不同标注者对同一路径的表述抽象层级差异很大有人报出显著物体和门口有人只说“穿过房间后右转”。因此R2R 测量的不只是空间几何匹配也测试模型能否在语言粒度不一致时维持正确的路线进度。这项规定很关键。R2R 评测不要求 agent 轨迹与某一个文本作者完全一致因为自然语言路线本来就存在多条等价走法。最终位置距离目标小于 3 米即为成功同时报告 oracle success——只要 agent 走过离目标最近的位置就算成功——用来把“走近目标”与“识别何时该 stop”分开。训练、验证和测试按建筑划分而不是将同一栋房子的路线随机分走。61 个场景用于训练和 seen 验证11 个场景形成 val unseen18 个场景和 4,173 条指令保留为测试。这使模型必须面对新的家具组合、新的房间拓扑和新的视觉外观。猫先生认为R2R 的数据设计比“把路径当标准答案”更成熟。它承认导航目标与唯一轨迹不是一回事也把 Stop 从一个实现细节提升为评测对象这两个选择后来深刻影响了 VLN 的成功率、路径长度和 oracle 指标体系。3.3 Seq2Seq agent语言注意力与历史记忆如何决定下一步作者的基线由两部分组成。指令编码器 LSTM 顺序读取单词并把得到的隐藏状态序列作为语言上下文解码器 LSTM 在每个时刻接收当前 RGB 图像的 ResNet-152 特征和上一步动作嵌入。解码器对语言隐藏状态做 attention选出与当前决策更相关的词再预测下一个动作分布。形式上当前动作依赖指令x 1 : L x_{1:L}x1:L​、观察o t o_tot​和历史p ( a t ∣ x 1 : L , o ≤ t , a t ) . p(a_t\mid x_{1:L},o_{\leq t},a_{t}).p(at​∣x1:L​,o≤t​,at​).这个条件写法说明了导航和单帧分类的区别。模型需要记住已走过的方向、已消耗的语言片段和此前的视觉证据才能判断“右转”是刚刚要做还是已经完成。论文只使用语言 attention尚未加入显式视觉 attention作者把后者留给后续研究。训练时teacher-forcing 始终把真实上一步动作喂回模型因此状态只沿最短路径展开student-forcing 则从模型自己预测的分布采样动作再从当前位置计算通往目标的最短下一步作为监督。这相当于让模型在训练中接触自己会造成的偏离缓解测试时从未见过错误状态的 exposure bias。4. 实验Student-forcing 有效但未见建筑仍是主要难关论文报告四个指标轨迹长度Trajectory Length、终点到目标的导航误差Navigation Error、3 米内成功率Success与 oracle success。后一个指标将 agent 经过目标附近但未停下的情况单独识别出来。在 val seen 中student-forcing 的成功率为38.6%明显高于 teacher-forcing 的 27.1% 和随机策略的 15.9%其导航误差也从 8.01 米降到 6.01 米。到 val unseenstudent-forcing 成功率降为21.8%测试集为20.4%人工在测试集上的成功率则为 86.4%。这组差距说明任务语言并非无效人类确实能依图行走但模型从已见建筑学到的视觉落地很容易绑定到训练环境。图 4student-forcing 的 seen 验证曲线持续改善unseen 验证的导航误差和成功率却较早平台化训练继续进行时泛化鸿沟仍在扩大。图 4 直观呈现了这种过拟合。即便使用 dropout 和权重衰减模型在训练建筑及 seen 验证建筑上的损失和成功率继续变好unseen 曲线却很早停止改善。论文的结论十分克制Seq2Seq 可以作为可行基线但常规视觉语言训练技巧不足以让 agent 在未见环境中可靠行动。从今天回看R2R 的早期基线不应与后来的 Transformer、预训练视觉模型或大规模导航数据直接横比它的价值在于首次把这一差距量化出来。后来的路径规划、跨模态预训练、环境记忆、数据增广和指令重写很多都可以视为对图 4 所揭示问题的回应。5. 局限真实图像不等于真实机器人世界Matterport3D 以真实照片提高了外观多样性但并非没有偏差。论文坦承其建筑多为整洁、富裕的居住空间人物和动物很少采样视点往往视野开阔也未必是实体机器人实际会处于的位置。另一个边界是离散节点和固定相机运动它适合高层路线决策却不覆盖避障、连续控制、动态人群和接触操作。R2R 的语言也缺少交互式消歧。现实导航者会追问“是哪扇门”、借助手势或请求重述而此基准要求单次读取指令后独立完成。因而 R2R 更准确地说是语言条件下的视觉导航基础测验而不是完整的人机协作导航。总结R2R 留下的不是一套模型而是一道泛化题R2R 将语言、视觉和动作放进了同一条闭环语言指向场景线索动作改变观察Stop 决定任务是否完成。它带来的三点遗产仍然清晰真实建筑的可复现环境让 VLN 不再依赖合成纹理或对象标签按建筑划分的 unseen 评测把环境泛化变成核心指标目标成功与 oracle success 的分离提示研究者接近目的地和知道何时结束是两种能力。今天的具身智能模型比 2018 年的 LSTM 基线强得多但“听懂一段说明后在从未见过的空间里稳健行动”依旧没有被彻底解决。R2R 的意义正在于它很早就让这个难题有了可比较、可复现、也不容易被单一分数掩盖的形式。推荐阅读► 技术资讯 魔方 AI 新视界► 项目应用开源视界► 技术专栏 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列

相关新闻

Na⁺/K⁺-ATP酶活性检测:揭示细胞膜离子稳态与能量代谢的精密调控

Na⁺/K⁺-ATP酶活性检测:揭示细胞膜离子稳态与能量代谢的精密调控

Na⁺/K⁺-ATP酶活性检测试剂盒(微量法)在细胞代谢与离子转运研究中的核心应用在生物体的每一个活细胞表面,都镶嵌着一种被称为"钠钾泵"的精密分子机器——Na⁺/K⁺-ATP酶(Sodium-Potassium ATPase, EC 3.6.3.9&#xff…

2026/7/26 18:11:11 阅读更多 →
百考通得力助手:AI赋能期刊论文写作,助力每一份研究从良好开端走向卓越成果

百考通得力助手:AI赋能期刊论文写作,助力每一份研究从良好开端走向卓越成果

在学术研究领域,期刊论文的撰写是成果输出的关键环节,却也让众多科研工作者与学生倍感压力:选题迷茫、逻辑梳理困难、格式规范复杂、内容提炼耗时,严重拖慢了学术成果的发表节奏。百考通(https://www.baikaotongai.com…

2026/7/26 12:32:36 阅读更多 →
具身智能之Xiaomi-Robotics-1:如何把 VLA 的规模化落到真实机器人

具身智能之Xiaomi-Robotics-1:如何把 VLA 的规模化落到真实机器人

写在前面 【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。 项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git 魔方AI空间 猫先生 从零走向…

2026/7/26 9:43:41 阅读更多 →

最新新闻

提示词工程实战:从基础指令到可测试上下文设计完整指南

提示词工程实战:从基础指令到可测试上下文设计完整指南

这次我们来看提示词工程的实际落地方法。很多人在学习Agent开发时,最头疼的就是提示词设计——要么堆砌大量指令效果不佳,要么缺乏可测试性难以迭代优化。本文将从实际工程角度,分享一套从基础指令堆叠到可测试上下文设计的完整实践路线。提示…

2026/7/29 2:12:08 阅读更多 →
小团队如何用AI降本?探讨AI能帮我做什么生意与人力替代

小团队如何用AI降本?探讨AI能帮我做什么生意与人力替代

小团队如何用AI降本?探讨AI能帮我做什么生意与人力替代策略当中小企业主思考“AI能帮我做什么生意”这一命题时,其核心诉求往往并非盲目追逐全新的商业风口,而是希望通过技术手段解决现有业务流程中的人力瓶颈与效率痛点。对于缺乏专职IT团队…

2026/7/29 2:12:08 阅读更多 →
162、NPU的编译器开发:数据预取与软件流水

162、NPU的编译器开发:数据预取与软件流水

NPU的编译器开发:数据预取与软件流水 一个让我熬夜三天的bug 去年做某款AI芯片的编译器时,遇到一个诡异现象:同样的卷积网络,在仿真器上跑出98%的MAC利用率,上板实测只有62%。我盯着波形图看了整整两天,发现NPU的DMA引擎每隔几十个周期就会“发呆”——数据没到位,计算…

2026/7/29 2:12:08 阅读更多 →
吴恩达提示词工程实践指南:从基础概念到代码生成实战

吴恩达提示词工程实践指南:从基础概念到代码生成实战

如果你还在为写不出高质量的提示词而苦恼,或者觉得AI总是无法理解你的真实意图,那么吴恩达的《提示词工程》课程可能是你一直在寻找的答案。这不是又一套枯燥的理论教程,而是一套真正从实践出发、能够立即提升你与大模型交互效率的实用指南。…

2026/7/29 2:12:08 阅读更多 →
161、NPU的编译器开发:内存布局优化

161、NPU的编译器开发:内存布局优化

好的,我们开始。 161、NPU的编译器开发:内存布局优化 从一次诡异的“算对但跑不对”说起 几年前调试一个轻量级检测网络,模型在PC端仿真器上精度完全达标,一部署到某款自研NPU上,输出特征图就出现周期性的“条纹状”错误。不是全错,是每隔几行数据就跳变一次,像有人把…

2026/7/29 2:12:08 阅读更多 →
Unity游戏伤害计算系统:从核心公式到模块化架构实战

Unity游戏伤害计算系统:从核心公式到模块化架构实战

1. 项目概述:为什么伤害计算是游戏战斗系统的灵魂在Unity3D游戏开发中,尤其是涉及角色扮演、动作冒险或策略对战类型时,战斗系统的“手感”和“平衡性”往往是决定游戏成败的关键。而这一切的基石,就是一套清晰、灵活且可扩展的伤…

2026/7/29 2:11:08 阅读更多 →

日新闻

【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

一、本文介绍 🔥本文在RT-DETR多模态融合目标检测中引入RLAB残差线性注意力模块,可在不同模态特征交互阶段进行多次残差细化,使可见光、红外等特征在尺度、语义和空间位置上更好对齐;随后将细化特征与解码器输出拼接并生成Q、K、V,通过线性注意力自适应强化关键通道、目…

2026/7/29 0:00:23 阅读更多 →
AI编程系列02:合并知识功能,给 AI 问数和 RAG 场景打基础

AI编程系列02:合并知识功能,给 AI 问数和 RAG 场景打基础

AI编程系列02:合并知识功能,给 AI 问数和 RAG 场景打基础 在上一期「AI编程系列」中,我们学习了如何构建一个基础的 AI 问答系统,通过简单的输入输出让模型回应问题。但现实世界中的 AI 应用往往需要处理更复杂的场景:…

2026/7/29 0:00:23 阅读更多 →
AI智能体开发实战:从工具调用到企业级部署

AI智能体开发实战:从工具调用到企业级部署

1. 从被动问答到主动执行:AI Agent的范式转变过去两年,大语言模型最显著的应用形态是聊天机器人——用户提问,AI回答。但真正的生产力革命发生在2023年下半年:当AI学会主动调用工具完成任务时,生产力工具的历史被彻底改…

2026/7/29 0:00:23 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/28 12:04:22 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/28 8:29:16 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/28 5:03:42 阅读更多 →

月新闻