【ICRA 2026】VeriGraph:以场景图为可验证中间表示的机器人任务规划|从具身大模型规划验证视角
摘要本文解读 ICRA 2026 论文《VeriGraph: Scene Graphs for Execution Verifiable Robot Planning》。该论文提出以场景图作为可执行验证的中间表示通过融合场景图结构化表示、图编辑式动作建模与迭代式约束校验让机器人在真正动手之前先证明计划做不做得成其特别之处在于场景图同时充当规划输入与验证机制既不需要额外的模型融合阶段也不需要重新训练。实验表明图像目标的两类任务成功率平均提升约 0.57参考图像积木场景从 0.27 提升到 0.86语言指令任务比 SayCan 高约 0.48七巧板任务比 VILA 高 0.56为长程机器人操作的可验证规划提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果结果对比总结关键发现局限性常见问题FAQVeriGraph 的核心创新点是什么VeriGraph 需要训练吗目标只能是语言指令吗为什么迭代规划有时反而不如单次规划错误阈值设多少合适这套方法能迁移到别的机器人任务吗参考链接论文基本信息项目内容标题英文VeriGraph: Scene Graphs for Execution Verifiable Robot Planning标题中文以场景图为可验证中间表示的机器人任务规划作者Daniel Ekpo, Mara Levy, Saksham Suri, Chuong Huynh, Archana Swaminathan, Abhinav Shrivastava机构University of Maryland, College Park马里兰大学帕克分校 PI Lab会议ICRA 2026arXivhttps://arxiv.org/abs/2411.10446项目网站https://verigraph-agent.github.io/背景与动机机器人要在真实世界里完成长程操作前提是理解物体以及物体之间的关系因为物理约束会限制动作的顺序。一个直观的例子是如果一只玻璃杯放在书上机器人必须先拿起杯子放到别处才轮得到那本书如果它不理解「杯在书上」这层关系就可能先去搬书杯子随之跌落摔碎。人类靠直觉就能理解这些空间关系机器人却很难。现有方法各有短板。大语言模型LLM与视觉语言模型VLM虽然推理能力与世界知识都很强但经常给出错误的动作序列往往需要多轮提示才能得到一条合法计划。用 LLM 生成 PDDL 再交给经典规划器是一条路线但 PDDL 本身过于受限跨物体、跨动作的泛化能力差。另一条路线是让 VLM 直接从图像出高层计划代表工作是VILA它把大 VLM 直接当作规划器使用最接近本文但每一轮都需要把环境的视觉状态重新喂回模型SayCan用学习到的价值函数过滤技能效果不错却需要大量训练数据SayPlan假设已经存在一张 3D 场景图用图模拟器验证 LLM 生成的计划主要面向多房间导航ConceptGraphs从 2D 基础模型构建开放词表的 3D 场景图再规划多了一个模型融合阶段。还有一类工作把人直接放进回路里检查计划代价是耗时且需要持续的人工监督。场景图因此成为自然的候选表示。它把场景抽象成「物体 关系」的结构化图既能保留动作可行性所需的关键信息又能滤掉像素级的噪声与无关视觉变化。本文正是把场景图推到更彻底的位置它不只是规划的输入也是规划的验证机制——动作被改写成图上的编辑操作于是「这条计划能不能执行」变成一个可以在图上即时回答的问题。研究主线从问题到结论图 5VeriGraph 研究主线从长程操作受物理约束、LLM/VLM 计划常出错到改用场景图做中间表示、动作即图编辑、节点与边约束校验最终在四类任务与真机上验证规划可执行、可验证。基准/方法设计VeriGraph 的输入是一张描述初始场景的图像以及一个目标——目标既可以是一段自然语言指令也可以是一张情境相似的参考图像。系统先把两侧都转成场景图再让规划器在图上生成动作序列。核心设计有四点场景图定义记场景图为 $G{V,E}$其中 $V$ 是物体节点集合$E$ 是关系边集合每条边 $e$ 由「起点、终点、关系」三元组构成。关系集 $R$ 只保留最基础的 ${\text{in}, \text{on}}$但结构上是开放的可以按任务扩展。场景图生成器把图像 $I$、关系集 $R$、全局对象字典 $D$ 与任务描述 $T$ 映射成一张图即 $SGG(I,R,D,T) \to G$。全局对象字典用来统一 tabletop、table、countertop 这类同物异名避免同一物体因为叫法不同而变成两个节点。动作即图编辑每次移动操作被表示为「删除旧的支撑边 建立新的支撑边」末端判定就是最终图的节点与边是否与目标图一致。两模态统一的目标规格语言指令与参考图像都会先归约成目标场景图参考图像只要求情境相似而非逐像素一致这让部署时目标可以来自不同格式的输入。图 1VeriGraph 总览给定初始场景与目标上语言指令下参考图像VLM 规划器逐段生成并执行动作每一步都做验证后才继续。分类全景图 6VeriGraph 四组件拆解场景图生成 SGG、约束校验 C、任务规划 P 与迭代规划 P_iter——以及全局对象字典、节点与边条件检查、LLM 规划器、反馈与错误阈值各自的职责。方法细节约束校验是整套机制的关键。每个动作都有一组前置条件动作涉及的节点必须存在于当前图中并且它的入边与出边要满足特定条件。例如要移动一个盘子系统会先确认这个盘子上没有压着别的东西——也就是不存在从这个节点出发指向其他节点的支撑边。动作执行后图形状随之更新删掉旧的支撑边建立新的支撑边。最终的节点与边同目标图比对一致则判定计划成功。迭代规划解决的是 LLM 会「忘记约束」的问题。规划器 $\mathcal{P}$ 在动作集合 $\mathcal{A}$ 与约束 $\mathcal{C}$ 下生成动作序列 $a\mathcal{P}(G_i, G_g, \mathcal{C}, \mathcal{A})$但一次性输出整条计划在困难任务上失败率很高。为此论文引入迭代规划器 $\mathcal{P}_{\text{iter}}$每一轮最多给出 $k$ 个动作加一个结束标记系统执行到出现违规为止把反馈与当前图状态回传给规划器重新规划每次违规会把错误计数 $\tau$ 加一一旦达到阈值 $t$ 就停止。这个阈值是必要的因为 LLM 可能反复提出同一个违规动作形成错误环实验中作者取 $k3$、阈值 5。图 2VeriGraph 框架起始图与目标图语言或参考图先由场景图模块生成规划器迭代提出动作、按图约束校验、执行可行动作并更新图违规则生成反馈重规划直到规划器发出结束标记。图 3基于图反馈的迭代规划提出动作后在当前图上校验可行则执行绿违反约束则生成反馈并重规划红如此循环直到规划器给出完成标记。实验设计与结果数据集包含厨房、餐具、积木三个场景每个场景都有多种配置物体数量在3 到 7之间变化真值场景图先由 GPT-4V 生成再人工修正。任务分四组七巧板要求只移动一块积木并让指定边对齐堆叠要求把所有积木码成一摞语言指令既包括「把锅移到灶台上」这类直接命令也包括「我需要把锅和锅铲的位置对调」这类目标状态描述参考图像指令给出一个结构相似的目标场景。评测协议是把规划器给出的动作在真值初始图上执行再把变换后的图与真值目标图比较图一致才算成功。基线包括 VILA、SayCan以及去掉验证环节的单次规划版本。任务SayCanVILAOurs直接无验证OursVeriGraph堆叠0.070.620.350.65语言指令0.170.430.730.65参考图像积木--0.270.670.86参考图像厨房0.000.050.500.55七巧板--0.160.720.72场景图生成质量单独做了评测。在同一个提示下比较三个 VLMGPT-4V 全面领先积木场景的精确图准确率Exact Graph Accuracy达到1.00餐具0.89厨房0.65Gemini 1.5 Pro 分别是 0.73、0.39、0.04LLaVA 三项全是 0.00。节点比边容易——GPT-4V 的节点 F1 在 0.98 到 1.00 之间边 F1 降到 0.87 到 1.00说明空间关系才是难点。超参消融方面错误阈值 $\tau$ 取 2 时准确率只有 20%取 10 时最好达到 90% 但迭代次数与成本都上升取 5 是性价比选择每轮动作数从 2 到 10 之间准确率没有显著差异作者最终选 3。真机执行用 LangSAM 取目标与目的物体的掩码投影到 3D 并变换到机器人坐标系用 AnyGrasp 预测抓取位姿、由目的物点云估计放置高度七巧板任务额外计算 x–y 偏移与旋转量整条链路是开环执行的。错误阈值 $\tau$23510准确率%20858090图 4四类任务组的评测场景示例积木、厨房、七巧板、餐具覆盖不同的物体集合与支撑关系用来检验约束感知的规划能力。结果对比总结图 7结果对比总结VILA、SayCan 与单次规划相对 VeriGraph 的成功率差距以及「最终图与目标图一致即成功」的判据与图像目标任务平均提升约 0.57 的结论。关键发现结构化表示是收益来源图像目标的两类任务上VeriGraph 相比 VILA 平均提升约0.57参考图像积木场景从 0.27 提升到0.86厨房场景从 0.05 提升到0.55。语言指令任务提升约 0.48相对 SayCan 的 0.17VeriGraph 达到 0.65七巧板任务相对 VILA 的 0.16 达到0.72提升 0.56。瓶颈在感知而不在规划多数失败源于场景图生成不准把真值场景图直接交给规划器后迭代规划器几乎全部成功。迭代并非万能语言指令任务从单次规划的0.73降到 0.65七巧板持平在 0.72——一旦图本身有错违规检测不出来反馈反而可能误导规划器。场景图质量决定了上限GPT-4V 的精确图准确率在三个场景上是 1.00 / 0.89 / 0.65而 LLaVA 三项全为 0.00说明这套方法对底层感知模型的选择非常敏感。超参不敏感但有性价比拐点错误阈值取 2 只有 20% 准确率取 10 达到 90%作者建议取5每轮动作数 2 到 10 之间准确率无显著差异。局限性强依赖场景图精度场景图由单目图像抽取物体检测或空间关系出错会直接传播到规划阶段导致错误动作。幻觉与错误关系实测中幻觉物体或不正确的关系偶尔会产生无效计划约束校验只能挡住一部分不可行动作。无法修正结构性错误校验不会发现「图本身就建错了」因此也不能把计划拉回正轨。作者把提高场景图生成的可靠性列为重要的未来方向并预期随着感知方法进步规划性能会同步提升。执行侧仍是开环真机部署一次性算好位姿后直接执行不做在线视觉闭环。成本没有定量报告论文指出计算成本由 VLM 与 LLM 调用次数主导图操作的开销可忽略但明确没有报告具体金额因此成本结论无法被读者独立核对。常见问题FAQVeriGraph 的核心创新点是什么把场景图同时用作规划表示与验证机制。动作被改写成图编辑操作删边 建边于是「计划是否可执行」退化成节点与边的条件检查验证成本从「再调一次大模型」降到「走一遍图」。VeriGraph 需要训练吗不需要。整套框架是模块化的提示式流程视觉语言模型负责生成初始与目标场景图LLM 负责出动作约束校验与图更新是轻量图操作。整个流程只需两次 VLM 调用初始图与目标图。目标只能是语言指令吗不是。目标既可以是自然语言指令也可以是一张参考图像而且参考图像只要求情境相似不要求与初始场景一致两者最终都归约成目标场景图。为什么迭代规划有时反而不如单次规划迭代规划依赖图上的约束来发现违规。如果场景图本身有错违规就检测不出来反馈反而可能把规划器带偏。实验里语言指令任务从 0.73 降到 0.65七巧板持平都指向同一个原因。错误阈值设多少合适阈值取 2 时准确率只有 20%取 10 时最好90%但重规划次数与成本更高作者实测后推荐取 5作为准确率与速度之间的平衡。每轮动作数对准确率影响不大最终取 3。这套方法能迁移到别的机器人任务吗场景图表示与图编辑式的验证是任务无关的抽象论文在四类任务组七巧板、堆叠、语言指令、参考图像指令上都做了验证。实际迁移的约束在于需要能把目标场景写成图并且底层感知能可靠地抽出物体与关系。参考链接论文 arXiv 摘要页https://arxiv.org/abs/2411.10446项目网站含定性结果与代码https://verigraph-agent.github.io/VILA: On Pre-training for Visual Language ModelsCVPR 2024https://arxiv.org/abs/2312.07533SayCan: Do As I Can, Not As I SayCoRL 2022https://arxiv.org/abs/2204.01691SayPlan: Grounding Large Language Models using 3D Scene GraphsCoRL 2023https://arxiv.org/abs/2307.06135ConceptGraphs: Open-Vocabulary 3D Scene Graphs for Perception and PlanningICRA 2024https://arxiv.org/abs/2309.16650给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件

相关新闻

《创业之路》-1024-细读商业经典 - AI 是一个普惠技术,其技术本身带来的原始创新能力,正在颠覆美国在原始创新上的优势。

《创业之路》-1024-细读商业经典 - AI 是一个普惠技术,其技术本身带来的原始创新能力,正在颠覆美国在原始创新上的优势。

AI 普惠时代:正在重构而非颠覆的全球创新格局这个判断切中了 AI 作为通用目的技术(GPT)最核心的革命意义:它不是一项普通的新产品,而是一种全新的创新生产工具 —— 它直接降低了 “原始创新” 的门槛,稀释…

2026/10/9 2:56:49 阅读更多 →
你不是记不住单词,只是没找到对的方式

你不是记不住单词,只是没找到对的方式

你有没有过这样的瞬间?深夜翻开单词书,abandon 那一页已经快被翻烂了,可后面的单词还是陌生得像第一次见。或者,明明背了一下午,合上书的那一刻,脑子里只剩下“马冬梅”三个字。我懂。那种挫败感&#xff0…

2026/10/9 2:56:49 阅读更多 →
基于全周期滑动DFT相量提取与Fortescue对称分量变换的高压输电线路多区距离保护及智能故障定位方法研究(Matlab代码实现)

基于全周期滑动DFT相量提取与Fortescue对称分量变换的高压输电线路多区距离保护及智能故障定位方法研究(Matlab代码实现)

💥💥💞💞欢迎来到本博客❤️❤️💥💥 🏆博主优势:🌞🌞🌞博客内容尽量做到思维缜密,逻辑清晰,为了方便读者。 &#x1f381…

2026/10/9 2:55:48 阅读更多 →

最新新闻

双指针算法全攻略:对撞、快慢、滑动窗口三大模板与实战总结

双指针算法全攻略:对撞、快慢、滑动窗口三大模板与实战总结

刷题刷到一定量,很多人会慢慢总结出一条规律:有一类题的解法特别“固定”——有序数组里找两个数凑目标值、链表中判断有没有环、字符串里找不重复的最长子串,题面长得完全不一样,翻开题解一看,底层全是同一个思路&…

2026/10/9 3:32:13 阅读更多 →
医疗NLP实战:词典构建与最大匹配实体标注

医疗NLP实战:词典构建与最大匹配实体标注

简介:一套基于Python与Jupyter构建的医疗实体识别模型资源,面向疾病、症状、身体部位三类实体,完整呈现词典构造、语料标注、模型训练与结果评估的工程化流程。压缩包共147个文件,约581MB,具体包含18个txt词典/文本、1…

2026/10/9 3:32:13 阅读更多 →
Git远程分支覆盖本地分支:reset、clean实操与急救指南

Git远程分支覆盖本地分支:reset、clean实操与急救指南

1. 什么时候需要“用远程分支覆盖本地分支”先聊个真实的场景。我在维护一个项目时,远程仓库里develop分支已经被同事 rebase 重新整理过,提交历史完全换了样子。我本地还停在老版本上,这时候直接git pull会提示分叉严重,甚至直接…

2026/10/9 3:32:13 阅读更多 →
Cache模拟器实战:从映射原理到命中率计算的完整工程解析

Cache模拟器实战:从映射原理到命中率计算的完整工程解析

简介:一份面向计算机组成原理与操作系统学习者的缓存模拟器源码,在Visual Studio 2010环境下编写,通过读取地址流文件模拟处理器访存行为,可设置缓存容量、块大小,并支持直接映射、组关联映射、全关联映射三种策略&…

2026/10/9 3:32:13 阅读更多 →
Servlet配置实战:web.xml与@WebServlet注解全面解析

Servlet配置实战:web.xml与@WebServlet注解全面解析

Servlet这个词,放在今天动辄微服务、云原生的大环境下,多少有点“老古董”的感觉。但你只要还在写Java后端,不管用Spring Boot还是Spring MVC,请求真正进来之后,最终处理的还是Servlet容器那一层。很多新人会直接跳过S…

2026/10/9 3:32:13 阅读更多 →
Claude Code与桌面版安装教程:环境配置、VS Code插件及MCP部署

Claude Code与桌面版安装教程:环境配置、VS Code插件及MCP部署

最近一直被同一个问题刷屏:“Claude到底怎么装?”尤其是Claude Code这三个月火起来之后,各大群里问安装的比问用法的还多。我前前后后帮朋友远程装过几十次,也踩了不少坑——什么安装到一半卡死、装完打开白屏、输入命令提示找不到…

2026/10/9 3:31:13 阅读更多 →

日新闻

Java时间API实战:LocalDate、Date与ZonedDateTime的转换与避坑指南

Java时间API实战:LocalDate、Date与ZonedDateTime的转换与避坑指南

Java时间API这个话题,隔三差五就会在群里被翻出来讨论一次。上周还有个同事线上处理一个订单超时问题,排查到最后发现是ZonedDateTime序列化后时区丢了,用户在下单当天晚上看到的时间整整差了8个小时。这类问题几乎每个做Java开发的人都遇到过…

2026/10/9 0:00:49 阅读更多 →
EasyTier实践:从NAT穿透到子网代理的异地组网部署与排错

EasyTier实践:从NAT穿透到子网代理的异地组网部署与排错

前几个月我手头有好几台机器需要互相访问:办公室台式机、家里 NAS、还有一台云主机。如果只是偶尔传个文件倒还好,问题是工作场景经常要在几处环境之间来回切换,每次都先登录跳板机再层层代理,实在折腾。我先后试过端口映射、自建…

2026/10/9 0:00:49 阅读更多 →
AI Agent工程实战:从七要素到七个决策点的系统设计指南

AI Agent工程实战:从七要素到七个决策点的系统设计指南

AI Agent 这个词在过去一年里被反复提及,但真正动手搭过一套能跑起来的 Agent 系统的人都知道,从"知道它是什么"到"让它稳定干活"之间隔着一整套工程决策。我前后参与过几个 Agent 项目的落地,从最初用现成框架拼装&…

2026/10/9 0:01:50 阅读更多 →

周新闻

KT148A语音芯片外挂8002D功放的工程实践指南

KT148A语音芯片外挂8002D功放的工程实践指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/8 15:26:32 阅读更多 →
LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/8 15:26:40 阅读更多 →
ARM架构深度解析:从RISC设计理念到交叉编译实战

ARM架构深度解析:从RISC设计理念到交叉编译实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/8 10:10:36 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/8 21:13:17 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/8 15:26:17 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/7 13:34:55 阅读更多 →