摘要本文解读 ICRA 2026 论文《VeriGraph: Scene Graphs for Execution Verifiable Robot Planning》。该论文提出以场景图作为可执行验证的中间表示通过融合场景图结构化表示、图编辑式动作建模与迭代式约束校验让机器人在真正动手之前先证明计划做不做得成其特别之处在于场景图同时充当规划输入与验证机制既不需要额外的模型融合阶段也不需要重新训练。实验表明图像目标的两类任务成功率平均提升约 0.57参考图像积木场景从 0.27 提升到 0.86语言指令任务比 SayCan 高约 0.48七巧板任务比 VILA 高 0.56为长程机器人操作的可验证规划提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果结果对比总结关键发现局限性常见问题FAQVeriGraph 的核心创新点是什么VeriGraph 需要训练吗目标只能是语言指令吗为什么迭代规划有时反而不如单次规划错误阈值设多少合适这套方法能迁移到别的机器人任务吗参考链接论文基本信息项目内容标题英文VeriGraph: Scene Graphs for Execution Verifiable Robot Planning标题中文以场景图为可验证中间表示的机器人任务规划作者Daniel Ekpo, Mara Levy, Saksham Suri, Chuong Huynh, Archana Swaminathan, Abhinav Shrivastava机构University of Maryland, College Park马里兰大学帕克分校 PI Lab会议ICRA 2026arXivhttps://arxiv.org/abs/2411.10446项目网站https://verigraph-agent.github.io/背景与动机机器人要在真实世界里完成长程操作前提是理解物体以及物体之间的关系因为物理约束会限制动作的顺序。一个直观的例子是如果一只玻璃杯放在书上机器人必须先拿起杯子放到别处才轮得到那本书如果它不理解「杯在书上」这层关系就可能先去搬书杯子随之跌落摔碎。人类靠直觉就能理解这些空间关系机器人却很难。现有方法各有短板。大语言模型LLM与视觉语言模型VLM虽然推理能力与世界知识都很强但经常给出错误的动作序列往往需要多轮提示才能得到一条合法计划。用 LLM 生成 PDDL 再交给经典规划器是一条路线但 PDDL 本身过于受限跨物体、跨动作的泛化能力差。另一条路线是让 VLM 直接从图像出高层计划代表工作是VILA它把大 VLM 直接当作规划器使用最接近本文但每一轮都需要把环境的视觉状态重新喂回模型SayCan用学习到的价值函数过滤技能效果不错却需要大量训练数据SayPlan假设已经存在一张 3D 场景图用图模拟器验证 LLM 生成的计划主要面向多房间导航ConceptGraphs从 2D 基础模型构建开放词表的 3D 场景图再规划多了一个模型融合阶段。还有一类工作把人直接放进回路里检查计划代价是耗时且需要持续的人工监督。场景图因此成为自然的候选表示。它把场景抽象成「物体 关系」的结构化图既能保留动作可行性所需的关键信息又能滤掉像素级的噪声与无关视觉变化。本文正是把场景图推到更彻底的位置它不只是规划的输入也是规划的验证机制——动作被改写成图上的编辑操作于是「这条计划能不能执行」变成一个可以在图上即时回答的问题。研究主线从问题到结论图 5VeriGraph 研究主线从长程操作受物理约束、LLM/VLM 计划常出错到改用场景图做中间表示、动作即图编辑、节点与边约束校验最终在四类任务与真机上验证规划可执行、可验证。基准/方法设计VeriGraph 的输入是一张描述初始场景的图像以及一个目标——目标既可以是一段自然语言指令也可以是一张情境相似的参考图像。系统先把两侧都转成场景图再让规划器在图上生成动作序列。核心设计有四点场景图定义记场景图为 $G{V,E}$其中 $V$ 是物体节点集合$E$ 是关系边集合每条边 $e$ 由「起点、终点、关系」三元组构成。关系集 $R$ 只保留最基础的 ${\text{in}, \text{on}}$但结构上是开放的可以按任务扩展。场景图生成器把图像 $I$、关系集 $R$、全局对象字典 $D$ 与任务描述 $T$ 映射成一张图即 $SGG(I,R,D,T) \to G$。全局对象字典用来统一 tabletop、table、countertop 这类同物异名避免同一物体因为叫法不同而变成两个节点。动作即图编辑每次移动操作被表示为「删除旧的支撑边 建立新的支撑边」末端判定就是最终图的节点与边是否与目标图一致。两模态统一的目标规格语言指令与参考图像都会先归约成目标场景图参考图像只要求情境相似而非逐像素一致这让部署时目标可以来自不同格式的输入。图 1VeriGraph 总览给定初始场景与目标上语言指令下参考图像VLM 规划器逐段生成并执行动作每一步都做验证后才继续。分类全景图 6VeriGraph 四组件拆解场景图生成 SGG、约束校验 C、任务规划 P 与迭代规划 P_iter——以及全局对象字典、节点与边条件检查、LLM 规划器、反馈与错误阈值各自的职责。方法细节约束校验是整套机制的关键。每个动作都有一组前置条件动作涉及的节点必须存在于当前图中并且它的入边与出边要满足特定条件。例如要移动一个盘子系统会先确认这个盘子上没有压着别的东西——也就是不存在从这个节点出发指向其他节点的支撑边。动作执行后图形状随之更新删掉旧的支撑边建立新的支撑边。最终的节点与边同目标图比对一致则判定计划成功。迭代规划解决的是 LLM 会「忘记约束」的问题。规划器 $\mathcal{P}$ 在动作集合 $\mathcal{A}$ 与约束 $\mathcal{C}$ 下生成动作序列 $a\mathcal{P}(G_i, G_g, \mathcal{C}, \mathcal{A})$但一次性输出整条计划在困难任务上失败率很高。为此论文引入迭代规划器 $\mathcal{P}_{\text{iter}}$每一轮最多给出 $k$ 个动作加一个结束标记系统执行到出现违规为止把反馈与当前图状态回传给规划器重新规划每次违规会把错误计数 $\tau$ 加一一旦达到阈值 $t$ 就停止。这个阈值是必要的因为 LLM 可能反复提出同一个违规动作形成错误环实验中作者取 $k3$、阈值 5。图 2VeriGraph 框架起始图与目标图语言或参考图先由场景图模块生成规划器迭代提出动作、按图约束校验、执行可行动作并更新图违规则生成反馈重规划直到规划器发出结束标记。图 3基于图反馈的迭代规划提出动作后在当前图上校验可行则执行绿违反约束则生成反馈并重规划红如此循环直到规划器给出完成标记。实验设计与结果数据集包含厨房、餐具、积木三个场景每个场景都有多种配置物体数量在3 到 7之间变化真值场景图先由 GPT-4V 生成再人工修正。任务分四组七巧板要求只移动一块积木并让指定边对齐堆叠要求把所有积木码成一摞语言指令既包括「把锅移到灶台上」这类直接命令也包括「我需要把锅和锅铲的位置对调」这类目标状态描述参考图像指令给出一个结构相似的目标场景。评测协议是把规划器给出的动作在真值初始图上执行再把变换后的图与真值目标图比较图一致才算成功。基线包括 VILA、SayCan以及去掉验证环节的单次规划版本。任务SayCanVILAOurs直接无验证OursVeriGraph堆叠0.070.620.350.65语言指令0.170.430.730.65参考图像积木--0.270.670.86参考图像厨房0.000.050.500.55七巧板--0.160.720.72场景图生成质量单独做了评测。在同一个提示下比较三个 VLMGPT-4V 全面领先积木场景的精确图准确率Exact Graph Accuracy达到1.00餐具0.89厨房0.65Gemini 1.5 Pro 分别是 0.73、0.39、0.04LLaVA 三项全是 0.00。节点比边容易——GPT-4V 的节点 F1 在 0.98 到 1.00 之间边 F1 降到 0.87 到 1.00说明空间关系才是难点。超参消融方面错误阈值 $\tau$ 取 2 时准确率只有 20%取 10 时最好达到 90% 但迭代次数与成本都上升取 5 是性价比选择每轮动作数从 2 到 10 之间准确率没有显著差异作者最终选 3。真机执行用 LangSAM 取目标与目的物体的掩码投影到 3D 并变换到机器人坐标系用 AnyGrasp 预测抓取位姿、由目的物点云估计放置高度七巧板任务额外计算 x–y 偏移与旋转量整条链路是开环执行的。错误阈值 $\tau$23510准确率%20858090图 4四类任务组的评测场景示例积木、厨房、七巧板、餐具覆盖不同的物体集合与支撑关系用来检验约束感知的规划能力。结果对比总结图 7结果对比总结VILA、SayCan 与单次规划相对 VeriGraph 的成功率差距以及「最终图与目标图一致即成功」的判据与图像目标任务平均提升约 0.57 的结论。关键发现结构化表示是收益来源图像目标的两类任务上VeriGraph 相比 VILA 平均提升约0.57参考图像积木场景从 0.27 提升到0.86厨房场景从 0.05 提升到0.55。语言指令任务提升约 0.48相对 SayCan 的 0.17VeriGraph 达到 0.65七巧板任务相对 VILA 的 0.16 达到0.72提升 0.56。瓶颈在感知而不在规划多数失败源于场景图生成不准把真值场景图直接交给规划器后迭代规划器几乎全部成功。迭代并非万能语言指令任务从单次规划的0.73降到 0.65七巧板持平在 0.72——一旦图本身有错违规检测不出来反馈反而可能误导规划器。场景图质量决定了上限GPT-4V 的精确图准确率在三个场景上是 1.00 / 0.89 / 0.65而 LLaVA 三项全为 0.00说明这套方法对底层感知模型的选择非常敏感。超参不敏感但有性价比拐点错误阈值取 2 只有 20% 准确率取 10 达到 90%作者建议取5每轮动作数 2 到 10 之间准确率无显著差异。局限性强依赖场景图精度场景图由单目图像抽取物体检测或空间关系出错会直接传播到规划阶段导致错误动作。幻觉与错误关系实测中幻觉物体或不正确的关系偶尔会产生无效计划约束校验只能挡住一部分不可行动作。无法修正结构性错误校验不会发现「图本身就建错了」因此也不能把计划拉回正轨。作者把提高场景图生成的可靠性列为重要的未来方向并预期随着感知方法进步规划性能会同步提升。执行侧仍是开环真机部署一次性算好位姿后直接执行不做在线视觉闭环。成本没有定量报告论文指出计算成本由 VLM 与 LLM 调用次数主导图操作的开销可忽略但明确没有报告具体金额因此成本结论无法被读者独立核对。常见问题FAQVeriGraph 的核心创新点是什么把场景图同时用作规划表示与验证机制。动作被改写成图编辑操作删边 建边于是「计划是否可执行」退化成节点与边的条件检查验证成本从「再调一次大模型」降到「走一遍图」。VeriGraph 需要训练吗不需要。整套框架是模块化的提示式流程视觉语言模型负责生成初始与目标场景图LLM 负责出动作约束校验与图更新是轻量图操作。整个流程只需两次 VLM 调用初始图与目标图。目标只能是语言指令吗不是。目标既可以是自然语言指令也可以是一张参考图像而且参考图像只要求情境相似不要求与初始场景一致两者最终都归约成目标场景图。为什么迭代规划有时反而不如单次规划迭代规划依赖图上的约束来发现违规。如果场景图本身有错违规就检测不出来反馈反而可能把规划器带偏。实验里语言指令任务从 0.73 降到 0.65七巧板持平都指向同一个原因。错误阈值设多少合适阈值取 2 时准确率只有 20%取 10 时最好90%但重规划次数与成本更高作者实测后推荐取 5作为准确率与速度之间的平衡。每轮动作数对准确率影响不大最终取 3。这套方法能迁移到别的机器人任务吗场景图表示与图编辑式的验证是任务无关的抽象论文在四类任务组七巧板、堆叠、语言指令、参考图像指令上都做了验证。实际迁移的约束在于需要能把目标场景写成图并且底层感知能可靠地抽出物体与关系。参考链接论文 arXiv 摘要页https://arxiv.org/abs/2411.10446项目网站含定性结果与代码https://verigraph-agent.github.io/VILA: On Pre-training for Visual Language ModelsCVPR 2024https://arxiv.org/abs/2312.07533SayCan: Do As I Can, Not As I SayCoRL 2022https://arxiv.org/abs/2204.01691SayPlan: Grounding Large Language Models using 3D Scene GraphsCoRL 2023https://arxiv.org/abs/2307.06135ConceptGraphs: Open-Vocabulary 3D Scene Graphs for Perception and PlanningICRA 2024https://arxiv.org/abs/2309.16650给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件