【前馈三维重建】Argus:室内场景的可度量全景三维重建
图1Argus是一个前馈式三维重建网络基于自主构建的室内全景三维数据集Realsee3D进行训练。该网络能够利用获取的稀疏多视角全景图像快速重建出完整、一致且具有度量尺度的三维场景。目录摘要一、全景3D重建与数据集二、预备知识全景图几何分解三、方法架构与流程1. 参考帧选择Learning to Select Reference View2. 逆对数变换公式的含义3.损失函数实验标题Argus: Metric Panoramic 3D Reconstruction for Indoor ScenesRealsee, China 2 Quanzhou University of Information Engineering, China摘要针对全景数据的度量前馈三维重建方法由于缺乏大规模全景 RGBD 训练数据而尚未得到充分研究。我们提出了Realsee3D——一个包含1万个室内场景其中1千个为真实场景9千个为合成场景的混合数据集该数据集拥有29.9万个全景视点及精确的度量标注同时我们还开发了Argus——一个基于该数据集训练的前馈网络用于进行度量全景三维重建。在Realsee3D的稀疏无序捕获环境下选择不当的坐标锚点可能导致全局位姿漂移。Argus通过引入一个学习型共可见性模块来解决这一问题该模块能够选择几何上最优的参考视图作为度量世界坐标系的锚点。为进一步提升多任务学习效果我们将双向像素到世界坐标系的映射过程分解为多个可解释的子步骤每个子步骤均设有监督机制和跨坐标联合约束从而强化不同预测分支之间的几何一致性。在Realsee3D基准测试中Argus在相机位姿估计、深度估计和点云重建方面均取得了最先进的度量性能。一、全景3D重建与数据集前馈方法的快速发展表明高质量的三维数据集是稳健的前馈三维重建的基础。然而大多数大规模室内RGB-D数据集均基于透视投影[构建导致全景度量重建领域在专用训练数据和标准化基准方面存在关键空白。现有的全景三维数据集如Matterport3D和Stanford2D3D主要作为单目深度估计和语义分割等任务的评估基准但其规模有限且标注方案难以支持基于学习的多视图度量重建。因此全景单目深度估计方法通常需借助从基于大规模透视图像预训练的基础模型如DepthAnything V2进行迁移学习。为推进这一尚未充分探索的领域我们提出了Realsee3D——一个具备精确度量标注的大规模多视图全景RGB-D数据集可支持前馈全景重建模型的训练与评估并能灵活扩展至包括深度补全、新视角合成及具身智能在内的下游任务。二、预备知识全景图几何分解图3单视图的像素至世界坐标双向变换三、方法架构与流程图2Argus框架。首先通过Covisibility Transformer选择最优参考帧随后利用基于参考帧的Geometry Transformer对多视图几何特征进行聚合最后构建多个预测分支以生成中间几何分解表示从而支持多任务学习。网络流程模型基于 DINOv2 提取无序全景图特征依次通过 Covisibility TransformerL c 2 L_c2Lc​2计算共视分数选出参考帧再通过 Geometry TransformerL g 24 L_g24Lg​24回归相机位姿9维3D 平移、4D 四元数旋转、2个置信度分数及深度/点云图。激活函数约束深度头采用exp ⁡ ( ⋅ ) \exp(\cdot)exp(⋅)保证正性点云图头采用逆对数变换f ( x ) sign ( x ) ⋅ ( exp ⁡ ( ∣ x ∣ ) − 1 ) f(x) \text{sign}(x) \cdot (\exp(\vert{}x\vert{}) - 1)f(x)sign(x)⋅(exp(∣x∣)−1)处理宽动态范围的 3D 坐标所有置信度值均通过1 exp ⁡ ( ⋅ ) 1 \exp(\cdot)1exp(⋅)激活以保证下界为 1。参考帧选择(Learning to Select Reference View)通过预计算图像对的共视分数构建全局共视矩阵利用 Dijkstra 算法选择最优参考视图。采用二元交叉熵BCE损失进行监督。1. 参考帧选择Learning to Select Reference View在多视角全景图三维重建任务中选择一个合适的主参照帧Reference Frame对于整个几何对齐和位姿估计至关重要。全局共视矩阵建立Global Covisibility Matrix Construction通过网络计算所有全景图对之间的局部共视得分Covisibility Score构建出一个N × N N \times NN×N的全局共视矩阵M \mathbf{M}M。矩阵中的元素M i , j \mathbf{M}_{i, j}Mi,j​代表图像I i I_iIi​和I j I_jIj​之间的空间重叠与共视程度。图路径优化Dijkstra’s Algorithm Route Optimization为了找到全局最优的中心参考帧模型将全局共视矩阵转换为图结构节点为视角边权为共视程度的倒数或距离。应用 Dijkstra 算法 计算每个节点到其他所有节点的最佳路径与可达性选择能够使整个数据集/场景全局共视关系最强、连接最紧密Max Global Covisibility的图像I \mathcal{I}I作为最优参考帧I ^ \hat{\mathcal{I}}I^。交叉熵监督训练BCE Supervised Training在训练阶段模型将预测的共视 LogitsC ^ ∈ R N \hat{\mathbf{C}} \in \mathbb{R}^NC^∈RN与由真实位姿和深度算出的 One-hot 独热标签C ∈ R N \mathbf{C} \in \mathbb{R}^NC∈RN进行对比采用二元交叉熵损失监督。推理阶段的置换等价性Permutation Equivalence in Inference在推理时直接通过argmax \text{argmax}argmax操作挑选出共视得分最高的视图作为参考帧I ^ \hat{\mathcal{I}}I^。由于argmax \text{argmax}argmax具有置换等价性参考帧的选择完全独立于输入的顺序。2. 逆对数变换公式的含义3D 点云图头部Point Map Head使用的逆对数变换公式为 (x xx表示网络直接回归输出的原始数值f ( x ) f(x)f(x)为映射后得到的真实 3D 空间坐标值)f ( x ) sign ( x ) ⋅ ( exp ⁡ ( ∣ x ∣ ) − 1 ) f(x) \text{sign}(x) \cdot (\exp(\vert{}x\vert{}) - 1)f(x)sign(x)⋅(exp(∣x∣)−1)解决大动态范围问题Handling Wide Dynamic Range室内及全景场景中的 3D 坐标数值跨度极大从零点几米到数十米不等。通过指数函数exp ⁡ ( ∣ x ∣ ) \exp(\vert{}x\vert{})exp(∣x∣)神经网络内部预测较小的数值区间x xx经过指数拉伸后可以无缝覆盖并拟合极大的真实三维空间物理坐标。保证原点连续性与零点映射Zero-Preserving Continuity减去1 11即exp ⁡ ( ∣ x ∣ ) − 1 \exp(\vert{}x\vert{}) - 1exp(∣x∣)−1是为了保证当网络输出x 0 x0x0时映射后的 3D 坐标f ( 0 ) exp ⁡ ( 0 ) − 1 0 f(0) \exp(0) - 1 0f(0)exp(0)−10避免了原点偏移。保持对称性与符号不变Sign Preservation由于 3D 坐标系X , Y , Z X, Y, ZX,Y,Z包含正负方向引入符号函数sign ( x ) \text{sign}(x)sign(x)和绝对值∣ x ∣ \vert{}x\vert{}∣x∣可以确保变换关于原点奇对称正坐标保持正数拉伸负坐标保持负数拉伸且正负方向的数值缩放尺度完全一致。3.损失函数实验实验细节。使用AdamW优化器对训练损失进行优化共进行了99K次迭代来训练Argus模型。我们采用余弦学习率调度器其峰值学习率为5e−5预热阶段为9.9K次迭代。对于每个批次数据从随机训练场景中随机抽取2至28个视图。由于各场景内视图间的共可见性邻接矩阵已预先计算完成我们确保在训练过程中所抽取的视图之间存在连通性。此外我们将真实数据集和合成数据集均按9:1的场景级比例随机划分为训练集和测试集。鉴于ERP全景图像的像素分布不均匀极点区域的像素利用率极低。我们首先将全景图像、深度图及点云地图调整至560×280分辨率随后分别裁剪顶部与底部各15%的像素最终获得560×196的分辨率。我们还对视图施加了随机色彩抖动、高斯模糊及灰度增强等数据增强操作。此外对每个全景视点的输入数据施加绕Y轴的随机旋转这可对应于ERP图像中的水平像素偏移从而增强视点航向角的多样性。我们设定α0.2作为所有置信度损失项中正则化项的权重系数。整个训练过程在配备141GB显存的24块H20 GPU上运行耗时36小时。为确保训练稳定性我们采用了阈值为1.0的梯度范数截断技术并利用bfloat16精度及梯度检查点机制以提升GPU内存利用率与计算效率。所有评估任务均在单块H20 GPU上完成。#pic_center 70%x80%d \sqrt{d}d​1 8 \frac {1}{8}81​x ˉ \bar{x}xˉD ^ \hat{D}D^I ~ \tilde{I}I~ϵ \epsilonϵϕ \phiϕ∏ \prod∏a b c \sqrt{abc}abc​∑ a b c \sum{abc}∑abc/ $$E \mathcal{E}E

相关新闻

叙事控制力基准测试(NCB):当所有模型都卡在同一个地方,问题就不在模型

叙事控制力基准测试(NCB):当所有模型都卡在同一个地方,问题就不在模型

叙事控制力基准测试(NCB):当所有模型都卡在同一个地方,问题就不在模型 声明:本文所述基准、评分协议及失败模式分析,均基于对当前主流大语言模型架构的理论推演得出。文中所有数据、阈值、消融结论均为推演…

2026/9/26 6:00:45 阅读更多 →
Flutter对象相等性优化:鸿蒙平台适配与性能提升

Flutter对象相等性优化:鸿蒙平台适配与性能提升

1. 项目背景与核心价值 在Flutter跨平台开发中,对象相等性比较是一个高频需求场景。equatable_annotations作为Dart生态中广受欢迎的三方库,通过注解驱动的方式实现了编译时安全的对象相等性自动校验,避免了开发者手动覆写 运算符和 hash…

2026/9/20 17:07:16 阅读更多 →
SpringBoot+Vue社区帮扶系统开发实战与优化

SpringBoot+Vue社区帮扶系统开发实战与优化

1. 项目概述:社区帮扶系统的技术架构与价值 这个基于SpringBootVue的社区帮扶对象管理系统,是我去年为本地社工机构开发的一套数字化解决方案。系统采用前后端分离架构,前端使用Vue3Element Plus构建响应式界面,后端基于SpringBoo…

2026/9/27 23:12:54 阅读更多 →

最新新闻

Oracle数据库平滑迁移至国产数据库实战指南

Oracle数据库平滑迁移至国产数据库实战指南

1. 项目背景与核心问题梳理干数据库这块的人,这两年应该都有同一个体感:Oracle 替换这件事,已经从“要不要做”变成了“怎么做”。我接手这个项目的时候,客户的核心诉求就一句话——把跑了好几年的 Oracle 数据库平滑地换掉&#…

2026/9/30 20:56:02 阅读更多 →
政务热线工单分类:DeepSeek本地部署与推理优化实战

政务热线工单分类:DeepSeek本地部署与推理优化实战

简介:这份PDF文档面向政务信息化从业者、数据分析人员及对DeepSeek落地应用感兴趣的开发者,聚焦民生诉求分类模型的完整部署实践。文档共23页,以1个PDF文件交付,压缩包约1.9MB,内容完整、目录清晰,涵盖背景…

2026/9/30 20:56:02 阅读更多 →
基于DeepSeek的政务热线工单分类:本地部署与效果调优实战

基于DeepSeek的政务热线工单分类:本地部署与效果调优实战

简介:这份PDF文档面向政务信息化从业者、数据分析人员及希望将大模型落地于公共服务的开发者,聚焦民生诉求数据的智能分类难题。文档以DeepSeek模型为核心,系统讲解从数据采集、清洗、标注到模型训练、优化、部署及系统集成的完整链路&#x…

2026/9/30 20:56:02 阅读更多 →
Claude2提示词工程实战:50个高级Prompts让工作逆天提效

Claude2提示词工程实战:50个高级Prompts让工作逆天提效

简介:这份资源是面向职场人士与效率提升爱好者的Claude2高级提示词合集,以docx文档形式收录50条可直接套用的Prompts,覆盖个人时间管理、团队协作、项目规划与自动化工作流等场景。每条提示词均给出中英双语表述,并预留「学习新技…

2026/9/30 20:56:02 阅读更多 →
面向代码助手 Agent 的 Harness 语法树注入:用 TaoToken 统一 Key 打通 AST 上下文链路

面向代码助手 Agent 的 Harness 语法树注入:用 TaoToken 统一 Key 打通 AST 上下文链路

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/30 20:56:02 阅读更多 →
vue-quill-editor深度解析:从Delta语义化到Vue3原生集成

vue-quill-editor深度解析:从Delta语义化到Vue3原生集成

1. 为什么 Vue 项目里非得用 vue-quill-editor?——从“能用”到“真好用”的认知跃迁最近帮三个不同行业的团队重构内容管理系统,发现一个特别有意思的现象:所有团队最初都默认选了vue-quill-editor,但其中两个团队在上线前一周紧…

2026/9/30 20:54:57 阅读更多 →

日新闻

Base64 图片头部特征识别:从文件头到格式判断的完整指南

Base64 图片头部特征识别:从文件头到格式判断的完整指南

1. 项目概述:为什么说看懂 base64 图片头部是基本功这几年跟 base64 打交道的机会越来越多,后端接口返回图片、前端渲染验证码、小程序里存小图、还有一些老系统导出报表,动不动就给你一段长到怀疑人生的 base64 字符串。很多人拿到字符串就直…

2026/9/30 0:00:35 阅读更多 →
Java公交站牌广告管理系统:JSP+Servlet+MySQL实战落地指南

Java公交站牌广告管理系统:JSP+Servlet+MySQL实战落地指南

简介:本资源是一份面向Java初学者与课程设计学生的公交站牌广告灯箱管理系统毕业设计文档,聚焦城市公共广告资源信息化管理痛点,提供从需求分析到技术实现的完整方案。文档采用标准学术论文结构,含摘要、英文摘要、目录及五章正文…

2026/9/30 0:00:35 阅读更多 →
用 Redis Lua 构建大模型 API 多租户原子配额治理体系

用 Redis Lua 构建大模型 API 多租户原子配额治理体系

我去年年底接了一个内部 AI 平台的治理需求,背景很直接:公司把 DeepSeek、MiniMax 这类大模型 API 统一封装成内部网关,开放给几个业务团队用。结果第一个月账单出来,额度直接超了 4 倍。仔细查日志,发现原因并不复杂—…

2026/9/30 0:00:35 阅读更多 →

周新闻

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解 【免费下载链接】spirula-studio Cross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA. 项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio Sp…

2026/9/30 13:14:22 阅读更多 →
SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南 模板网站太丑不够用?别急着加滤镜,那是治标不治本。很多老板盯着后台流量掉得眼红,却还在纠结首页Banner的圆角是不是3像素。这就像穿着西装去挖土,姿势不对,努力白费。我整理这份 速查手册…

2026/9/30 18:13:06 阅读更多 →
FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏 【免费下载链接】FireRed-OpenStoryline FireRed-OpenStoryline is an AI video editing agent that transforms manual editing into intention-driven directing through natural language …

2026/9/30 13:14:49 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/29 19:29:29 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/29 5:58:00 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/30 15:27:04 阅读更多 →