【前馈三维重建】Argus:室内场景的可度量全景三维重建
图1Argus是一个前馈式三维重建网络基于自主构建的室内全景三维数据集Realsee3D进行训练。该网络能够利用获取的稀疏多视角全景图像快速重建出完整、一致且具有度量尺度的三维场景。目录摘要一、全景3D重建与数据集二、预备知识全景图几何分解三、方法架构与流程1. 参考帧选择Learning to Select Reference View2. 逆对数变换公式的含义3.损失函数实验标题Argus: Metric Panoramic 3D Reconstruction for Indoor ScenesRealsee, China 2 Quanzhou University of Information Engineering, China摘要针对全景数据的度量前馈三维重建方法由于缺乏大规模全景 RGBD 训练数据而尚未得到充分研究。我们提出了Realsee3D——一个包含1万个室内场景其中1千个为真实场景9千个为合成场景的混合数据集该数据集拥有29.9万个全景视点及精确的度量标注同时我们还开发了Argus——一个基于该数据集训练的前馈网络用于进行度量全景三维重建。在Realsee3D的稀疏无序捕获环境下选择不当的坐标锚点可能导致全局位姿漂移。Argus通过引入一个学习型共可见性模块来解决这一问题该模块能够选择几何上最优的参考视图作为度量世界坐标系的锚点。为进一步提升多任务学习效果我们将双向像素到世界坐标系的映射过程分解为多个可解释的子步骤每个子步骤均设有监督机制和跨坐标联合约束从而强化不同预测分支之间的几何一致性。在Realsee3D基准测试中Argus在相机位姿估计、深度估计和点云重建方面均取得了最先进的度量性能。一、全景3D重建与数据集前馈方法的快速发展表明高质量的三维数据集是稳健的前馈三维重建的基础。然而大多数大规模室内RGB-D数据集均基于透视投影[构建导致全景度量重建领域在专用训练数据和标准化基准方面存在关键空白。现有的全景三维数据集如Matterport3D和Stanford2D3D主要作为单目深度估计和语义分割等任务的评估基准但其规模有限且标注方案难以支持基于学习的多视图度量重建。因此全景单目深度估计方法通常需借助从基于大规模透视图像预训练的基础模型如DepthAnything V2进行迁移学习。为推进这一尚未充分探索的领域我们提出了Realsee3D——一个具备精确度量标注的大规模多视图全景RGB-D数据集可支持前馈全景重建模型的训练与评估并能灵活扩展至包括深度补全、新视角合成及具身智能在内的下游任务。二、预备知识全景图几何分解图3单视图的像素至世界坐标双向变换三、方法架构与流程图2Argus框架。首先通过Covisibility Transformer选择最优参考帧随后利用基于参考帧的Geometry Transformer对多视图几何特征进行聚合最后构建多个预测分支以生成中间几何分解表示从而支持多任务学习。网络流程模型基于 DINOv2 提取无序全景图特征依次通过 Covisibility TransformerL c 2 L_c2Lc​2计算共视分数选出参考帧再通过 Geometry TransformerL g 24 L_g24Lg​24回归相机位姿9维3D 平移、4D 四元数旋转、2个置信度分数及深度/点云图。激活函数约束深度头采用exp ⁡ ( ⋅ ) \exp(\cdot)exp(⋅)保证正性点云图头采用逆对数变换f ( x ) sign ( x ) ⋅ ( exp ⁡ ( ∣ x ∣ ) − 1 ) f(x) \text{sign}(x) \cdot (\exp(\vert{}x\vert{}) - 1)f(x)sign(x)⋅(exp(∣x∣)−1)处理宽动态范围的 3D 坐标所有置信度值均通过1 exp ⁡ ( ⋅ ) 1 \exp(\cdot)1exp(⋅)激活以保证下界为 1。参考帧选择(Learning to Select Reference View)通过预计算图像对的共视分数构建全局共视矩阵利用 Dijkstra 算法选择最优参考视图。采用二元交叉熵BCE损失进行监督。1. 参考帧选择Learning to Select Reference View在多视角全景图三维重建任务中选择一个合适的主参照帧Reference Frame对于整个几何对齐和位姿估计至关重要。全局共视矩阵建立Global Covisibility Matrix Construction通过网络计算所有全景图对之间的局部共视得分Covisibility Score构建出一个N × N N \times NN×N的全局共视矩阵M \mathbf{M}M。矩阵中的元素M i , j \mathbf{M}_{i, j}Mi,j​代表图像I i I_iIi​和I j I_jIj​之间的空间重叠与共视程度。图路径优化Dijkstra’s Algorithm Route Optimization为了找到全局最优的中心参考帧模型将全局共视矩阵转换为图结构节点为视角边权为共视程度的倒数或距离。应用 Dijkstra 算法 计算每个节点到其他所有节点的最佳路径与可达性选择能够使整个数据集/场景全局共视关系最强、连接最紧密Max Global Covisibility的图像I \mathcal{I}I作为最优参考帧I ^ \hat{\mathcal{I}}I^。交叉熵监督训练BCE Supervised Training在训练阶段模型将预测的共视 LogitsC ^ ∈ R N \hat{\mathbf{C}} \in \mathbb{R}^NC^∈RN与由真实位姿和深度算出的 One-hot 独热标签C ∈ R N \mathbf{C} \in \mathbb{R}^NC∈RN进行对比采用二元交叉熵损失监督。推理阶段的置换等价性Permutation Equivalence in Inference在推理时直接通过argmax \text{argmax}argmax操作挑选出共视得分最高的视图作为参考帧I ^ \hat{\mathcal{I}}I^。由于argmax \text{argmax}argmax具有置换等价性参考帧的选择完全独立于输入的顺序。2. 逆对数变换公式的含义3D 点云图头部Point Map Head使用的逆对数变换公式为 (x xx表示网络直接回归输出的原始数值f ( x ) f(x)f(x)为映射后得到的真实 3D 空间坐标值)f ( x ) sign ( x ) ⋅ ( exp ⁡ ( ∣ x ∣ ) − 1 ) f(x) \text{sign}(x) \cdot (\exp(\vert{}x\vert{}) - 1)f(x)sign(x)⋅(exp(∣x∣)−1)解决大动态范围问题Handling Wide Dynamic Range室内及全景场景中的 3D 坐标数值跨度极大从零点几米到数十米不等。通过指数函数exp ⁡ ( ∣ x ∣ ) \exp(\vert{}x\vert{})exp(∣x∣)神经网络内部预测较小的数值区间x xx经过指数拉伸后可以无缝覆盖并拟合极大的真实三维空间物理坐标。保证原点连续性与零点映射Zero-Preserving Continuity减去1 11即exp ⁡ ( ∣ x ∣ ) − 1 \exp(\vert{}x\vert{}) - 1exp(∣x∣)−1是为了保证当网络输出x 0 x0x0时映射后的 3D 坐标f ( 0 ) exp ⁡ ( 0 ) − 1 0 f(0) \exp(0) - 1 0f(0)exp(0)−10避免了原点偏移。保持对称性与符号不变Sign Preservation由于 3D 坐标系X , Y , Z X, Y, ZX,Y,Z包含正负方向引入符号函数sign ( x ) \text{sign}(x)sign(x)和绝对值∣ x ∣ \vert{}x\vert{}∣x∣可以确保变换关于原点奇对称正坐标保持正数拉伸负坐标保持负数拉伸且正负方向的数值缩放尺度完全一致。3.损失函数实验实验细节。使用AdamW优化器对训练损失进行优化共进行了99K次迭代来训练Argus模型。我们采用余弦学习率调度器其峰值学习率为5e−5预热阶段为9.9K次迭代。对于每个批次数据从随机训练场景中随机抽取2至28个视图。由于各场景内视图间的共可见性邻接矩阵已预先计算完成我们确保在训练过程中所抽取的视图之间存在连通性。此外我们将真实数据集和合成数据集均按9:1的场景级比例随机划分为训练集和测试集。鉴于ERP全景图像的像素分布不均匀极点区域的像素利用率极低。我们首先将全景图像、深度图及点云地图调整至560×280分辨率随后分别裁剪顶部与底部各15%的像素最终获得560×196的分辨率。我们还对视图施加了随机色彩抖动、高斯模糊及灰度增强等数据增强操作。此外对每个全景视点的输入数据施加绕Y轴的随机旋转这可对应于ERP图像中的水平像素偏移从而增强视点航向角的多样性。我们设定α0.2作为所有置信度损失项中正则化项的权重系数。整个训练过程在配备141GB显存的24块H20 GPU上运行耗时36小时。为确保训练稳定性我们采用了阈值为1.0的梯度范数截断技术并利用bfloat16精度及梯度检查点机制以提升GPU内存利用率与计算效率。所有评估任务均在单块H20 GPU上完成。#pic_center 70%x80%d \sqrt{d}d​1 8 \frac {1}{8}81​x ˉ \bar{x}xˉD ^ \hat{D}D^I ~ \tilde{I}I~ϵ \epsilonϵϕ \phiϕ∏ \prod∏a b c \sqrt{abc}abc​∑ a b c \sum{abc}∑abc/ $$E \mathcal{E}E

相关新闻

叙事控制力基准测试(NCB):当所有模型都卡在同一个地方,问题就不在模型

叙事控制力基准测试(NCB):当所有模型都卡在同一个地方,问题就不在模型

叙事控制力基准测试(NCB):当所有模型都卡在同一个地方,问题就不在模型 声明:本文所述基准、评分协议及失败模式分析,均基于对当前主流大语言模型架构的理论推演得出。文中所有数据、阈值、消融结论均为推演…

2026/8/11 8:04:50 阅读更多 →
Flutter对象相等性优化:鸿蒙平台适配与性能提升

Flutter对象相等性优化:鸿蒙平台适配与性能提升

1. 项目背景与核心价值 在Flutter跨平台开发中,对象相等性比较是一个高频需求场景。equatable_annotations作为Dart生态中广受欢迎的三方库,通过注解驱动的方式实现了编译时安全的对象相等性自动校验,避免了开发者手动覆写 运算符和 hash…

2026/8/11 8:04:50 阅读更多 →
SpringBoot+Vue社区帮扶系统开发实战与优化

SpringBoot+Vue社区帮扶系统开发实战与优化

1. 项目概述:社区帮扶系统的技术架构与价值 这个基于SpringBootVue的社区帮扶对象管理系统,是我去年为本地社工机构开发的一套数字化解决方案。系统采用前后端分离架构,前端使用Vue3Element Plus构建响应式界面,后端基于SpringBoo…

2026/8/11 8:04:50 阅读更多 →

最新新闻

众诚评级纪念钞服务流程是啥?一文说清

众诚评级纪念钞服务流程是啥?一文说清

“我手里有张建国50周年纪念钞,想送评但不知道选哪家机构,TPG泰平评级靠谱吗?”最近,一位藏友在社区论坛的提问,戳中了不少纪念钞收藏者的痛点新手到底该怎么选? 其实,这背后藏着两个关键问题&a…

2026/8/11 9:00:11 阅读更多 →
实战指南:基于国产大模型API构建企业级AI助手服务

实战指南:基于国产大模型API构建企业级AI助手服务

最近在技术社区看到不少关于国产AI模型性能突破的讨论,尤其是Kimi Chat的K3版本,其展现出的长上下文处理、代码生成和逻辑推理能力,让许多开发者感到惊喜。作为长期关注AI应用落地的技术博主,我决定深入探究一下,如何将…

2026/8/11 9:00:11 阅读更多 →
Python内置模块实战技巧与常见陷阱解析

Python内置模块实战技巧与常见陷阱解析

1. Python内置模块概述 Python作为一门"自带电池"的编程语言,其标准库中内置了数百个实用模块,这些模块无需额外安装即可直接使用。我在实际开发中发现,熟练掌握常用内置模块能显著提升编码效率,减少重复造轮子的情况。…

2026/8/11 9:00:11 阅读更多 →
雷军再出牌:小米澎程增程SUV 25.99万起,昆仑架构杀入理想腹地

雷军再出牌:小米澎程增程SUV 25.99万起,昆仑架构杀入理想腹地

小米汽车在7月30日晚的北京技术发布会上,发布了第二套整车技术底座——小米昆仑技术架构,并同步推出全新序列"SKYNOMAD小米澎程"。两款智能可变大空间增程SUV开启小订:大五座四驱的澎程N70 MAX预售价25.99万元,大七座旗…

2026/8/11 9:00:10 阅读更多 →
从OpenAI Astra事件看AI网络安全能力:原理、风险与开发实践

从OpenAI Astra事件看AI网络安全能力:原理、风险与开发实践

最近在 AI 领域,一则关于 OpenAI 暂停其 Astra 模型开发的消息引发了广泛讨论。据称,暂停的原因是该模型在内部测试中展现出了超出预期的“关键”网络安全能力。这并非简单的功能迭代,而是触及了 AI 安全与伦理的敏感地带。对于开发者、安全研…

2026/8/11 9:00:10 阅读更多 →
Kotlin开发实战:高频痛点解析与避坑指南

Kotlin开发实战:高频痛点解析与避坑指南

1. 从“Hello World”到“What the Hell”:Kotlin开发中的高频痛点 干了这么多年安卓和后台开发,从Java全面转向Kotlin也有四五年了。Kotlin这语言,用起来是真香,空安全、扩展函数、协程,哪一样都让人回不去。但香归香…

2026/8/11 8:59:10 阅读更多 →

日新闻

如何用Video2X实现专业级视频画质提升:AI视频增强完整指南

如何用Video2X实现专业级视频画质提升:AI视频增强完整指南

如何用Video2X实现专业级视频画质提升:AI视频增强完整指南 【免费下载链接】video2x A machine learning-based video super resolution and frame interpolation framework. Est. Hack the Valley II, 2018. 项目地址: https://gitcode.com/GitHub_Trending/vi/v…

2026/8/11 0:00:02 阅读更多 →
前后端分离项目中控制台与接口工具数据差异排查指南

前后端分离项目中控制台与接口工具数据差异排查指南

1. 问题现象解析:控制台与Apifox的数据差异 最近在调试一个前后端分离项目时,遇到了一个典型问题:后端服务在本地开发环境控制台能正常输出查询数据,但通过Apifox测试时却返回空结果。这种"控制台有数据,接口工具…

2026/8/11 0:00:03 阅读更多 →
AI编程实战:从Claude Code踩坑到游戏开发入门

AI编程实战:从Claude Code踩坑到游戏开发入门

1. 从“AI能帮我做游戏”到“AI让我重新学编程”最近身边不少朋友,尤其是一些非技术背景、但对游戏开发有浓厚兴趣的朋友,都在问我同一个问题:“听说现在用Claude Code这种AI编程工具,小白也能做游戏了,是真的吗&#…

2026/8/11 0:00:03 阅读更多 →

周新闻

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁 【免费下载链接】baidupankey 在线查询网盘提取码(维护中 rm repo) 项目地址: https://gitcode.com/gh_mirrors/ba/baidupankey 你是否曾经在深夜寻找一份重要资料&#x…

2026/8/11 1:08:05 阅读更多 →
如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/11 1:08:05 阅读更多 →
收藏!小白程序员轻松入门大模型,从Harness工程开始实践

收藏!小白程序员轻松入门大模型,从Harness工程开始实践

文章强调学习大模型不应只关注模型本身,而应重视模型外的系统搭建,即Harness。提出AgentModelHarness的实用公式,详细介绍Harness的四个层次:持久化层、执行层、控制层和观察与验证层。文章还探讨了上下文工程、工具设计、AGENTS.…

2026/8/11 1:08:05 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/10 17:07:33 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/11 1:08:06 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/10 17:07:33 阅读更多 →