《面向地面图像与卫星图像配准的空间智能技术》-CVPR-2026
论文英文题目WRIVINDER: Towards Spatial Intelligence for Geo-locating Ground Images onto Satellite Imagery论文发表期刊/会议CVPR论文发表年份2026年1. 论文核心内容概括解决的问题论文解决了在GPS不可信或存在巨大视角差异的情况下如何准确地将地面图像与地理注册的卫星地图进行对齐的问题。采用的方法提出了Wrivinder框架。这是一种零样本Zero-shot、几何驱动的框架通过聚合多张地面照片重建一致的3D场景并将其与顶视卫星图像对齐。适用范围适用于自主导航、灾难响应、大规模地图绘制以及在GPS受限环境下的态势感知。它不依赖配对的训练数据因此在校园、建筑工地或乡村等缺乏标注数据的场景中表现稳健。2. 数据集情况论文发布了MC-Sat数据集这是首个链接多视图地面图像、SfM/3DGS 重建结果与地理注册卫星背景的数据集。数据来源集成了来自 ULTRAA、VisymScenes、ACC-NVS1 和 JHU-Ames 的地面图像。卫星数据采用了 USDA NAIP分辨率 0.6–1.0 米/像素和 ESRI World Imagery 底图。规模与多样性包含 15 个多视图场景共计约20,000 张地面图像。场景类型图像密度型Image Density图像集中在小型区域如建筑入口用于评估微观几何对齐。重建区域型Reconstructed Area跨越较大空间如校园用于评估远距离重建和对齐性能。3. 主要技术路线1总体概括Wrivinder 弃用了传统的检索范式利用几何重建和度量对齐来推断相机的物理位置。其核心思路是将多视图地面图像重建为 3D 场景生成天顶视图Zenith-view渲染图并将其与卫星图像直接匹配。2分项介绍3D 重建 (SfM 3DGS)输入无序地面图像集。流程首先使用 SfM 求解器如 HLOCCOLMAP估计相机内参、外参和稀疏点云随后使用3D 高斯泼溅3D Gaussian Splatting, 3DGS优化几何与外观。输出稠密且写实的 3D 场景模型。优势相比稀疏点云3DGS 能生成高质量的渲染图减少浮动伪影。天顶视角提取 (Zenith Viewpoint Extraction)输入稀疏 SfM 点云和语义掩码。流程利用 PCA 分析点云几何以确定垂直轴同时使用 Mask2Former 提取地面语义信息如道路、草地拟合地面平面。输出一致的顶视天顶视角参数。优势通过语义增强能更准确地识别可通行地面区域。度量映射器 (Metric Mapper)输入单目深度先验来自 DepthPro 或 PatchFusion。流程估计 SfM 深度与物理深度之间的全局尺度因数 \(s\)计算重建场景的物理足迹宽 \(W_m\)高 \(H_m\)。输出带有物理度量信息的渲染图模板。深度模板匹配器 (Deep Template Matcher, DTM)输入天顶渲染图与卫星图像。流程使用自监督的 ResNet-18 孪生网络预测图像间的 IoU从而确定天顶图在卫星地图中的精确位置。优势测试时自监督无需地面-卫星训练对即可实现稳健配准。地理定位 (Geolocator)流程将匹配得到的像素级对应点反向投影回 3DGS 和 SfM 模型。输出所有地面相机的 GPS 坐标经度、纬度、高度。3损失函数/优化目标DTM 训练采用自监督方式从卫星图像中提取伪地面真值块Pseudo GT Patch Pairs其中一个块经过高斯模糊和亮度扰动以模拟 3DGS 渲染的外观监督网络学习预测两者的IoU。4. 实验结果概括1评价指标平均地理定位均方根误差 (Mean Geolocation RMSE)预测坐标与真值间的平均哈弗斯距离。67% 分位地理定位误差 (67th Percentile RMSE)更稳健的异常值衡量指标。中心点地理定位误差 (Centroid Error)预测中心与真值中心间的距离。运行时间 (Run Time)以分钟为单位的计算开销。2评测结果总体表现在零样本实验中Wrivinder 在致密和大型场景中均实现了亚 30 米sub-30 m的定位精度。性能瓶颈在大范围场景中由于地面无法观测到屋顶等结构渲染图中会出现空隙导致误差升高。运行时间与图像数量呈线性相关SfM 阶段耗时最长。5. 图表描述与解读图1Wrivinder是一个零样本、几何驱动的空间智能框架旨在解决在 GPS 不可靠或存在巨大视角差异的情况下如何将多张无序地面图像精确配准到地理注册卫星地图上的难题。该框架通过SfM稀疏重建与3D 高斯泼溅稠密建模聚合场景信息利用语义感知和单目深度先验估计物理度量尺度从而生成与卫星视角一致的天顶视角渲染图。随后系统采用自监督的深度模板匹配器将渲染图与卫星背景对齐最终实现对地面相机位置的物理坐标推断。配合发布的涵盖 2 万张图像的MC-Sat 数据集Wrivinder 在无需配对训练数据的情况下于校园、工地等复杂户外场景中实现了亚 30 米的定位精度为大规模地图绘制和自主导航提供了稳健的技术路线。图2 展示了论文所提出的MC-Sat 数据集的场景示例通过三个子图直观呈现了地面图像与地理注册卫星切片之间的关联其中(a)展示了来自ULTRAA数据集的场景(b)展示了来自VisymScenes数据集的场景(c)展示了来自JHU AMES数据集的场景。该图体现了该数据集如何将多视图拍摄的地面照片与中心位置的高分辨率卫星底图链接在一起涵盖了不同的环境条件、传感器类型和地理区域为评估零样本及几何驱动的地面与卫星图像配准技术提供了基础。图3 详细展示了Wrivinder这一零样本、免训练系统的总体架构描绘了将地面图像定位到卫星地图上的五个核心技术阶段该流程始于对无序地面图像进行SfM稀疏重建并结合3D 高斯泼溅3DGS生成稠密场景模型4.1随后利用天顶视角提取器确定垂直方向并生成顶视渲染图4.2同时由度量映射器结合单目深度先验恢复物理尺度以确定渲染图的实际尺寸4.3。接着系统通过自监督的深度模板匹配器DTM在测试时将渲染图与地理注册的卫星图像进行精确对齐4.4最后利用高斯泼溅与相机地理定位器将匹配结果反向投影从而输出每个地面相机的经度、纬度和高度坐标。图4 集中展示了Wrivinder框架在执行过程中的关键中间产物直观地呈现了从地面视角到度量天顶模板的转化流程该图包含了输入端的(a) 原始地面图像以及通过 monocular 模型估计的(b) 度量深度图和用于识别地表结构的(c) 语义图。这些信息与(d) SfM 稀疏点云结合生成了能够区分地面与物体的(e) 语义化点云PCD并最终输出带有明确物理尺寸标注如 20m x 10m的(f) 度量天顶渲染图为后续与卫星地图的自监督对齐提供了具备几何一致性和物理比例的高保真 3DGS 模板。图5 展示了多个MC-Sat场景的卫星图像与Wrivinder生成的渲染图对照组具体包括(a) MUTC A09、(b) APL Back Door、(c) siteSTR0059和(d) MUTC A10四个示例。在每组对比中左侧为卫星视图其中散布的蓝色点标示了地面相机的真实地理位置Ground-truth右侧则是对应的3DGS 天顶视角渲染图。该图直观地揭示了重建质量对定位精度的影响明确指出渲染图中出现的空隙、模糊或缺失结构通常由于从地面无法观测到屋顶等高处表面所致会增加对齐的歧义性这也是导致某些场景出现较高定位误差的主要原因。表1 概述了集成到MC-Sat数据集中的原始地面图像源及其核心统计数据详细列出了包括ULTRAA3个场景1,028张地面图像、VisymScenes149个场景25.8万张地面图像、ACC-NVS16个场景14.8万张地面与机载图像和JHU-Ames1个场景1,717张地面与机载图像在内的四个子数据集的具体规模和图像类型。该表反映了 MC-Sat 如何通过整合这些具有地理和几何多样性的多源数据并将其与正射校正的卫星图像如 NAIP 和 ESRI进行配对从而构建起一个涵盖广泛环境条件、传感器类型和拍摄几何的基准测试集用以支持对零样本、几何驱动定位方法的系统评估。表2 详尽列出了Wrivinder框架在MC-Sat基准测试集的 15 个场景下的量化评估结果通过记录每个场景的图像数量、运行时间、反映 SfM 对齐质量的 World2Model RMSE以及包括平均地理定位均方根误差Mean Geolocation RMSE、67% 分位误差和中心点误差在内的多项关键地理定位指标全面衡量了系统在零样本设置下的性能表现。该表涵盖了来自 ULTRAA、VisymScenes、AMES 和 ACC-NVS 数据集的多种场景数据表明系统在图像密度型场景如 APL 门口精度可达约 1.96 米表现优异而在大规模重建区域则面临更高挑战且运行时间与图像数量大致呈线性相关从而为几何驱动的地面与卫星图像配准技术提供了核心的性能基准。

相关新闻

防冻液三年不换?冰点没变,保护可能已经“过期”

防冻液三年不换?冰点没变,保护可能已经“过期”

很多人觉得,防冻液只要不少、不脏、冬天不结冰,就一直能用。甚至有些“老司机”说:“我车六年没换防冻液,照样开得好好的。”但维修厂里因为水箱腐蚀、水泵漏液、暖风水箱堵塞而大修的发动机,不少恰恰是“长期不换防冻…

2026/7/29 22:51:41 阅读更多 →
d2s-editor:暗黑破坏神2存档编辑终极指南 - 5分钟学会免费可视化修改

d2s-editor:暗黑破坏神2存档编辑终极指南 - 5分钟学会免费可视化修改

d2s-editor:暗黑破坏神2存档编辑终极指南 - 5分钟学会免费可视化修改 【免费下载链接】d2s-editor 项目地址: https://gitcode.com/gh_mirrors/d2/d2s-editor 还在为复杂的暗黑2存档修改而头疼吗?d2s-editor是你的完美解决方案!这款基…

2026/7/29 22:51:41 阅读更多 →
数学艺术图案画-曼陀罗(69)

数学艺术图案画-曼陀罗(69)

数学艺术图案画-曼陀罗(69) 本系列曼陀罗图案创制一直以来都是我的最爱。我总是被色彩绚烂和美轮美奂的图案感动。 在前些时候完成了曼陀罗图案系列 6轮既定目标,( 图1)至( 图 60)。…

2026/7/29 22:51:41 阅读更多 →

最新新闻

FireSharp查询技巧:掌握QueryBuilder实现高效数据过滤与排序

FireSharp查询技巧:掌握QueryBuilder实现高效数据过滤与排序

FireSharp查询技巧:掌握QueryBuilder实现高效数据过滤与排序 【免费下载链接】FireSharp An asynchronous cross-platform .Net library for Firebase 项目地址: https://gitcode.com/gh_mirrors/fi/FireSharp FireSharp是一个异步跨平台的.Net Firebase库&a…

2026/7/29 23:03:48 阅读更多 →
Notchi 1.2.2更新日志:新增韩语/越南语支持与性能优化详解

Notchi 1.2.2更新日志:新增韩语/越南语支持与性能优化详解

Notchi 1.2.2更新日志:新增韩语/越南语支持与性能优化详解 【免费下载链接】notchi notch app for claude code & codex 项目地址: https://gitcode.com/gh_mirrors/no/notchi Notchi 1.2.2版本正式发布!本次更新带来了韩语和越南语本地化支持…

2026/7/29 23:03:48 阅读更多 →
5分钟上手libipt:处理器追踪解码的极简入门

5分钟上手libipt:处理器追踪解码的极简入门

5分钟上手libipt:处理器追踪解码的极简入门 【免费下载链接】libipt libipt - an Intel(R) Processor Trace decoder library 项目地址: https://gitcode.com/gh_mirrors/li/libipt libipt是一款强大的Intel Processor Trace(Intel PT&#xff09…

2026/7/29 23:03:48 阅读更多 →
Apollo配置中心开放API实战:自动化配置管理的企业级解决方案

Apollo配置中心开放API实战:自动化配置管理的企业级解决方案

Apollo配置中心开放API实战:自动化配置管理的企业级解决方案 【免费下载链接】apollo Apollo is a reliable configuration management system suitable for microservice configuration management scenarios. 项目地址: https://gitcode.com/gh_mirrors/apoll/a…

2026/7/29 23:03:48 阅读更多 →
解决virtme-ng常见问题:提升性能与稳定性的8个技巧

解决virtme-ng常见问题:提升性能与稳定性的8个技巧

解决virtme-ng常见问题:提升性能与稳定性的8个技巧 【免费下载链接】virtme-ng Quickly build and run kernels inside a virtualized snapshot of your live system 项目地址: https://gitcode.com/gh_mirrors/vi/virtme-ng virtme-ng是一款能够在实时系统的…

2026/7/29 23:03:48 阅读更多 →
adsb_deku核心功能解析:从1090MHz信号到飞机位置的解码魔法

adsb_deku核心功能解析:从1090MHz信号到飞机位置的解码魔法

adsb_deku核心功能解析:从1090MHz信号到飞机位置的解码魔法 【免费下载链接】adsb_deku ✈️ Rust ADS-B decoder tui radar application 项目地址: https://gitcode.com/gh_mirrors/ad/adsb_deku adsb_deku是一个基于Rust语言开发的ADS-B信号解码工具&…

2026/7/29 23:02:48 阅读更多 →

日新闻

【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

一、本文介绍 🔥本文在RT-DETR多模态融合目标检测中引入RLAB残差线性注意力模块,可在不同模态特征交互阶段进行多次残差细化,使可见光、红外等特征在尺度、语义和空间位置上更好对齐;随后将细化特征与解码器输出拼接并生成Q、K、V,通过线性注意力自适应强化关键通道、目…

2026/7/29 0:00:23 阅读更多 →
AI编程系列02:合并知识功能,给 AI 问数和 RAG 场景打基础

AI编程系列02:合并知识功能,给 AI 问数和 RAG 场景打基础

AI编程系列02:合并知识功能,给 AI 问数和 RAG 场景打基础 在上一期「AI编程系列」中,我们学习了如何构建一个基础的 AI 问答系统,通过简单的输入输出让模型回应问题。但现实世界中的 AI 应用往往需要处理更复杂的场景:…

2026/7/29 0:00:23 阅读更多 →
AI智能体开发实战:从工具调用到企业级部署

AI智能体开发实战:从工具调用到企业级部署

1. 从被动问答到主动执行:AI Agent的范式转变过去两年,大语言模型最显著的应用形态是聊天机器人——用户提问,AI回答。但真正的生产力革命发生在2023年下半年:当AI学会主动调用工具完成任务时,生产力工具的历史被彻底改…

2026/7/29 0:00:23 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/29 22:18:20 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/29 14:34:28 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/29 15:00:03 阅读更多 →

月新闻