零样本立体深度估计实战指南:FoundationStereo 从环境搭建到三维重建的完整流程
零样本立体深度估计实战指南FoundationStereo 从环境搭建到三维重建的完整流程【免费下载链接】FoundationStereo[CVPR 2025 Best Paper Nomination] FoundationStereo: Zero-Shot Stereo Matching项目地址: https://gitcode.com/gh_mirrors/fo/FoundationStereo提到深度估计很多人第一反应是单目方案——只用一张图猜深度。但真正能在无人驾驶、机器人抓取这类任务中稳定输出带真实尺度的三维信息的往往是立体视觉路线用左右两个摄像头同时拍摄利用视角差异推算出场景中每个像素的远近。传统立体匹配模型有个通病——换一个场景就得重新微调泛化能力差。而 FoundationStereo 正是冲着这个痛点来的它是一款面向零样本立体深度估计的基础模型输入一对双目图像即可直接输出稠密视差图进而转换为带真实尺度的深度图与三维点云无需任何场景定制。这项来自 NVIDIA 的工作拿下了 CVPR 2025 的口头报告席位并获最佳论文提名是目前零样本立体匹配领域绕不开的标杆。先认识它一双经过大规模训练的眼睛视差是什么不妨用两只眼睛来理解当你用双眼看前方左右眼接收到的画面其实略有差异——手指放近一点两眼看到的错位就越明显。这种同一物体在左右画面中的横向位置差就叫视差disparity。视差越大物体离你越近视差趋近于零说明物体在无穷远处。立体匹配算法所做的就是逐像素地把左图和右图对齐找出每一个点的视差值最终拼成一张完整的视差图。零样本的底气从哪来绝大多数立体模型只在特定数据集上表现良好换个拍摄风格就水土不服。FoundationStereo 之所以能直接泛化到新场景靠的是三件事大规模合成训练集FSD 数据集构建了约 100 万对高真实感、高多样性的合成立体图像对覆盖室内、桌面、道路等大量场景为模型提供了足够丰富的见识。自动自校准管道合成数据里难免有遮挡、模糊等歧义样本团队用一套自动化的自筛选流程把它们剔除避免模型学到错误信号。架构上的精心设计引入侧调优side-tuning特征骨干把 DINOv2 等视觉基础模型里丰富的单目先验嫁接到立体任务上缩小合成域到真实域的差距同时用长程上下文推理对成本体积做有效过滤让视差估计在纹理稀疏的区域也足够稳健。图 1FSD 数据集样例左图为左视图中图为右视图右图为模型输出的视差可视化颜色越暖代表距离越近这套组合拳的成效也直接反映在榜单上项目目前位居 Middlebury 与 ETH3D 两个国际立体匹配排行榜的首位这在不做场景微调的情况下尤为难得。动手前如何配置运行环境并准备预训练模型硬件需求先对齐FoundationStereo 需要 GPU 才能高效推理官方在 3090、4090、A100、V100 以及 Jetson Orin 上都做过测试。显存是主要瓶颈——大分辨率图像会更吃显存如果遇到显存不足先试试降低输入分辨率而不是直接放弃。另外模型依赖 FlashAttention 加速记得单独安装。三步装好环境环境安装走 conda 比较省心按下面的顺序执行即可git clone https://gitcode.com/gh_mirrors/fo/FoundationStereo conda env create -f environment.yml conda run -n foundation_stereo pip install flash-attn conda activate foundation_stereo这里有个小提示flash-attn必须单独安装否则在创建环境的过程中可能报错中断这也是官方 FAQ 里被问得最多的问题之一。下载权重并放到约定位置项目提供两套零样本推理权重按需二选一权重骨干网络特点23-51-11ViT-Large精度最高通用场景首选11-33-40ViT-Small精度略降但推理更快下载后把整个文件夹例如23-51-11放进./pretrained_models/目录即可。如果你有商用需求官方还提供基于小模型的商业授权版本NVIDIA TAO可以按需评估。第一次运行一对图像、一条命令、三份输出先检查输入图像是否合规输入是一对经过校正rectified的立体图像即左右图像之间不能有鱼眼类畸变极线应当保持水平。一般从 Zed、RealSense 这类双目相机直接导出的画面已经做过这步处理。另外请注意左右图像分辨率要一致推荐用无损压缩的 PNG 格式不要调换左右图左图必须来自左侧相机否则视差方向会整体反掉模型对 RGB 彩色图效果最佳但官方也验证过它在单目灰度或红外立体图上如 RealSense D4XX 系列同样可用。图 2项目自带的示例输入左视图对应的右视图位于assets/right.png二者构成一对已校正的立体图像跑通官方 demo环境就绪、权重就位后一条命令即可完成推理python scripts/run_demo.py --left_file ./assets/left.png --right_file ./assets/right.png --ckpt_dir ./pretrained_models/23-51-11/model_best_bp2.pth --out_dir ./test_outputs/运行结束后--out_dir目录下会出现三类产物理解它们有助于你快速判断结果好坏vis.png左图与视差可视化的横向拼接图直观看到每帧的深度分布depth_meter.npy以米为单位的稠密深度图可直接用于后续几何计算cloud.ply由深度图反投影生成的三维点云可用 Open3D 打开。命令行里还有大量可调参数全部参数说明可以通过python scripts/run_demo.py --help查看。如果你的图像分辨率很高超过 1000px建议开启--hiera 1分层推理以保留全分辨率深度若更看重速度则可用--scale 0.5降采样输入。看懂结果视差、深度与三维点云的一次换算视差不是深度但它离深度只差一个公式很多初学者会混淆视差图和深度图。简单说视差是模型的原生输出描述左右画面的错位量深度则是物体到相机的真实距离。两者呈反比关系深度 相机焦距 × 双目基线 ÷ 视差其中焦距来自相机内参矩阵 K基线baseline是左右相机光心之间的距离。这就是为什么演示脚本里需要传入一个内参文件——assets/K.txt第一行是展平后的 3×3 内参矩阵第二行是以米为单位的基线长度。拿到你自己的相机标定结果后照这个格式写即可。从深度图到三维点云只差一次反投影有了深度图和相机内参每个像素都能被还原为三维空间中的一个点从而得到点云。项目在 demo 中已把这套逻辑封装好并顺带做了两步优化一是剔除左右视图无重叠区域的不可靠点--remove_invisible二是用半径离群点去除算法做去噪--denoise_cloud。如果你的点云出现空洞或飞点优先从这两个参数入手排查。图 3Open3D 中展示的桌面场景三维点云来自assets/left.png与assets/right.png这对示例输入点云文件cloud.ply是通用格式可无缝导入 Open3D、MeshLab 等工具做后续处理也可以直接在 demo 运行结束后弹窗预览。对机器人抓取、环境重建这类需要看得见物体形状的任务来说这一步输出的正是下游系统最需要的几何数据。让它更快、更准分辨率、迭代次数与 TensorRT 的取舍精度与速度的常用调节旋钮推理脚本暴露了几个直接影响精度/速度比对的参数调参时可以按先调分辨率再调迭代的思路来--scale 0.5输入图像减半显存占用和耗时都明显下降代价是深度分辨率随之降低--valid_iters 16减少前向推理中视差场更新的迭代次数这是最直接的减档方式--hiera 1针对超高清输入的层次化推理拿速度换全分辨率精度适合离线处理大图。想要 6 倍加速试试 TensorRT如果对推理速度有更高要求例如接近实时应用官方推荐的路线是把模型导出为 ONNX再转成 TensorRT FP16 引擎。实测在同样的 RTX 3090 上可以拿到约 6 倍加速具体收益因模型与输入而异。需要提醒的是ONNX/TRT 版本目前只支持 Docker 部署需要先构建镜像再在容器内完成导出与推理具体步骤可参考docker/目录下的构建脚本与readme_jetson.md。Jetson 平台的用户同样可以借助容器方案部署在 Isaac ROS 的开发容器里安装 onnxruntime-gpu 与 onnx-tensorrt再编译或直接使用预编译的 FP16 engine 跑推理边缘设备的实时深度估计由此成为可能。从桌面到道路零样本能力能带你去哪零样本意味着拿到就能用这正好切中了许多场景对深度数据的迫切需求自动驾驶与移动机器人用双目相机实时感知障碍物距离为避障与路径规划提供稠密几何输入机械臂抓取点云级别的三维信息帮助机械臂估计物体的位姿与形状提升抓取成功率增强现实把虚拟物体按真实深度嵌入画面实现更自然的遮挡与交互遥感与测绘从无人机或卫星的立体影像中恢复地表高程生成数字表面模型。如果你手上正好有一对双目相机最直接的上手方式是用相机标定结果生成内参文件把左右视图存成 PNG然后跑一遍上面的 demo看看自己的场景里零样本深度估计的极限在哪里。项目仓库git clone https://gitcode.com/gh_mirrors/fo/FoundationStereo中既有完整的推理与导出脚本也附带可视化数据集的工具从复现到二次开发都有现成的起点。FoundationStereo 用事实证明立体匹配不必再被一场景一模型束缚。无论你是刚接触立体视觉的研究者还是正在为产品寻找稳定深度方案工程师这套开箱即用的零样本立体深度估计工具都值得放进你的工具箱——下一次面对新场景时不必再从头训练。【免费下载链接】FoundationStereo[CVPR 2025 Best Paper Nomination] FoundationStereo: Zero-Shot Stereo Matching项目地址: https://gitcode.com/gh_mirrors/fo/FoundationStereo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

如何在项目中平滑迁移到String.dedent?兼容性与最佳实践

如何在项目中平滑迁移到String.dedent?兼容性与最佳实践

如何在项目中平滑迁移到String.dedent?兼容性与最佳实践 【免费下载链接】proposal-string-dedent TC39 Proposal to remove common leading indentation from multiline template strings 项目地址: https://gitcode.com/gh_mirrors/pr/proposal-string-dedent …

2026/10/4 17:46:20 阅读更多 →
为什么你的 Fight Club 5e 总缺内容?FightClub5eXML 零基础完整配置指南

为什么你的 Fight Club 5e 总缺内容?FightClub5eXML 零基础完整配置指南

为什么你的 Fight Club 5e 总缺内容?FightClub5eXML 零基础完整配置指南 【免费下载链接】FightClub5eXML Creating XML files of all D&D sources compatible with Fight Club 5e and Game Master 5e apps for iOS and Android. 项目地址: https://gitcode.c…

2026/10/9 1:42:38 阅读更多 →
从流水线到安全运营:DevSecOps 度量与持续改进

从流水线到安全运营:DevSecOps 度量与持续改进

系列导读 你现在看到的是《从零到一:DevSecOps 安全流水线建设实战指南》的第 10/10 篇,当前这篇会重点解决:让读者掌握衡量安全流水线成效的方法,并知道如何不断优化,实现安全能力的螺旋上升。 上一篇回顾:第 9 篇《攻防视角:在流水线中引入自动化安全攻防演练(安全…

2026/10/6 19:27:15 阅读更多 →

最新新闻

supabase-postgres-best-practices - schema-partitioning

supabase-postgres-best-practices - schema-partitioning

title: Partition Large Tables for Better Performance impact: MEDIUM-HIGH impactDescription: 5-20x faster queries and maintenance on large tables tags: partitioning, large-tables, time-series, performance 对大表进行分区以获得更好的性能 分区将大表拆分为更小…

2026/10/12 4:36:45 阅读更多 →
litellm实战:统一大模型API网关,解决多厂商接入痛点

litellm实战:统一大模型API网关,解决多厂商接入痛点

如果你同时对接过三家以上大模型厂商的 API,大概率体会过那种“每家都长得差不多,每家都不一样”的憋屈。请求体里的字段名不同、认证方式不同、返回结构不同,甚至同一个模型名在不同平台下的效果也天差地别。以前我的处理方式是在业务代码里…

2026/10/12 4:36:45 阅读更多 →
Apache Beam ZetaSQL 方言详解:语法、数据类型、函数与 BigQuery 兼容实践

Apache Beam ZetaSQL 方言详解:语法、数据类型、函数与 BigQuery 兼容实践

批处理流处理大数据 【免费下载链接】beam Apache Beam is a unified programming model for Batch and Streaming data processing. 项目地址: https://gitcode.com/gh_mirrors/beam15/beam 点击查看 免费下载 本文以 Apache Beam 官方文档中的 Beam ZetaSQL 总览…

2026/10/12 4:36:45 阅读更多 →
supabase-postgres-best-practices - security-rls-performance

supabase-postgres-best-practices - security-rls-performance

title: Optimize RLS Policies for Performance impact: HIGH impactDescription: 5-10x faster RLS queries with proper patterns tags: rls, performance, security, optimization 优化 RLS 策略以提升性能 编写不当的 RLS 策略会导致严重的性能问题。应策略性地使用子查询…

2026/10/12 4:36:45 阅读更多 →
aiogram 实时位置编辑指南:editMessageLiveLocation 方法全方位解析

aiogram 实时位置编辑指南:editMessageLiveLocation 方法全方位解析

后端即时通讯API设计 【免费下载链接】aiogram aiogram is a modern and fully asynchronous framework for Telegram Bot API written in Python using asyncio 项目地址: https://gitcode.com/gh_mirrors/ai/aiogram 点击查看 免费下载 实时位置(Live…

2026/10/12 4:36:45 阅读更多 →
AnyPS5跨平台游戏串流工具:从画面采集到客户端渲染的技术拆解与调优实践

AnyPS5跨平台游戏串流工具:从画面采集到客户端渲染的技术拆解与调优实践

1. 从"AnyPS5"这个名字说起:一个跨平台游戏串流工具的设计初衷第一次看到"AnyPS5"这个命名,我的直觉是:这大概率是一个围绕主机游戏远程游玩场景做的工具类项目。名字里的"Any"暗示了跨平台、跨设备的通用性诉…

2026/10/12 4:35:44 阅读更多 →

日新闻

复古胶片颗粒感噪点合成器:Canvas ImageData 像素高斯杂色注入算法

复古胶片颗粒感噪点合成器:Canvas ImageData 像素高斯杂色注入算法

在数码相机、高清显示屏与现代矢量图形技术高度发达的今天,画面可以做到绝对的锐利、平滑与无瑕。然而,当一张秋日手账插画或拍立得照片过于“平整无瑕”时,往往会散发出一种冰冷生硬的“数码塑料感(Digital Plasticity&#xff0…

2026/10/12 0:00:59 阅读更多 →
活字印刷古籍线装排版:Canvas 竖排文字与栏线自适应算法

活字印刷古籍线装排版:Canvas 竖排文字与栏线自适应算法

在现代网页与移动端设计中,横排(Horizontal Layout)早已经成为了绝对的主流。然而,当我们翻开泛黄的线装古籍、宋版木刻诗集,或是欣赏一张茶道雅集的手写便签时,那种**自上而下纵向书写、自右向左逐列铺展&…

2026/10/12 0:00:59 阅读更多 →
周日晚间的“精神松绑减震器”:无压力情绪倾倒箱与温和轻声陪伴

周日晚间的“精神松绑减震器”:无压力情绪倾倒箱与温和轻声陪伴

每到周日的晚上八点到十点,很多人心里都会悄悄亮起一盏警示灯。 在心理学上,这种现象有一个专门的称谓——“周日夜晚焦虑症(Sunday Scaries)”。明天又是周一,闹钟又要重新在七点响彻卧房;脑海里仿佛有一个…

2026/10/12 0:00:59 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/12 0:16:30 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/12 0:16:38 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/12 0:16:43 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 10:45:37 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:53 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:54 阅读更多 →