精读笔记10_PointCLIP
【3D点云暑期学习】精读笔记(10)PointCLIP —— 把 CLIP 借到 3D研0暑期进组学习 · 3D点云多模态方向 · 论文精读系列第 10 篇论文信息标题PointCLIP: Point Cloud Understanding by CLIP作者Renrui Zhang, Ziyu Guo, et al.发表 venueCVPR 2022阅读日期2026 年 7 月写在前面前面两篇PointNet / PointNet踩实了 3D 点云的基础但它们都有一个共同的、绕不开的前提模型必须在大规模带标注的 3D 数据上从零训练。这恰恰是点云领域最大的痛点数据稀缺ModelNet40 只有 9,843 个样本、40 类而 CLIP 用的 ImageNet 有 100 万样本、1000 类。3D 标注极其昂贵根本喂不出高质量预训练unseen 类别真实场景不断冒出新物体。PointNet 训得再好遇到训练集里没见的类别也只能干瞪眼而每次重训成本高得离谱。反观 2D 视觉CLIP用 4 亿图文对做对比学习学出了图像 ↔ 自然语言的对齐能力能**零样本zero-shot**认没见过的类。于是论文抛出一个灵魂问题CLIP 在 2D 上学到的知识能不能直接迁移到 3D 点云上实现跨模态的零样本识别PointCLIP 的回答是可以而且几乎不需要任何 3D 训练。它用多视角深度图投影把点云伪装成 CLIP 能看的图片把 2D 预训练知识高效地借到了 3D。这是我们从在 3D 里造轮子转向向 2D 大模型借知识的第一个关键拐点。一、3D 数据为什么这么饿经典 3D 网络PointNet / PointNet需要 3D 全量标注训练本质是在 3D 里从零学。而 PointCLIP 只在 2D 图文对上预训练无需任何 3D 训练即可直接做零样本分类——这中间的鸿沟就是它要解决的模态桥梁问题。数据饥渴的根源在于3D 点云标注要靠人工逐点/逐物体标成本是指数级的而 2D 图文对可以从互联网海量爬取。所以思路很清楚——既然 3D 数据少、标注贵那干脆绕开 3D 结构建模用投影把点云变成 CLIP 能看的图片直接借用 2D 的开放语义。二、怎么把点云伪装成 CLIP 能看的图整条流水线可以拆成三块理解模态桥梁左把 3D 点云投影成 M 个视角的 2D 深度图让 CLIP 视觉编码器能直接使用双塔编码中用 CLIP 预训练视觉编码器提每个视角特征用文本编码器把类别名变成零样本分类器视角聚合 可选 Adapter右各视角预测分数加权求和少样本场景再叠一个轻量 Inter-view Adapter 优化。关键姿态CLIP 的两个编码器全程冻结零样本时一个参数都不训少样本时也只训一个小小的 Adapter彻底避免 3D 数据不够导致的过拟合。步骤 1 的投影细节借鉴 SimpleView在线把原点云投影到图像平面不做离线渲染、不上色。以底视图为例点( x , y , z ) (x,y,z)(x,y,z)投影到图像平面位置( ⌈ x / z ⌉ , ⌈ y / z ⌉ ) (\lceil x/z\rceil, \lceil y/z\rceil)(⌈x/z⌉,⌈y/z⌉)像素值直接取深度z zz并复制到 RGB 三通道——连 SimpleView 那种 1 层卷积都不用。默认从6 个正交视角投影前/右/后/左/上/下最后上采样到( 224 , 224 ) (224,224)(224,224)对齐 CLIP 输入。这一步开销几乎可忽略却把 3D 点云伪装成了 CLIP 能理解的多张 2D 图。三、CLIP 双塔怎么用视觉分支用 CLIP 预训练视觉编码器默认 ResNet-50提取 M 个视角特征f i ∈ R 1 × C f_i \in \mathbb{R}^{1\times C}fi​∈R1×C文本分支把 K 个类别名塞进模板point cloud depth map of a [CLASS].用 CLIP 文本编码器得到零样本分类器权重W t ∈ R K × C W_t \in \mathbb{R}^{K\times C}Wt​∈RK×C每行编码一个类别的预训练语义。每个视角独立算分类 logits再加权求和logits i f i W t T , logits ∑ i 1 M α i logits i \text{logits}_i f_i W_t^T,\quad \text{logits} \sum_{i1}^M \alpha_i\,\text{logits}_ilogitsi​fi​WtT​,logitsi1∑M​αi​logitsi​其中α i \alpha_iαi​是视角重要性超参ModelNet40 上设成 3,9,5,4,5,4。每个视角自带一份片面理解加权求和后互补成整体理解。整个过程对 3D 数据集完全无参数、无训练。四、零样本精度不够怎么办零样本虽然惊艳但 ModelNet40 仅 20.18%打不过全监督 3D 网络。论文挂了个三层的残差式 MLPInter-view Adapter专门针对少样本拼接多视角特征把 M 个视角特征沿通道拼成Concat ( f 1 ∼ M ) ∈ R 1 × M C \text{Concat}(f_{1\sim M}) \in \mathbb{R}^{1\times MC}Concat(f1∼M​)∈R1×MC提取全局表征f g l o b a l ReLU ( Concat W 1 T ) W 2 T f_{global} \text{ReLU}(\text{Concat}\,W_1^T)W_2^Tfglobal​ReLU(ConcatW1T​)W2T​残差式注入每视角f i a f i ReLU ( f g l o b a l W 3 i T ) f_i^a f_i \text{ReLU}(f_{global}W_{3i}^T)fia​fi​ReLU(fglobal​W3iT​)把新学的 3D 少样本知识融进预训练 CLIP。训练时只微调这个 Adapter冻结 CLIP 双塔避免参数太多、样本太少导致过拟合。效果极显著ModelNet40 上仅用每类 16 个样本不到全量 1/10精度从 20.18% 飙到87.20%。五、和全监督 3D 网络是替代还是互补惊喜结论互补而且一融合反而变强。PointCLIP 学的是 CLIP 的 2D 对比开放语义经典 3D 网络PointNet 等学的是 3D 封闭集监督二者知识来源正交。推理时直接把两者 logits 相加logits f i n a l logits 3 D - n e t λ ⋅ logits P o i n t C L I P \text{logits}_{final} \text{logits}_{3D\text{-}net} \lambda \cdot \text{logits}_{PointCLIP}logitsfinal​logits3D-net​λ⋅logitsPointCLIP​而两个同训练范式的全监督模型简单融合只会掉点——证明互补性才是关键。这就是前人铺路后人借力的范式PointCLIP 在推理期还能白嫖 PointNet 等的预测做知识互补式集成。六、实验亮点① 零样本分类完全无 3D 训练数据集零样本精度类别越难越真实ModelNet1030.23%—ModelNet4020.18%—ScanObjectNN15.38%含真实噪声最难② 少样本分类接 Inter-view Adapter16-shot ModelNet40 从零样本 20.18% 跃升到87.20%在 1/2/4/8/16-shot 下全面超越 PointNet / PointNet / SimpleView / CurveNet1-shot 时比 PointNet 高 25.49%、比 CurveNet 高 12.29%。③ 多知识集成增益16-shot PointCLIP 增强全监督网络模型集成前集成后增益PointNet88.7890.761.98PointNet89.7192.102.39CurveNet (SOTA)93.8494.080.24RSCNN / DGCNN / SimpleView——0.20~0.64④ Prompt 设计的影响ModelNet40 零样本Prompt精度“a photo of a [CLASS].”朴素17.02%主语换成 “point cloud”1.66%加形容词 “big”19.21%“point cloud depth map of a [CLASS].”最贴合投影图20.18%说明提示词prompt的选择对零样本精度影响很大——投影图本质是深度图prompt 必须贴合模态。七、个人思考局限性PointCLIP 牺牲了显式的 3D 几何建模能力换来极致的数据效率。零样本精度有限20.18%且3D 几何推理弱于全监督方法——它靠多视角 2D CNN 隐式抓局部没有真正的点云几何结构。另外它主要针对分类分割等稠密任务未涉及。与 3D 点云主线的联系这是**2D → 3D 知识迁移的第一个成功尝试**对后续整个 3D 多模态主线是思想雏形ULIP 的直接前身ULIP 用 CLIP 预训练的图像/文本编码器当老师引导 3D 编码器对齐到统一空间——PointCLIP 已经证明了CLIP 图文对齐空间能借给 3DUni3D 的 2D 初始化思路Uni3D 用 2D 预训练 ViT 做 3D 编码器既然 3D 数据少就向 2D 大模型借的范式PointCLIP 是第一个吃螃蟹的工程套路可复用多视角投影 即插即用集成是后续 3D 多模态方法常用的低成本蹭 2D 大模型手段。可改进点零样本精度低能否用更强的 2D 基础模型如 ViT-L/14 的 CLIP提升能否把投影换成更保几何信息的表示这些正是 ULIP-2、Uni3D 后续要去填的坑。下周我们就进 ULIP / ULIP-2。本周系列博文精读笔记(9)PointNet — 层次化局部建模精读笔记(10)PointCLIP — 把 CLIP 借到 3D ← 当前对比学习(3)点云方法对比PointNet/PointNet/PointCLIP周报(3)第三周学习总结

相关新闻

Qt HTTP Server 嵌入式开发指南:从原理到实战应用

Qt HTTP Server 嵌入式开发指南:从原理到实战应用

1. 项目概述:为什么我们需要一个嵌入式的 Qt HTTP Server? 在桌面应用、嵌入式设备或者工业控制软件的开发中,我们常常会遇到一个需求:如何让我们的程序能够被外部轻松地访问和控制?传统的做法可能是写一个复杂的Socke…

2026/8/16 15:49:30 阅读更多 →
C++/Qt面试项目实战指南:从工程能力到架构设计

C++/Qt面试项目实战指南:从工程能力到架构设计

1. 项目概述:为什么C/Qt面试需要项目支撑? 最近几年,无论是校招还是社招,C方向的面试越来越“卷”。面试官早已不满足于你背熟了“八股文”,他们更想看到的是你如何将C、Qt这些技术栈,真正地应用到解决实际…

2026/8/19 17:38:31 阅读更多 →
三色标注法:用gInk打造高效屏幕协作工作流

三色标注法:用gInk打造高效屏幕协作工作流

三色标注法:用gInk打造高效屏幕协作工作流 【免费下载链接】gInk An easy to use on-screen annotation software inspired by Epic Pen. 项目地址: https://gitcode.com/gh_mirrors/gi/gInk 在当今数字化工作环境中,如何快速清晰地表达想法、标注…

2026/8/16 14:55:44 阅读更多 →

最新新闻

手机存储扩容新思路|四款主流云盘工具功能实测与对比

手机存储扩容新思路|四款主流云盘工具功能实测与对比

一、前言当下手机高清影像、原创素材、办公文档与社交缓存数据持续增长,设备自带的本地存储空间很容易出现容量不足的情况,影响日常存储与使用体验。更换大容量设备、硬件拆机扩容存在成本高、硬件改动风险大的问题,云端软件扩容凭借无需改动…

2026/8/21 9:01:48 阅读更多 →
AI视频生成技术拆解:Seedance类模型在企业内容生产中的工程化实践

AI视频生成技术拆解:Seedance类模型在企业内容生产中的工程化实践

作为长期做AIGC应用落地的工程师,这一年被业务方问得最多的问题是:"AI视频生成能不能接进我们的内容生产流程?"答案是能,但坑不少。这篇文章从工程视角拆解Seedance类视频生成模型在企业场景下的落地实践。 一、Seedanc…

2026/8/21 9:01:48 阅读更多 →
国内外标准文献免费查询及下载攻略——国标 行标 团体标,国际标准 国外标准,全搞定,建议收藏

国内外标准文献免费查询及下载攻略——国标 行标 团体标,国际标准 国外标准,全搞定,建议收藏

文章目录前言一、国内官方免费标准平台1. 国家标准信息公共服务平台2. 全国标准信息公共服务平台3. 分行业专属免费标准网站二、国际 / 国外标准官方渠道1. ISO 国际标准化组织官网2. IEC 国际电工委员会3. 欧美常用行业标准官网三、第三方网站1. 国内常用的第三方网站2. 国外的…

2026/8/21 9:01:48 阅读更多 →
线性规划实战:从模型构建到求解分析,掌握数学建模核心优化方法

线性规划实战:从模型构建到求解分析,掌握数学建模核心优化方法

1. 从“拍脑袋”到“算出来”:线性规划在数学建模中的核心价值如果你参加过数学建模比赛,或者在工作中处理过资源分配、生产计划这类问题,大概率听过“线性规划”这个词。很多人的第一印象是:一堆数学公式,看着就头疼。…

2026/8/21 9:01:48 阅读更多 →
2026求职趋势:微证书化与人机协同面试解析

2026求职趋势:微证书化与人机协同面试解析

1. 求职市场变局:从"金三银四"到"全年备战" 2026年的求职市场早已不是我们熟悉的模样。记得五年前,每到春节后,"金三银四"的招聘旺季总会如期而至,求职者们摩拳擦掌准备简历,HR们忙着筛…

2026/8/21 9:01:48 阅读更多 →
PFTrack 2017 Windows版下载与详细安装指南(含图文步骤+实操视频教程)

PFTrack 2017 Windows版下载与详细安装指南(含图文步骤+实操视频教程)

温馨提示:文末有联系方式 PFTrack 2017 Windows专业版全面介绍 PFTrack 2017是业界公认的高精度三维摄像机反求与动态物体跟踪解决方案,专为影视后期、VFX特效合成及动态匹配需求深度优化,支持Windows平台稳定运行。 一键直达:高…

2026/8/21 9:00:48 阅读更多 →

日新闻

机场边检旅客定位系统国产化白皮书:算法、硬件、底座平台全程自主

机场边检旅客定位系统国产化白皮书:算法、硬件、底座平台全程自主

前言随着国家数字基础设施信创替代、关键技术自主可控战略持续深化,口岸智慧安防、边检智能管控领域正全面进入国产化、自主化、安全可控升级周期。当前国内机场边检旅客识别与定位体系长期依赖国外商用视觉算法、进口成像硬件、闭源通用计算平台,存在核…

2026/8/21 0:00:42 阅读更多 →
别再把“数字孪生”当空间智能了!镜像视界揭开四维时空的真正面纱

别再把“数字孪生”当空间智能了!镜像视界揭开四维时空的真正面纱

别再把“数字孪生”当空间智能了!镜像视界揭开四维时空的真正面纱当下数字化建设浪潮中,很多项目将三维可视化、视频贴图叠加的数字孪生等同于空间智能。传统数字孪生更多停留在三维场景复刻,擅长把物理世界“画出来、展示出来”,…

2026/8/21 0:00:42 阅读更多 →
105、车载温度范围-40°C到85°C的影像质量一致性——ISP参数温漂补偿与产线标定策略

105、车载温度范围-40°C到85°C的影像质量一致性——ISP参数温漂补偿与产线标定策略

105、车载温度范围-40C到85C的影像质量一致性——ISP参数温漂补偿与产线标定策略 去年冬天在北方某车厂做A样评审,凌晨四点的黑河试验场,零下三十三度。客户拿了一台冷启动的车,中控屏上倒车影像全是雪花噪点,暗部细节直接糊成一片。我第一反应是sensor温度没上来,暗电流…

2026/8/21 0:00:42 阅读更多 →

周新闻

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

如果你是一名开发者,最近可能已经感受到了AI大模型正在从“玩具”变成“生产力工具”的强烈信号。从代码补全到智能Agent,从本地部署到云端API,我们正处在一个技术栈快速重构的节点。然而,面对层出不穷的模型、框架和工具&#xf…

2026/8/21 3:21:33 阅读更多 →
工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/21 0:02:09 阅读更多 →
【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

2026/8/21 6:07:56 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/20 6:11:08 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/20 21:46:49 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/21 0:14:22 阅读更多 →