【CVPR 2025】ImagineFSL 论文解读:想象基集上的自监督预训练,VLM 少样本学习新范式|从少样本学习专家视角
摘要本文解读 CVPR 2025Highlight论文《ImagineFSL: Self-Supervised Pretraining Matters on Imagined Base Set for VLM-based Few-shot Learning》。该论文提出ImagineFSL一种基于想象基集iBase自监督预训练的 CLIP 少样本学习新范式通过融合高阶矩表示HoM-DINO、掩码图像建模MIM与思维链上下文学习合成管线CoTICL先把合成图像当作独立知识仓库进行预训练再在少样本任务上微调其特别之处在于把文生图补充升级为独立知识仓库。实验表明11 个数据集全面刷新 SOTA少样本平均 79.9%、16-shot 84.4%、LoRA 变体 87.6%为数据稀缺场景下的视觉语言模型适应提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机少样本学习的数据稀缺困境为什么合成图当补充不是最优解研究主线从问题到结论基准/方法设计两阶段架构预训练 微调关键发现自监督优于监督分类全景方法细节HoM-DINO为少样本定制的自监督目标可扩展合成管线CoT ICL实验设计与结果评测协议合成图方法对比1/16-shot 平均精度 %仅用真实图的 K-shot 对比平均精度 %域泛化、零样本与效率关键消融1/16-shot 平均 %结果对比总结关键发现局限性常见问题FAQImagineFSL 与 DISEF、DataDream 有什么区别为什么自监督预训练优于监督预训练HoM-DINO 比 DINO 强在哪里合成图像质量对结果影响大吗ImagineFSL 需要多少额外参数本论文有 arXiv 预印本吗参考链接论文基本信息项目内容标题英文ImagineFSL: Self-Supervised Pretraining Matters on Imagined Base Set for VLM-based Few-shot Learning标题中文想象基集上的自监督预训练VLM 少样本学习作者Haoyuan Yang, Xiaoou Li, Jiaming Lv, Xianjun Cheng, Qilong Wang, Peihua Li机构大连理工大学 · 北京邮电大学 · 天津大学会议CVPR 2025HighlightarXiv无本论文无 arXiv 预印本项目网站https://peihuali.org/ImagineFSL背景与动机少样本学习的数据稀缺困境少样本学习FSL旨在从极少量标注样本中识别新概念一直是计算机视觉的热点。然而FSL 面临的根本矛盾是标签数据稀缺标注成本高、长尾类别样本少CLIP 等视觉语言模型VLM虽有零样本能力但在少样本场景下仍受数据不足制约。为什么合成图当补充不是最优解近年来文生图T2I模型可以生成海量逼真的标注图像看似为 FSL 提供了数据出路。但现有方法存在系统性局限DISEFarXiv:2312.03046用 LLaVA 描述少样本真实图再输入 T2I 生成配合 LoRA 微调DataDreamECCV 2024用真实图微调 T2I 模型为每个数据集定制生成器IsSynthICLR 2023用 T5 生成多样化描述。这三类方法有一个共同问题只把合成图当作真实图的补充直接混合进微调阶段。论文作者指出合成图来自独立基础模型LLMT2I应被当作独立的知识仓库而非附属品——这正是 ImagineFSL 的核心动机。研究主线从问题到结论图 1ImagineFSL 研究主线从数据稀缺问题到自监督预训练范式再到全面 SOTA。基准/方法设计两阶段架构预训练 微调ImagineFSL 的核心是两阶段 CLIP 适应预训练阶段在纯合成图像基集iBase上用自监督方法HoM-DINO训练适配器学生-教师双分支 EMA冻结 CLIP 图像编码器微调阶段保留教师适配器丢弃头部与学生分支附加视觉V分类器与视觉-语言VL分类器损失为 $L_V L_{VL}$推理时按融合权重平均 logits。图 2HoM-DINO 自监督预训练SyntAug 构造正对高阶矩表示 掩码图像建模双头EMA 教师更新。关键发现自监督优于监督论文通过消融证实相比无预训练监督预训练SL与自监督预训练Self-SL都有益但 Self-SL 显著更好1-shot/16-shot 平均 2.3%/1.1%。这意味着从合成域到真实域的表示迁移自监督学习学到的特征更具泛化性。图 3少样本微调阶段视觉与视觉-语言双分类器联合训练LoRA 进一步微调图像编码器。分类全景图 4CLIP 适应方法谱系ImagineFSL 开辟先在合成基集预训练、再微调的两阶段范式。方法细节HoM-DINO为少样本定制的自监督目标DINO 只看 [CLS] token忽略了 patch token。HoM-DINO的关键创新是建模patch 分布的高阶矩表示 $r \phi\circ\theta(x) \triangleq [\text{CLS};\ m_1;\ m_2;\ m_3]$4p 维其中 $m_1$ 为分布中心$m_2$、$m_3$ 为归一化的二阶、三阶矩SyntAug同一 caption 由 T2I 生成的两张合成图构成正对语义一致且自然多样优于手工增强MIM随机掩码 patch学生重建教师预测强化 patch 级判别总损失 $L L_{\text{HoM}} L_{\text{MIM}}$均为 KL 散度自蒸馏无负样本、无大 batch 依赖。可扩展合成管线CoT ICL合成数据从哪来论文设计了系统性管线GPT-4 思维链CoT分析识别五个图像描述因子——属性attribute、视角viewpoint、背景BG、光照LC、退化原因CD设计四种描述模式Llama 3 8B 上下文学习ICL以 GPT-4 示例为上下文本地大规模扩写描述温度 0.5、核采样 0.7Stable Diffusion 3 Medium 出图构建 SyntIN1KImageNet-1K 类名每概念 300 描述 × 4 图基集。图 5合成管线CoT 提升保真度FID 40.1→32.6ICL 保证多样性1.06→1.21。实验设计与结果评测协议在11 个基准数据集ImageNet、Caltech、Aircraft、Cars、Food、Pets、Flowers、DTD、EuroSAT、SUN、UCF101上评测少样本与零样本识别域泛化用 ImageNet 训练 16-shot测试 V2/Sketch/A/R 四个目标集。每数据集采样 3 个 All-way-K-shot 任务取平均精度主模型为 CLIP ViT-B/16。合成图方法对比1/16-shot 平均精度 %方法类型1-shot16-shot平均IsSynth补充合成图73.881.777.8CaFo补充合成图71.581.776.6DISEF补充LoRA--85.1--DataDream微调T2I--87.0--ImagineFSL两阶段75.884.180.0ImagineFSL$_{LoRA}$两阶段LoRA77.387.582.4共享同一批合成数据时ImagineFSL 平均超复现基线2.0%LoRA 变体 16-shot 达87.5%全面超过 DISEF85.1与 DataDream87.0。仅用真实图的 K-shot 对比平均精度 %方法1-shot2-shot4-shot8-shot16-shotCoOp67.670.874.076.880.0PromptSRC72.375.378.480.782.9CLIP-LoRA72.575.577.480.383.0GalLoP72.876.479.182.284.5ImagineFSL76.177.579.482.284.4ImagineFSL$_{LoRA}$77.679.181.984.287.6少样本越多优势越大1-shot 超 CLIP-LoRA3.6%16-shot 1.4%LoRA 变体各 shot 全面领先平均超第二名 GalLoP3.1%。域泛化、零样本与效率域泛化16-shotImagineFSL / LoRA 平均62.7% / 63.2%刷新 IN-Sketch53.8%与 IN-R80.0%双 SOTA零样本识别平均72.3% / 73.0%超 DMN70.51.8%/2.5%LoRA 在 11 个数据集中 7 个第一训练效率LoRA 变体训练2 倍快265ms vs DISEF 544ms、显存减半11.8G vs 20.6G参数仅占 5.89%。关键消融1/16-shot 平均 %设置1-shot16-shot无预训练真实图58.175.6无预训练混合合成图62.276.5监督预训练SL63.176.8HoM-DINOSelf-SL65.477.9Self-SL 方法对比DINOv263.3/77.2、SynCLR64.4/77.4、MAE61.9/76.3、HoM-DINO65.4/77.9——HoM-DINO 全面胜出。结果对比总结图 6三大评测维度的提升幅度少样本 3.1%、零样本 2.5%、自监督对比 2.1%。关键发现视角转变带来范式级提升把合成图从补充升级为独立知识仓库 iBase少样本平均精度达79.9%全面超越单阶段方法自监督预训练 监督预训练HoM-DINO 在 1-shot/16-shot 超 SL2.3%/1.1%合成到真实域的迁移性更强HoM-DINO 超越主流自监督方法超 DINOv22.1%/0.7%、SynCLR1.0%/0.5%、MAE 显著高阶矩 MIM SyntAug 三者缺一不可合成管线可扩展且高质量CoT 把 FID 从 40.1 降到32.6多样性从 1.06 提升到1.21轻量且高效仅5.08% 额外参数适配器即可刷新 SOTALoRA 变体训练速度快2 倍、显存减半随模型规模扩展换 ViT-L/14 后 1-shot 精度5.9%72.8%方法对大 CLIP 模型有持续增益。局限性预训练开销SyntIN1K 预训练约9 小时 / 4 张 RTX 4090ViT-B/16ViT-L/14 约 40 小时——虽然一次训练多任务复用仍有成本门槛合成描述未充分利用冻结编码器下数据规模增大出现性能饱和0.3M→0.45M 提升趋缓合成文本知识的潜力尚未挖尽依赖生成模型质量GPT-4 与 Llama 的生成质量直接决定合成数据上限闭源模型有成本与可复现性考量。作者展望换用更大 CLIP 模型带来显著增益合成数据在数据稀缺任务上值得进一步探索。常见问题FAQImagineFSL 与 DISEF、DataDream 有什么区别区别在于范式。DISEF、DataDream 是单阶段方法把合成图直接混入微调ImagineFSL 是两阶段方法先在纯合成基集 iBase 上自监督预训练适配器再微调下游任务把合成图当作独立知识仓库。为什么自监督预训练优于监督预训练监督预训练用类标签训练学到的特征偏向于区分 iBase 类别自监督预训练HoM-DINO学习通用的分布统计与局部结构从合成域到真实域的表示迁移性更强实验上 1-shot/16-shot 分别高2.3%/1.1%。HoM-DINO 比 DINO 强在哪里DINO 只用 [CLS] tokenHoM-DINO 额外建模patch token 分布的一/二/三阶矩并用掩码图像建模强化 patch 级判别用SyntAug同一 caption 的两张合成图构造视图——三者组合让它在 1-shot/16-shot 上超 DINOv22.1%/0.7%。合成图像质量对结果影响大吗非常大。论文用 CoT 思维链优化描述生成FID 从 40.1 降到32.6、多样性从 1.06 升到1.21更好的合成数据直接带来更优的少样本性能这也是管线设计GPT-4 分析因子 Llama 扩写的核心价值。ImagineFSL 需要多少额外参数基础版只需在冻结 CLIP 编码器上附加适配器参数占编码器总参数的5.08%LoRA 变体额外微调图像编码器占 5.89%训练速度仍比 DISEF/DataDream 快2 倍、显存减半。本论文有 arXiv 预印本吗没有。ImagineFSLCVPR 2025 Highlight无 arXiv 预印本官方项目网站为 https://peihuali.org/ImagineFSL注意 arXiv:2312.03046 是另一篇论文 DISEF不要混淆。参考链接项目网站https://peihuali.org/ImagineFSLDINO 自监督学习Caron et al., ICCV 2021https://arxiv.org/abs/2104.14294DISEFDiversified In-domain SynthesisarXiv:2312.03046https://arxiv.org/abs/2312.03046DataDreamECCV 2024https://arxiv.org/abs/2403.18807SynCLRTian et al., CVPR 2024https://arxiv.org/abs/2401.13868Tip-AdapterECCV 2022https://arxiv.org/abs/2111.03930给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件

相关新闻

构建完全离线的AI开发环境:核心组件与实战指南

构建完全离线的AI开发环境:核心组件与实战指南

1. 为什么需要完全离线的AI开发环境?在AI技术快速发展的今天,绝大多数开发者都习惯了依赖云端服务和网络连接来完成模型训练与应用开发。但真实业务场景中,我们经常会遇到以下几种典型情况:军工、金融等涉密机构的数据处理需求&am…

2026/8/17 2:38:59 阅读更多 →
解决Java连接Oracle数据库ZHS16GBK字符集不支持问题

解决Java连接Oracle数据库ZHS16GBK字符集不支持问题

1. 项目概述:当Oracle字符集遇上Java应用如果你正在开发一个连接Oracle数据库的Java应用,尤其是在处理中文数据时,很可能在某个深夜被这样一个错误信息惊醒:“不支持的字符集:ZHS16GBK”。这个错误看似简单&#xff0c…

2026/8/17 2:37:59 阅读更多 →
构建高效软件项目文档体系:从PRD到交付的全流程实战指南

构建高效软件项目文档体系:从PRD到交付的全流程实战指南

1. 从“文档地狱”到“项目利器”:一份真正能用的开发文档体系干了十几年软件项目,从一线码农到带团队、管交付,我见过太多项目栽在文档上。要么是项目启动时雄心勃勃搞了一堆模板,最后都成了压箱底的废纸;要么是临近交…

2026/8/17 2:37:59 阅读更多 →

最新新闻

大模型预训练新范式:从Token Zero开始的对齐方法探索

大模型预训练新范式:从Token Zero开始的对齐方法探索

这次我们来看一个名为“Synthetic Persona Pretraining: Alignment from Token Zero”的研究项目。它不是一个新的图像生成模型,也不是一个可以直接下载运行的软件包,而是一种旨在从模型训练的最初阶段(即“Token Zero”)就融入对…

2026/8/17 3:11:05 阅读更多 →
2026年AiPPT制作全攻略:学术汇报从3天缩到3小时

2026年AiPPT制作全攻略:学术汇报从3天缩到3小时

开题要 PPT、答辩要 PPT、组会汇报还要 PPT——对学生和科研人来说,做 PPT 的痛苦不亚于写论文本身。光是调模板、对齐文本框、找配图,一个晚上就没了,内容反而没时间打磨。2026 年 AiPPT 制作工具已经相当成熟,但很多人还停留在「…

2026/8/17 3:11:05 阅读更多 →
2026年宽带选择指南:三大运营商对比与300M/500M/1000M套餐实测分析

2026年宽带选择指南:三大运营商对比与300M/500M/1000M套餐实测分析

1. 先搞清楚“封神级”宽带到底在比什么一提到“封神级”宽带,很多人第一反应就是“千兆”、“万兆”这些数字。但实测下来,数字大不等于体验好。真正决定你上网感受的,是几个更具体的指标:晚高峰稳定性、游戏延迟、跨网访问速度、…

2026/8/17 3:11:05 阅读更多 →
因果状态绑定:提升语言智能体行动控制能力的关键机制

因果状态绑定:提升语言智能体行动控制能力的关键机制

1. 项目概述:当语言智能体学会“因果绑定”最近在跟进语言智能体(Language Agents)的研究时,一个概念反复被提及,那就是“因果状态绑定”(Causal State Binding)。乍一听,这像是一个…

2026/8/17 3:11:05 阅读更多 →
JavaScript Promise 异步编程全解析:从基础概念到实战避坑指南

JavaScript Promise 异步编程全解析:从基础概念到实战避坑指南

1. 从“回调地狱”到异步编程的救赎:为什么我们需要Promise如果你写过一段时间的JavaScript,尤其是处理过网络请求、文件读写或者定时任务,那你一定对“回调地狱”(Callback Hell)这个词不陌生。代码一层套一层&#x…

2026/8/17 3:11:05 阅读更多 →
【FortiOS 8.0】❀ 15. 阻止同网段有线设备互相访问 ❀ FortiGate 防火墙

【FortiOS 8.0】❀ 15. 阻止同网段有线设备互相访问 ❀ FortiGate 防火墙

【简介】虽然可以利用VLAN将网络分割成多个小网段,避免中招电脑扩散到整个网络,但是由于整个小网段是可以互相访问的,还是存在安全隐患,那有没有办法阻止相同VLAN内设备互相访问呢?验证VLAN流量是否到达防火墙首先我们…

2026/8/17 3:10:05 阅读更多 →

日新闻

LabVIEW异步调用实战:从原理到生产者消费者模式,解决界面卡顿与并行处理难题

LabVIEW异步调用实战:从原理到生产者消费者模式,解决界面卡顿与并行处理难题

1. 项目概述:为什么异步调用是LabVIEW进阶的必修课? 如果你用LabVIEW做过稍微复杂点的项目,尤其是涉及界面响应、多任务并行或者硬件IO等待的场景,大概率遇到过这样的窘境:前面板点个按钮,整个程序就“卡死…

2026/8/17 0:00:08 阅读更多 →
LabVIEW异步调用实战:解决界面卡顿与并行处理难题

LabVIEW异步调用实战:解决界面卡顿与并行处理难题

1. 项目概述:为什么异步调用是LabVIEW进阶的必经之路如果你在LabVIEW里写过稍微复杂点的程序,尤其是涉及到界面响应、多任务并行或者硬件IO等待,大概率会遇到一个头疼的问题:程序“卡”住了。前面板点不动,进度条不更新…

2026/8/17 0:00:08 阅读更多 →
飞书局域网文件传输实战:3种方案实现高速点对点传输

飞书局域网文件传输实战:3种方案实现高速点对点传输

1. 项目概述:为什么要在局域网内用飞书传文件? 飞书作为一款主流的协同办公套件,其核心功能是围绕云端协作设计的。无论是文档、表格还是文件,通常的分享逻辑都是“上传到云端 -> 生成链接 -> 分享给同事”。这个流程在互联…

2026/8/17 0:00:08 阅读更多 →

周新闻

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

如果你是一名开发者,最近可能已经感受到了AI大模型正在从“玩具”变成“生产力工具”的强烈信号。从代码补全到智能Agent,从本地部署到云端API,我们正处在一个技术栈快速重构的节点。然而,面对层出不穷的模型、框架和工具&#xf…

2026/8/17 2:58:27 阅读更多 →
工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/17 2:58:30 阅读更多 →
【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

2026/8/17 2:58:32 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/16 6:00:23 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/16 6:00:24 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/16 6:00:27 阅读更多 →