完整指南:使用vit_base_patch32_clip_384.openai_ft_in12k_in1k生成图像嵌入向量的3种方法
完整指南使用vit_base_patch32_clip_384.openai_ft_in12k_in1k生成图像嵌入向量的3种方法【免费下载链接】vit_base_patch32_clip_384.openai_ft_in12k_in1k项目地址: https://ai.gitcode.com/hf_mirrors/timm/vit_base_patch32_clip_384.openai_ft_in12k_in1kvit_base_patch32_clip_384.openai_ft_in12k_in1k是一个基于Vision TransformerViT架构的图像分类模型由OpenAI使用CLIP在WIT-400M图像文本对上预训练然后在ImageNet-12k和ImageNet-1k数据集上进行微调。该模型不仅可用于图像分类还能高效生成图像嵌入向量助力各种计算机视觉任务。模型基础信息核心参数模型类型图像分类/特征骨干网络参数量88.3M图像尺寸384×384特征维度768通过config.json可知num_features为768预训练数据集WIT-400M、ImageNet-12k方法一移除分类头获取嵌入向量这种方法通过设置num_classes0来移除模型的分类层直接输出特征向量。from urllib.request import urlopen from PIL import Image import timm # 加载图像 img Image.open(urlopen( https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/beignets-task-guide.png )) # 创建模型设置num_classes0移除分类器 model timm.create_model( vit_base_patch32_clip_384.openai_ft_in12k_in1k, pretrainedTrue, num_classes0, # 关键参数移除分类头 ) model model.eval() # 获取模型特定的图像变换 data_config timm.data.resolve_model_data_config(model) transforms timm.data.create_transform(**data_config, is_trainingFalse) # 生成嵌入向量 output model(transforms(img).unsqueeze(0)) # 输出形状为 (batch_size, num_features) print(f嵌入向量维度: {output.shape}) # 应输出 (1, 768)方法二使用forward_features获取中间特征通过调用模型的forward_features方法可以获取未经池化的中间特征适用于需要更细粒度特征的场景。from urllib.request import urlopen from PIL import Image import timm # 加载图像 img Image.open(urlopen( https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/beignets-task-guide.png )) # 创建模型无需移除分类头 model timm.create_model( vit_base_patch32_clip_384.openai_ft_in12k_in1k, pretrainedTrue, ) model model.eval() # 获取图像变换 data_config timm.data.resolve_model_data_config(model) transforms timm.data.create_transform(**data_config, is_trainingFalse) # 获取中间特征未池化 output model.forward_features(transforms(img).unsqueeze(0)) print(f未池化特征维度: {output.shape}) # 输出 (1, 145, 768) # 进一步处理为最终嵌入向量 output model.forward_head(output, pre_logitsTrue) print(f最终嵌入向量维度: {output.shape}) # 输出 (1, 768)方法三结合Hugging Face Transformers库使用如果你熟悉Transformers库也可以通过该库加载模型并生成嵌入向量需确保已安装transformers库。from urllib.request import urlopen from PIL import Image from transformers import ViTImageProcessor, ViTModel # 加载图像处理器和模型 processor ViTImageProcessor.from_pretrained(hf_mirrors/timm/vit_base_patch32_clip_384.openai_ft_in12k_in1k) model ViTModel.from_pretrained(hf_mirrors/timm/vit_base_patch32_clip_384.openai_ft_in12k_in1k) # 加载并预处理图像 img Image.open(urlopen( https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/beignets-task-guide.png )) inputs processor(imagesimg, return_tensorspt) # 生成嵌入向量 with torch.no_grad(): outputs model(**inputs) # 获取[CLS] token对应的特征作为嵌入向量 embedding outputs.last_hidden_state[:, 0, :] print(f嵌入向量维度: {embedding.shape}) # 输出 (1, 768)模型应用场景生成的图像嵌入向量可广泛应用于图像检索通过比较嵌入向量相似度实现相似图像搜索零样本分类结合文本嵌入进行跨模态分类特征提取作为其他下游任务的输入特征迁移学习在小数据集上进行微调以提高性能注意事项图像预处理必须使用模型特定的预处理参数可通过data_config获取包括归一化均值[0.48145466, 0.4578275, 0.40821073]和标准差[0.26862954, 0.26130258, 0.27577711]模型加载确保使用pretrainedTrue加载预训练权重性能优化推理时使用model.eval()和torch.no_grad()提高速度并减少内存占用总结vit_base_patch32_clip_384.openai_ft_in12k_in1k提供了灵活多样的图像嵌入向量生成方法无论是通过timm库的简洁API还是结合Transformers库的丰富功能都能轻松获取高质量的图像特征。这些嵌入向量为计算机视觉任务提供了强大的基础帮助开发者快速构建各类应用。要开始使用该模型可通过以下命令克隆仓库git clone https://gitcode.com/hf_mirrors/timm/vit_base_patch32_clip_384.openai_ft_in12k_in1k【免费下载链接】vit_base_patch32_clip_384.openai_ft_in12k_in1k项目地址: https://ai.gitcode.com/hf_mirrors/timm/vit_base_patch32_clip_384.openai_ft_in12k_in1k创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

合伙做生意没签书面协议,散伙时谁说了算?

合伙做生意没签书面协议,散伙时谁说了算?

一、合伙的起点,往往是风险的起点 不少人合伙做生意,出于情面只做口头约定:谁出多少钱、谁管什么事、赚了怎么分、亏了谁担,全凭一句"放心,我心里有数"。刚开始都好说,一旦经营波动、利益分配不均…

2026/8/11 17:49:17 阅读更多 →
从口头约定到电子签约,股权转让协议这样签才稳

从口头约定到电子签约,股权转让协议这样签才稳

一、股权转让,最怕"说好了又不认" 很多中小企业做股权转让,习惯先口头谈、微信聊,等到要办工商变更才补一份纸面协议。但股权交易金额大、责任重,口头约定一旦翻脸,谁先付钱、谁先过户、违约怎么赔&#xff…

2026/8/11 17:49:16 阅读更多 →
CSSG多语言格式输出:C/C++/F/UUID shellcode转换技巧

CSSG多语言格式输出:C/C++/F/UUID shellcode转换技巧

CSSG多语言格式输出:C#/C/F#/UUID shellcode转换技巧 【免费下载链接】CSSG Cobalt Strike Shellcode Generator 项目地址: https://gitcode.com/gh_mirrors/cs/CSSG CSSG(Cobalt Strike Shellcode Generator)是一款强大的shellcode生…

2026/8/12 18:57:20 阅读更多 →

最新新闻

Python游戏化学习指南:从零到一,在玩中掌握编程核心

Python游戏化学习指南:从零到一,在玩中掌握编程核心

很多Python初学者都经历过这样的阶段:对着枯燥的语法书和练习题,感觉编程既抽象又无趣,学习热情很快就被消磨殆尽。直到有一天,你发现原来Python可以如此“好玩”——通过游戏化的方式,在闯关、解谜、甚至编写小游戏的…

2026/8/12 20:08:24 阅读更多 →
AI Agent上下文压缩:Headroom原理、实战与长对话优化指南

AI Agent上下文压缩:Headroom原理、实战与长对话优化指南

1. 项目概述:为什么我们需要“上下文压缩”?如果你最近在折腾AI Agent或者大语言模型应用,大概率被“上下文长度”这个问题折磨过。无论是OpenAI的GPT-4 Turbo那128K的“豪华”窗口,还是Claude那令人咋舌的200K上下文,…

2026/8/12 20:08:24 阅读更多 →
Claude的60个子Agent冲击黎曼猜想:AI自主科研的里程碑与边界

Claude的60个子Agent冲击黎曼猜想:AI自主科研的里程碑与边界

Claude的60个子Agent冲击黎曼猜想:AI自主科研的里程碑与边界 一个非数学家在晨跑时随口给AI布置了一道167年没人解出的数学题。AI没能证明它,却在"失败"的路上,把人类37年攒下的成绩一口气刷新了25倍。 2026年8月10日,A…

2026/8/12 20:08:24 阅读更多 →
UML类图六大关系详解:从依赖到组合,掌握面向对象设计核心

UML类图六大关系详解:从依赖到组合,掌握面向对象设计核心

1. 项目概述:为什么UML类图是程序员必备的“设计蓝图”?干了这么多年开发,我见过太多因为前期设计没想清楚,导致后期代码改得面目全非、牵一发而动全身的项目。很多时候,问题不是出在编码能力上,而是团队成…

2026/8/12 20:08:24 阅读更多 →
深入解析CPU指令执行:从单周期到流水线,揭秘程序运行底层原理

深入解析CPU指令执行:从单周期到流水线,揭秘程序运行底层原理

1. 从“按按钮”到“跑程序”:指令执行到底在干什么?如果你刚开始接触计算机组成原理,看到“指令执行过程”这几个字,可能会觉得它离我们日常写代码、用软件很远,是那些设计CPU的工程师才需要关心的底层黑盒。但恰恰相…

2026/8/12 20:08:24 阅读更多 →
地震损失评估建模实战:从哥伦比亚7.4级强震、188人遇难看烈度衰减与损失预测

地震损失评估建模实战:从哥伦比亚7.4级强震、188人遇难看烈度衰减与损失预测

地震损失评估建模实战:从哥伦比亚7.4级强震、188人遇难看烈度衰减与损失预测 当地时间8月10日上午7点34分,哥伦比亚西部发生7.4级强震,震中位于首都波哥大以西约240公里,是哥伦比亚过去十年来录得的最强地震。据中新社8月12日报道…

2026/8/12 20:07:24 阅读更多 →

日新闻

Ubuntu 22.04安装与使用tree命令:高效管理Linux目录结构

Ubuntu 22.04安装与使用tree命令:高效管理Linux目录结构

1. 为什么需要一个“目录树”工具?在Linux世界里,尤其是Ubuntu这样的发行版,命令行是很多人的主战场。我们每天都要和文件、目录打交道。ls命令是查看目录内容的首选,它简洁、高效,能列出文件名、权限、大小等关键信息…

2026/8/12 9:33:34 阅读更多 →
博思AI智能体:意图识别、思考链与性能优化的工程实践

博思AI智能体:意图识别、思考链与性能优化的工程实践

在AI应用从“能用”走向“好用”的进程中,系统的响应速度、决策透明度与高并发稳定性是决定用户体验的关键。博思AI智能体近期完成了一次重要的专项优化,聚焦于意图识别、思考链展示与全链路压测三大核心领域,将系统从功能实现推向了工程卓越…

2026/8/12 9:33:34 阅读更多 →
子代理架构:AI智能体任务分解与协同执行的核心原理与实践

子代理架构:AI智能体任务分解与协同执行的核心原理与实践

1. 项目概述:为什么我们需要“子代理”?最近在折腾各种AI应用和自动化流程时,我越来越频繁地遇到一个瓶颈:单个AI智能体(Agent)的能力边界。无论是处理复杂的多步骤任务,还是需要同时调用多个专…

2026/8/12 9:33:34 阅读更多 →

周新闻

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁 【免费下载链接】baidupankey 在线查询网盘提取码(维护中 rm repo) 项目地址: https://gitcode.com/gh_mirrors/ba/baidupankey 你是否曾经在深夜寻找一份重要资料&#x…

2026/8/12 1:11:09 阅读更多 →
如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/12 1:11:09 阅读更多 →
收藏!小白程序员轻松入门大模型,从Harness工程开始实践

收藏!小白程序员轻松入门大模型,从Harness工程开始实践

文章强调学习大模型不应只关注模型本身,而应重视模型外的系统搭建,即Harness。提出AgentModelHarness的实用公式,详细介绍Harness的四个层次:持久化层、执行层、控制层和观察与验证层。文章还探讨了上下文工程、工具设计、AGENTS.…

2026/8/12 1:11:08 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/11 17:09:45 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/12 1:11:10 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/11 17:09:45 阅读更多 →