Visual Transformer (ViT)模型详解
1 Vit简介1.1 Vit的由来ViT是2020年Google团队提出的将Transformer应用在图像分类的模型虽然不是第一篇将transformer应用在视觉任务的论文但是因为其模型“简单”且效果好可扩展性强scalable模型越大效果越好成为了transformer在CV领域应用的里程碑著作也引爆了后续相关研究。论文地址https://arxiv.org/pdf/2010.11929.pdfVisual Transformer (ViT) 出自于论文《AN IMAGE IS WORTH 16X16 WORDS: TRANSFORMERS FOR IMAGE RECOGNITION AT SCALE》是基于Transformer的模型在视觉领域的开篇之作。ViT模型是基于Transformer Encoder模型的。1.2 Vit如何工作我们知道Transformer模型最开始是用于自然语言处理 (NLP)领域的NLP主要处理的是文本、句子、段落等即序列数据。但是视觉领域处理的是图像数据因此将Transformer模型应用到图像数据上面临着诸多挑战理由如下与单词、句子、段落等文本数据不同图像中包含更多的信息并且是以像素值的形式呈现。如果按照处理文本的方式来处理图像即逐像素处理的话即使是目前的硬件条件也很难。Transformer缺少CNNs的归纳偏差比如平移不变性和局部受限感受野。CNNs是通过相似的卷积操作来提取特征随着模型层数的加深感受野也会逐步增加。但是由于Transformer的本质其在计算量上会比CNNs更大。Transformer无法直接用于处理基于网格的数据比如图像数据。为了解决上述问题Google的研究团队提出了ViT模型它的本质其实也很简单既然Transformer只能处理序列数据那么我们就把图像数据转换成序列数据就可以了呗。下面来看下ViT是如何做的。1.3 ViT模型架构我们先结合下面的动图来粗略地分析一下ViT的工作流程如下将一张图片分成patches将patches铺平将铺平后的patches的线性映射到更低维的空间添加位置embedding编码信息将图像序列数据送入标准Transformer encoder中去在较大的数据集上预训练在下游数据集上微调用于图像分类模型由三个模块组成Linear Projection of Flattened Patches(Embedding层)Transformer EncoderMLP Head最终用于分类的层结构Embedding层对于标准的Transformer模块要求输入的是token向量序列即二维矩阵 [num_token, token_dim]如下图token0-9对应的都是向量以ViT-B/16为例每个token向量长度为768。对于图像数据而言其数据格式为[H, W, C]是三维矩阵明显不是Transformer想要的。所以需要先通过一个Embedding层来对数据做个变换。如下图所示首先将一张图片按给定大小分成一堆Patches。以ViT-B/16为例将输入图片(224x224)按照16x16大小的Patch进行划分划分后会得到196个Patches。接着通过线性映射将每个Patch映射到一维向量中以ViT-B/16为例每个Patche数据shape为[16, 16, 3]通过映射得到一个长度为768的向量后面都直接称为token。[16, 16, 3] - [768]在代码实现中直接通过一个卷积层来实现。 以ViT-B/16为例直接使用一个卷积核大小为16x16步距为16卷积核个数为768的卷积来实现。通过卷积[224, 224, 3] - [14, 14, 768]然后把H以及W两个维度展平即可[14, 14, 768] - [196, 768]此时正好变成了一个二维矩阵正是Transformer想要的。Transformer EncoderTransformer Encoder其实就是重复堆叠Encoder Block L次主要由Layer Norm、Multi-Head Attention、Dropout和MLP Block几部分组成。​​MLP Head上面通过Transformer Encoder后输出的shape和输入的shape是保持不变的以ViT-B/16为例输入的是[197, 768]输出的还是[197, 768]。这里我们只是需要分类的信息所以我们只需要提取出[class]token生成的对应结果就行即[197, 768]中抽取出[class]token对应的[1, 768]。接着我们通过MLP Head得到我们最终的分类结果。MLP Head原论文中说在训练ImageNet21K时是由Lineartanh激活函数Linear组成。但是迁移到ImageNet1K上或者你自己的数据上时只用一个Linear即可。2 ViT工作原理我们将上图展示的过程近一步分解为6步接下来一步一步地来解析它的原理。如下图2.1 步骤1、将图片转换成patches序列这一步很关键为了让Transformer能够处理图像数据第一步必须先将图像数据转换成序列数据但是怎么做呢假如我们有一张图片patch大小为那么我们可以创建个图像patches可以表示为其中就是序列的长度类似一个句子中单词的个数。在上面的图中可以看到图片被分为了9个patches。2.2 步骤2、将Patches铺平在原论文中作者选用的patch大小为16那么一个patch的shape为(3,16,16)维度为3将它铺平之后大小为3x16x16768。即一个patch变为长度为768的向量。不过这看起来还是有点大此时可以使用加一个Linear transformation即添加一个线性映射层将patch的维度映射到我们指定的embedding的维度这样就和NLP 中的词向量类似了。2.3 步骤3、添加Position embedding与CNNs不同此时模型并不知道序列数据中的patches的位置信息。所以这些patches必须先追加一个位置信息也就是图中的带数字的向量。实验表明不同的位置编码embedding对最终的结果影响不大在Transformer原论文中使用的是固定位置编码在ViT中使用的可学习的位置embedding 向量将它们加到对应的输出patch embeddings上。2.4 步骤4、添加class token在输入到Transformer Encoder之前还需要添加一个特殊的class token这一点主要是借鉴了BERT模型。添加这个class token的目的是因为ViT模型将这个class token在Transformer Encoder的输出当做是模型对输入图片的编码特征用于后续输入MLP模块中与图片label进行loss计算。2.5 步骤5、输入Transformer Encoder将patch embedding和class token拼接起来输入标准的Transformer Encoder中。 Transformer Encoder其实就是重复堆叠Encoder Block L次主要由Layer Norm、Multi-Head Attention、Dropout和MLP Block几部分组成。2.6 步骤6、分类注意Transformer Encoder的输出其实也是一个序列但是在ViT模型中只使用了class token的输出将其送入MLP模块中去输出最终的分类结果。3 模型搭建参数在论文的Table1中有给出三个模型Base/ Large/ Huge的参数在源码中除了有Patch Size为16x16的外还有32x32的。其中Layers就是Transformer Encoder中重复堆叠Encoder Block的次数 L。Hidden Size就是对应通过Embedding层(Patch Embedding Class Embedding Position Embedding)后每个token的dim序列向量的长度MLP Size是Transformer Encoder中MLP Block第一个全连接的节点个数是token长度的4倍Heads代表Transformer中Multi-Head Attention的heads数。4 结果分析上表是论文用来对比ViTResnet和刚刚讲的一样使用的卷积层和Norm层都进行了修改以及Hybrid模型的效果。通过对比可得出结论在训练epoch较少时Hybrid优于ViT - Epoch小选Hybrid当epoch增大后ViT优于Hybrid - Epoch大选ViT

相关新闻

树莓派CSI接口深度解析:引脚定义、MIPI协议与I2C协同调试

树莓派CSI接口深度解析:引脚定义、MIPI协议与I2C协同调试

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/24 9:16:30 阅读更多 →
GD32H759与RT-Thread下I2C和RTC的工程实践与调试指南

GD32H759与RT-Thread下I2C和RTC的工程实践与调试指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/24 9:16:30 阅读更多 →
咪咕盒子MGV2000线刷全攻略:S905L2刷机救砖与避坑指南

咪咕盒子MGV2000线刷全攻略:S905L2刷机救砖与避坑指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/24 9:16:29 阅读更多 →

最新新闻

ESP32 应用平台:基于 WebAssembly 实现固件动态加载应用

ESP32 应用平台:基于 WebAssembly 实现固件动态加载应用

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/24 9:45:53 阅读更多 →
Photogimp for Windows:让GIMP秒变Photoshop的免费配置方案

Photogimp for Windows:让GIMP秒变Photoshop的免费配置方案

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/24 9:45:53 阅读更多 →
洛谷-入门-B2059

洛谷-入门-B2059

这是我在洛谷刷的第59道题。#include<stdio.h> int main() { int m,n,i,num0; scanf("%d %d",&m,&n); for(im;i<n;i) {if(i%2!0){numi; } } printf("%d",num);return 0; }反思&#xff1a; 余2做为判断。

2026/9/24 9:45:53 阅读更多 →
DeepSeek医疗私有化部署实战:从病历NLP到vLLM结构化流水线

DeepSeek医疗私有化部署实战:从病历NLP到vLLM结构化流水线

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/24 9:45:53 阅读更多 →
恶意代码可视化检测实战:从字节流到CNN图像分类

恶意代码可视化检测实战:从字节流到CNN图像分类

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/24 9:45:53 阅读更多 →
【awinic inside】艾为第六代高压线性马达驱动助力OPPO Find X10系列新体验

【awinic inside】艾为第六代高压线性马达驱动助力OPPO Find X10系列新体验

产品介绍Boost Haptic awinicTikTap算法可选&#xff0c;丰富效果全新体验 多重专项设计为效果护航&#xff1a;F0追踪、AAE自动刹车、LCC一致性校准 基础性能强大&#xff1a;2.3V支持硅负极电池、LRA故障诊断、11V高压振感强

2026/9/24 9:44:52 阅读更多 →

日新闻

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

简介&#xff1a;这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源&#xff0c;围绕YOLOv8实现渔船作业监控系统&#xff0c;可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件&#xff0c;约24.21MB&#xff0c;以70个Python源码文件为…

2026/9/24 0:00:19 阅读更多 →
单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

简介&#xff1a;一份基于单细胞RNA测序数据的细胞类型注释算法研究Python毕业设计源码&#xff0c;针对计算机相关专业正在做毕设或需要项目实战的学习者&#xff0c;可用于课程设计与期末大作业。项目代码完整、经导师指导评审通过&#xff0c;可直接运行&#xff0c;覆盖数据…

2026/9/24 0:00:19 阅读更多 →
C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

第一次在项目里被反射卡住&#xff0c;是在一个老旧的WinForms模块里&#xff1a;几十个类依赖PropertyChanged通知&#xff0c;运行时反射读属性、发通知&#xff0c;每次启动慢半拍不说&#xff0c;一上.NET Native/AOT裁剪模式几乎全面崩盘。后来我把这段逻辑全部改成C#源生…

2026/9/24 0:00:19 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事&#xff1a;用Flutter给OpenHarmony做一款游戏集合类的App&#xff0c;说白了就是把若干小游戏塞进一个壳里&#xff0c;用统一入口分发。这个方向本身不算新鲜&#xff0c;真正让我花了不少心思的&#xff0c;是首页那堆游戏卡…

2026/9/23 4:55:02 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档&#xff0c;最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事&#xff1a;今天在表后面多加了两个空白行&#xff0c;明天给客户交稿前发现整个章节的编号全部错位&#xff0c;光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/24 9:10:42 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年&#xff0c;说实话&#xff0c;第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年&#xff0c;流量惨淡、功能臃肿、代码自己都懒得看第二遍之后&#xff0c;我才慢慢琢磨明白一个道理&#xff1a;第一个网站是练手&…

2026/9/23 9:53:41 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践&#xff1a;原型怎样变成可用功能分类&#xff1a;[AI/大模型]细分主题&#xff1a;AI 增强型 CI/CD 流水线自动化与 GitOps 实践&#xff1a;Agent 工作流、工具调用与任务拆解&#xff1a;从原型到生产的验收清单很多团队在尝试用大…

2026/9/23 9:53:40 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战&#xff1a;复盘记录怎样真正派上用场分类&#xff1a;[工程技术]细分主题&#xff1a;Kubernetes 生产环境运维与排障实战&#xff1a;可复制的项目复盘模板与决策记录大部分团队的事故复盘报告&#xff0c;最后都变成了躺在 Confluence 或钉…

2026/9/23 9:53:40 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理&#xff1a;核心链路应该先拆哪一步分类&#xff1a;[工程技术]细分主题&#xff1a;Docker 容器化技术与镜像安全管理&#xff1a;核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用&#xff08;包含 Web 接口、后台…

2026/9/23 9:53:40 阅读更多 →