视觉特征提取器-训练范式02-自监督-掩码图像建模01:MAE的Mask Vector【所有遮挡块复制同一个共享可学习向量】【初始化完全相同,预训练后仍为同一个参数向量】【各位置差异仅由位置编码提供】
MAE 中的 Mask Vector:从形状、初始化到预训练与推理1. Mask Vector 到底是什么?论文《Masked Autoencoders Are Scalable Vision Learners》的核心任务是:随机删除图片中的大量 patch,只让 Encoder 观察剩余 patch,再让 Decoder 重建被删除的 patch。MAE 使用一个特殊的掩码向量(mask vector)来告诉 Decoder:“这个位置原本存在一个 patch,但它的内容现在未知,需要预测。”论文将每个掩码标记(mask token)描述为共享的、通过学习得到的向量。同时,MAE 的 Encoder 只处理真实的可见图像块(visible patches),mask token 只在 Decoder 中出现。因此,首先要建立最重要的概念:maskvector不是缺失patch的内容,而是缺失patch的可学习占位符。\boxed{\text{mask vector 不是缺失 patch 的内容,而是缺失 patch 的可学习占位符。}}maskvector不是缺失patch的内容,而是缺失patch的可学习占位符。​2. Masked Patch、Mask Token 和 Mask Vector 的区别这三个概念不能混淆。被掩码图像块(masked patch)是原始图片中真实存在、后来被随机删除的 patch。例如原始图片有:[P0,P1,P2,P3,P4,P5,P6,P7][P_0,P_1,P_2,P_3,P_4,P_5,P_6,P_7][P0​,P1​,P2​,P3​,P4​,P5​,P6​,P7​]假设只保留P1P_1P1​和P3P_3P3​,那么其他 6 个 patch 都属于 masked patches。但在 Encoder 中,它们不是被替换成某个特殊向量,而是直接被删除。论文明确说明 Encoder 不使用 mask tokens。掩码向量(mask vector)则是模型真正保存的一个可训练参数,记为:m\mathbf mm掩码标记(mask token)可以理解为把这个m\mathbf mm复制到某个缺失位置后得到的 token。因此:一个maskvector→复制出很多masktokens\boxed{\text{一个 mask vector}\rightarrow\text{复制出很多 mask tokens}}一个maskvector→复制出很多masktokens​而不是每个 masked patch 都拥有自己独立的 mask vector。3. Mask Vector 的形状假设 Decoder 的隐藏维度为:DDD_DDD​那么从数学上看:m∈RDD\mathbf m\in\mathbb R^{D_D}m∈RDD​官方 MAE PyTorch 实现将它保存为:self.mask_token=nn.Parameter(torch.zeros(1,1,decoder_embed_dim))所以张量形状是:1×1×DD\boxed{1\times1\times D_D}1×1×DD​​官方 MAE 的 ViT-Base、ViT-Large 和 ViT-Huge 配置都采用 512 维 Decoder,因此这些默认模型中的 mask token 参数形状为:1×1×512\boxed{1\times1\times512}1×1×512​官方代码同时表明,ViT-Large 的 Encoder 维度为 1024,而 Decoder 维度为 512;Encoder 输出首先通过线性层映射到 Decoder 维度,然后才加入 mask tokens。这说明一个重要事实:maskvector属于Decoder表示空间,而不是Encoder表示空间。\boxed{\text{mask vector 属于 Decoder 表示空间,而不是 Encoder 表示空间。}}maskvector属于Decoder表示空间,而不是Encoder表示空间。​4. 为什么形状是[1, 1, 512]?可以把它拆成:[1, 1, 512] │ │ │ │ │ └── 一个 token 含 512 个特征 │ └────── 只有一个 mask token 参数 └───────── batch 维真正需要模型学习的是:m=[m1,m2,…,m512]\mathbf m=[m_1,m_2,\ldots,m_{512}]m=[m1​,m2​,…,m512​]也就是 512 个标量。如果一张图片有 147 个 masked patches,并不意味着模型学习:147×512147\times512147×512套独立参数。它只学习一个:m\mathbf mm然后重复使用。5. “Shared” 到底是什么意思?假设一张224×224224\times224224×224图片使用16×1616\times1616×16patch。patch 总数:L=22416×22416=14×14=196L=\frac{224}{16}\times\frac{224}{16}=14\times14=196L=16224​×16224​=14×14=196MAE 的典型 masking ratio 为 75%,因此:Lvisible=196×0.25=49L_{\text{visible}}=196\times0.25=49Lvisible​=196×0.25=49Lmasked=196−49=147L_{\text{masked}}=196-49=147Lmasked​=196−49=147论文的默认设置就是 75% masking ratio,并使用 512 维 Decoder。对于这 147 个缺失位置,模型不是学习:m1,m2,…,m147\mathbf m_1,\mathbf m_2,\ldots,\mathbf m_{147}m1​,m2​,…,m147​而是使用:m,m,…,m⏟147次\underbrace{\mathbf m,\mathbf m,\ldots,\mathbf m}_{147\text{ 次}}147次m,m,…,m​​所以共享(shared)的准确含义是:同一张图片的所有 masked positions、不同图片的 masked positions,都使用同一个可训练参数m\mathbf mm。6. Mask Vector 如何初始化?这里要区分“论文描述”和“官方代码实现”。论文说明它是可学习向量(learned vector),但方法部分并没有指定它必须按照什么概率分布初始化。官方 PyTorch 实现首先创建全零参数张量:self.mask_token=nn.Parameter(torch.zeros(1,1,decoder_embed_dim))随后在模型初始化函数中执行:torch.nn.init.normal_(self.mask_token,std=.02)因此真正开始训练时,每个维度近似满足:mj∼N(0,0.022)m_j\sim\mathcal N(0,0.02^2)mj​∼N(0,0.022)也就是说:创建时先是零张量,正式训练前再用标准差0.02的正态随机数初始化。\boxed{\text{创建时先是零张量,正式训练前再用标准差 0.02 的正态随机数初始化。}}创建时先是零张量,正式训练前再用标准差0.02的正态随机数初始化。​刚初始化时,这些数字没有“狗”“天空”“汽车”等视觉语义,它只是一个待优化的小随机向量。7. Mask Vector 在 Encoder 中出现吗?不出现。这是 MAE 与很多容易产生的直觉最不一样的地方。假设:[P0,P1,P2,P3,P4,P5,P6,P7][P_0,P_1,P_2,P_3,P_4,P_5,P_6,P_7][P0​,P1​,P2​,P3​,P4​,P5​,P6​,P7​]只保留:P1,P3P_1,P_3P1​,P3​Encoder 实际处理的是:[P1,P3][P_1,P_3][P1​,P3​]而不是:[m,P1,m,P3,m,m,m,m][\mathbf m,P_1,\mathbf m,P_3,\mathbf m,\mathbf m,\mathbf m,\mathbf m][m,P1​,m,P3​,m,m,m,m]论文明确采用非对称编码器—解码器(asymmetric encoder-decoder):Encoder 只处理 visible patches,而完整 token 集合只交给较轻量的 Decoder。这样既减少计算量,也避免 Encoder 在预训练阶段依赖下游完整图片中不存在的 mask tokens。

相关新闻

动态规划解LeetCode摆动序列问题与优化

动态规划解LeetCode摆动序列问题与优化

1. 问题背景与理解第一次看到LeetCode 376题"摆动序列"这个标题时,我脑海中浮现的是一条波浪形的曲线。这道题在动态规划分类中属于中等难度,但实际解题时需要跳出常规思维模式。题目要求我们找出数组中最长的摆动子序列长度,所谓摆…

2026/8/9 20:52:42 阅读更多 →
NEORV32 RISC-V处理器终极指南:构建可定制微控制器的完整解析

NEORV32 RISC-V处理器终极指南:构建可定制微控制器的完整解析

NEORV32 RISC-V处理器终极指南:构建可定制微控制器的完整解析 【免费下载链接】neorv32 🖥️ A small, customizable and extensible MCU-class 32-bit RISC-V soft-core CPU and microcontroller-like SoC written in platform-independent VHDL. 项目…

2026/8/9 20:52:42 阅读更多 →
StabilityMatrix终极指南:一站式管理20+主流AI绘画工具

StabilityMatrix终极指南:一站式管理20+主流AI绘画工具

StabilityMatrix终极指南:一站式管理20主流AI绘画工具 【免费下载链接】StabilityMatrix Multi-Platform Package Manager for Stable Diffusion 项目地址: https://gitcode.com/gh_mirrors/st/StabilityMatrix StabilityMatrix是一款革命性的跨平台AI绘画工…

2026/8/9 20:52:42 阅读更多 →

最新新闻

如何用开源AI标书工具3天完成10万字技术方案:易标投标工具箱实战指南

如何用开源AI标书工具3天完成10万字技术方案:易标投标工具箱实战指南

如何用开源AI标书工具3天完成10万字技术方案:易标投标工具箱实战指南 【免费下载链接】OpenBidKit_Yibiao 开箱即用的AI标书编写工具,标书AI生成工具,投标工具箱、知识库、标书查重、废标项检查,完全开源免费,欢迎使用…

2026/8/9 21:51:09 阅读更多 →
5步快速掌握Asspp:专业的多区域App Store管理工具

5步快速掌握Asspp:专业的多区域App Store管理工具

5步快速掌握Asspp:专业的多区域App Store管理工具 【免费下载链接】Asspp The App Store for your multi-account eco system. 项目地址: https://gitcode.com/gh_mirrors/as/Asspp Asspp是一款专为多账户生态系统设计的App Store管理工具,它能够…

2026/8/9 21:51:09 阅读更多 →
SAP FAGLFLEXT表与利润中心会计技术解析

SAP FAGLFLEXT表与利润中心会计技术解析

1. FAGLFLEXT表在SAP财务系统中的核心地位FAGLFLEXT是SAP New General Ledger(新总账)架构中的核心汇总表,它相当于整个财务系统的"中央数据枢纽"。这张表的设计理念源于SAP对传统总账结构的重构——在ECC时代,系统使用…

2026/8/9 21:51:09 阅读更多 →
跨境电商海外采购系统搭建与优化实战

跨境电商海外采购系统搭建与优化实战

1. 海外采购环境搭建的必要性与挑战做跨境电商的朋友都知道,海外采购是业务链条中最关键的环节之一。去年我们团队在亚马逊美国站采购时,经常遇到IP被封、账号关联、支付失败等问题,导致采购效率低下,错失了不少爆款机会。经过半年…

2026/8/9 21:51:09 阅读更多 →
《贾子理论·原本》——思想主权与文明级认知操作系统公理全集

《贾子理论·原本》——思想主权与文明级认知操作系统公理全集

《贾子理论原本》 ——思想主权与文明级认知操作系统公理全集 自序 2025年3月28日,黄帝历4722年二月廿九日,一个普通的夜晚。我将“贾子猜想”挂上网络,写完最后一行,关闭电脑,去厨房热了一碗昨天的剩饭。-4 端起碗…

2026/8/9 21:50:09 阅读更多 →
OpenClaw私有化部署指南:从环境准备到安全运维

OpenClaw私有化部署指南:从环境准备到安全运维

1. OpenClaw私有化部署核心价值解析OpenClaw作为新一代AI智能体平台,其私有化部署方案正在成为企业级用户构建自主可控AI能力的首选。不同于公有云服务,私有化部署将整套系统运行在用户自有环境中,从根本上解决了三个核心问题:数据…

2026/8/9 21:50:09 阅读更多 →

日新闻

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁 【免费下载链接】baidupankey 在线查询网盘提取码(维护中 rm repo) 项目地址: https://gitcode.com/gh_mirrors/ba/baidupankey 你是否曾经在深夜寻找一份重要资料&#x…

2026/8/9 0:01:47 阅读更多 →
如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/9 0:01:47 阅读更多 →
收藏!小白程序员轻松入门大模型,从Harness工程开始实践

收藏!小白程序员轻松入门大模型,从Harness工程开始实践

文章强调学习大模型不应只关注模型本身,而应重视模型外的系统搭建,即Harness。提出AgentModelHarness的实用公式,详细介绍Harness的四个层次:持久化层、执行层、控制层和观察与验证层。文章还探讨了上下文工程、工具设计、AGENTS.…

2026/8/9 0:03:48 阅读更多 →

周新闻

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁 【免费下载链接】baidupankey 在线查询网盘提取码(维护中 rm repo) 项目地址: https://gitcode.com/gh_mirrors/ba/baidupankey 你是否曾经在深夜寻找一份重要资料&#x…

2026/8/9 0:01:47 阅读更多 →
如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/9 0:01:47 阅读更多 →
收藏!小白程序员轻松入门大模型,从Harness工程开始实践

收藏!小白程序员轻松入门大模型,从Harness工程开始实践

文章强调学习大模型不应只关注模型本身,而应重视模型外的系统搭建,即Harness。提出AgentModelHarness的实用公式,详细介绍Harness的四个层次:持久化层、执行层、控制层和观察与验证层。文章还探讨了上下文工程、工具设计、AGENTS.…

2026/8/9 0:03:48 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/9 17:05:02 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/9 0:45:04 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/9 17:05:02 阅读更多 →