走进 VLM(二):Vision Encoder——VLM 到底是怎么看懂一张图片的?从 CNN 到 Vision Transformer
专栏走进 VLM——从视觉语言模型到多模态 Agent 的技术实战本文是专栏第 2 篇共 20 篇。关键词Vision Encoder、ViT、CNN、Patch Embedding、Attention、视觉 Token、CLIP一、上一章回顾VLM 为什么需要“眼睛”在上一篇文章中我们介绍了 VLM 的整体结构Image ↓ Vision Encoder ↓ Visual Features ↓ Projector ↓ Visual Tokens ↓ LLM ↓ Answer其中最前面的Image ↓ Vision Encoder就是 VLM 的视觉感知模块。简单来说Vision Encoder 的任务就是把一张图片转换成语言模型能够理解的信息。例如输入一张街道图片计算机看到的不是“这是一条街有汽车有行人。”而是一堆像素[ [255,120,80], [120,90,60], ... ]对于计算机来说图片本质上只是一个二维数字矩阵。那么问题来了模型如何从这些数字中提取出“语义”答案就是Vision Encoder。二、从像素到语义视觉模型的发展路线Vision Encoder 并不是 VLM 出现后才诞生的。它经历了几十年的发展传统图像算法 ↓ CNN ↓ ResNet ↓ Vision Transformer ↓ CLIP Vision Encoder ↓ VLM Vision Encoder其中最重要的两个阶段CNNVision TransformerViT三、早期视觉理解CNN 如何看图片CNNConvolutional Neural Network中文卷积神经网络曾经是计算机视觉领域的核心技术。它最大的特点利用卷积操作提取局部空间特征。例如一张猫的图片Image ↓ 卷积层1 检测边缘 ↓ 卷积层2 检测纹理 ↓ 卷积层3 检测眼睛、耳朵 ↓ 高层网络 识别猫可以简单理解低层线条 颜色 边缘中层眼睛 鼻子 耳朵高层猫 狗 汽车这就是 CNN 的核心思想从简单特征逐渐组合成复杂语义。四、CNN 的核心卷积到底做了什么假设有一张图片5×5 像素 [ 1 2 3 4 5 2 3 4 5 6 3 4 5 6 7 4 5 6 7 8 5 6 7 8 9 ]CNN 会使用一个小窗口例如3×3 Kernel不断滑动图片 ┌─────────┐ │ │ │ 3×3区域 │ │ │ └─────────┘计算图片区域 × Kernel得到新的特征。这个过程Image ↓ Convolution ↓ Feature Map就是卷积。五、CNN 为什么适合视觉因为图片有一个特点空间关系非常重要。比如猫的眼睛一定在鼻子上方耳朵通常头部两侧CNN 天然利用局部连接权重共享平移不变性因此非常适合图片。六、但是 CNN 有一个限制CNN 擅长看局部。例如它可以发现这里有眼睛 这里有耳朵但是理解“这个人在拿着雨伞因为正在下雨。”这种全局关系需要更强的建模能力。例如图片人 雨伞 天空 街道模型需要理解雨伞 ↓ 挡雨 ↓ 说明可能下雨 ↓ 人物正在户外这属于全局语义理解。而 Transformer 在这方面表现非常优秀。七、Vision TransformerViT的出现Transformer 最初用于 NLP。例如我 喜欢 人工智能转换成Token1 Token2 Token3然后输入 Transformer。研究人员发现图片也可以拆成 Token。这就是 ViTVision Transformer。八、图片如何变成 Token这是理解 VLM 最重要的一步。假设一张图片224 × 224ViT 不会直接处理整个图片。它会切成很多小块例如16 × 16 Patch那么224 / 16 14所以14 × 14 196 个 Patch图片┌────┬────┬────┐ │ P1 │ P2 │ P3 │ ├────┼────┼────┤ │ P4 │ P5 │ P6 │ ├────┼────┼────┤ │ P7 │ P8 │ P9 │ └────┴────┴────┘每个 Patch就是一个视觉 Token。九、Patch Embedding图片 Token 化原始 Patch例如16×16×3RGB 三通道16 × 16 × 3 768 个数字然后通过一个线性层Patch ↓ Linear Projection ↓ Embedding Vector得到Visual Token例如Patch1 ↓ [0.23,0.51,0.72,...]于是图片Image变成[ Token1, Token2, Token3, ... Token196 ]十、ViT 的完整流程整体结构Image ↓ Split Patch ↓ Patch Embedding ↓ Position Embedding ↓ Transformer Encoder ↓ Visual Representation展开Image ↓ ┌──────────────┐ │ Patch Split │ └──────────────┘ ↓ Patch1 Patch2 ... ↓ Embedding ↓ Transformer ↓ Feature Vector十一、为什么需要 Position EmbeddingTransformer 本身不知道顺序。例如文本我 爱 AI如果打乱AI 爱 我意思完全不同。图片同样如此。如果猫的位置被打乱模型无法知道耳朵在哪里 身体在哪里所以 ViT 加入Position Embedding告诉模型这个 Patch 在图片哪个位置。十二、Attention 如何帮助模型理解图片Transformer 最大特点Self-Attention。简单理解每个 Patch 会观察其他 Patch。例如猫图片Patch A: 眼睛 会关注 Patch B: 耳朵 Patch C: 身体于是模型建立眼睛 ↓ 猫 ↓ 整体语义关系。公式经典 Attention$$Attention(Q,K,V)softmax(\frac{QK^T}{\sqrt d})V$$不用深入数学可以理解Attention 让模型决定哪些区域更加重要。十三、Vision Encoder 在 VLM 中的位置回到 VLMImage ↓ Vision Encoder ↓ Visual Feature ↓ Projector ↓ LLMVision Encoder 输出例如[196,1024]表示196 个视觉 Token。每个 Token1024 维。这些信息之后会进入语言模型。十四、CLIP Vision Encoder现代 VLM 中非常常见的一类视觉编码器CLIP Vision EncoderCLIP 的结构Image ↓ Vision Encoder ↓ Image Embedding Text ↓ Text Encoder ↓ Text Embedding ↓ Similarity它训练的目标让图片 和 对应文字 距离更近。例如图片狗文本一只狗二者向量更加接近。这让视觉世界第一次和语言世界连接起来。十五、代码实践使用 CLIP 提取图片特征下面使用 Hugging Face 调用 CLIP Vision Encoder。安装pip install transformers torch pillow代码import torch from PIL import Image from transformers import CLIPProcessor, CLIPModel model_name openai/clip-vit-base-patch32 # 加载模型 model CLIPModel.from_pretrained( model_name ) processor CLIPProcessor.from_pretrained( model_name ) # 图片 image Image.open( test.jpg ) # 处理图片 inputs processor( imagesimage, return_tensorspt ) # 提取视觉特征 with torch.no_grad(): image_features model.get_image_features( **inputs ) print( image_features.shape )输出类似torch.Size([1,512])说明图片Image已经变成512维向量这就是Image Embedding。十六、查看图片和文本的相似度CLIP 最经典的应用图片匹配文字。代码import torch from PIL import Image from transformers import CLIPProcessor, CLIPModel model CLIPModel.from_pretrained( openai/clip-vit-base-patch32 ) processor CLIPProcessor.from_pretrained( openai/clip-vit-base-patch32 ) image Image.open( test.jpg ) texts [ a dog, a car, a person ] inputs processor( texttexts, imagesimage, return_tensorspt, paddingTrue ) with torch.no_grad(): outputs model(**inputs) similarity outputs.logits_per_image print(similarity)输出类似dog 8.5 car 1.2 person 2.3模型认为图片 ≈ dog十七、Vision Encoder 的未来发展现在主流 VLM 使用的视觉编码器越来越强例如CLIP ViTSigLIPEVA-CLIPInternViTQwen-VL Vision Encoder未来趋势更高分辨率 ↓ 更多视觉 Token ↓ 更强视觉理解 ↓ 视频理解 ↓ 世界模型十八、总结这一篇我们理解了1. Vision Encoder 是什么它负责图片 ↓ 视觉特征2. CNN 做了什么核心局部特征提取3. ViT 做了什么核心图片 Patch ↓ Visual Token ↓ Transformer4. VLM 为什么需要 Vision Encoder因为LLM 不认识图片。必须Image ↓ Vision Encoder ↓ Visual Token ↓ LLM5. 最重要的一句话Vision Encoder 就是 VLM 的眼睛它负责把现实世界中的图像转换成语言模型能够理解的视觉表示。下一篇我们继续深入《走进 VLM三CLIP 如何连接视觉与语言从图文对齐到多模态理解》我们将详细拆解CLIP 双塔结构Contrastive LearningImage EncoderText Encoder为什么 CLIP 成为了 VLM 的基础设施

相关新闻

基于AI与规则引擎的邮件自动化处理:从NLP解析到任务执行

基于AI与规则引擎的邮件自动化处理:从NLP解析到任务执行

在日常工作中,你是否也常常被海量的邮件和会议邀请淹没?处理一封封会议确认、日程安排、任务跟进邮件,手动创建日历事件、发送提醒、更新任务列表,这些重复性操作不仅耗时耗力,还容易出错。如果能有一个智能助手&#…

2026/8/15 8:30:04 阅读更多 →
AI辅助学术写作全流程工具链与效率提升实践

AI辅助学术写作全流程工具链与效率提升实践

1. 论文写作的数字化革命:当学术遇上AI 去年帮导师审阅研究生论文时,一个现象让我震惊:超过60%的初稿存在结构混乱、文献引用不规范等基础问题。更令人头疼的是,这些学生往往要花费数百小时在格式调整和重复性写作上。正是在这样的…

2026/8/15 8:30:04 阅读更多 →
NVIDIA Profile Inspector避坑指南:从入门到精通的显卡调优完整手册

NVIDIA Profile Inspector避坑指南:从入门到精通的显卡调优完整手册

NVIDIA Profile Inspector避坑指南:从入门到精通的显卡调优完整手册 【免费下载链接】nvidiaProfileInspector 项目地址: https://gitcode.com/gh_mirrors/nv/nvidiaProfileInspector NVIDIA Profile Inspector 是一款读写 NVIDIA 驱动内部游戏配置数据库的…

2026/8/15 8:30:04 阅读更多 →

最新新闻

AI Agent开发实战:MCP协议与Skill设计赋能智能体高效执行

AI Agent开发实战:MCP协议与Skill设计赋能智能体高效执行

1. 项目概述:当AI Agent学会“套路”最近在折腾AI Agent开发的朋友,估计没少被两个词刷屏:MCP和Skill。乍一看,这俩词儿挺唬人,一个叫“模型上下文协议”,一个叫“技能”,听起来像是某种高深莫测…

2026/8/15 9:10:20 阅读更多 →
FPGA常用型号参考

FPGA常用型号参考

FPGA市场主要由国际巨头和快速崛起的国内厂商两大阵营构成。国际厂商凭借深厚的技术积累和广泛的产品线,覆盖从顶尖数据中心到低功耗边缘计算的全场景;国内厂商则在通信、工业控制和汽车电子等特定市场加速追赶,部分已实现中高端突破。下表汇…

2026/8/15 9:10:20 阅读更多 →
汽车零部件大批量生产,单件检测时间如何压到 30 秒?

汽车零部件大批量生产,单件检测时间如何压到 30 秒?

汽车零部件大批量生产,单件检测时间如何压到 30 秒? Equator 比对仪是雷尼绍(Renishaw)推出的车间级在线比对测量系统,专门面向中大批量生产场景,以"标准件比对"为原理,在 2μm&#…

2026/8/15 9:10:20 阅读更多 →
多线程同时调用通信接口,为什么会出现数据乱码?

多线程同时调用通信接口,为什么会出现数据乱码?

在工业上位机开发中,这是非常经典的“玄学故障”:单线程调试一切正常,设备多了、业务模块多了之后,就开始偶发数据乱码、CRC校验失败、返回值对不上;错误率时高时低,压力越大出错越频繁;很多人第…

2026/8/15 9:10:20 阅读更多 →
PDF.js Viewer.html 实战指南:快速集成与深度定制

PDF.js Viewer.html 实战指南:快速集成与深度定制

1. 项目概述:为什么需要Viewer.html这种“现成”方案?如果你在前端开发中处理过PDF预览,大概率听说过甚至用过pdf.js这个库。它的第一种方式——直接使用PDFViewer等API进行编程式集成——给了开发者极大的灵活性,你可以自定义UI、…

2026/8/15 9:10:20 阅读更多 →
Agent Skills:将个人经验转化为AI可复用的团队能力

Agent Skills:将个人经验转化为AI可复用的团队能力

1. 项目概述:从“一次性经验”到“可复用能力”的进化在任何一个团队里,你肯定都见过这样的场景:某个同事为了解决一个棘手问题,花了整整两天时间,查遍了各种文档、试了无数种方法,最后终于搞定。他长舒一口…

2026/8/15 9:09:20 阅读更多 →

日新闻

内景 空间站内部 中国空间站 太空 内仓

内景 空间站内部 中国空间站 太空 内仓

本项目为前几天收费帮学妹做的一个项目,在工作环境中基本使用不到,但是很多学校把这个当作编程入门的项目来做,故分享出本项目供初学者参考。 一、项目描述 空间站内部 中国空间站 太空 内仓 地址:本地PC端运行(或Web…

2026/8/15 0:00:30 阅读更多 →
重新定义数据接口:3个突破性场景让通达信数据读取更智能

重新定义数据接口:3个突破性场景让通达信数据读取更智能

重新定义数据接口:3个突破性场景让通达信数据读取更智能 【免费下载链接】mootdx 通达信数据读取的一个简便使用封装 项目地址: https://gitcode.com/GitHub_Trending/mo/mootdx 当我们面对海量金融数据时,传统的数据获取方式往往让我们陷入困境—…

2026/8/15 0:00:30 阅读更多 →
一文读懂快消WMS怎么选?2026年国内外10大主流WMS品牌盘点

一文读懂快消WMS怎么选?2026年国内外10大主流WMS品牌盘点

快消品(FMCG)是流通速度较快、竞争较为激烈的行业之一。一瓶饮料从出厂到消费者手中,往往只有几十天甚至几天的周转窗口。这决定了快消行业的仓储管理系统(WMS)与制造业、电商行业存在明显区别:它不仅需要管…

2026/8/15 0:02:30 阅读更多 →

周新闻

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁 【免费下载链接】baidupankey 在线查询网盘提取码(维护中 rm repo) 项目地址: https://gitcode.com/gh_mirrors/ba/baidupankey 你是否曾经在深夜寻找一份重要资料&#x…

2026/8/13 2:38:34 阅读更多 →
如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/13 10:41:52 阅读更多 →
收藏!小白程序员轻松入门大模型,从Harness工程开始实践

收藏!小白程序员轻松入门大模型,从Harness工程开始实践

文章强调学习大模型不应只关注模型本身,而应重视模型外的系统搭建,即Harness。提出AgentModelHarness的实用公式,详细介绍Harness的四个层次:持久化层、执行层、控制层和观察与验证层。文章还探讨了上下文工程、工具设计、AGENTS.…

2026/8/13 10:41:51 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/14 13:40:53 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/14 14:06:45 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/15 2:35:29 阅读更多 →