InternVL3.5-4B架构深潜:InternViT+Qwen3的ViT-MLP-LLM多模态范式逐层拆解
InternVL3.5-4B架构深潜InternViTQwen3的ViT-MLP-LLM多模态范式逐层拆解【免费下载链接】InternVL3_5-4B项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-4BInternVL3.5-4B 是 OpenGVLab 开源的轻量级多模态大模型总参数量约 4.7B采用经典的「ViT-MLP-LLM」架构InternViT-300M 视觉编码器 MLP 投影层 Qwen3-4B 语言模型。本文逐层拆解这套多模态范式的实现细节讲清它如何把一张图片变成视觉 token 序列并交给 LLM帮助新手彻底看懂轻量级 VLM 的架构原理。 30 秒概览三个「零件」拼成一个模型组件模型参数量职责视觉编码器InternViT-300M0.3B切图、提取视觉特征投影层Pixel Shuffle MLP约几 M压缩视觉 token、对齐维度语言模型Qwen3-4B4.4B多模态理解、推理与生成关键数字每个 448×448 图像切片最终转换为256 个IMG_CONTEXT视觉 token一张原图会被动态切成1~12 个切片 1 张缩略图见config.json中的max_dynamic_patch12、downsample_ratio0.5。 数据流全景一张图如何变成回答动态切图按最接近的宽高比把原图切成 1~12 个 448×448 切片再附一张缩略图视觉编码每个切片进入 InternViT24 层 Transformer448÷1432得到 32×321024 个 patch 特征 1 个 CLS tokentoken 压缩pixel shuffle 把 1024 个 token 压成 256 个每个 token 维度变为 4 倍投影对齐mlp1把 4096 维映射到 Qwen3 的 2560 维占位替换输入 embedding 序列中的IMG_CONTEXT占位符逐个换成视觉特征见modeling_internvl_chat.py的forward自回归生成Qwen3-4B 基于「文本 视觉」混合序列生成回答。 第一层InternViT 视觉编码器实现在modeling_intern_vit.py关键参数来自config.json的vision_config段参数值含义num_hidden_layers24Transformer 层数hidden_size1024隐层维度num_attention_heads16注意力头数patch_size14切片窗口大小像素image_size448每个切片分辨率hidden_act / normgelu / layer_norm激活与归一化方式几个值得留心的设计细节可插值位置编码_get_pos_embed用双三次插值把 32×32 的位置编码表重采样因此任意尺寸的切片都能拿到合适的位置信息LayerScale DropPath每层带ls1/ls2缩放参数和随机深度drop_path_rate0.1让大视觉编码器训练更稳FlashAttention 加速配置了use_flash_attntrue自注意力走flash_attn_varlen_qkvpacked_func快速路径。「动态高分辨率」由config.json中dynamic_image_sizetrue、min_dynamic_patch1、max_dynamic_patch12、use_thumbnailtrue共同控制小图只切 1 块信息量大的图表、文档则最多切 12 块「看得更仔细」兼顾精度与开销。 第二层MLP 投影层——视觉与语言之间的「翻译官」这是 ViT-MLP-LLM 中「MLP」的核心位于modeling_internvl_chat.py的InternVLChatModel.__init__pixel shuffledownsample_ratio0.5把 32×32 网格的 1024 维特征重排为 16×16 网格的 4096 维特征token 数从 1024 压到 256序列长度骤降 4 倍mlp1LayerNorm(4096) → Linear(4096→2560) → GELU → Linear(2560→2560)完成到 Qwen3 隐层维度的对齐。算一笔账一张 12 切片 缩略图的图像会注入 256×13 3328 个 token——这就是多模态对话为什么特别「吃」上下文窗口的原因。 第三层Qwen3-4B 语言模型参数定义在config.json的llm_config段架构为Qwen3ForCausalLM参数值参数值num_hidden_layers36hidden_size2560num_attention_heads32num_key_value_heads8GQAintermediate_size9728max_position_embeddings40960rope_theta1,000,000vocab_size151,936hidden_actsiluattention_biasfalse两个亮点分组查询注意力32 个 Q 头共享 8 个 KV 头显著降低推理时的 KV 缓存占用40K 上下文足以容纳多张高分辨率图 长文档对话。️ 训练管线四步走到最终版本据README.md说明InternVL3.5-4B 依次经历CPT多模态持续预训练文本 多模态语料联合训练配合平方根加权的最下一个词预测损失SFT监督微调32K 上下文引入「思考模式」推理数据MPO离线强化学习DPO BCO LM 三项损失组合——当前仓库模型的直接基座README.md中base_model指向InternVL3_5-4B-MPOGSPO在线强化学习级联强化学习收尾MMMU、MathVista 等推理基准大幅提升。 快速上手最低门槛的部署方式环境要求transformers4.52.1单张 24G 显存 GPU 即可跑起来官方说明 30B 及以下可单卡 A100 部署4B 更轻松import torch from transformers import AutoModel, AutoTokenizer path OpenGVLab/InternVL3_5-4B model AutoModel.from_pretrained( path, torch_dtypetorch.bfloat16, low_cpu_mem_usageTrue, use_flash_attnTrue, trust_remote_codeTrue, device_mapauto).eval() tokenizer AutoTokenizer.from_pretrained(path, trust_remote_codeTrue) question image\nPlease describe the image shortly. # pixel_values 由动态切图得到完整示例见 README.md 的 load_image response model.chat(tokenizer, pixel_values, question, dict(max_new_tokens1024, do_sampleTrue))要开启「思考模式」只需把系统提示词换成官方 R1 提示并设置do_sampleTrue、temperature0.6。在线服务场景可直接用 vLLM 或 LMDeploy 起 OpenAI 兼容 APIlmdeploy serve api_server OpenGVLab/InternVL3_5-4B --server-port 23333 --tp 1。 关键文件速查文件作用config.json顶层配置 vision_configllm_config三段式结构modeling_intern_vit.pyInternViT 视觉编码器Embeddings / Attention / Encoderconfiguration_intern_vit.pyViT 配置类本模型覆盖为 24 层modeling_internvl_chat.py主模型pixel shuffle、mlp1、chat / generate 逻辑configuration_internvl_chat.py组合式配置把 vision 与 LLM 配置拼装在一起conversation.py对话模板本模型使用internvl2_5模板special_tokens_map.jsonimg、IMG_CONTEXT、box等特殊 tokenchat_template.jinja新版 transformers 的聊天模板 写在最后InternVL3.5-4B 用 4.7B 的体量证明ViT-MLP-LLM 范式简单却高效——InternViT 负责「看」pixel shuffle MLP 负责「压缩」Qwen3-4B 负责「想与说」。动态高分辨率切图让它能看清细节级联强化学习训练让它具备数学与图表推理能力是理解开源多模态大模型架构的绝佳入口。【免费下载链接】InternVL3_5-4B项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-4B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

10行Clojurescript做一个钟琴:Klangmeister乐器合成技巧详解(Bell/Organ/Wah/打击乐)

10行Clojurescript做一个钟琴:Klangmeister乐器合成技巧详解(Bell/Organ/Wah/打击乐)

10行Clojurescript做一个钟琴:Klangmeister乐器合成技巧详解(Bell/Organ/Wah/打击乐) 【免费下载链接】klangmeister A musical scratchpad. 项目地址: https://gitcode.com/gh_mirrors/kl/klangmeister Klangmeister 是一个浏览器里的…

2026/8/26 19:58:43 阅读更多 →
nestjs-starter-rest-api如何用Husky+Commitlint+SonarCloud打造规范化开发工作流

nestjs-starter-rest-api如何用Husky+Commitlint+SonarCloud打造规范化开发工作流

nestjs-starter-rest-api如何用HuskyCommitlintSonarCloud打造规范化开发工作流 【免费下载链接】nestjs-starter-rest-api NestJS Starter Kit. Monolithic Backend. REST API. 项目地址: https://gitcode.com/gh_mirrors/ne/nestjs-starter-rest-api nestjs-starter-r…

2026/8/26 19:58:43 阅读更多 →
5分钟搭好Electron-i18n开发环境:从GitHub Token到npm run build的完整指南

5分钟搭好Electron-i18n开发环境:从GitHub Token到npm run build的完整指南

5分钟搭好Electron-i18n开发环境:从GitHub Token到npm run build的完整指南 【免费下载链接】i18n 🌍 The home of Electrons translated documentation 项目地址: https://gitcode.com/gh_mirrors/i18n/i18n 想快速搭好 Electron-i18n 开发环境吗…

2026/8/26 19:58:43 阅读更多 →

最新新闻

mes厂家有哪些?从开发与二次开发灵活性看mes厂家的业务适配深度

mes厂家有哪些?从开发与二次开发灵活性看mes厂家的业务适配深度

半导体制造是一个工艺流程高度差异化的领域。同样是封测环节,做引线键合和做倒装焊的工序逻辑完全不同;即便是同一种封装形式,不同工厂的设备配置、物料编码规则、质量判定标准也各有差异。标准化的mes产品往往只能覆盖通用流程,而…

2026/8/26 20:27:53 阅读更多 →
[AutoSar]BSW_Com010 CAN IF 模块介绍

[AutoSar]BSW_Com010 CAN IF 模块介绍

目录关键词平台说明一、CAN IF 所在架构位置二、CAN interface 简介三、CAN interface 主要功能描述3.1 CANIF 被调用方式3.1.1 中断模式3.1.2 轮询模式3.1.3 混合模式3.2 Hardware object handles(HO)3.4 Dynamic L-PDUs3.4.1 Dynamic Transmit L-PDUs3…

2026/8/26 20:27:53 阅读更多 →
IMA 零代码搭建财务制度 RAG 问答助手(“AI+财务“最经典应用)

IMA 零代码搭建财务制度 RAG 问答助手(“AI+财务“最经典应用)

IMA 零代码搭财务制度 RAG 问答助手 从文档导入到检索调优,一套照着做的极简落地法。 很多人一听到 “RAG” 就头大:向量库、Embedding、重排序、余弦相似度……感觉非得会 Python、会部署才能玩。其实对大多数职场人来说,个人知识库 垂直问…

2026/8/26 20:27:53 阅读更多 →
数字化转型:转什么、怎么转?

数字化转型:转什么、怎么转?

一、引言:为什么今天必须认真讨论数字化转型过去十年,“数字化转型”从一个概念热词,逐渐变成了企业无法回避的战略命题。无论是制造业、零售业、金融业,还是公共服务、农业和医疗领域,几乎所有行业都在谈论数字化。然…

2026/8/26 20:27:53 阅读更多 →
天猫店群自动化管理系统:20核并发不抢焦,单机跑通百店零报错

天猫店群自动化管理系统:20核并发不抢焦,单机跑通百店零报错

天猫店群自动化管理系统:20核并发不抢焦,单机跑通百店零报错 做店群的老板都知道,天猫的同行数据截流,是店群运营中最耗人力也最容易出错的环节。 同行截流是店群最核心的引流手段。别人花大价钱投流的爆款,你把他的…

2026/8/26 20:27:53 阅读更多 →
cumulus collator-selection Pallet 解析:Parachain 如何实现开放出块与提名集(完整指南)

cumulus collator-selection Pallet 解析:Parachain 如何实现开放出块与提名集(完整指南)

cumulus collator-selection Pallet 解析:Parachain 如何实现开放出块与提名集(完整指南) 【免费下载链接】cumulus Write Parachains on Substrate 项目地址: https://gitcode.com/gh_mirrors/cum/cumulus cumulus 是 Polkadot 生态中…

2026/8/26 20:26:53 阅读更多 →

日新闻

Python random 模块常用函数详解:从入门到实战

Python random 模块常用函数详解:从入门到实战

目录 1. 引言2. 准备工作3. 基础随机函数4. 序列相关函数5. 随机种子与复现6. 实战案例7. 注意事项8. 常见问题与排查9. 总结 1. 引言 摘要: 本文系统介绍 Python 标准库 random 模块中最常用的随机数生成函数。内容涵盖基础随机函数(random()、unifor…

2026/8/26 0:00:40 阅读更多 →
《Microsoft Sql server 2008 Internals》读书笔记--第三章Databases and Database Files(2)

《Microsoft Sql server 2008 Internals》读书笔记--第三章Databases and Database Files(2)

《Microsoft Sql server 2008 Internals》索引目录: 《Microsoft Sql server 2008 Internals》读书笔记--目录索引 在上篇文章中,主要介绍了创建数据库的基本语法和FileGroup的初步知识。需要注意的是: 关于FileGroup 如果你的系统是用Raid设备直接存…

2026/8/26 1:18:18 阅读更多 →
政务AI智能体怎么建?三种模式、三步路径与四个误区

政务AI智能体怎么建?三种模式、三步路径与四个误区

政务AI智能体已经从概念试点阶段,转入了政务服务的常态化落地应用;在实际使用过程中,它能自主理解办事需求、辅助完成填报申报、开展材料预审,并联动多个系统协同作业,真正嵌入到政务办理的全流程当中。但在落地推进过…

2026/8/26 1:18:18 阅读更多 →

周新闻

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/26 14:45:33 阅读更多 →
SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/26 17:46:43 阅读更多 →
Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/26 14:46:37 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/26 3:50:20 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/26 17:46:39 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/26 1:24:05 阅读更多 →