InternVL3_5-GPT-OSS-20B-A4B-Preview-HF 多模态大模型训练原理揭秘:CascadeRL 级联强化学习如何带来 16% 推理性能提升
InternVL3_5-GPT-OSS-20B-A4B-Preview-HF 多模态大模型训练原理揭秘CascadeRL 级联强化学习如何带来 16% 推理性能提升【免费下载链接】InternVL3_5-GPT-OSS-20B-A4B-Preview-HF项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-GPT-OSS-20B-A4B-Preview-HFInternVL3_5-GPT-OSS-20B-A4B-Preview-HF 是 OpenGVLab 开源的 InternVL3.5 系列多模态大模型MLLM以 GPT-OSS-20B 混合专家语言模型为底座。本文用大白话揭秘它的四阶段训练流程重点讲清 CascadeRL 级联强化学习如何以极低的训练成本带来最高 16% 的整体推理性能提升帮助新手快速理解并上手这个多模态模型。 先认识主角21B 总参数、只激活 4B 的多模态模型examples/image1.jpg这样的自然照片就是这类多模态大模型的典型输入——模型既能看懂图也能推理题。它的能力背后是一套经典架构ViT–MLP–LLM 三段式InternViT-300M 视觉编码器约 0.3B负责看图 → MLP 投影层做对齐 → GPT-OSS-20B 语言模型负责理解和生成MoE 混合专家结构语言底座共有 32 个专家每个 token 只激活 4 个所以总参数约 21.2B、实际激活仅约 4B名字里的A4B即 Active 4B。推理成本低一张 A100 就能部署动态高分辨率图片被切块送入视觉编码器每个 patch 先表示为 1024 个视觉 token再经 pixel shuffle 压缩到 256 个兼顾细节与效率。关键参数可以直接在 config.json 中查到vision_config里是 448×448 输入、14×14 patch 的 InternViT 配置text_config里是 GPT-OSS 的 24 层 MoE 结构num_local_experts: 32、experts_per_token: 4。模型权重被切成 9 个分片model-00001-of-00009.safetensors等索引文件是 model.safetensors.index.json。 训练流程全揭秘CPT → SFT → CascadeRL 三步走InternVL3.5 的训练管线共四个环节其中第三个级联强化学习正是 16% 性能提升的来源阶段名称一句话作用①CPT 多模态持续预训练用大规模文本图文语料打底联合更新全部参数②SFT 监督微调教会模型听话地思考支持 32K 长上下文③CascadeRL 级联强化学习先离线 RL 再在线 RL推理能力大幅提升④ViCO 视觉一致性学习Flash 版教路由器学会省钱地压缩视觉 token阶段一CPT——打好图文底子预训练阶段对文本多模态混合语料做下一个 token 预测并做了两个小优化对长短回答做平方平均重加权防止偏向长/短回复、随机 JPEG 压缩模拟真实网络图片。阶段二SFT——灌入思考模式数据微调数据来自三个渠道其中最有价值的是第二类复用 InternVL3 的指令数据保证覆盖面Thinking 模式推理数据先用 InternVL3-78B 描述图片再交给 DeepSeek-R1 采样出带详细推理链的解答答错的直接过滤掉只留下高质量长思考样本——这就是模型会一步一步想的由来GUI 交互、具身智能等新能力扩展数据。阶段三CascadeRL——本文主角为什么不用单一的离线 RL 或在线 RL因为两者各有短板离线 RL收敛稳定、省算力但吃的是死数据模型无法从自身最新输出中继续学习在线 RL效果好但冷启动时模型太弱采出的 rollout试答质量差训练又贵又慢。CascadeRL 的思路是先稳后精的级联第一步 · MPO 离线强化学习热身MPOMixed Preference Optimization的损失 偏好损失DPO学选对弃错 质量损失BCO学绝对质量 生成损失LM loss防止语言能力回退三项加权求和。它先用高质量静态数据把模型托到一个不错的水平第二步 · GSPO 在线强化学习精修模型自己采样试答并打分奖励在同题多个回答间归一化类似 GRPO。GSPO 用逐 token 比率的几何平均作为重要性比率、且不依赖参考模型官方实测对稠密模型和 MoE 模型都更稳。级联的好处是112离线阶段提供了稳定收敛和高质 rollout在线阶段在此基础上精修输出分布——相比单用任一种 RL用一小部分 GPU 时间就拿到明显更大的推理提升官方消融实验证实了这一点。 16% 推理性能提升到底从哪来对比上一代 InternVL3InternVL3.5 在 MMMU、MathVista 等 30 余个基准上的整体推理得分最高提升 16.0%推理速度提升 4.05 倍。拆解一下来源CascadeRL 本身贡献了推理链的严谨性与解题正确率主贡献**测试时扩展TTS**进一步放大效果分两路深度思考 Deep Thinking开启 Thinking 模式模型先拆解问题、验证中间结论再给答案并行思考 Parallel ThinkingBest-of-N 策略用 VisualPRM 作为评审模型从多条推理候选中挑最优——一深一广推理更稳。实用技巧想开启思考模式把系统提示设为官方的 Thinking System PromptREADME 中有完整模板并设置do_sampleTrue、temperature0.6可有效避免复读。⚡ 顺带一提4.05 倍加速的秘密除了训练InternVL3.5 还有两个效率设计主要服务于 Flash 版ViR 视觉分辨率路由器按每个 patch 的语义丰富度动态选择压缩率256 token 或 64 token视觉 token 数减少 50%、性能几乎不掉DvD 解耦式部署视觉编码器和 LLM 分到不同 GPU 上跑BF16 特征经 TCP/RDMA 单向传输异步三阶段流水线让看图和说话互不阻塞。 三步上手多模态大模型推理第 1 步获取模型git clone https://gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-GPT-OSS-20B-A4B-Preview-HF第 2 步安装依赖该 20B MoE 版本要求transformers4.55.0部署推荐使用 vLLMpip install transformers4.55.0 vllm第 3 步加载并提问以 transformers 为例from transformers import AutoTokenizer, AutoModelForImageTextToText import torch model AutoModelForImageTextToText.from_pretrained( OpenGVLab/InternVL3_5-GPT-OSS-20B-A4B-Preview-HF, torch_dtypetorch.bfloat16, low_cpu_mem_usageTrue, trust_remote_codeTrue).eval().cuda()配套的对话与预处理配置都在仓库里对话模板 chat_template.jinja、图文处理器 processor_config.json、图像预处理 preprocessor_config.json、视频预处理 video_preprocessor_config.json分词器则是 tokenizer.json 和 special_tokens_map.json。❓ 新手常见问题该选哪个版本官方明确建议不确定就选不带后缀的版本如本仓库它走完了完整训练管线CPT SFT CascadeRL效果最好带-Pretrained、-Instruct、-MPO后缀的是不同训练阶段的中间权重供研究对比用。为什么叫 HF 格式本项目是符合 HuggingFace Transformers 标准的权重格式可直接用AutoModelForImageTextToText加载与 GitHub 自定义格式可互相转换。显存够吗30B 以内模型单张 A100 可跑本 20B-A4B 版激活参数仅 4B消费级高显存显卡配合量化也有机会。 小结一句话记住 InternVL3.5 的核心创新CascadeRL 用离线 MPO 热身 在线 GSPO 精修的级联设计用更低成本的强化学习把多模态推理能力整体拉升了 16%再叠加 ViR、DvD 等效率设计实现 4.05 倍加速——这套又强又快的配方正是它值得你动手试一試的原因。【免费下载链接】InternVL3_5-GPT-OSS-20B-A4B-Preview-HF项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-GPT-OSS-20B-A4B-Preview-HF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

2026年AI原生智能体招聘平台:GoHire.TOP

2026年AI原生智能体招聘平台:GoHire.TOP

GoHire 完整产品介绍 GoHire 是一款 AI 原生智能体招聘平台,帮助企业比其他人更快招到精英人才。它的 AI 招聘助手自动筛选简历、进行面试,并为每位候选人提供综合评估报告,把招聘周期从平均 42 天压缩到 3 天。 官网:GoHire - H…

2026/8/26 19:44:37 阅读更多 →
大型量产固件的工程实践(六):嵌入式错误码体系设计

大型量产固件的工程实践(六):嵌入式错误码体系设计

大型量产固件的工程实践(六):嵌入式错误码体系设计 本文是《大型量产固件的工程实践》专栏第 6 篇。 上一篇:第 5 篇《自研轻量 RTOS 内核设计》 | 下一篇:第 7 篇《嵌入式调试日志系统设计》 一、为什么需要统一的错误码 没有统一错误码的固件,错误处理是混乱的: //…

2026/8/26 19:43:36 阅读更多 →
InternVL3.5-30B-A3B流式输出实战:如何实现逐字实时输出体验

InternVL3.5-30B-A3B流式输出实战:如何实现逐字实时输出体验

InternVL3.5-30B-A3B流式输出实战:如何实现逐字实时输出体验 【免费下载链接】InternVL3_5-30B-A3B-Instruct 项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-30B-A3B-Instruct InternVL3.5-30B-A3B-Instruct 是书生万象(I…

2026/8/26 19:43:36 阅读更多 →

最新新闻

AI Agent开发进阶:语音编程、搜索服务与工具调用实战解析

AI Agent开发进阶:语音编程、搜索服务与工具调用实战解析

近两天 AI 圈子的动态比较密集,尤其是围绕 AI 编程、Agent 能力和搜索服务这三个方向,几乎每天都有新能力放出来。今天这篇文章就集中梳理一下 7 月 29 日前后值得开发者关注的几条动态:阿里 Qoder 的语音编程能力、豆包搜索服务上线、以及 G…

2026/8/26 21:08:28 阅读更多 →
MathorCup物流排班赛题解析:从时间序列预测到运筹优化建模

MathorCup物流排班赛题解析:从时间序列预测到运筹优化建模

1. 项目概述与核心价值刚带完今年的MathorCup,看到C题“物流网络分拣中心货量预测及人员排班”这个题目,感觉特别有聊头。这题可以说是把当下物流行业最头疼的两个运营核心——预测不准和人力浪费——直接搬到了赛场上。对于参赛的同学来说,它…

2026/8/26 21:08:28 阅读更多 →
用Python构建访谈文本分析流程:从资料采集到情感与主题挖掘

用Python构建访谈文本分析流程:从资料采集到情感与主题挖掘

这个话题出现在技术社区里,多数人可能以为是音乐评论,但我想从另一个角度切入:当你想研究“罗大佑如何评价 Beyond”这类开放性问题时,如何用一套可复现的技术流程,把散落在公开访谈、媒体报道、视频字幕中的观点整理成…

2026/8/26 21:08:28 阅读更多 →
天然气水合物资源量评价:测井联合反演与贝叶斯不确定性量化

天然气水合物资源量评价:测井联合反演与贝叶斯不确定性量化

1. 这不是“套模板”的数学建模题,而是一道真实地质资源评估的工程问题“天然气水合物资源量评价”——光看标题,很多人第一反应是:又一道用现成模型套数据的数维杯常规题。但如果你真去翻过中国地质调查局2023年发布的《南海神狐海域天然气水…

2026/8/26 21:08:28 阅读更多 →
AI内容安全:从识别擦边信息到合规写作的工程实践

AI内容安全:从识别擦边信息到合规写作的工程实践

抱歉,我不能基于这个标题来撰写文章。 原因很直接:这个标题包含明显的低俗擦边联想,把“裸泳”和个人姓名组合在一起,属于不适合公开发布的内容。即使尝试往健康方向改写,也会保留原有的风险联想和不适感,…

2026/8/26 21:08:27 阅读更多 →
Beyond Compare 实战:图片对比、文件夹同步与文件合并详解

Beyond Compare 实战:图片对比、文件夹同步与文件合并详解

两张图片要放到一起对比,很多人第一反应是打开画图工具手动拖动,或者用截图软件把两张图拼到同一张画布里逐个像素数过去。偶尔一次这样处理没有太大问题,但如果是设计走查、前端改版、测试回归、文档版本核对这类需要反复比对的工作&#xf…

2026/8/26 21:07:27 阅读更多 →

日新闻

Python random 模块常用函数详解:从入门到实战

Python random 模块常用函数详解:从入门到实战

目录 1. 引言2. 准备工作3. 基础随机函数4. 序列相关函数5. 随机种子与复现6. 实战案例7. 注意事项8. 常见问题与排查9. 总结 1. 引言 摘要: 本文系统介绍 Python 标准库 random 模块中最常用的随机数生成函数。内容涵盖基础随机函数(random()、unifor…

2026/8/26 0:00:40 阅读更多 →
《Microsoft Sql server 2008 Internals》读书笔记--第三章Databases and Database Files(2)

《Microsoft Sql server 2008 Internals》读书笔记--第三章Databases and Database Files(2)

《Microsoft Sql server 2008 Internals》索引目录: 《Microsoft Sql server 2008 Internals》读书笔记--目录索引 在上篇文章中,主要介绍了创建数据库的基本语法和FileGroup的初步知识。需要注意的是: 关于FileGroup 如果你的系统是用Raid设备直接存…

2026/8/26 1:18:18 阅读更多 →
政务AI智能体怎么建?三种模式、三步路径与四个误区

政务AI智能体怎么建?三种模式、三步路径与四个误区

政务AI智能体已经从概念试点阶段,转入了政务服务的常态化落地应用;在实际使用过程中,它能自主理解办事需求、辅助完成填报申报、开展材料预审,并联动多个系统协同作业,真正嵌入到政务办理的全流程当中。但在落地推进过…

2026/8/26 1:18:18 阅读更多 →

周新闻

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/26 14:45:33 阅读更多 →
SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/26 17:46:43 阅读更多 →
Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/26 14:46:37 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/26 3:50:20 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/26 17:46:39 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/26 1:24:05 阅读更多 →