Mage-ViT技术解密:微软如何从零训练出 codec-native 视觉编码器?
Mage-ViT技术解密微软如何从零训练出 codec-native 视觉编码器【免费下载链接】Mage-VL项目地址: https://ai.gitcode.com/hf_mirrors/microsoft/Mage-VLMage-VL是微软推出的一款高效的 codec-native 流式多模态基础模型专为图像和视频理解而设计。其视觉编码器 Mage-ViT 完全从零开始训练规模紧凑至 4B。它旨在解决现代 VLM 的“莫拉维克悖论”——在复杂的离线推理任务上表现出色但在简单的实时流感知任务上却速度缓慢且计算量大。什么是 codec-native 视觉编码器传统的视频理解模型通常将视频解码为均匀采样的帧然后通过冻结的网络预训练 ViT 推送密集的补丁标记网格。而 Mage-VL 则遵循现代视频编解码器的结构将流分离为锚定I帧和预测P帧保留每个锚定补丁并仅保留编解码器花费比特的预测帧补丁——即携带真实运动和新细节的区域。这种与编解码器对齐的稀疏性使得 Mage-VL 在保持高视觉质量的同时能够显著降低计算成本和延迟。Mage-ViT 的训练方法Mage-ViT 是从两阶段从零开始的 ViT 预训练中提取的独立视觉编码器。这是仅 ViT 预训练的检查点它没有经过与语言模型的联合 VLM 训练。微软通过以下关键步骤从零训练出 Mage-ViT数据准备收集了大量的图像和视频数据包括各种场景、物体和动作。这些数据经过预处理以适应编解码器原生的输入格式。架构设计设计了一种与编解码器对齐的视觉编码器架构。该架构能够有效地处理锚定帧和预测帧并提取其中的关键信息。预训练使用大规模的图像和视频数据对 Mage-ViT 进行预训练。预训练过程中模型学习如何从编解码器原生的输入中提取视觉特征。微调在预训练的基础上对 Mage-ViT 进行微调以适应特定的下游任务如图像理解、视频理解和实时流感知等。Mage-VL 的整体架构Mage-VL 是一个统一的模型其中投影的视觉标记和文本标记共享一个因果 Qwen3 解码器。静态图像成为单个空间块视频成为时间有序的编解码器窗口。在流模式下轻量级认知门预测每个滚动窗口的p_speak g(h_t)通过事件保留特征提取器保持的循环流内存并在p_speak ≥ τ时触发生成响应由冻结的基础模型从最近编解码器段的本地滑动窗口解码文本查询可以随时注入。Mage-VL 的整体架构包括以下几个关键组件Mage-ViT 视觉编码器负责从图像和视频中提取视觉特征。Qwen3 语言解码器负责处理文本输入和生成文本输出。认知门负责控制实时流感知任务中的生成时机。事件保留特征提取器负责保持循环流内存以便认知门能够准确预测生成时机。Mage-VL 的性能表现Mage-VL 在多个视频和时间接地基准测试中表现出色。在保持 4B Qwen3 骨干网络固定且仅交换 ViT 的情况下Mage-VL 在所有报告的视频和时间接地基准测试中均优于 Qwen3-VL-4B——在本地化繁重的任务上优势最大22.5 QVHighlight17.1 ActivityNet11.0 VSI-Bench24.5 VideoEval-Pro。在 SoccerNet 基准测试中Mage-VL-4B 在响应时间方面表现出色具有较高的 TriggerAcc、Precision、Recall、F1 和 Latency 指标。在 OVO-Bench 基准测试中Mage-VL 在流式架构中设置了新的最先进总体得分。如何使用 Mage-VLMage-VL 提供了一个单一的检查点microsoft/Mage-VL它同时提供图像和视频理解以及主动流门——相同的权重可以回答离线图像/视频问题并驱动事件门控评论。它涵盖了所有 Mage-VL 功能图像理解、帧采样视频、传统 H.264/HEVC 编解码器视频、神经 DCVC-RT 编解码器视频和事件门控流。该存储库捆绑了编解码器处理器、神经编解码器包和主动门权重——不需要单独的理解、NVC 或流检查点。要使用 Mage-VL 进行图像和帧采样视频推理只需安装transformers库然后使用以下代码model_id microsoft/Mage-VL model AutoModelForCausalLM.from_pretrained(model_id, trust_remote_codeTrue) processor AutoProcessor.from_pretrained(model_id, trust_remote_codeTrue)对于在线模式可以与 OpenAI 兼容的 SGLang 服务器通信。首先使用 Mage-VL SGLang 分支构建并启动服务器构建需要protobuf-compiler和 Rust 工具链git clone https://gitcode.com/hf_mirrors/microsoft/Mage-VL cd Mage-VL git checkout sglang cargo build --release ./target/release/sglang-server --model-path microsoft/Mage-VL总结Mage-ViT 是微软从零训练的 codec-native 视觉编码器它通过与编解码器对齐的稀疏性在保持高视觉质量的同时显著降低了计算成本和延迟。Mage-VL 作为一个统一的模型涵盖了图像理解、视频理解和实时流感知等多种功能在多个基准测试中表现出色。如果你正在寻找一种高效的多模态基础模型Mage-VL 绝对值得一试。Mage-VL 采用 Apache-2.0 许可证发布你可以在遵守许可证条款的前提下自由使用和修改它。【免费下载链接】Mage-VL项目地址: https://ai.gitcode.com/hf_mirrors/microsoft/Mage-VL创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

IPD咨询洞察:IPD研发绩效考核制度全集

IPD咨询洞察:IPD研发绩效考核制度全集

很多企业推行矩阵型研发组织之后,绩效考核却还停留在"谁的人向谁汇报"的老逻辑里:PDT成员的绩效,到底该由项目说了算,还是由部门说了算?规则说不清楚,员工自己心里也犯嘀咕。华为在IPD试点期间设…

2026/7/31 19:27:07 阅读更多 →
编译器驱动安全的极限:Rust 能防住所有 Bug 吗?从代码质量视角的冷静评估

编译器驱动安全的极限:Rust 能防住所有 Bug 吗?从代码质量视角的冷静评估

编译器驱动安全的极限:Rust 能防住所有 Bug 吗?从代码质量视角的冷静评估 一、那段让借用检查器"通过"但生产环境崩溃的代码 两年前写过一个文件缓冲池。Rust 的借用检查器通过了——没有编译错误、没有 clippy 警告。测试也通过了——1000 …

2026/7/31 19:27:07 阅读更多 →
推理基础设施的 8 月建设规划:GPU 集群扩展、多模型管理与成本优化的路线图

推理基础设施的 8 月建设规划:GPU 集群扩展、多模型管理与成本优化的路线图

推理基础设施的 8 月建设规划:GPU 集群扩展、多模型管理与成本优化的路线图 一、7 月的 3 个瓶颈确定了 8 月该做什么 7 月的数据不会说谎。Prometheus 面板上,三个瓶颈已经非常清晰。 瓶颈一:GPU 利用率曲线是锯齿形的。业务高峰期&#…

2026/7/31 19:27:07 阅读更多 →

最新新闻

7 月总结:LLM 工作流自动化的探索与反思——从兴奋到冷静的工程沉淀

7 月总结:LLM 工作流自动化的探索与反思——从兴奋到冷静的工程沉淀

7 月总结:LLM 工作流自动化的探索与反思——从兴奋到冷静的工程沉淀 一、一个月的认知曲线:从"AI 能做什么"到"AI 该在哪里停" 7 月份 LLM 工作流自动化的实践经历了一条清晰的认知曲线。月初对 Agent 自主工作流充满期待——&quo…

2026/7/31 20:02:18 阅读更多 →
5分钟搞定Figma中文界面:设计师的母语工作流终极指南

5分钟搞定Figma中文界面:设计师的母语工作流终极指南

5分钟搞定Figma中文界面:设计师的母语工作流终极指南 【免费下载链接】figmaCN 中文 Figma 插件,设计师人工翻译校验 项目地址: https://gitcode.com/gh_mirrors/fi/figmaCN 嘿,设计师朋友们!是不是每次打开Figma&#xff…

2026/7/31 20:02:18 阅读更多 →
实战教程:用UNICOM训练自定义图像检索模型的完整流程

实战教程:用UNICOM训练自定义图像检索模型的完整流程

实战教程:用UNICOM训练自定义图像检索模型的完整流程 【免费下载链接】unicom Large-Scale Visual Representation Model 项目地址: https://gitcode.com/gh_mirrors/uni/unicom UNICOM(Universal and Compact Representation)是一款强…

2026/7/31 20:02:17 阅读更多 →
终极分屏游戏指南:Nucleus Co-Op如何让单机游戏变身多人派对

终极分屏游戏指南:Nucleus Co-Op如何让单机游戏变身多人派对

终极分屏游戏指南:Nucleus Co-Op如何让单机游戏变身多人派对 【免费下载链接】nucleuscoop Starts multiple instances of a game for split-screen multiplayer gaming! 项目地址: https://gitcode.com/gh_mirrors/nu/nucleuscoop Nucleus Co-Op是一款革命性…

2026/7/31 20:02:17 阅读更多 →
论文复现-2026-7-30

论文复现-2026-7-30

MSD-DDA模型:openbmi数据集:模型训练结果和论文中有较大差异。BCI-2a数据集:本周进展:本周,已在服务器上成功部署了实验环境与代码,并使用公开数据集 OPENBMI 和 BCI-2a 对模型进行了训练。初步运行结果与学长论文中报…

2026/7/31 20:02:17 阅读更多 →
OpenWork扩展性能优化:让你的插件运行如飞的6个秘诀

OpenWork扩展性能优化:让你的插件运行如飞的6个秘诀

OpenWork扩展性能优化:让你的插件运行如飞的6个秘诀 【免费下载链接】openwork The open-source alternative to Claude Cowork (powered by opencode) 项目地址: https://gitcode.com/GitHub_Trending/ope/openwork OpenWork作为Claude Cowork的开源替代方案…

2026/7/31 20:01:17 阅读更多 →

日新闻

物理复制比逻辑复制好在哪?数据库复制原理详解

物理复制比逻辑复制好在哪?数据库复制原理详解

数据库复制是把主库数据同步到备库的机制,分为逻辑复制和物理复制两种。逻辑复制传输的是 SQL 语句或行变更事件,物理复制传输的是存储引擎底层的物理日志。阿里云 PolarDB(云原生数据库)采用物理复制,在同步延迟、数据…

2026/7/31 0:00:34 阅读更多 →
BilibiliDown:3分钟学会B站视频下载的终极指南

BilibiliDown:3分钟学会B站视频下载的终极指南

BilibiliDown:3分钟学会B站视频下载的终极指南 【免费下载链接】BilibiliDown (GUI-多平台支持) B站 哔哩哔哩 视频下载器。支持稍后再看、收藏夹、UP主视频批量下载|Bilibili Video Downloader 😳 项目地址: https://gitcode.com/gh_mirrors/bi/Bilib…

2026/7/31 0:00:34 阅读更多 →
有哪些游戏数据AI平台?游戏行业Data+AI融合方案盘点

有哪些游戏数据AI平台?游戏行业Data+AI融合方案盘点

当前,游戏行业的“DataAI融合”已从概念验证进入价值落地阶段。根据IDC 2025年数据,中国AI游戏云市场规模已达18.6亿元;同时,游戏研发环节AI渗透率高达86%,生成式AI内容普及率超过50%。面对庞大的市场,游戏…

2026/7/31 0:00:34 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/31 1:03:03 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/29 14:34:28 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/31 4:19:39 阅读更多 →

月新闻