WeMM-Embedding输入类型完全指南:文本、图像、视频、文档与交错多模态的5种用法
人工智能大模型Embedding多模态模型评测模型推理服务【免费下载链接】WeMM-EmbeddingWeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.项目地址https://gitcode.com/gh_mirrors/we/WeMM-Embedding点击查看免费下载WeMM-Embedding 是微信视觉团队WeChat Vision开源的通用多模态 Embedding 模型家族能把文本、图像、视频、视觉文档、交错多模态这 5 种输入统一编码成同一个向量空间里的嵌入向量Embedding一个模型就能完成跨模态的语义检索。本文带你从零看懂这 5 种输入类型分别怎么用以及它们各自的典型场景。一、5种输入类型总览一张表看懂无论输入是什么模态WeMM-Embedding 的输出都是同一个维度的向量——不同模态的向量可以直接做相似度计算余弦相似度这就是统一表示的意义。输入类型典型场景示例 文本文搜图、文搜视频、语义搜索用一段描述从图库中找照片️ 图像以图搜图、图文跨模态检索找同款商品、以图搜描述 视频文搜视频、视频推荐湖心船上看山景定位视频片段 视觉文档图表/票据/页面截图检索问题定位到相关图表 交错多模态图文混排内容理解与检索商品页图标题价格卖点整体编码 全系列 3 个模型2B / 4B / 9B都支持以上全部 5 种输入音频输入暂不支持。模型规模与维度一览模型支持的 Matryoshka 维度WeMM-Embedding-2B64 / 128 / 256 / 512 / 1024 / 2048WeMM-Embedding-4B64 / 128 / 256 / 512 / 1024 / 2560WeMM-Embedding-9B64 / 128 / 256 / 512 / 1024 / 2048 / 4096二、文本嵌入从一句话到检索结果最基础的用法把一段自然语言编码成向量。WeMM-Embedding 的文本嵌入特别强的一点是细粒度语义区分——连图片里包含的文字招牌、水印都能理解。比如用文字一家转角建筑门上方写着 Red Corner Cafe 的招牌去检索模型能精确命中带这块招牌的店面而不是其他长得像的转角咖啡馆。下面这张就是模型用来做干扰项的相似店面在 TextCaps 等图中文字检索基准上WeMM-Embedding 都能把正确目标排到 Top-1。三、图像嵌入以图搜图与图文跨模态图像输入走的是视觉语言模型VLM预处理管线图片被切分成视觉 token与文本 token 在同一个 Transformer 里融合编码。这意味着图像嵌入天然理解图像里的语义而不只是像素相似度。看一个真实案例输入一段很长的描述——一只龟坐在长满青苔的漂浮树干上水面漂着泡沫远处有枯草——模型在 5000 张候选图里精准找到了下面这张图Top-1 命中两个近似干扰项只有龟木头但缺少青苔、泡沫等细节的图都被正确排在了后面。这就是细粒度描述检索的威力。四、视频嵌入把整段视频压成一个向量视频输入会被均匀采样成帧序列官方评测使用 64 帧按帧包frame bundle约定展开后与文本一起编码输出和文本/图像完全同构的向量。典型场景是文搜视频在 MSR-VTT 基准中用文本 the mountain views are from a boat on the center of a lake湖中心船上的山景视角检索WeMM-Embedding-9B 能在一千个候选视频中把从船上拍摄湖面山景的那段排到第一并把陆上旅行视角等干扰视频排到后面。五、视觉文档嵌入检索图表、票据与页面截图视觉文档VisDoc任务处理的是以图像形式存在的文档内容图表、表格、票据、合同页、网页截图。模型需要理解图中的数字、单位和类别标签而不只是版式。看一个图表检索案例问题是按每 100 千卡热量计的羊肉与山羊肉生产的土地利用是多少模型要在 500 张图表里找到单位是每 100 千卡而不是相近的每 100 克蛋白质的那张单位、指标、类别三个条件全部对上才能命中这也是 VisDoc 任务得分最高的关键。六、交错多模态图文混排在同一个 Prompt 里第 5 种输入是前四种的组合体一段 Prompt 里文本和图片按顺序穿插排列。输入消息中的内容列表content list可以包含多个text、image、video项模型会把它们按占位符位置交错插入后一起编码。典型应用是商品信息理解与检索MCMR 任务候选商品 商品主图 Title / Description / Price / Features字段整体作为一个图文混合样本编码查询则是一条文字描述。相关解析逻辑见 mmeb_v3_eval/src/data/eval_dataset/mcmr_dataset.py交错插入的处理在 mmeb_v3_eval/src/model/processor.py。在 MMEB-v3 的 47 个 Agent 任务上交错多模态理解能力让 WeMM-Embedding 拿到同规模第一9B 达 50.1 分。七、快速上手三步跑通第一种输入依赖非常轻核心就是transformerssentence-transformerspip install -r requirements.txt仓库自带两个最小推理示例官方推荐transformers5.2.0以保证预处理行为一致python examples/transformers_inference.py \ --model /path/to/WeMM-Embedding-2B \ --image /path/to/image.jpg \ --video /path/to/video.mp4 \ --dimension 2048它会对同一条消息里的文本、图像、视频分别输出独立嵌入向量省略--dimension则使用完整维度。另外 examples/sentence_transformers_inference.py 展示了用SentenceTransformer.encode()的更简洁写法——文本、图像、视频都可以直接encode()。生产环境部署可用 vLLM 或 SGLang 起推理服务一键脚本在 scripts/serve_vllm.sh 与 scripts/serve_sglang.shSGLang 需先跑 scripts/patch_sglang_video.py 打视频补丁。八、Matryoshka 维度一个模型输出多种向量长度所有模型都支持MatryoshkaMRL嵌入截取完整向量前 d 维再 L2 归一化即可得到 d 维表示无需重新训练。维度越短向量库存储和检索越快性能损失很小——以 2B 模型为例256 维时仍保留完整维度图像/视频性能的98.7%九、性能表现与评测代码WeMM-Embedding 在 MMEB-v278 个数据集与 MMEB-v3190 个任务上全面领先同规模模型模型MMEB-v2 AVG图像视频视觉文档WeMM-Embedding-2B77.979.670.880.7WeMM-Embedding-4B79.280.872.182.0WeMM-Embedding-9B80.681.974.383.3MMEB-v3 上 9B 模型更是拿下 Agent 任务 50.1 分的全场最高分。完整对比见 README.md 的评测章节与技术报告 assets/WeMM_Embedding_tech_report.pdf。评测代码在 mmeb_v3_eval/mmeb_v3_eval/README.md 有数据下载、单机/多机多卡的完整命令如scripts/run_eval.sh。另外docs/ 是一个交互式项目页内置 6 个真实检索案例数据见 docs/data/cases.json可以在线查看每个查询的 Top-1 命中与干扰项分析。十、总结选哪种输入只有文字→ 直接传文本消息覆盖文搜图/文搜视频/语义搜索有一张图→ 图像消息适合以图搜图、同款识别有一段视频→ 视频消息采样 64 帧编码适合视频检索图表/票据/截图→ 视觉文档消息适合 RAG 图表问答、单据归档检索图文混排内容→ 交错多模态消息商品理解、GUI 轨迹、多截图对话都可以整体编码。无论哪种输入输出的都是同一个空间里的向量——这就是 WeMM-Embedding 作为多模态 Embedding 统一底座的核心价值5 种输入1 个向量空间。赞分享人工智能大模型Embedding多模态模型评测模型推理服务【免费下载链接】WeMM-EmbeddingWeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.项目地址https://gitcode.com/gh_mirrors/we/WeMM-Embedding点击查看免费下载相关推荐WeMM-Embedding概览微信开源的通用多模态嵌入模型文本、图像、视频、文档统一进一个向量空间WeMM Embedding概览微信开源的通用多模态嵌入模型文本、图像、视频、文档统一进一个向量空间 WeMM Embedding 是微信视觉团队WeCh人工智能大模型Embedding多模态模型评测模型推理服务Xinference 文本嵌入完全指南Embeddings API、多引擎服务与多模态 WeMM 输入Xinference 文本嵌入完全指南Embeddings API、多引擎服务与多模态 WeMM 输入 本文围绕 Xinference 的 Embedding模型推理服务人工智能大模型本地部署多模态语音vLLM-Omni多模态输入处理文本、图像、音频、视频全支持vLLM Omni多模态输入处理文本、图像、音频、视频全支持 vLLM Omni是一个高效的 多模态推理框架 专门设计用于处理文本、图像、音频和视频等多种模人工智能大模型模型推理服务多模态语音音频媒体生成本地部署创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

用Mermaid把文档图表变成可维护的文本源码:原理、工作流与避坑指南

用Mermaid把文档图表变成可维护的文本源码:原理、工作流与避坑指南

记不清是第几次了,为了改一张流程图里的一个判断分支,我打开绘图软件重新拖了一遍箭头。图改完还要重新导出、重新上传,然后打开聊天记录,问群里的人拿的是不是最新版本。后来我把图表换成了 Mermaid 这类文本绘图方式&#xff0c…

2026/10/11 14:18:24 阅读更多 →
中南大学数据库试题:数据库工程师能力校准器

中南大学数据库试题:数据库工程师能力校准器

简介:本资源为中南大学数据库课程历年典型试题汇编,面向计算机专业本科生、考研备考学生及数据库初学者,系统覆盖数据库原理核心考点与应试难点。试题内容紧扣教学大纲,涵盖DBMS演进逻辑、三级模式结构、ER与关系模型设计、SQL语法…

2026/10/11 14:18:24 阅读更多 →
Origin 安装全流程指南:选型、部署、激活与避坑

Origin 安装全流程指南:选型、部署、激活与避坑

简介:Origin是一套专为科研与工程领域设计的专业数据分析和绘图软件,集成数据导入、函数拟合、统计分析及二维/三维图形绘制功能,适合高校师生、科研人员及工程师用于制作论文中的高质量插图,尤其适合需要发表高水平学术论文的学者…

2026/10/11 14:18:24 阅读更多 →

最新新闻

GCC四阶段实战:从hello.c到可执行文件的完整编译链

GCC四阶段实战:从hello.c到可执行文件的完整编译链

简介:这是一份面向软件开发初学者与Linux系统使用者的GCC编译器入门指南,聚焦C/C开发环境搭建与核心编译原理。资源以PDF形式呈现,内容覆盖GCC发展沿革、多语言支持能力、跨平台特性及与G的本质区别,重点澄清四大常见误区&#xf…

2026/10/11 15:09:55 阅读更多 →
OVITO数据管道实战:分子模拟轨迹可视化与Python批处理解析

OVITO数据管道实战:分子模拟轨迹可视化与Python批处理解析

简介:OVITO是分子动力学模拟结果可视化的常用工具,这份1个PDF文件(约2.14MB)的手册与总结面向使用LAMMPS开展材料、物理、化学等模拟研究的用户,帮助快速掌握从导入Dump文件到分析原子轨迹的完整流程。内容按三部分梳理…

2026/10/11 15:09:55 阅读更多 →
220V降压24V700mA交转直芯片WT5110

220V降压24V700mA交转直芯片WT5110

220V降压24V700mA交转直芯片WT5110WT5110 是一款适用于非隔离型 AC-DC 降压转换的芯片,支持宽输入电压范围(85VAC~265VAC,部分场景可扩展至 110VAC~265VAC), 可将 220V 交流电转换为稳定的 24V 直流输出,并…

2026/10/11 15:09:55 阅读更多 →
SQL Server AlwaysOn 集群添加只读副本:从裸机到可用组的完整实战指南

SQL Server AlwaysOn 集群添加只读副本:从裸机到可用组的完整实战指南

简介:这份文档面向 SQL Server 数据库管理员与运维工程师,聚焦在已有 Always On 可用性组集群中新增一个数据库节点的完整落地流程,适合具备一定故障转移群集基础、需要横向扩展只读副本或提升高可用能力的技术人员参考。资源包内共 1 个 doc…

2026/10/11 15:09:55 阅读更多 →
SHL真题截图结构化:从PNG到JSON的6步确定性流水线

SHL真题截图结构化:从PNG到JSON的6步确定性流水线

简介:本资源为SHL在线评估测试真题截图整理文档,面向IT、金融、咨询等行业的求职者及HR招聘从业者,助力高效备考数理逻辑、数据解读与商业分析类标准化测评。文档完整呈现22道典型题目及其参考答案(含9处错题标注)&…

2026/10/11 15:09:55 阅读更多 →
2027浙大EMBA提前批面试怎么准备?底层逻辑与实战策略全解析

2027浙大EMBA提前批面试怎么准备?底层逻辑与实战策略全解析

每年到了三四月份,总会有几位在企业里做到中高层的老朋友来找我聊同样的问题:2027年想试试浙大EMBA,提前批面试到底要不要报名?我的回答从来都很干脆——只要你自己评估下来基本条件达标,就一定要申。原因并不复杂&…

2026/10/11 15:08:55 阅读更多 →

日新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 10:45:37 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:53 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:54 阅读更多 →