文章主要内容总结本文针对MoE(混合专家)架构的多模态大语言模型(MLLM)推理效率低的问题,提出了训练无关的专家跳过框架MoDES。核心发现是现有单模态LLM的专家跳过方法未考虑MoE层间专家贡献异质性和模态特异性,导致MLLM性能大幅下降。MoDES通过全局调制局部门控(GMLG)、双模态阈值化(DMT)和前沿搜索算法,在13个基准测试中实现高效推理:最高可跳过88%专家,保留95%以上原始性能,预填充速度提升2.16倍,解码速度提升1.26倍,显著优于NAEE、MC-MoE等现有方法。核心创新点双关键洞察:发现浅层专家对模型输出贡献远大于深层专家,且文本与视觉 tokens 在专家网络中的更新幅度差异显著(文本 tokens 受影响更大)。全局调制局部门控(GMLG):融合层级全局重要性与局部路由概率,精准计算专家重要性得分,解决层间贡献不平衡问题。双模态阈值化(DMT):为文本和视觉 tokens 分别设置跳过阈值,适配不同模态的专家交互特性。高效前沿搜索算法:利用性能与效率的单调性,将阈值搜索时间从数天缩短至数小时,复杂度从O(ND²)降至O(ND)。Abstract 翻译混合专家(MoE)多模态大语言模型(MLLM)在视觉-语言任务中表现出色,但存在计算效率低下的问题。为降低推理开销,已有专家跳过方法基于当前输