论文题目MLFork: Bearing fault diagnosis via Mamba-powered few-shot learning model with multi-level architecture enhanced by spatial-wise and channel-wise local vector attention中文译名MLFork通过空间级与通道级局部向量注意力增强多层级架构的 Mamba 驱动小样本轴承故障诊断模型期刊Neurocomputing2025摘要轴承是电机和机械设备中最重要的部件之一但轴承容易受到损伤从而降低设备安全性并导致机器故障。包括深度学习在内的多种方法可用于轴承故障诊断然而在实际应用中模型必须适应来自用户端的训练数据不足问题同时仍保持良好性能。为解决这一问题本文提出一种新型MLFork模型它遵循小样本学习算法并在特征提取和分类前处理阶段进行了改进。在特征提取方面本文引入新的Bi-Context Visual State Space Block能够以多种方式有效学习样本的全局上下文。在多层级分类模块之前模型使用相互独立的空间级和通道级局部向量注意力路径以突出局部描述子中的重要细节。为评价模型性能作者在美国凯斯西储大学CWRU和帕德博恩大学PU数据集上开展了多组实验MLFork 表现出良好的结果。模型代码将发布于https://github.com/thzhere/MLFork 。一、研究背景与核心问题故障振动数据采集、标注成本高少量数据训练容易过拟合。小样本诊断通常采用Support支持集—Query查询样本任务每类提供 K 个支持样本判断查询样本所属类别。K-shot 是每类支持样本数不等于训练集总量。论文主要关注两个问题如何同时建模全局与局部CNN 擅长局部纹理Transformer 能捕获长距离依赖但计算开销较高。两种度量该不该共享同一份特征原 Multi-Level 模型的空间、通道分类器共用特征图可能相互牵制。作者先用Mamba/SS2D 学全局、多尺度卷积学局部再分别增强空间、通道特征并融合分类结果。Fork指的就是这种分叉结构。二、MLFork 整体框架先共享提取再分路比较论文 Figure 1原始振动信号经过 STFT 转换为时间—频率谱图。论文 Figure 2MLFork 整体结构包括共享特征提取器、PSVA/PCVA 双路径与双分类器。输入并不是直接送入 Mamba 的一维振动序列。论文先进行短时傅里叶变换STFT再将谱图统一调整为64 × 64主实验采用512 点 STFT 窗长。Query 和 Support 经共享参数的四层卷积、Bi-Context VSS 和 SAFE再分成两条路径。空间路径PSVA 增强空间向量以协方差度量得到分数S通道路径PCVA 增强通道向量以余弦度量得到分数C。两路经一维卷积汇总再加权形成最终分数T。完整数据流原始振动 → STFT → Conv ×4 → Bi-Context VSS → SAFE → {PSVA → 协方差分类PCVA → 余弦分类} → 加权融合 → 故障类别。模型前端共享但两个度量头获得各自适配的增强特征并非简单堆叠分类器。三、全局与局部特征提取Bi-Context VSS SAFE3.1 Bi-Context VSS用两条 Mamba 分支看同一张谱图论文 Figure 3Bi-Context VSS 及其内部 ResMeVSS 模块结构。论文 Figure 4SS2D 的四向扫描正常、翻转、转置、转置后翻转。Bi-Context VSS 的核心是两条平行分支每条均由ResMeVSS → 大核轴向深度卷积Axial Depthwise Conv7 × 7构成。ResMeVSS 利用基于 Mamba 的二维选择性扫描SS2D沿四个方向展开特征缓解单向扫描的方向偏置以较简洁的结构捕获全局关系。两条分支并非直接平均。第 i 条分支为T_context,i ADW_i(ResMeVSS_i(T))随后通过 GAP、Softmax 计算分支权重加权求和再经 Pointwise Conv 融合。相当于两种全局视角的自适应选择。3.2 SAFE全局信息之后还需要局部细节论文 Figure 5SAFESelective Aggregation Feature Extractor内部结构。为补足细小冲击纹理作者采用已有的 SAFE 模块以三条3 × 3 膨胀卷积膨胀率 1/2/3提取多范围局部模式再通过 GAP、Softmax 自适应融合。二者分别回答整体有什么规律局部哪里不一样四、双向量注意力与多层级分类为什么要分叉4.1 PSVA 与 PCVA关注的不是同一个维度论文 Figure 6Priority Spatial Vector AttentionPSVA结构。论文 Figure 7Priority Channel Vector AttentionPCVA结构。设特征图形状为C × H × W。从空间角度看它有 H × W 个长度为 C 的空间向量从通道角度看它有 C 个长度为 H × W 的通道向量。两者都重新加权向量内部信息但作用维度不同。PSVA 计算通道间协方差以 Depthwise Conv 前后的关系变化生成 Softmax/Sigmoid 权重再作用于每个空间向量。它回答一个位置的哪些通道分量更重要PCVA 则经 Pointwise Conv比较空间位置间的余弦相似度矩阵得到长度为 H × W 的权重并作用于每个通道向量。它回答某个通道中哪些空间位置更重要两路独立以减少相互干扰。4.2 一个用协方差一个用余弦度量要匹配特征论文 Figure 8空间级分类器基于支持样本协方差矩阵的匹配。论文 Figure 9通道级分类器基于向量余弦相似度的匹配。空间级分类器先基于某一类支持样本构建协方差矩阵 Σₙ再让查询样本的每个空间向量 yᵢ 与该矩阵进行二次型度量Σₙ 表示第 n 类支持特征的协方差Aₙ,ᵢ 为查询空间向量的匹配响应。这比单纯的点对点距离多利用了二阶统计关系结果经Conv1D汇总为 S。通道级分类器计算查询和支持特征中通道向量的成对余弦相似度经归一化和 Conv1D 得到通道分数 C。最终分类分数遵循论文式56其中 w₁、w₂ 为可学习权重。关键是先按度量目标增强特征再融合互补的分类分数。五、实验结果与消融分析5.1 数据、评价方式与任务设定论文在CWRU10 类和PU13 类两个轴承故障数据集上评估模型。前者包含不同部位和尺寸的故障后者包含真实与人工故障类别更复杂。类别见Table 1–2信号示例见Figure 10–11。实验同时改变训练集总样本数与 episodic 任务中的1-shot/5-shot支持样本数训练和测试均采用 100 个 episode以 Accuracy、Recall、F1 评价测试集分别为 750 和 6464 条。需要强调“60/195 training samples”指实验训练集规模不是每类 60/195-shot。5.2 CWRU极少训练数据也能较准确地区分类别论文 Table 3CWRU 上不同训练集规模、1-shot 与 5-shot 的主实验对比。在训练集仅 60 条样本、1-shot时MLFork 的 Accuracy/F1 都为99.60%高于 Multi-Level 的99.07%和 MixMamba 的99.00%。同样是 60 条训练样本切换至 5-shot 后MLFork 达到100%。随着训练数据增多各方法逐渐接近上限极少样本下的差距更有参考意义。论文 Figure 12–13CWRU 低样本实验的混淆矩阵与 t-SNE 特征可视化。Figure 12 显示部分基线容易混淆不同损伤程度的滚动体故障而 MLFork 的预测集中在对角线Figure 13 的 t-SNE 也显示类别分离更清晰。但降维可视化不能替代定量泛化评估。5.3 PU复杂故障下的提升更有参考价值论文 Table 4PU 上不同训练集规模、1-shot 与 5-shot 的主实验对比。PU 更具挑战性。在195 条训练样本、1-shot下MLFork 的 Accuracy 为91.00%Multi-Level 为87.38%MixMamba 为83.62%5-shot 时 MLFork 达到93.00%。训练集为 260 条、1-shot 时MLFork 取得93.31%进一步显示分叉注意力与双度量设计的优势。论文 Figure 14–15PU 低样本实验的混淆矩阵与 t-SNE 可视化。这两张图呈现 PU 的易混类别及特征聚集情况可与 Table 4 的定量结果相互印证。但其并非所有设置都第一例如 PU 的 1300 条训练样本、5-shot 下MLFork 为98.62%低于 MixMamba 的99.23%。因此更准确的结论是MLFork 在多数、尤其是低样本场景中具有较强竞争力。5.4 噪声鲁棒性两套数据集表现并不一致论文 Table 5CWRU60 条训练样本、1-shot不同高斯噪声强度下的诊断结果。论文 Table 6PU195 条训练样本、1-shot不同高斯噪声强度下的诊断结果。论文 Figure 16两个数据集随信噪比变化的 Accuracy 与 Recall 曲线。噪声添加于原始时域信号未额外去噪。CWRU 在5 dB时MLFork 仍有92.60%Accuracy而 Multi-Level 为66.60%优势明显。然而 PU 的结果不同在10 dB时MLFork 为75.46%低于 Multi-Level 的78.15%在5 dB时MLFork 进一步降至59.85%也低于 Multi-Level 的61.77%。因此不能笼统地说“MLFork 在所有噪声条件下最鲁棒”其抗噪能力存在明显的数据集依赖性。5.5 向量注意力消融两条注意力是否必要论文 Table 7CWRU 上关闭或开启 PSVA/PCVA 的消融。论文 Table 8PU 上关闭或开启 PSVA/PCVA 的消融。在 CWRU 的60 条、1-shot设置中全部关闭注意力时 Accuracy 为97.27%仅开启 PSVA 为98.80%仅开启 PCVA 为99.13%两者同时开启则为99.60%。PU 的195 条、1-shot下相应结果从无注意力的83.77%提高至双注意力的91.00%。因此两路注意力表现出互补性不过单独一支并非在所有 PU 设置下都优于基线。5.6 双分类器消融通道级分支为什么仍值得保留论文 Table 9CWRU 上仅空间级、仅通道级及双分支分类的对比。论文 Table 10PU 上三种分类器配置的对比。在 CWRU 的60 条、1-shot设置中仅空间级分类得到97.20%仅通道级为89.87%联合后达到99.60%PU 的195 条、1-shot下分别为88.85%、83.15%、91.00%。空间级度量在低样本时更强通道级提供补充信息单独较弱的分支仍可能提高融合效果。5.7 STFT 窗长与注意力可解释性论文 Table 11CWRU 在 STFT 窗长 256、512、1024 下的性能对比。论文 Table 12PU 在 STFT 窗长 256、512、1024 下的性能对比。STFT 窗长影响时频分辨率之间的权衡。以 CWRU 的60 条、1-shot为例256/512/1024 对应 Accuracy98.70%/99.60%/96.80%PU 的195 条、1-shot则为86.54%/91.00%/86.23%。因此论文选用 512并且这一选择在所报告的窗口对比中持续占优。与此同时这也说明模型对人为选择的时频变换参数仍有依赖。论文 Figure 17PCVA 对正常、内圈故障、外圈故障产生的注意力图。Figure 17 展示同一故障类别下不同样本的注意力模式较为一致而不同故障类别对应的高响应区域存在区别。这是 PCVA 具备类别相关响应的直观证据但不等同于物理故障机理解释。六、总结与思考如果把 MLFork 压缩成一句话就是用 Bi-Context VSS 与 SAFE 建立全局—局部联合表示再针对空间与通道两种度量分别强化向量最终通过可学习融合完成小样本故障分类。启发是让特征表示与度量目标匹配而非一味加深网络。论文实验支持 MLFork 在 CWRU 和 PU 多数小样本场景中的优势消融也比较明确地说明了双向量注意力和双分类器的互补作用。不过作者同时指出三点限制STFT 窗长依赖经验选取实验基于类别分布较均衡、训练与测试故障类型一致的条件在强噪声下的表现尚不充分稳定。从工程应用看后续更值得检验的是跨工况、跨设备、类别不一致与更复杂噪声下的泛化能力而不是只追求标准数据集上的接近满分准确率。