多年前在一家水泥厂的巡检通道上老师傅掏出一根螺丝刀把刀尖顶在风机轴承座外壳上另一头贴着耳朵听。他说这个声音比上周毛了一点。三个月后那台风机换了轴承。这套判断很准但只长在少数人身上——人一退休经验就带走了。振动分析要干的事其实是把这种听出来的手感变成一条可以被机器持续跟踪的曲线不是等振动超标停机而是在故障萌芽期就看出趋势。为什么不等它坏了再修旋转机械里轴承、齿轮、转子是最容易出问题的地方。轴承滚道点蚀、齿面磨损、联轴器不对中、转子不平衡这些退化都不是一夜之间发生的。它们在时域波形上会留下两类痕迹一类是周期性的冲击每次滚子碾过缺陷就弹一下另一类是幅值调制转频的包络把故障特征裹在里面。只要能把波形稳定地采下来退化在早期就是可观测的。布点与安装先把信号入口做对测点选错的代价后面算法再怎么补也补不回来。工程上一般按力的传递路径布点靠近轴承座、刚度高、表面平整的位置优先同一台设备上后续要对比的测点位置和方向要保持一致。方向通常三个都测——水平、垂直、轴向不同故障对不同方向的敏感度不一样。安装方式决定可用上限螺栓固定的频响最好磁吸次之手持探针最省事但也最不稳。传感器和被测面之间要干净、贴合、拧紧松一点就多一层谐振采集系统里再想滤掉就难了。采样与工况记录别把转速丢了采样率要够。工程惯例是覆盖到关心的最高分析频率之上通常留出数倍余量具体倍数按设备类型和分析目标定。比采样率更常被忽略的是转速与工况记录负载变了、转速变了、料位变了振动幅值本来就会动不看工况光看幅值几乎必然误判。所以采集时至少要同步留下转速、负载、温度这类标签作为后续建模和判读的上下文。时域统计特征四个最常看的指标不翻频域光在时域里就能提取出一批非常有用的指标RMS有效值整体能量水平反映振动烈度的总趋势适合看缓慢劣化。峭度对冲击敏感信号里出现尖峰时它会先动早期点蚀常常是它先报警而 RMS 还平得像没事。峰值因子峰值与有效值之比同样是冲击型故障的早期探针但会随故障发展先升后降不能单指标看。裕度因子峰值与方根幅值之比对早期冲击也较敏感常和峰值因子一起交叉验证。这四个指标的价值在于轻量——可以直接在边缘侧算不需要复杂模型也便于长期画趋势线。包络解调与阶次分析冲击型故障的信息藏在高端载波里直接用谱看容易淹没在噪声中。工程上常规做法是先做带通滤波再对信号做包络解调把故障特征频率搬到低频段来看。更贴合旋转机械的一步是阶次分析把时间轴按转速换算成角度轴转速波动带来的糊就被校正掉故障特征频率与轴频之间的整数比例关系会清晰浮现。这一步做对了后面的模型输入质量会完全不同。上 AI几种模型各管一段深度学习在这里不是用来替代物理判断而是补上人工看不到的高维模式CNN把时域波形或时频图当图像处理擅长自动抓局部冲击形态省掉大量手工特征工程。LSTM 一类序列模型适合处理连续采样序列对退化过程的时序依赖建模便于输出趋势。自编码器做异常检测只用健康数据训练重构器新样本重构误差变大就意味着偏离正常状态。这条路线的好处是故障样本稀缺时也能起步。迁移学习一台设备的标签数据少就把同类设备、相近工况上学到的表示迁移过来再做小样本微调。剩余寿命怎么估RULRemaining Useful Life。做法通常是先构造一个能跟随退化单调变化的健康指标再让它去外推到阈值还有多久。真实场景里退化曲线的拐点比直线段更关键因此既要给出预测值也要给出不确定区间——检修排期需要的是大概还有多少时间、置信到什么程度而不是一个过于精确的数字。在线推理与告警闭环落地形态一般是边缘侧做特征与轻量推理、平台侧做趋势与模型迭代。告警要分级轻微偏离只进观察清单到达需关注级别才推给检修确认临近失效才触发工单。更重要的是闭环——每一次告警最终发生了什么要回填成标签模型才有持续学习的输入只有单向告警没有回填的系统跑半年就没人信了。误报从哪来最典型的两个来源一是工况漂移转速、负载、环境温度变了振动特征跟着变模型却以为设备坏了于是需要工况归一化或迁移学习来对齐。二是样本失衡正常数据海量真实故障少得可怜模型很容易学会全部判正常也能拿高准确率。应对手段包括重采样、代价敏感训练、以异常检测为主、以及人为构造合理的数据增强——但增强要贴近物理否则是在教模型学假象。和工艺知识、检修记录对齐同样的振动幅值在不同工艺阶段含义不同同一条谱线异常是不是真需要停机往往要看检修记录里这台设备上次拆开时看到什么。工艺知识负责给特征加约束检修记录负责给模型加标签两者缺一AI 就只能停在演示阶段。真正能减少非计划停机的方案通常不是算法最花哨的那一个而是把测点、采集、指标、模型、告警和检修流程串成一条闭环的那一个。