在利用深度学习进行设备状态监测与故障诊断时,往往面临正常样本充足而故障样本极度匮乏的类别不平衡困境。本文分享发表于《Computers in Industry》的研究论文《Empirical mode reconstruction: Preserving intrinsic components in data augmentation for intelligent fault diagnosis of civil aviation hydraulic pumps》。一维时序信号不同于直观的图像,盲目的数据变换极易破坏信号原有的物理特征与故障属性,因此如何在一维信号扩充过程中既提升样本多样性又严格保持其本质类别特征,是解决不平衡分类的关键。
为了实现高质量的时序数据扩增,论文提出了一种名为经验模态重构(Empirical Mode Reconstruction, EMR)的通用数据增强方法。该方法将复杂时序信号视作多种固有振动源的叠加,通过自适应时频分解技术将信号解耦,并在特定固有分量上施加可控的幅值微调,最后重构出全新样本。这种“模态级微整形”的处理方式,在一定程度上确保了生成样本在继承原始信号核心物理机制(满足类别不变性)的同时,产生合理的形态差异(丰富样本多样性)。

在具体的数据生成步骤中,EMR首先对输入的原始一维信号进行零均值化处理,并计算该样本的标准差作为基准属性。接着,算法调用经验模态分解(EMD)将该时序信号自适应分解为若干个代表不同频率尺度的固有模态函数(IMF)。然后,算法在这些分解出的模态中随机挑选一个IMF分量,并从预先设定的合理数值区间内抽取一个权重系数对该分量进行线性缩放,从而在局部频带引入平滑且受控的扰动。

完成局部扰动后,算法将经过加权缩放的模态与其余未作调整的模态分量进行线性直接求和,重新合成一条一维时序信号。由于模态的缩放可能会引入基线漂移并改变能量水平,重构后的新信号会再次执行去均值操作,并根据原始样本的标准差进行严格的等比例缩放校准。这一统计量对齐步骤确保了生成样本在直流偏置与总体振幅离散度上与母样本保持一致,锁定了判断设备运行状态的关键宏观特征。

在与卷积神经网络等深度学习模型结合时,EMR采取了动态在线增强的训练架构。它并非在训练前静态生成一批固定的扩展样本,而是在每一个训练轮次中实时对少数类样本执行重新分解与加权重构,并与多数类样本动态组装为平衡的训练批次。这种动态机制让神经网络在每个训练周期中都能接触到细微不同的新样本形态,有助于遏制深度模型对小样本噪声的记忆效应,降低过拟合风险。
总体而言,经验模态重构构建了一套通用且具有较强物理可解释性的一维时序数据增强机制,不仅适用于振动信号,也可推广至声学、电流、压力等各类旋转与往复机械的时序监测场景。通过将自适应信号分解、局部模态加权、宏观统计量约束与动态训练策略有机融合,EMR为解决工业时序大数据中的小样本与类别不平衡难题提供了一条的工程技术路径。
来源文献:
Empirical mode reconstruction: Preserving intrinsic components in data augmentation for intelligent fault diagnosis of civil aviation hydraulic pumps[J]. Computers in Industry, 2022, 134: 103557.
https://www.sciencedirect.com/science/article/pii/S0166361521001640