一、燃气轮机故障诊断中的数据不均衡与样本重叠问题
在工业设备特别是航空燃气轮机的状态监测中,采集到的故障样本通常极为稀缺,而正常运行样本数据量庞大,这使得模型训练面临严重的类别不均衡问题。此外,设备早期故障特征微弱,故障样本与正常样本在原始信号空间中往往存在高度重叠,直接在原始数据空间应用传统过采样方法容易在重叠区域生成模糊样本甚至噪声样本,进而加剧分类边界的混淆。针对此类挑战,论文《Feature-level SMOTE: Augmenting fault samples in learnable feature space for imbalanced fault diagnosis of gas turbines》提出了一种在可学习特征空间中生成故障样本的特征级数据增强方法。

在该方法的数据准备阶段,状态监测数据经过基线模型处理,提取出排气温度裕度、排气温度偏差、高压转子转速偏差以及燃油流量偏差等关键性能参数偏差量。为了保留时间序列的动态特征与前后依赖关系,数据处理采用滑动窗口方法沿时间序列截取多维时间矩阵,构建出包含正常状态与多种典型故障状态的原始时序样本集。

二、基于深度孪生多头自注意力网络的可分空间映射
特征级数据增强的核心前提是将原始重叠数据映射至具有高类间分离度的特征空间。整体框架划分为空间映射、特征级数据增强和故障分类三个连续阶段,其首要任务是通过深度孪生多头自注意力网络(DSMHSA)实现特征空间投影,拉大类间样本间距并缩小类内样本间距,为后续的样本合成提供分布边界清晰的特征表示。

在特征提取结构设计上,该方法采用多头自注意力网络(MHSANet)作为孪生子网络的主体,利用自注意力机制捕获多维时间序列在不同时间尺度上的依赖关系和参数关联。孪生网络的两个分支共享参数权重,通过构建同类样本对与异类样本对,并结合对比损失函数(Contrastive Loss)进行优化训练,从而使得映射后的同类样本在特征空间中彼此靠近,而异类样本之间的欧氏距离被推至预设边界之外。

三、特征空间中的样本插值生成与状态分类
在通过深度网络获得类间分离的特征空间后,合成少数类过采样技术(SMOTE)被直接应用于潜在特征向量层面。算法针对特征空间中的每个少数类样本,在其同类别近邻样本中寻找对应点,并在两者的特征向量连线上进行线性插值,生成具有代表性的合成特征向量,直至少数类与多数类在特征层面上达到数量均衡。

完成特征层面的数据平衡后,合并了合成样本与真实样本的平衡特征集被直接输入至由单层网络构成的Softmax分类器中进行分类训练。该方案将数据合成过程与复杂的原始时序空间解耦,在特征分布可分的空间内消除类别数量差异,使分类器在反向传播训练过程中保持对各个类别误差梯度的均衡响应,从而实现对机械系统不同运行状态的识别。
参考文献:
Feature-level SMOTE: Augmenting Fault Samples in Learnable Feature Space for Imbalanced Fault Diagnosis of Gas Turbines. Expert Systems with Applications, 2024, 238(F): 122023.
https://www.sciencedirect.com/science/article/pii/S0957417423025253