在工业设备监测与故障诊断领域,正常运行数据占据绝大多数,而异常数据极为稀缺,导致采集到的多维时间序列存在严重的类别不平衡与类间重叠问题。针对这一难题,相关学者在期刊《Computers in Industry》上发表了题为“Deep attention SMOTE: Data augmentation with a learnable interpolation factor for imbalanced anomaly detection of gas turbines”的研究论文。
该研究将传统过采样技术与深度学习相结合,提出了一种增强版本的SMOTE方法——深度注意力SMOTE(DA-SMOTE-ED)。该方法致力于克服传统过采样在边界区域盲目插值容易引入噪声的缺陷,为不平衡时间序列数据的异常检测提供了一种技术路径。

传统SMOTE算法通过在少数类样本及其近邻之间随机选取插值系数进行线性插值,这种完全随机的生成机制极易导致合成样本落在多数类密集的重叠危险区域,进而形成标签噪声并误导分类模型。
为了从根本上保留更多有用信息并降低噪声风险,该研究构建了一套混合重采样框架。首先,在多数类样本上采用基于聚类的欠采样策略,将多数类数据划分为多个簇并提取簇中心来代表正常样本,从而在压缩数据量、缓解不平衡程度的同时最大化保留正常状态的分布信息;然后,欠采样后的多数类样本与原始少数类样本组合,共同进入后续的特征投影与智能数据增强阶段。

为了进一步消除类间重叠对数据生成的不利影响,增强版本的SMOTE将样本生成过程从原始数据空间迁移到可学习的潜特征空间中。
DA-SMOTE-ED整体由编码网络、DA-SMOTE生成模块以及解码网络三部分构成。编码网络基于多头自注意力机制构建Transformer编码器层,能够自适应捕获多维时间序列中的复杂时序关联与特征依赖,将输入数据投影到一个类内紧凑且类间可分的潜空间中。在潜空间内完成数据增强后,结构对称的解码网络再将合成特征无损地映射回原始数据空间,确保最终生成的合成时序样本与真实样本具有一致的维度和物理意义。

DA-SMOTE模块是该方法的核心改进所在,它彻底摒弃了传统SMOTE中服从均匀分布的随机插值因子,设计了一种基于注意力的自适应插值机制。该模块将少数类样本与其近邻构成的样本对作为输入,依次通过降维线性层、非线性激活函数、升维线性层以及逻辑激活层,端到端地为每一对样本动态计算出最优的插值系数。
在学习机制的作用下,该插值因子能够感知全局数据分布,引导生成的合成少数类样本主动偏向少数类中心,并远离多数类的聚集区域,从而显著抑制了重叠区域噪声样本的产生。

为了使模型能够同时兼顾特征保真度与类别可分性,DA-SMOTE-ED在训练过程中联合优化了重构损失与三元组中心损失。重构损失采用类别平衡的距离度量,约束编码器和解码器在降维映射与逆映射过程中保留原始时序的关键模式信息;三元组中心损失则同时作用于真实特征与合成特征,通过拉近样本与其所属类别中心的距离、同时推远样本与相异类别中心之间的距离,显式地拉大类间边界。这种双重驱动的目标机制不仅重塑了更加清晰的决策边界,也使得注意力模块生成的插值因子具备了明确的物理导向性。
在完成潜空间插值与解码重构后,合成的少数类时序样本与欠采样后的多数类样本进行拼接,重构出完全平衡的新训练集。在此基础上,系统采用基于自注意力机制的分类网络作为下游判别器,对多维时间序列样本进行端到端的二分类判决。
该方法不仅在一定程度上解决了传统SMOTE在复杂时序和重叠边界下的退化问题,其网络结构与损失函数设计还具备良好的通用性,通过扩展类别中心定义即可直接适配多分类故障识别任务,展现了数据驱动与深度注意力相结合在工业数据增强领域的实用潜力。
参考文献:
Deep attention SMOTE: Data augmentation with a learnable interpolation factor for imbalanced anomaly detection of gas turbines[J]. Computers in Industry, 2023, 151: 103972.
https://www.sciencedirect.com/science/article/pii/S0166361523001227