在实际工业应用与复杂系统决策中,强化学习智能体往往面临数据样本极度不平衡、环境动态演化以及多源流式数据持续增长等难题。本文介绍发表在《Advanced Engineering Informatics》期刊上的研究论文《Continual contrastive reinforcement learning: Towards stronger agent for environment-aware fault diagnosis of aero-engines through long-term optimization under highly imbalance scenarios》。
为了克服传统离线学习模式无法自适应环境变化以及小样本类别难以精确表征的局限,该研究提出了一种持续对比强化学习(Continual Contrastive Reinforcement Learning, CCRL)算法框架。CCRL将序列状态识别任务转化为智能体与环境的持续交互决策过程,通过将无监督自编码预训练、加权有监督对比学习以及类别加权深度强化学习有机结合,构建了一种具备长期优化能力和强特征辨识度的通用强化学习决策架构。
整个CCRL框架的运行与更新依赖于环境与智能体之间的闭环交互流,其整体架构如图所示。在工作流程中,运行环境持续向智能体提供多维时序传感器数据作为状态输入,智能体根据当前策略网络输出分类或决策动作。然后,环境或外部专家评估系统对智能体动作的正确性进行判定,并反馈特定的奖励信号与真实标签,所有状态转移轨迹及评价信息被统一写入经验回放池中。在此机制下,训练与推理过程不再相互割裂,智能体能够在数据持续增加的生命周期中利用回放机制不断提取经验并动态更新策略网络,从而保持对环境变化与未知数据分布的长期感知与自适应演进能力。

针对稀缺类别样本量极小所导致的特征捕获困难问题,CCRL在特征编码阶段首先引入了自编码预训练机制。该阶段完全使用海量且易于获取的正常基准序列数据对长短期记忆网络(LSTM)自编码器进行重构训练。网络通过时序门控单元逐步压缩多维输入序列,并将编码器最终时刻的隐层状态作为低维特征表达输入解码器以完成原始信号重构。由于仅在基准数据上进行无监督特征重构学习,编码器能够充分掌握时序运行状态的共性演化规律与底层压缩表征,有效避免了模型在初始阶段因少数类样本过少而产生严重的过拟合风险。
在此基础上,CCRL构建了如图所示的特征区分模块,利用加权对比学习进一步拉大不同类别之间的特征间距。该模块直接采用真实样本构建正负样本对,将同类别样本组合作为正样本对,不同类别样本组合作为负样本对,避免了时序数据人工增强带来的失真问题。
针对多类别严重不平衡的现实情况,算法在对比损失函数中引入了正负样本调节权重,通过增强同类正样本投影的聚合约束并平衡负样本排斥强度,使得同类特征在投影空间中高度紧凑而异类特征被显著分离。在此过程中,预训练好的LSTM编码器以较小的学习率进行微调,配合后接的全连接投影层,从而在保留通用时序特性的同时最大化不同状态类别的判别度。

在动作决策端,CCRL采用了基于对偶双深度Q网络(Dueling Double Deep Q-Network, D3QN)的类型识别模块,如图所示。冻结参数的对比学习编码器为该模块提供高质量的状态特征向量,输入至主决策LSTM网络中。网络末端分别通过两个独立的全连接层解耦计算状态价值与动作优势,并将两者组合为最终的动作Q值,有效规避了单一网络带来的Q值过高估计问题。
为了消除类别不平衡对梯度更新方向的干扰,环境奖励函数依据训练集中各类别样本数量的倒数进行归一化设计,使得罕见类别在正确或错误决策时获得更高绝对值的奖惩反馈,促使智能体在探索过程中对少数类决策边界施加足够关注。

CCRL智能体的训练过程采取多阶段协同与双网络交替更新策略。在动作探索阶段,策略网络结合递减探索因子的贪婪策略与环境交互生成多样化经验并存入缓冲池;在参数学习阶段,当缓冲池样本达到阈值后,算法通过均方误差损失对策略网络进行梯度反向传播更新,而目标网络则保持相对固定并周期性同步参数,以确保时序差分目标值的稳定性。
该算法从表示学习与强化学习策略优化两个维度协同发力,不仅适用于复杂装备的状态监测与故障诊断任务,其核心思想亦可作为一种通用的强化学习模式,拓展至流式数据分类、极端不平衡序列决策及非平稳环境下的长期控制等复杂任务中。
参考文献:
Continual contrastive reinforcement learning: Towards stronger agent for environment-aware fault diagnosis of aero-engines through long-term optimization under highly imbalance scenarios[J]. Advanced Engineering Informatics, 2025, 65(C): 103297.
https://www.sciencedirect.com/science/article/pii/S1474034625001909