在航空发动机实际运行过程中,故障样本稀少且类别多样,同时监测数据随飞行任务持续积累。针对这一长期优化与高不平衡场景,论文 Continual contrastive reinforcement learning: Towards stronger agent for environment-aware fault diagnosis of aero-engines through long-term optimization under highly imbalance scenarios 提出了一种将环境感知与持续演化相融合的故障诊断智能体构建方法。航空发动机在服役周期内大部分时间处于正常状态,故障记录主要来源于制造商的客户通知报告与专家研判。如何让智能体在有限且极不均衡的故障标签下,持续吸收日常飞行数据并准确识别早期故障隐患,是该研究关注的核心工程问题。
该智能体的核心设计思路是将民航日常运营环境转化为智能体的交互学习场域。在实际业务流程中,发动机状态参数通过机载报文传输至地面并解析,智能体以此为基础评估当前发动机的健康状态并输出诊断判断;地面工程专家结合实际维护情况对诊断结果进行验证与评估,进而将传感数据、判定行为和反馈评价存入经验库。智能体通过定期从经验库中提取样本进行自我更新,实现与真实机队运营的动态同步。这一机制打破了传统模型离线训练与线上部署的割裂状态,使智能体能够伴随数据增长自适应环境变化。
为了让智能体在故障样本极其匮乏的情况下仍能有效提取特征,研究设计了前置的特征区分模块。传统对比学习通常依赖数据增强手段生成正负样本对,但在发动机时序数据中盲目生成样本容易引入不确定性。该智能体直接将同类故障样本作为正样本对,异类故障样本作为负样本对,并引入样本权重以抑制类间干扰。同时,智能体首先利用海量正常样本预训练基于长短期记忆网络的自编码器,捕捉发动机正常运行的基准规律,再利用加权对比损失微调编码器,从而拉近同类样本表征并推远异类样本表征,为后续决策奠定特征基础。
在具体类别识别层面,智能体采用了基于对偶双重深度Q网络(D3QN)的决策架构。智能体将编码器提取的时序特征作为状态输入,由主干网络与状态值层、动作优势层解耦计算各故障类别的Q值,进而选取最大值对应的动作作为诊断结论。为了解决样本高度不平衡导致的识别偏差,环境反馈的奖励规则根据各类别样本数量的倒数进行归一化加权,提高稀有故障样本的奖惩权重。在学习机制上,智能体通过探索率衰减策略平衡早期试错与后期决策,并利用策略网络与目标网络的周期性异步更新,有效缓解价值高估问题,实现稳定的状态到动作映射。
智能体的感知输入紧密贴合航空发动机气路监测的物理机理。以CFM56系列涡扇发动机为例,核心监测参数包括高低压转速、燃油流量及排气温度等,这些数据由分布于压气机、燃烧室和涡轮区域的传感器采集,并在起飞、巡航等关键飞行阶段经由通信系统下传。原始传感读数经过发动机制造商的专用算法修正,转换为反映气路性能偏离的衍生参数。智能体接收连续多个航段的序列化参数矩阵作为输入,有效捕捉部件渐变过程与突发异常,从而实现对典型气路故障和传感器失效的精准判别。
总体而言,该研究通过对比学习特征提取与强化学习决策优化的有机结合,为数据不平衡与动态演化场景下的航空装备故障诊断提供了一种务实的智能体构建方案。该智能体无需依赖人工合成时序数据,即可利用存量有限样本建立稳定的故障区分边界,并能随着航线数据的不断累积进行持续学习与升级。
这种将工业业务闭环与智能体交互优化相结合的设计模式,不仅为航空发动机的视情维护提供了可行路径,也对其他复杂工业装备的长周期智能运维具有参考价值。
参考文献:
Continual contrastive reinforcement learning: Towards stronger agent for environment-aware fault diagnosis of aero-engines through long-term optimization under highly imbalance scenarios[J]. Advanced Engineering Informatics, 2025, 65(C): 103297.
https://www.sciencedirect.com/science/article/pii/S1474034625001909