在强化学习故障诊断系统中,决策网络权重的优化方向肯定受制于外部环境反馈的奖励信号质量。在民航实际运行中,正常气路数据规模庞大而各类故障数据极度稀缺,传统的均等化奖励机制会导致智能体产生偏向多数类的学习惰性。论文《Continual contrastive reinforcement learning: Towards stronger agent for environment-aware fault diagnosis of aero-engines through long-term optimization under highly imbalance scenarios》构建了面向样本失衡的环境交互与自适应奖励生成器组件。该组件作为智能体与物理运维流程之间的动态交互接口,通过将样本分布特征转化为非对称的奖励调节信号,从反馈源头上尽量消除了数据极度不平衡带来的决策偏置。

环境交互模块在逻辑上承担着模拟机队运行与专家标定闭环的功能。该组件内部封装了包含多航段特征序列与对应真实故障标签的样本池,并执行标准化的四步状态流转逻辑:首先,环境向决策智能体推送一组多航段时序特征状态;然后,环境接收智能体返回的诊断动作;接着,比对单元将智能体的输出与内部真实标签进行匹配,并调用奖励生成器计算即时反馈数值;最后,环境向智能体同步输出奖励数值以及后继状态样本,推动整个序列判定过程的持续进行。
自适应奖励生成器的内部计算核心在于构建基于样本存量倒数的动态赋权引擎。生成器实时统计当前训练数据池中正常工况及各细分故障类别的样本绝对数量,并按照样本量的倒数计算各个类别的基础权重。对于样本存量极少的高敏感度故障类型(如排气温度不平衡),系统赋予其极高的基础权重系数;而对于样本存量庞大的正常状态类别,则分配较低的基础权重系数。这一设计使奖励机制能够自适应感知各类别的物理稀缺程度,赋予稀有故障更高的决策敏感性。
为了尽量消除由于样本量巨大级差引发的数值计算震荡,生成器对所有类别的基础权重执行平方和开根号的全局归一化运算,据此锁定各类别对应的绝对奖励幅值。在生成即时奖励信号时,系统采用对称的正负反馈规则:若智能体准确识别出当前状态的真实类别,环境即刻返回该类别对应的正向归一化奖励;若判定错误,环境则直接赋予同等幅度的负向惩罚值。这种非均等的反馈机制使得漏报稀有故障将面临巨大的负向损失,驱使决策网络在更新梯度时优先修正对少数类故障的分类超平面。
与奖励生成器紧密配合的是环境交互控制器中内置的探索率动态退火调度器。为了防止智能体在训练初期因盲目贪婪而陷入多数类主导的局部最优,调度器在学习初始阶段设置了较高的随机探索门限,强制智能体以较大概率随机选择诊断动作,充分遍历各种稀有故障的状态空间;随着训练步数的推进,调度器依据预设的最大步数阈值对探索概率实施平滑的线性衰减,引导智能体平稳过渡至依据策略网络输出进行确定性判定,并在后期保持极小的探索冗余以应对工况漂移。
面向样本失衡的环境交互与自适应奖励生成器构成了强化学习智能体严密的反馈调控回路。该组件摒弃了传统监督学习依赖人工过采样或欠采样破坏数据分布的做法,而是通过在强化学习的价值信号中注入基于样本逆频的数学约束,系统性重构了贝尔曼损失曲面的梯度流向,从反馈机制层面尽量保障了智能体在面对极度不平衡气路故障时的判别敏锐度与全局决策稳定性。
参考文献:
Continual contrastive reinforcement learning: Towards stronger agent for environment-aware fault diagnosis of aero-engines through long-term optimization under highly imbalance scenarios[J]. Advanced Engineering Informatics, 2025, 65(C): 103297.
https://www.sciencedirect.com/science/article/pii/S1474034625001909