发动机故障诊断智能体(五):面向样本失衡的环境交互与自适应奖励生成器

简介: 在民航实际运行中,正常气路数据规模庞大而各类故障数据极度稀缺,传统的均等化奖励机制会导致智能体产生偏向多数类的学习惰性。该论文构建了面向样本失衡的环境交互与自适应奖励生成器组件。该组件作为智能体与物理运维流程之间的动态交互接口,通过将样本分布特征转化为非对称的奖励调节信号,从反馈源头上尽量消除了数据极度不平衡带来的决策偏置。

在强化学习故障诊断系统中,决策网络权重的优化方向肯定受制于外部环境反馈的奖励信号质量。在民航实际运行中,正常气路数据规模庞大而各类故障数据极度稀缺,传统的均等化奖励机制会导致智能体产生偏向多数类的学习惰性。论文《Continual contrastive reinforcement learning: Towards stronger agent for environment-aware fault diagnosis of aero-engines through long-term optimization under highly imbalance scenarios》构建了面向样本失衡的环境交互与自适应奖励生成器组件。该组件作为智能体与物理运维流程之间的动态交互接口,通过将样本分布特征转化为非对称的奖励调节信号,从反馈源头上尽量消除了数据极度不平衡带来的决策偏置。

ScreenShot_2026-09-18_205629_981.png

环境交互模块在逻辑上承担着模拟机队运行与专家标定闭环的功能。该组件内部封装了包含多航段特征序列与对应真实故障标签的样本池,并执行标准化的四步状态流转逻辑:首先,环境向决策智能体推送一组多航段时序特征状态;然后,环境接收智能体返回的诊断动作;接着,比对单元将智能体的输出与内部真实标签进行匹配,并调用奖励生成器计算即时反馈数值;最后,环境向智能体同步输出奖励数值以及后继状态样本,推动整个序列判定过程的持续进行。

自适应奖励生成器的内部计算核心在于构建基于样本存量倒数的动态赋权引擎。生成器实时统计当前训练数据池中正常工况及各细分故障类别的样本绝对数量,并按照样本量的倒数计算各个类别的基础权重。对于样本存量极少的高敏感度故障类型(如排气温度不平衡),系统赋予其极高的基础权重系数;而对于样本存量庞大的正常状态类别,则分配较低的基础权重系数。这一设计使奖励机制能够自适应感知各类别的物理稀缺程度,赋予稀有故障更高的决策敏感性。

为了尽量消除由于样本量巨大级差引发的数值计算震荡,生成器对所有类别的基础权重执行平方和开根号的全局归一化运算,据此锁定各类别对应的绝对奖励幅值。在生成即时奖励信号时,系统采用对称的正负反馈规则:若智能体准确识别出当前状态的真实类别,环境即刻返回该类别对应的正向归一化奖励;若判定错误,环境则直接赋予同等幅度的负向惩罚值。这种非均等的反馈机制使得漏报稀有故障将面临巨大的负向损失,驱使决策网络在更新梯度时优先修正对少数类故障的分类超平面。

与奖励生成器紧密配合的是环境交互控制器中内置的探索率动态退火调度器。为了防止智能体在训练初期因盲目贪婪而陷入多数类主导的局部最优,调度器在学习初始阶段设置了较高的随机探索门限,强制智能体以较大概率随机选择诊断动作,充分遍历各种稀有故障的状态空间;随着训练步数的推进,调度器依据预设的最大步数阈值对探索概率实施平滑的线性衰减,引导智能体平稳过渡至依据策略网络输出进行确定性判定,并在后期保持极小的探索冗余以应对工况漂移。

面向样本失衡的环境交互与自适应奖励生成器构成了强化学习智能体严密的反馈调控回路。该组件摒弃了传统监督学习依赖人工过采样或欠采样破坏数据分布的做法,而是通过在强化学习的价值信号中注入基于样本逆频的数学约束,系统性重构了贝尔曼损失曲面的梯度流向,从反馈机制层面尽量保障了智能体在面对极度不平衡气路故障时的判别敏锐度与全局决策稳定性。

参考文献:
Continual contrastive reinforcement learning: Towards stronger agent for environment-aware fault diagnosis of aero-engines through long-term optimization under highly imbalance scenarios[J]. Advanced Engineering Informatics, 2025, 65(C): 103297.
https://www.sciencedirect.com/science/article/pii/S1474034625001909

相关文章
|
机器学习/深度学习 人工智能 计算机视觉
万物皆Contrastive Learning,从ICLR和NIPS上解读对比学习最新研究进展(三)
万物皆Contrastive Learning,从ICLR和NIPS上解读对比学习最新研究进展(三)
3076 0
万物皆Contrastive Learning,从ICLR和NIPS上解读对比学习最新研究进展(三)
|
14小时前
|
机器学习/深度学习 索引
发动机故障诊断智能体(四):价值解耦型决斗深度决策网络
在智能体完成特征时序压缩与可分性优化后,系统需要一个具备离散状态决策与多类辨识能力的逻辑控制中枢。该组件位于特征提取网络后端,负责接收经过对比微调的紧凑时序表征,并通过解耦状态自身价值与各候选动作的相对优势,将连续的气路特征映射为离散的故障诊断结论。
|
14小时前
|
存储 机器学习/深度学习 运维
发动机故障诊断智能体(六):经验重放存储结构与双网络参数同步机制
在发动机故障诊断智能体完成特征感知、空间优化、决策构建以及奖励调节的模块化设计后,系统需要一套可靠的存储调度与参数更新机制来保障长效在线演化。该论文通过构建经验重放存储结构与双网络异步参数同步机制,搭建起智能体持续学习的基础支撑体系。该体系在时间维度上解耦了物理数据的采集过程与算法模型的梯度优化过程,从工程架构层面尽量保障了智能体在长期服役中的数值收敛性与抗遗忘能力。
|
3天前
|
传感器 机器学习/深度学习 设计模式
面向航空发动机的故障诊断智能体论文解读
提出了一种将环境感知与持续演化相融合的故障诊断智能体构建方法,该智能体的核心设计思路是将民航日常运营环境转化为智能体的交互学习场域。
|
15小时前
|
机器学习/深度学习 前端开发
发动机故障诊断智能体(三):特征可分性优化与加权对比投影层
在基础时序编码网络完成对正常工况的压缩表征后,尽管模型具备了提取稳态规律的能力,但在面对多种不同类型的微量气路故障时,潜在空间中的特征分布仍可能存在相互交叠的现象。该组件致力于通过引入度量对比学习机制,在特定的低维投影空间内重塑特征拓扑结构,系统性优化不同故障模式之间的几何可分性。
|
15小时前
|
机器学习/深度学习 算法 前端开发
发动机故障诊断智能体(二):基础时序压缩与长短期记忆编码网络
在智能体完成气路多航段时序数据的采集与规整后,高维度的原始时序信号需要经过深度表征与降维处理,以消除高频测量噪声并提炼本质物理趋势。采用长短期记忆自编码器架构,在脱离人工标签监督的情况下,利用海量正常运行数据进行自监督重构训练,构建出能够压缩并表征发动机稳态工况与退化趋势的时序特征提取模型。
|
16小时前
|
传感器 数据采集 机器学习/深度学习
发动机故障诊断智能体(一):气路状态感知与多航段时序输入模块
作为故障诊断智能体感知物理世界的前端中枢,数据采集与输入构建模块决定了后续算法对发动机真实运行状态的表征质量。
|
15天前
|
机器学习/深度学习 算法
船舶柴油机活塞烧蚀故障的热力学建模与可解释故障诊断
该研究提出了热力学仿真辅助随机森林方法,通过构建一维热力学仿真模型获取故障演化规律,并将机理先验知识与机器学习算法相结合,开展了面向活塞烧蚀等燃烧室故障的特征提取、状态辨识与双视角可解释性分析。
|
6天前
|
机器学习/深度学习 算法 大数据
论文分享 | 给时序信号做微整形:基于经验模态重构(EMR)的数据增强
为了实现高质量的时序数据扩增,论文提出了一种名为经验模态重构(Empirical Mode Reconstruction, EMR)的通用数据增强方法。

热门文章

最新文章