发动机故障诊断智能体(五):面向样本失衡的环境交互与自适应奖励生成器

简介: 在民航实际运行中,正常气路数据规模庞大而各类故障数据极度稀缺,传统的均等化奖励机制会导致智能体产生偏向多数类的学习惰性。该论文构建了面向样本失衡的环境交互与自适应奖励生成器组件。该组件作为智能体与物理运维流程之间的动态交互接口,通过将样本分布特征转化为非对称的奖励调节信号,从反馈源头上尽量消除了数据极度不平衡带来的决策偏置。

在强化学习故障诊断系统中,决策网络权重的优化方向肯定受制于外部环境反馈的奖励信号质量。在民航实际运行中,正常气路数据规模庞大而各类故障数据极度稀缺,传统的均等化奖励机制会导致智能体产生偏向多数类的学习惰性。论文《Continual contrastive reinforcement learning: Towards stronger agent for environment-aware fault diagnosis of aero-engines through long-term optimization under highly imbalance scenarios》构建了面向样本失衡的环境交互与自适应奖励生成器组件。该组件作为智能体与物理运维流程之间的动态交互接口,通过将样本分布特征转化为非对称的奖励调节信号,从反馈源头上尽量消除了数据极度不平衡带来的决策偏置。

ScreenShot_2026-09-18_205629_981.png

环境交互模块在逻辑上承担着模拟机队运行与专家标定闭环的功能。该组件内部封装了包含多航段特征序列与对应真实故障标签的样本池,并执行标准化的四步状态流转逻辑:首先,环境向决策智能体推送一组多航段时序特征状态;然后,环境接收智能体返回的诊断动作;接着,比对单元将智能体的输出与内部真实标签进行匹配,并调用奖励生成器计算即时反馈数值;最后,环境向智能体同步输出奖励数值以及后继状态样本,推动整个序列判定过程的持续进行。

自适应奖励生成器的内部计算核心在于构建基于样本存量倒数的动态赋权引擎。生成器实时统计当前训练数据池中正常工况及各细分故障类别的样本绝对数量,并按照样本量的倒数计算各个类别的基础权重。对于样本存量极少的高敏感度故障类型(如排气温度不平衡),系统赋予其极高的基础权重系数;而对于样本存量庞大的正常状态类别,则分配较低的基础权重系数。这一设计使奖励机制能够自适应感知各类别的物理稀缺程度,赋予稀有故障更高的决策敏感性。

为了尽量消除由于样本量巨大级差引发的数值计算震荡,生成器对所有类别的基础权重执行平方和开根号的全局归一化运算,据此锁定各类别对应的绝对奖励幅值。在生成即时奖励信号时,系统采用对称的正负反馈规则:若智能体准确识别出当前状态的真实类别,环境即刻返回该类别对应的正向归一化奖励;若判定错误,环境则直接赋予同等幅度的负向惩罚值。这种非均等的反馈机制使得漏报稀有故障将面临巨大的负向损失,驱使决策网络在更新梯度时优先修正对少数类故障的分类超平面。

与奖励生成器紧密配合的是环境交互控制器中内置的探索率动态退火调度器。为了防止智能体在训练初期因盲目贪婪而陷入多数类主导的局部最优,调度器在学习初始阶段设置了较高的随机探索门限,强制智能体以较大概率随机选择诊断动作,充分遍历各种稀有故障的状态空间;随着训练步数的推进,调度器依据预设的最大步数阈值对探索概率实施平滑的线性衰减,引导智能体平稳过渡至依据策略网络输出进行确定性判定,并在后期保持极小的探索冗余以应对工况漂移。

面向样本失衡的环境交互与自适应奖励生成器构成了强化学习智能体严密的反馈调控回路。该组件摒弃了传统监督学习依赖人工过采样或欠采样破坏数据分布的做法,而是通过在强化学习的价值信号中注入基于样本逆频的数学约束,系统性重构了贝尔曼损失曲面的梯度流向,从反馈机制层面尽量保障了智能体在面对极度不平衡气路故障时的判别敏锐度与全局决策稳定性。

参考文献:
Continual contrastive reinforcement learning: Towards stronger agent for environment-aware fault diagnosis of aero-engines through long-term optimization under highly imbalance scenarios[J]. Advanced Engineering Informatics, 2025, 65(C): 103297.
https://www.sciencedirect.com/science/article/pii/S1474034625001909

相关文章
|
9天前
|
人工智能 自然语言处理 安全
阿里云千问办公 QwenWork详细介绍:产品核心能力、典型场景、价格及常见问题解答
千问办公是阿里云推出的一站式AI办公平台,主打"不止于对话,更注重交付",依托通义千问旗舰大模型,用户一句话即可完成数据分析、PPT生成、视频剪辑等复杂任务,直接输出可用成果。产品深度打通钉钉生态与企业OA,覆盖桌面端、网页端,提供企业标准版198元/人/月等多档订阅方案,新用户注册即赠2000积分,适配工程师、HR、财务等多职业办公场景,成为能动手干活的"全能AI同事"。
|
9天前
|
人工智能
千问办公官网入口:阿里AI办公QwenWork产品页和免费网页端链接
千问办公官网含两大入口:一是网页端(qwenwork.cn),即开即用,支持浏览器直接访问;二是阿里云产品页 https://t.aliyun.com/U/JNKJuO 提供免费/付费版详情、功能介绍及使用指南。
|
15天前
|
网络协议 Linux iOS开发
【2026实测】Wireshark下载+安装+汉化+使用教程(图文版,巨详细)
Wireshark 是一款免费开源的网络协议分析工具,可实时捕获、解析并可视化数据包,助你诊断网络故障、分析通信协议(如HTTP、DNS、TCP等)。支持Windows/macOS/Linux,含中文界面,新手入门便捷。(239字)
|
10天前
|
人工智能 API 内存技术
刚刚 DeepSeek V4.1 Flash 开启内测,1 分钟教你用上!
刚刚 DeepSeek 内测群发布了 DeepSeek V4.1 Flash 中间版本内测的消息,这次的模型采用了新的结构,原生支持多模态、能力更强、速度更快、且成本更低。
1912 15
|
8天前
|
IDE 开发工具
Qoder 上线 Sonus 模型,Computer Use 能力全面增强
Qoder国际版上线全新内置大模型Sonus(/ˈsoʊnəs/),全球领先,专精超长任务执行与电脑操作(Computer Use)。配合Qoder桌面端0.2.3版本,可自主完成编程、金融建模、科研及表格制作等复杂工作。现全面支持Qoder全系产品,效率提升3.2倍。
1034 1
Qoder 上线 Sonus 模型,Computer Use 能力全面增强
|
14天前
|
人工智能 运维 BI
阿里云千问办公QwenWork深度解析:基于Qwen3.8,六大核心能力重构企业全自动化工作流与计费选型指南
传统AI办公工具大多停留在对话问答、文档摘要、简单文案生成层面,只能完成单点碎片化任务,无法自主拆解复杂业务流程,很难串联多工具、多文档、外部业务系统完成端到端完整工作交付。很多企业在落地AI办公的时候,需要组合多款不同工具,来回切换界面,手动复制粘贴中间结果,智能化改造落地门槛居高不下。千问办公QwenWork是整合多款智能体产品能力打造的一体化企业办公智能体平台,底层基座依托Qwen3.8大模型,打通桌面端Agent、云端Agent、企业协同Agent三种运行形态,不再局限简单问答,接收业务目标之后自主拆解任务步骤,调用各类工具,处理文档、表格、浏览器自动化、数据查询,直接输出可交付的办公
1670 4
|
10天前
|
缓存 人工智能 自然语言处理
阿里云qwen3.8-flash大模型介绍:模型能力、模型价格、免费额度与最新活动
本文是阿里云百炼平台Qwen3.8-Flash大模型的选型接入指南,作为兼顾性能与响应速度的高性价比多模态模型,它支持百万级上下文窗口、全场景多模态输入与完整智能体能力矩阵,适配编程辅助、智能体协作等核心场景。文中同步梳理了最新下调的阶梯定价、夜间4折等优惠活动,搭配OpenAI兼容流式调用示例,帮助开发者低成本快速落地高并发AI应用。
阿里云qwen3.8-flash大模型介绍:模型能力、模型价格、免费额度与最新活动
|
16天前
|
缓存 数据可视化 开发工具
DeepSeek Harness 怎么更新?dsh 更新完整指南:更新本体(npx、npm、源码)与更新插件两种方式
DeepSeek Harness 的更新分两层:本体更新(npx 自动最新、npm update -g、源码 git pull)与插件更新(插件市场点更新、命令行覆盖安装)。本文按「准备 → 更新本体 → 更新插件 → 更新后检查」四步走,覆盖新手常见疑问。
1831 1
DeepSeek Harness 怎么更新?dsh 更新完整指南:更新本体(npx、npm、源码)与更新插件两种方式
|
11天前
|
SQL 人工智能 前端开发
QoderWake 1.0 正式发布:从桌面里的 Agent,到工作现场的数字员工
QoderWake v1.0正式发布:企业级数字员工团队平台。支持“一句话建岗”,预置10类特训岗位;Waker常驻钉钉/飞书群,@即响应、自动协作、跨任务记忆;具备定时/事件/API多触发方式与统一任务看板;已沉淀27.6万条记忆、12.3万项技能,助力组织实现人机协同增效。
829 2
|
9天前
|
缓存 测试技术 API
DeepSeek V4.1 Flash 内测接入:改个模型名即可调用(附代码)
DeepSeek V4.1 Flash 内测不用申请,base_url 不变、改个模型名就能调,9/10 到期。本文讲清接入、计费限流与多模态注意点。
832 0
DeepSeek V4.1 Flash 内测接入:改个模型名即可调用(附代码)

热门文章

最新文章