强化学习算法 | 持续对比强化学习CCRL

简介: 持续对比强化学习将序列状态识别任务转化为智能体与环境的持续交互决策过程,通过将无监督自编码预训练、加权有监督对比学习以及类别加权深度强化学习有机结合,构建了一种具备长期优化能力和强特征辨识度的通用强化学习决策架构。

在实际工业应用与复杂系统决策中,强化学习智能体往往面临数据样本极度不平衡、环境动态演化以及多源流式数据持续增长等难题。本文介绍发表在《Advanced Engineering Informatics》期刊上的研究论文《Continual contrastive reinforcement learning: Towards stronger agent for environment-aware fault diagnosis of aero-engines through long-term optimization under highly imbalance scenarios》。

为了克服传统离线学习模式无法自适应环境变化以及小样本类别难以精确表征的局限,该研究提出了一种持续对比强化学习(Continual Contrastive Reinforcement Learning, CCRL)算法框架。CCRL将序列状态识别任务转化为智能体与环境的持续交互决策过程,通过将无监督自编码预训练、加权有监督对比学习以及类别加权深度强化学习有机结合,构建了一种具备长期优化能力和强特征辨识度的通用强化学习决策架构。

整个CCRL框架的运行与更新依赖于环境与智能体之间的闭环交互流,其整体架构如图所示。在工作流程中,运行环境持续向智能体提供多维时序传感器数据作为状态输入,智能体根据当前策略网络输出分类或决策动作。然后,环境或外部专家评估系统对智能体动作的正确性进行判定,并反馈特定的奖励信号与真实标签,所有状态转移轨迹及评价信息被统一写入经验回放池中。在此机制下,训练与推理过程不再相互割裂,智能体能够在数据持续增加的生命周期中利用回放机制不断提取经验并动态更新策略网络,从而保持对环境变化与未知数据分布的长期感知与自适应演进能力。

2.png

针对稀缺类别样本量极小所导致的特征捕获困难问题,CCRL在特征编码阶段首先引入了自编码预训练机制。该阶段完全使用海量且易于获取的正常基准序列数据对长短期记忆网络(LSTM)自编码器进行重构训练。网络通过时序门控单元逐步压缩多维输入序列,并将编码器最终时刻的隐层状态作为低维特征表达输入解码器以完成原始信号重构。由于仅在基准数据上进行无监督特征重构学习,编码器能够充分掌握时序运行状态的共性演化规律与底层压缩表征,有效避免了模型在初始阶段因少数类样本过少而产生严重的过拟合风险。

在此基础上,CCRL构建了如图所示的特征区分模块,利用加权对比学习进一步拉大不同类别之间的特征间距。该模块直接采用真实样本构建正负样本对,将同类别样本组合作为正样本对,不同类别样本组合作为负样本对,避免了时序数据人工增强带来的失真问题。

针对多类别严重不平衡的现实情况,算法在对比损失函数中引入了正负样本调节权重,通过增强同类正样本投影的聚合约束并平衡负样本排斥强度,使得同类特征在投影空间中高度紧凑而异类特征被显著分离。在此过程中,预训练好的LSTM编码器以较小的学习率进行微调,配合后接的全连接投影层,从而在保留通用时序特性的同时最大化不同状态类别的判别度。

3.png

在动作决策端,CCRL采用了基于对偶双深度Q网络(Dueling Double Deep Q-Network, D3QN)的类型识别模块,如图所示。冻结参数的对比学习编码器为该模块提供高质量的状态特征向量,输入至主决策LSTM网络中。网络末端分别通过两个独立的全连接层解耦计算状态价值与动作优势,并将两者组合为最终的动作Q值,有效规避了单一网络带来的Q值过高估计问题。

为了消除类别不平衡对梯度更新方向的干扰,环境奖励函数依据训练集中各类别样本数量的倒数进行归一化设计,使得罕见类别在正确或错误决策时获得更高绝对值的奖惩反馈,促使智能体在探索过程中对少数类决策边界施加足够关注。

4.png

CCRL智能体的训练过程采取多阶段协同与双网络交替更新策略。在动作探索阶段,策略网络结合递减探索因子的贪婪策略与环境交互生成多样化经验并存入缓冲池;在参数学习阶段,当缓冲池样本达到阈值后,算法通过均方误差损失对策略网络进行梯度反向传播更新,而目标网络则保持相对固定并周期性同步参数,以确保时序差分目标值的稳定性。

该算法从表示学习与强化学习策略优化两个维度协同发力,不仅适用于复杂装备的状态监测与故障诊断任务,其核心思想亦可作为一种通用的强化学习模式,拓展至流式数据分类、极端不平衡序列决策及非平稳环境下的长期控制等复杂任务中。

参考文献:
Continual contrastive reinforcement learning: Towards stronger agent for environment-aware fault diagnosis of aero-engines through long-term optimization under highly imbalance scenarios[J]. Advanced Engineering Informatics, 2025, 65(C): 103297.

https://www.sciencedirect.com/science/article/pii/S1474034625001909

相关文章
|
1天前
|
人工智能 自然语言处理 安全
阿里云AI数智鉴密:AI 生成内容如何拿到一张"防篡改的身份证"
隐形水印 + C2PA签名:让AI生成内容“持证上岗”。
1088 0
|
10天前
|
人工智能 自然语言处理 安全
阿里云千问办公、Qoder Teams、Qoder CN区别与选择指南:模型能力、适用场景与最新活动参考
本文聚焦阿里云2026年推出的三款自研AI办公产品,清晰拆解千问办公、Qoder Teams、Qoder CN的差异化定位与能力边界:千问办公主打职场全场景提效,支持自然语言指令一键完成PPT生成、数据分析等高频办公任务;Qoder Teams面向程序员团队,深度整合AI代码生成、团队协同与企业知识库能力;Qoder CN则专为金融、政务等强合规场景打造,实现数据不出境与VPC私有化部署。文章同步给出分场景选型指南与最新活动定价,帮助不同类型的企业按需组合产品,实现业务岗、研发岗与强合规场景的AI能力全覆盖。
3621 3
阿里云千问办公、Qoder Teams、Qoder CN区别与选择指南:模型能力、适用场景与最新活动参考
|
22天前
|
人工智能 缓存 前端开发
DeepSeek Harness 首发实测 + 入门教程,夯爆了!梁神我错了
DeepSeek Harness + DeepSeek V4 Pro 项目实战保姆级教程!手把手带你从零安装开源 AI 编程工具,开发架构图、知识讲解网站、3D 网页游戏、全栈 AI 应用 4 个项目,覆盖运行模式选择、插件安装与开发,看看能不能对标 Claude。
13355 91
DeepSeek Harness 首发实测 + 入门教程,夯爆了!梁神我错了
|
15天前
|
Web App开发 人工智能 API
16 个超火的 DeepSeek Harness 插件,大肥鱼已经落后 N 个版本了。。。
DeepSeek Harness 精选插件推荐合集,从图片识别、浏览器操控、多 Agent 协作到手机远程控制,一口气带你看完 DSH 社区热门的十几个插件,覆盖技能扩展、UI 界面增强、整活玩法三大类,让你的鲸鱼变得更强。
1883 5
|
8天前
|
人工智能 监控 测试技术
Qwen3.8-Flash 来了,100万上下文、Agent、Coding 都加强了
8月26日,通义千问发布Qwen3.8-Flash-Next:125B参数、每Token仅激活6B,原生支持26万Token、可扩展至100万上下文;Coding、Agent与工具调用能力显著增强,面向真实软件工程任务,推动大模型从“回答问题”迈向“完成工作”。
|
11天前
|
人工智能 Linux iOS开发
Ollama使用教程:Ollama官网下载、Ollama本地部署大模型(2026最新)
Ollama 是一款免费开源的本地大模型运行工具,支持在 Windows/macOS/Linux 上离线运行 Qwen、DeepSeek、Llama 等主流开源模型,数据不出本机、隐私安全。提供 OpenAI 兼容 API,命令行一键拉取/运行/管理模型,无需联网,无调用限制,是开发者与 AI 爱好者部署本地 AI 助手的理想选择。(239 字)
|
16天前
|
人工智能 Java BI
【AI】DeepSeek Harness 安装、运行、管理插件
本文介绍了如何运行DeepSeek开源的Agent框架DeepSeek Harness(dsh)。主要内容包括:使用nvm安装适配的Node版本;通过代理加速克隆GitHub源码;使用pnpm安装依赖并启动项目;配置DeepSeek API Token;安装扩展功能的插件。该框架自带Web界面,支持模型适配、文件编辑等插件化功能
2100 1