再介绍一篇最新的Contrastive Self-supervised Learning综述论文(三)

简介: 再介绍一篇最新的Contrastive Self-supervised Learning综述论文(三)

使用 Momentum Encoder



为了解决 memory bank 的缺点,momentum encoder [14] 被提了出来。这种机制创建了一种特殊的字典,它把字典当作一个队列的keys,当前的batch进入队列,最老的batch退出队列。


Momentum encoder 共享了encoder Q的参数。它不会在每次反向传播后更新,而是依据query encoder的参数来更新:

θ k ← m θ k + ( 1 − m ) θ q \theta_k \leftarrow m\theta_k + (1-m)\theta_


a083d29577bb7e70ed34078df1ff04e9.png


特征表示聚类 Clustering Feature Representation


上面介绍的三种架构都是用某种相似度衡量来对比样本,使得相似样本相近,不相似样本变远,从而学习到好的表示。


本节介绍的机制使用两个共享参数的端到端架构,这种架构使用聚类算法来聚类相似样本表示。


387a026de5eeadec24f02c7aa218ae33.png


图十四:传统对比样本学习 vs 对比聚类学习


SwAV [13] 使用了聚类方法。其背后的idea在于,在一个嵌入空间中,猫的样本们应该和狗的样本们相近(都是动物),而与房子的样本们相远。


在基于样本的学习中,每个样本被当作一个数据集中的离散类。


离散类在连续的嵌入空间中(相似的样本表示相近)可能会有问题。


例如在一个batch里,正样本是猫,负样本们中也有猫,模型会让正样本的猫和负样本中的猫变远,不利于表示学习。


4.Encoders



在自监督学习中,Encoder非常重要,因为它们把数据样本遍历到隐空间中。


e116380bed7920d61065dd43d24c19bd.png


图十五:训练一个Encoder,然后迁移学习到下游任务


没有一个强大的encoder的话,模型可能难以学到有效的表示,从而执行分类任务。对比学习中的大多数模型都采用了ResNet或其变种。


5.训练



为了训练一个encoder,需要一个前置任务来利用对比损失来进行反向传播。


对比学习最核心的观点是将相似样本靠近,不相似样本靠远。


所以需要一个相似度衡量指标来衡量两个表示的相近程度。


在对比学习中,最常用的指标是cosine similarity。


94b21d0c745db6bb7975391a18c17d7f.png


Noise Contrastive Estimation (NCE) [38] 函数定义为:


32c3980772a739d8ac9641dd77226f0f.png


如果负样本的数量很多,NCE的一个变种 InfoNCE 定义为:


f2ab33c7a0b2aa0530441e1fb93fec5c.png


与其他深度学习模型类似,对比学习应用了许多训练优化算法。训练的过程包括最小化损失函数来学习模型的参数。


常见的优化算法包括 SGD 和 Adam 等。


训练大的 batch 的网络有时需要特殊设计的优化算法,例如 LARS。


6.下游任务



644d68be95ffc8786039abd0daa24c65.png


图十六:计算机视觉中的各种下游任务


一般来说,计算机视觉的自监督训练包括两个任务:


  • 前置任务


  • 下游任务


下游任务聚焦于具体的应用,在优化下游任务的时候,模型利用到了前置任务优化时期所学到的知识。这些任务可以是分类、检测、分割、预测等。图十七提供了一个迁移学习的流程。


bfcd060e77d27da42b6d9d2a1f0ab69a.png


图十七:计算机视觉中的下游任务


为了测试自监督学习中学习到的特征对下游任务的效果,一些方法,例如


  • kernel visualization


  • feature map visualization


  • nearsest-neighbor based approaches


被用来分析前置任务的有效性。


对 Kernels 和 特征图进行可视化



在这里,第一个卷积层的特征的kernels(分别来自于自监督训练和监督训练)被用来做比较。


类似地,不同层的 attention maps 也可以被用来测试模型的有效性。


2216480a96cb7863c022a62608c36558.png


图十八:AlexNet所训练的 attention map


最近相邻撷取



一般来说,相同类的样本在隐藏空间中的位置应该相近。对一个输入的样本,使用最近相邻方法,可以在数据集中使用 top-K 抽取来分析自监督学习的模型是否有效。


**7.基准**


最近,许多自监督学习模型挑战了监督模型的效果。在本章中,我们收集和对比了这些模型的效果,在下游任务上。对于图像分类,我们选择了ImageNet和Places数据集。类似的,对于目标检测,我们选择了Pascal VOC数据集。行为识别和视频分类我们选择了UCF-101,HMDB-51和Kinetics。


f2575244e9d6cf7fa72e4af14579756e.png50c44161f0190a2dd101fc3adc85090f.png


**8.结论**


这篇论文总结了各种流行的自监督对比模型。


我们解释了对比学习中不同的模块:


  • 如何选择正确的前置任务


  • 如何选择学习架构


  • 如何在下游任务上优化


基于对比学习的模型获得了非常好的实验效果。


本文最后总结了当前对比学习面临的问题。


相关文章
|
Python
python使用pip镜像源加速安装包(清华、阿里、中科大)
python使用pip镜像源加速安装包(清华、阿里、中科大)
10375 0
python使用pip镜像源加速安装包(清华、阿里、中科大)
|
数据采集 JSON 数据可视化
【python】python懂车帝数据可视化(代码+报告)
【python】python懂车帝数据可视化(代码+报告)
|
前端开发
2023Web前端开发八股文&面试题(万字系列)——这篇就够了!
2023Web前端开发八股文&面试题(万字系列)——这篇就够了!
2962 2
|
1月前
|
人工智能 JavaScript 开发工具
MCP Server 开发入门:手把手写一个能跑的 Server,三种协议怎么选
MCP Server 开发入门:用 uv 建工程装 SDK,FastMCP 写出 tool 和 resource 并跑通,再讲清三种传输协议怎么选。
157 0
|
12月前
|
人工智能 安全 架构师
告别旅行规划的"需求文档地狱"!这个AI提示词库,让你像调API一样定制完美旅程
作为开发者,旅行规划如同“需求地狱”:信息碎片、需求多变、缺乏测试。本文提出一套“企业级”AI提示词库,将模糊需求转化为结构化“API请求”,实现标准化输入输出,让AI成为你的专属旅行架构师,30分钟生成专业定制方案,提升决策质量,降低90%时间成本。
1072 129
|
3月前
|
数据采集 人工智能 API
AI 智能体项目的费用
AI智能体项目费用结构迥异于传统开发:研发成本递减,而算力与运营成本持续攀升,核心在于工程化编排。费用分两块——前期研发(8万–100万+,依单任务/目标导向/多智能体分级)与动态运行(Tokens消耗、向量库、沙箱等)。避坑关键:少微调、重提示词+RAG,严控循环次数。
|
2月前
|
人工智能 并行计算 iOS开发
openclaw一键部署脚本更新,TopClaw支持最新模型及多平台适配
TopClaw是国产优化版OpenClaw,支持一键部署、自动适配Windows/macOS(含Apple Silicon)、免配置运行。内置Qwen2.5、DeepSeek等最新模型,性能提升30%-50%,全程离线、隐私安全,小白3分钟即可上手。
328 0
|
10月前
|
机器学习/深度学习 人工智能 边缘计算
# AI商业落地专家TOP榜:极睿科技武彬的AIGC电商应用全解析
2025年AI深度融入商业,优质知识传播成关键。本文基于学术、实战、内容与影响力四大维度,精选十位持续输出高质量内容的AI领域博主,涵盖计算机视觉、NLP、大模型、边缘计算与AI产品等方向,助力从业者精准获取专业资源,提升技术落地能力。
802 0
|
人工智能 资源调度 数据可视化
ModelScope魔搭25年7月发布月报
七月流火,这个夏天火热的开场已然揭开。6月30号,我们在北京举办了首届魔搭开发者大会(ModelScope DevCon 2025),邀请了国内外知名的开源模型,以及头部开源工具的研发团队,与广大开发者共聚一堂进行分享。顶尖的AI 模型首次从线上 Hub走进线下盛会,为大家呈现了一场“模型全明星”盛会。同时我们还邀请了社区开发者参加我们的“搭友之夜”(aka 大规模面基大会)。大会分享场场爆满,现场只能用一句话来描述:“好~多~人~啊”,不提前占位根本挤不进去~~
704 3
|
10月前
|
人工智能 供应链 安全
人工智能安全治理框架2.0发布:我国AI治理迈入新阶段
我国发布《人工智能安全治理框架》2.0版,标志着AI治理从原则构建迈向系统化、动态化、标准化新阶段。面对生成式AI快速发展带来的数据滥用、算法歧视、模型失控等风险,新版框架强化风险分类,新增衍生安全维度,推动全过程防控与伦理前置,实现技术、伦理与社会治理协同。通过分级分类监管与制度衔接,为企业提供合规路径,助力产业健康有序发展,同时彰显中国在全球AI治理中“发展与安全并重”的治理智慧。