YOLOv11改进策略【YOLO和Mamba】| 2024 VM-UNet,高效的特征提取模块VSS block 二次创新提高精度

简介: YOLOv11改进策略【YOLO和Mamba】| 2024 VM-UNet,高效的特征提取模块VSS block 二次创新提高精度

一、本文介绍

本文记录的是利用VM-UNet中的VSS block优化YOLOv11的目标检测网络模型VSS Block与传统模块不同,它汲取了VMamba模型的优势,通过特定结构设计,在保证计算效率的同时,精准建模局部特征学习长距离依赖实现局部特征的高效处理与长距离依赖关系的有效学习。本文将其应用于YOLOv11的改进与创新,能让模型更关注图像关键特征区域抑制背景等无关信息干扰,突出目标物体关键特征。


专栏目录:YOLOv11改进目录一览 | 涉及卷积层、轻量化、注意力、损失函数、Backbone、SPPF、Neck、检测头等全方位改进
专栏地址:YOLOv11改进专栏——以发表论文的角度,快速准确的找到有效涨点的创新点!

二、VM-UNet模型介绍

VM-UNet: Vision Mamba UNet for Medical Image Segmentation

VM-UNet模型设计的出发点是解决现有CNN-basedTransformer-based模型在医学图像分割中的局限性,利用State Space Models(SSMs)的优势,提出一种更有效的医学图像分割模型。

具体来说,CNN-based模型在捕捉长距离信息方面存在不足,而Transformer-based模型由于自注意力机制的二次复杂度导致计算负担较重SSMs模型如Mamba不仅在建模长距离依赖方面表现出色,还具有线性计算复杂度,这为VM-UNet的设计提供了理论基础。

2.1 VSS block的原理

  • VSS block基于现代SSM模型中的线性常微分方程(ODE)进行工作。它将一维输入函数或序列$x(t)$通过中间隐状态$h(t)$映射到输出$y(t)$。其中,状态矩阵$A$、投影参数$B$和$C$在模型中起着关键作用。
  • S4Mamba通过引入时间尺度参数$\Delta$并使用零阶保持(ZOH)作为离散化规则,将连续系统离散化,使模型更适合深度学习场景。离散化后的SSM模型可以通过线性递归全局卷积两种方式进行计算。

    2.3 VSS block的结构

  • 图b所示,输入经过Layer Normalization后被分为两个分支。在第一个分支中,输入通过线性层激活函数(默认为SiLU)。在第二个分支中,输入经过线性层深度可分离卷积激活函数后,进入2D-Selective-Scan(SS2D)模块进行特征提取。

在这里插入图片描述

  • SS2D模块由扫描扩展(scan expanding)、S6块扫描合并(scan merging)三个组件组成。
      - <font color=navy>**扫描扩展**</font>操作将输入图像沿**四个不同方向**展开为序列,这些序列由`S6块`进行特征提取。
      - <font color=navy>**S6块**</font>基于Mamba的S4框架,通过调整SSM的参数来引入**选择性机制**,能够<font color=darkorange>**区分和保留相关信息,过滤无关信息**</font>。
      - <font color=navy>**扫描合并**</font>操作将**四个方向**的序列求和合并,恢复输出图像大小。
      - 最后,两个分支的特征经过`Layer Normalization`后进行元素积操作,再通过**线性层混合**,并与**残差连接**相结合,形成`VSS block`的输出。
    

在这里插入图片描述

2.3 VSS block的优势

  • 高效的特征提取能力:通过两个分支的设计和SS2D模块,能够从不同角度对输入特征进行处理,充分提取多样化的特征信息,从而提高模型对图像的理解能力。
  • 选择性机制增强相关性:S6块的选择性机制使模型能够聚焦于重要信息,减少无关信息的干扰,有助于提高分割的准确性。
  • 适应性强:在不同的数据集和任务中,VSS block能够根据输入数据的特点动态调整特征提取过程,从而适应各种复杂的医学图像分割任务。

论文:https://arxiv.org/pdf/2402.02491
源码: https://github.com/JCruan519/VM-UNet

三、实现代码及YOLOv11修改步骤

模块完整介绍、个人总结、实现代码、模块改进、二次创新以及各模型添加步骤参考如下地址:

https://blog.csdn.net/qq_42591591/article/details/144259128

相关文章
|
机器学习/深度学习 编解码 计算机视觉
Transformer又一城 | Swin-Unet:首个纯Transformer的医学图像分割模型解读
Transformer又一城 | Swin-Unet:首个纯Transformer的医学图像分割模型解读
2972 0
|
8月前
|
机器学习/深度学习 人工智能 计算机视觉
YOLO26改进 - 注意力机制 | 多扩张通道细化器MDCR 通过通道划分与异构扩张卷积提升小目标定位能力
本文介绍了一种在YOLO26目标检测模型中引入高效解码器模块EMCAD的创新方法,以提升模型在资源受限场景下的性能与效率。EMCAD由多个模块构成,其中核心的EUCB(高效上卷积块)通过上采样、深度可分离卷积、激活归一化和通道调整等操作,兼顾了特征质量与计算成本。实验结果显示,该模块在显著减少参数与FLOPs的同时仍具备优异性能。文章还提供了完整的YOLO26模型集成流程、配置和训练实战。
YOLO26改进 - 注意力机制 | 多扩张通道细化器MDCR 通过通道划分与异构扩张卷积提升小目标定位能力
|
编解码 计算机视觉
YOLOv11改进策略【YOLO和Mamba】| 替换骨干 Mamba-YOLOv11-T !!! 最新的发文热点
YOLOv11改进策略【YOLO和Mamba】| 替换骨干 Mamba-YOLOv11-T !!! 最新的发文热点
2263 7
YOLOv11改进策略【YOLO和Mamba】| 替换骨干 Mamba-YOLOv11-T !!! 最新的发文热点
|
8月前
|
机器学习/深度学习 移动开发 编解码
YOLO26 改进 - C2PSA | C2PSA融合MSLA多尺度线性注意力:并行多分支架构融合上下文语义,提升特征判别力 | Arxiv 2025
本文提出多尺度线性注意力机制MSLA,通过并行3×3/5×5/7×7/9×9深度卷积提取多尺度特征,结合低复杂度线性注意力(O(N)),兼顾细粒度局部细节与全局长程依赖。将其集成至YOLO26,构建C2PSA_MSLA模块,在医学图像分割与目标检测任务中显著提升性能、效率与鲁棒性。(239字)
YOLO26 改进 - C2PSA | C2PSA融合MSLA多尺度线性注意力:并行多分支架构融合上下文语义,提升特征判别力 | Arxiv 2025
|
机器学习/深度学习 计算机视觉
YOLOv11改进策略【YOLO和Mamba】| 替换骨干 Mamba-YOLOv11-L !!! 最新的发文热点
YOLOv11改进策略【YOLO和Mamba】| 替换骨干 Mamba-YOLOv11-L !!! 最新的发文热点
786 10
YOLOv11改进策略【YOLO和Mamba】| 替换骨干 Mamba-YOLOv11-L !!! 最新的发文热点
|
9月前
|
机器学习/深度学习 算法 数据挖掘
YOLOv11改进 - C3k2融合 | C3k2融合CBSA 收缩 - 广播自注意力:轻量级设计实现高效特征压缩,优化处理效率 | NeurIPS 2025
本文提出收缩-广播自注意力(CBSA),通过选取代表性token进行收缩计算并广播结果,实现高效、可解释的线性复杂度注意力机制。其逻辑透明,统一多种注意力形式,并集成至YOLOv11的C3k2模块,在视觉任务中展现优越性能与速度优势。
YOLOv11改进 - C3k2融合 | C3k2融合CBSA 收缩 - 广播自注意力:轻量级设计实现高效特征压缩,优化处理效率 | NeurIPS 2025
|
9月前
|
机器学习/深度学习 算法 atlas
YOLOv11 改进 - 注意力机制 MCAttn 蒙特卡洛注意力:全局上下文与局部细节协同建模,破解微小目标特征表达难题
本文提出将蒙特卡洛注意力(MCAttn)模块融入YOLOv11,通过随机采样多尺度池化特征并加权融合,增强模型对小目标的敏感性。MCAttn兼顾局部细节与全局上下文,提升检测精度,尤其适用于医学图像中小面积病灶识别,显著改善特征丢失问题,且保持轻量化与高效推理。
YOLOv11 改进 - 注意力机制 MCAttn 蒙特卡洛注意力:全局上下文与局部细节协同建模,破解微小目标特征表达难题
|
机器学习/深度学习 计算机视觉 异构计算
【YOLOv8改进 - Backbone主干】FasterNet:基于PConv(部分卷积)的神经网络,提升精度与速度,降低参数量。
【YOLOv8改进 - Backbone主干】FasterNet:基于PConv(部分卷积)的神经网络,提升精度与速度,降低参数量。
|
机器学习/深度学习 数据可视化 测试技术
YOLO11实战:新颖的多尺度卷积注意力(MSCA)加在网络不同位置的涨点情况 | 创新点如何在自己数据集上高效涨点,解决不涨点掉点等问题
本文探讨了创新点在自定义数据集上表现不稳定的问题,分析了不同数据集和网络位置对创新效果的影响。通过在YOLO11的不同位置引入MSCAAttention模块,展示了三种不同的改进方案及其效果。实验结果显示,改进方案在mAP50指标上分别提升了至0.788、0.792和0.775。建议多尝试不同配置,找到最适合特定数据集的解决方案。
4392 0