🏆 走进工厂产线,异常检测面临的现实远比实验室复杂得多:新品上线就要重新训练模型;缺陷样本翻遍仓库都凑不齐几张;边缘设备的算力和内存根本跑不动大模型。
2026年,CVPR、ECCV等顶会上涌现了四篇突破性工作,恰好瞄准了这些工业落地中最痛的“死穴”。有趣的是,它们的共同趋势是极简、轻量、免训练。
博主简介
AI小怪兽 | 计算机视觉布道者 | 视觉检测领域创新者
深耕计算机视觉与深度学习领域,专注于视觉检测前沿技术的探索与突破。长期致力于YOLO系列算法的结构性创新、性能极限优化与工业级落地实践,旨在打通从学术研究到产业应用的最后一公里。
一、工业异常检测的三大困境
困境一:正常样本不缺,异常样本难寻。 工业生产追求“零缺陷”,缺陷品本就稀少。新品上线前可能只有几十张甚至几张正常样品可供建模,传统方法根本训不动。
困境二:新品换型快,重训成本高。 产线产品型号频繁更换,每次都要采集数据、标注、训练、部署,周期动辄数周。为每个新场景收集和标注数据是不现实的。
困境三:边缘设备算力有限,大模型跑不动。 产线工控机往往无独立显卡,内存吃紧。现有异常检测方法计算量大,无法部署在资源受限的边缘设备上。
正是这三个困境,催生了2026年一系列“低代码”风格的顶会工作。
二、SubspaceAD(CVPR 2026):一张良品图,无需训练即达SOTA
一句话概括:不用训练、不用记忆库、不用调提示词——用冻结的DINOv2提取特征,PCA拟合正常子空间,推理时算重建残差就能定位异常。
论文:SubspaceAD: Training-Free Few-Shot Anomaly Detection via Subspace Modeling
摘要:工业检测中的视觉异常检测通常仅需每类别少量正常图像即可进行训练。近期的一些少样本方法利用基础模型的特征取得了优异的结果,但通常依赖于记忆库、辅助数据集或视觉语言模型的多模态微调。因此,我们质疑:鉴于视觉基础模型的特征表示能力,这种复杂性是否真的必要?为了回答这个问题,我们引入了 SubspaceAD,一种无需训练的方法,它通过两个简单阶段运行。首先,通过冻结的 DINOv2 骨干网络从少量正常图像中提取图像块级特征。其次,对这些特征拟合一个主成分分析模型,以估计正常变化的低维子空间。在推理时,通过计算相对于该子空间的重建残差来检测异常,从而产生可解释且具有统计基础的异常分数。尽管方法简单,SubspaceAD 在单样本和少样本设置下均实现了最先进的性能,无需训练、提示调优或记忆库。在单样本异常检测设置中,SubspaceAD 在 MVTec-AD 数据集上达到了 97.1% 的图像级 AUROC 和 97.5% 的像素级 AUROC,在 VisA 数据集上分别达到了 93.4% 和 98.2%,超越了先前的最先进结果。
性能数据:在单样本异常检测设置下,MVTec-AD上图像级AUROC达98.0%、像素级AUROC达97.6%;VisA上分别为93.3%和98.3%,全面超越先前复杂方法。存储每类小于1MB。
“低代码”体现在哪? 整个方法无需训练,无需提示词调优,无需维护庞大的记忆库。你只需要1-4张正常图像,跑几行推理代码就能部署。
实测:
三、VisualAD(CVPR 2026):扔掉文本编码器,纯视觉首次超越CLIP
一句话概括:把CLIP的文本编码器整个砍掉,只靠两个可学习的视觉token,参数量减少99%以上,效果反而更好。
论文:VisualAD: Language-Free Zero-Shot Anomaly Detection via Vision Transformer
摘要:零样本异常检测要求在无法获取目标类别异常样本的情况下检测并定位异常。主流方法依赖于视觉-语言模型:它们为正常和异常语义构建手工设计或可学习的提示集,然后通过计算图像-文本相似度进行开集判别。尽管有效,但这种范式依赖于文本编码器和跨模态对齐,可能导致训练不稳定和参数冗余。本文重新审视了文本分支在零样本异常检测中的必要性,并提出了VisualAD,一个基于视觉Transformer的纯视觉框架。我们在冻结的骨干网络中引入两个可学习的标记,直接编码正常性和异常性。通过多层自注意力,这些标记与图像块标记交互,逐步习得正常与异常的高级概念,同时引导图像块突出与异常相关的线索。此外,我们结合了一个空间感知交叉注意力模块和一个轻量级自对齐函数:SCA将细粒度空间信息注入标记,SAF则在异常评分前重新校准图像块特征。VisualAD在涵盖工业和医学领域的13个零样本异常检测基准上取得了最先进的性能,并能无缝适配预训练的视觉骨干网络。
性能数据:在MVTec-AD上图像级AUROC达92.2%;在DAGM上高达99.5%。在非MVTec数据集上优势尤为明显——BTAD超AnomalyCLIP 6.2个百分点,KSDD2超6.1个百分点。参数量较传统VLM方案减少99%以上。
“低代码”体现在哪? 不需要设计复杂的文本提示词,不需要CLIP的跨模态对齐。代码已开源,基于ViT的架构与YOLO等检测器天然兼容。
四、ArcAD(ECCV 2026):3%的异常样本,99.7%的检测精度
一句话概括:冷启动场景下正常样本不足、异常样本极度稀缺,ArcAD用即插即用的校准框架把性能拉满。
论文:ArcAD: Anomaly-Rectified Calibration for Cold-Start Supervised Anomaly Detection
摘要:在现实制造业中部署工业异常检测常常遇到一个具有挑战性的冷启动瓶颈,即有限的正常样本无法代表完整的正常分布,且仅有少量异常样本可用。在这种机制下,现有方法难以形成紧凑的正常边界,也无法有效利用来自罕见缺陷的监督信号。为应对这一挑战,我们提出了异常修正冷启动异常检测,一个面向基于重建的工业异常检测基线的即插即用校准框架。ArcAD 遵循一种推拉学习范式,在数据稀缺条件下构建一个紧凑且有判别性的正常边界。一方面,ArcAD 将有限的正常样本投影到一个超球面上,并将它们拉入多个紧凑的聚类中,以最大化对正常流形的覆盖。另一方面,它在超球面上合成伪异常,并利用真实异常将边界向内推,增强异常判别能力。在 MVTec-AD、VisA、Real-IAD 和 MANTA 上的大量实验表明,ArcAD 在冷启动条件下的单类别和多类别设置中均显著优于最先进的有监督和无监督方法。
性能数据:在MVTec-AD上图像级AUROC达99.7%,单类设置下达100.0%。在Real-IAD上I-AUROC达92.5%,超越基线3.7%。即使异常样本比例仅3%,仍能带来0.9%~5.2%的稳定增益。产线部署耗时仅50ms。
“低代码”体现在哪? ArcAD是即插即用的校准框架,可无缝集成至现有基于重建的检测模型。你不需要换模型,加一层校准就能显著提升性能。
实测:
可视化结果如下:
五、LiZAD(IEEE COINS 2026):推理20ms,内存仅1.01GB
一句话概括:DINOv3的精准定位能力 + MobileCLIP2的高效文本嵌入,在边缘设备上实现实时零样本异常检测。
论文:https://arxiv.org/pdf/2607.01949
摘要:在现代高通量工业生产线上,产品配置和视觉特征频繁变化,因此为每个新场景收集和标注数据变得不切实际。这种动态环境使得零样本异常检测特别适用,因为它能够在无需对特定目标样本进行训练的情况下实现缺陷检测。尽管近期的ZSAD方法显示出有前景的结果,但它们计算密集,不适合部署在资源受限的设备上。我们提出了LiZAD:一个专为边缘设备实时ZSAD设计的轻量级框架。所提出的方法将DINOv3密集且具有空间感知能力的视觉特征(对于精确的像素级定位至关重要)与MobileCLIP2的高计算效率文本嵌入相结合。这些特征随后通过低内存可训练的投影头映射到一个共享的潜在空间。与六个最先进的ZSAD模型相比,LiZAD实现了平均内存减少61.5%,参数减少74.6%,以及延迟加速3.02倍。尽管计算和内存成本大幅降低,我们的方法仍保持了有竞争力的异常检测性能,在VisA、BTAD、MPDD和MVTec-AD数据集上,相对于最佳最先进模型,平均P-AUROC仅下降了6.4%。最后,它已成功部署在NVIDIA Jetson NX和Jetson AGX边缘设备上,并在维罗纳大学工业计算机工程实验室的真实生产线上进行了测试。
性能数据:相比六个最先进的零样本异常检测模型,LiZAD平均内存减少61.5%、参数量减少74.6%、推理速度提升3.02倍。在VisA、BTAD、MPDD、MVTec-AD上,平均P-AUROC仅下降6.4%。推理实测20ms以内,内存仅1.01GB,已成功部署在NVIDIA Jetson NX和Jetson AGX边缘设备上。
“低代码”体现在哪? 专为边缘设备设计,开箱即用。训练和推理流程标准化。
实测:
六、横向对比:四个方案怎么选?
| 维度 | SubspaceAD | VisualAD | ArcAD | LiZAD |
| 核心思想 | 冻结DINOv2+PCA子空间 | 两个可学习视觉token | 推拉学习校准框架 | DINOv3+MobileCLIP2协同 |
| 是否需要训练 | ❌ 完全免训练 | ⚠️ 需训练两个token | ⚠️ 需训练校准模块 | ⚠️ 需训练投影头 |
| 所需样本 | 1-4张正常图 | 零样本(无需目标类样本) | 少量正常+少量异常 | 零样本(无需目标类样本) |
| 内存占用 | <1MB/类 | 极小 | 低 | 1.01GB |
| 推理速度 | 快 | 快 | 50ms | <20ms |
| 核心优势 | 极简、免训练、可解释性强 | 纯视觉、参数量减少99% | 冷启动场景、即插即用 | 边缘实时、极致轻量 |
| 适用场景 | 多品种频繁换线 | 零样本跨域检测 | 缺陷样本极度稀缺 | 资源受限边缘设备 |
七、总结:工业异常检测的“低代码”趋势
2026年这四项工作,共同指向了一个清晰的趋势——工业异常检测正在从“重训练、大模型”走向“轻量化、免训练、易部署”。
SubspaceAD用PCA替代了复杂的训练流程,VisualAD砍掉了冗余的文本分支,ArcAD用即插即用的校准框架替代了从头训练,LiZAD则把推理做到了20ms、内存压到了1GB。
我的总结:工业异常检测的“低代码”时代已经到来。你不需要堆GPU、不需要海量标注数据、不需要调参到天亮。用对方法,几张正常图像、几行推理代码,就能在边缘设备上跑出顶会级的检测效果。
我的建议:如果你在做多品种频繁换线的产线,从SubspaceAD入手——1张正常图就能部署;如果追求边缘实时部署,直接上LiZAD——20ms推理+1GB内存,Jetson上开箱即用;如果缺陷样本极度稀缺(只有3%的异常样本),ArcAD的校准框架能帮你把性能拉满。
让每一行代码都有温度,也让你每一次部署都少踩坑。🚀