谷歌最新研究:用性能差的模型计算「相似度」反而更准?

简介: 谷歌最新研究:用性能差的模型计算「相似度」反而更准?
【新智元导读】计算图像感知相似度,模型分类准确率还不能太高!


计算图像之间的相似度是计算机视觉中的一个开放性问题


在图像生成火遍全球的今天,如何定义「相似度」,也是评估生成图像真实度的关键问题。


虽然当下有一些相对直接的方法来计算图像相似度,比如测量像素上的差异(如FSIM, SSIM),但这种方法获得的相似性差异和人眼感知到的差异相去深远。


深度学习兴起后,一些研究人员发现一些神经网络分类器,如AlexNet, VGG, SqueezeNet等在ImageNet上训练后得到的中间表征可以用作感知相似性的计算。


也就是说,embedding比像素更贴近人对于多张图像相似的感知



当然,这只是一个假设


最近Google发表了一篇论文,专门研究了ImageNet分类器是否能够更好地评估感知相似度。


论文链接:https://openreview.net/pdf?id=qrGKGZZvH0


虽然已经有工作在2018年发布的BAPPS数据集基础上,在第一代ImageNet分类器上研究了感知评分(perceptual scores),为了进一步评估准确率和感知评分的相关性,以及各种超参数的影响,论文中增加了对最新ViT模型的研究结果。


准确率越高,感知相似度越差?


众所周知,通过在ImageNet上的训练学到的特性可以很好地迁移到许多下游任务,提升下游任务的性能,这也使得在ImageNet预训练成了一个标准操作。


此外,在ImageNet上取得更高的准确率通常意味着在一组多样化的下游任务上有更好的性能,例如对破损图片的鲁棒性、对out-of-distribution数据的泛化性能和对较小分类数据集的迁移学习。


但在感知相似度计算上,一切好像反过来了。


在ImageNet上获得高精度的模型反而具有更差的感知分数,而那些成绩「中游」的模型在感知相似度任务上性能最好。


ImageNet 64 × 64验证精度(x 轴) ,64 × 64 BAPPS 数据集上的感知评分(y 轴),每个蓝点代表一个 ImageNet 分类器


可以看到,更好的 ImageNet 分类器在一定程度上实现了更好的感知评分,但超过某一阈值,提高准确性反而会降低感知评分,分类器的准确度适中(20.0-40.0) ,可以获得最佳的感知评分


文中同时研究了神经网络超参数对感知分数的影响,如宽度、深度、训练步数、权重衰减、标签平滑和dropout


对于每个超参数,存在一个最优精度,提高精度可以改善感知评分,但这个最优值相当低,并且在超参数扫描中很早就可以达到。


除此之外,分类器精度的提高会导致更差的感知评分。


举个例子,文中给出了感知评分相对于两个超参数的变化: ResNets中的训练steps和ViTs中的宽度。


提前停止的ResNets在6, 50和200的不同深度设置下获得了最佳感知评分


ResNet-50和ResNet-200的感知评分在训练的前几个epoch达到最高值,但在峰值后,性能更好的分类器感知评分值下降更为剧烈。


结果显示,ResNets的训练与学习率调整可以随step增加提升模型的准确性。同样,在峰值之后,模型也表现出与这种逐步提高的精度相匹配的感知相似度评分逐步下降。


ViTs由应用于输入图像的一组Transformer块组成,ViT模型的宽度是单个Transformer块的输出神经元数,增加宽度可以有效提高模型的精度。


研究人员通过更换两个ViT变体的宽度,获得两个模型B/8(即Base-ViT模型,patch尺寸为4)和L/4(即Large-ViT模型) ,并评估准确性和感知评分。


结果还是与提前停止的ResNets观察结果相似,精度较低的较窄的ViT比默认宽度表现得更好。



不过ViT-B/8和 ViT-L/4的最佳宽度分别是它们默认宽度的6% 和12% ,论文中还提供了对于其他超参数的更详细实验列表,如宽度、深度、训练步数、权重衰减、标签平滑和跨 ResNet 和 ViTs 的dropout。


所以想提升感知相似度,那策略就简单了,适当降低准确率即可。


通过缩小ImageNet模型来提高感知评分,表格中的值表示通过在带有默认超参数的模型上缩放给定超参数的模型而获得的改进


根据上述结论,文中提出了一个简单的策略来改善架构的感知评分:缩小模型来降低准确性,直至达到最佳的感知得分。


在实验结果中还可以看到,通过在每个超参数上缩小每个模型所获得的感知评分改进。除了 ViT-L/4,提前停止可以在所有架构中产生最高的评分改进度,并且提前停止是最有效的策略,不需要进行费时的网格搜索。


全局感知函数


在先前的工作中,感知相似度函数使用跨图像空间维度的欧氏距离来计算。


这种方式假定了像素之间存在直接对应关系,但这种对应关系可能不适用于弯曲、平移或旋转的图像。


在这篇文章中,研究人员采用了两个依赖于图像全局表示的感知函数,即捕捉两个图像之间的风格相似性的神经风格迁移工作中的风格损失函数和归一化的平均池距离函数。


样式损失函数比较两幅图像之间的通道间cross-correlation矩阵,而平均池函数比较空间平均的全局表示。


全局感知函数一致地改善了两个网络训练的默认超参数和ResNet-200作为训练epoch函数的感知评分


文中还探讨了一些假设来解释精确度和感知评分之间的关系,并得出了一些额外的见解。


例如,没有常用的skip连接的模型准确性也与感知评分成反比,与接近输入的层相比,更接近输出的层平均具有较低的感知评分。


同时还进一步探索了失真灵敏度(distortion sensitivity)、 ImageNet类别粒度和空间频率灵敏度。


总之,这篇论文探讨了提高分类精度是否会产生更好的感知度量的问题,研究了不同超参数下ResNets和ViTs上精度与感知评分之间的关系,发现感知评分与精度呈现倒U型关系,其中精度与感知评分在一定程度上相关,呈现倒U型关系。


最后,文章详细讨论了精度与感知评分之间的关系,包括skip连接、全局相似函数、失真敏感度、分层感知得分、空间频率敏感度和ImageNet类别粒度。


虽然对于ImageNet精确度和感知相似度之间的权衡现象的确切解释仍然是一个谜,但这篇论文向前迈出了第一步。


相关文章
|
机器学习/深度学习 数据采集 人工智能
【技术揭秘】高性能粤语语音识别模型构建方案
随着人工智能技术的飞速发展,语音识别(Automatic SpeechRecognition)的应用越来越广泛,对于多语种多口音语音识别的需求也在日渐增加。虽然语音识别系统的基本原理和框架是不受限于语种的,在建立一个新语种的ASR模型时,还是需要结合到语言本身的特点,才能得到较好的效果。
【技术揭秘】高性能粤语语音识别模型构建方案
|
人工智能 自然语言处理 监控
前阿里专家揭秘:你对GEO优化的认知,99%都是错的
本文深入剖析了AI时代GEO优化的本质,指出许多出海企业在本地化过程中常犯的认知错误,如迷信技术信号、将翻译等同于本地化等。作者提出,真正的GEO优化应构建“AI驱动的全域内容矩阵”,通过AI赋能意图洞察、人机协同内容生成、智能技术架构与数据闭环迭代四大支柱,实现可持续的跨境流量增长。文章还提供了可落地的方法论与避坑指南,帮助企业在海外市场实现低成本、高效率的精准获客。
560 5
前阿里专家揭秘:你对GEO优化的认知,99%都是错的
|
9月前
|
存储 弹性计算 网络安全
阿里云服务器购买全流程参考:账号注册、价格查询、优惠购买与发票申请
对于初次接触阿里云服务器的新用户而言,购买云服务器需要经历从注册账号到查询价格,再到优惠购买,部分用户后期可能还需要申请发票,新手用户可能对这些流程不是很清楚。本文将为大家解读阿里云服务器购买的每一个步骤,助力您轻松上手,快速且经济地购置到心仪的云服务器,并顺利完成发票申请。
705 13
|
监控 前端开发 应用服务中间件
小游戏源码开发搭建技术栈和服务器配置流程
近些年不同场景游戏层出不穷,现就小游戏开发技术应用及功能详细剖析!
|
10月前
|
弹性计算 固态存储 调度
阿里云99元服务器ECS经济型e实例ecs.e-c1m1.large详细介绍,CPU采用Intel Xeon Platinum架构处理器
阿里云99元/年服务器ECS经济型e实例,2核2G配置,Intel Xeon Platinum处理器,3M独享带宽,40G ESSD Entry系统盘,分配独立公网IP,不限流量,新老用户均可购买,续费同价,性价比高,适合个人建站、开发测试等轻量应用。
1228 1
|
11月前
|
SQL 运维 Kubernetes
【故障定位系列】电商业务系统告警频发,如何快速实现应用接口级故障定位
本文以电商场景为例,探讨如何实现Web应用接口级故障根因定位。通过构建实时拓扑、对比客户端与服务端响应时间,结合指标下钻与耗时分解技术,精准定位到故障服务及具体接口,提升运维效率。
|
机器学习/深度学习 人工智能 负载均衡
《人工智能驾驭复杂网络拓扑:网络规模扩张下的管理之道》
在数字化时代,网络规模持续扩大,拓扑结构日益复杂,传统管理方式难以应对。人工智能凭借强大数据处理与决策能力,成为解决这一难题的关键技术。它通过智能拓扑发现、动态路由优化、故障预测诊断及资源智能分配等策略,有效提升网络性能与可靠性。例如,谷歌B4网络和阿里巴巴电商网络成功应用AI技术,实现了高效资源利用与快速故障修复。未来,结合区块链与量子计算等新兴技术,人工智能将推动网络拓扑管理迈向更智能、安全与高效的阶段,助力构建可靠的数字世界。
542 5
|
XML Linux 数据库
openGauss6.0单中心一主两备部署
openGauss6.0单中心一主两备部署
openGauss6.0单中心一主两备部署
|
弹性计算 小程序 关系型数据库
阿里云虚拟主机配置版本选择,共享独享、基础、标准、高级和豪华选择攻略
阿里云虚拟主机提供共享与独享版本,后者包括基础、标准、高级和豪华四种配置。选择依据为网站访问量及图片数量。独享型主机具备独立CPU、内存和带宽,利于SEO。基础版适合个人展示,标准版适用于企业官网,高级版适合博客论坛,豪华版则针对多媒体展示网站。然而,考虑到性价比,云服务器可能是更优选择,其不仅限于网站搭建,还支持多种应用场景,如小程序、App和游戏服务器等。

热门文章

最新文章