深度学习网络大杀器之Dropout——深入解析Dropout

本文涉及的产品
公共DNS(含HTTPDNS解析),每月1000万次HTTP解析
云解析 DNS,旗舰版 1个月
全局流量管理 GTM,标准版 1个月
简介: 本文详细介绍了深度学习中dropout技巧的思想,分析了Dropout以及Inverted Dropout两个版本,另外将单个神经元与伯努利随机变量相联系让人耳目一新。

过拟合深度神经网DNN)中的一个常见问题:模型只学会训练集分类这些年提出的许多拟合问题解决方案;其中dropout具有简单并取得良好的结果

Dropout

7e31586d15d887ae0901452e2e1b1c6cb94f882e

上图为Dropout的可视化表示,左边是应用Dropout之前的网络,右边是应用了Dropout的同一个网络。

Dropout的思想是训整体DNN,并平均整个集合的结果,而不是训练单个DNNDNNs以概率P舍弃部分神经元其它神经元以概率q=1-p被保留舍去的神经元的输出都被设置为零。

引述作者

在标准神经网络中,每个参数的导数告诉应该如何改变,以致损失函数最后被减少因此神经元可以通过这种方式修正其他单的错误。但这可能导致复杂的协调,反过来导致过拟合,因为这些协调没有推广到未知数据。Dropout通过使其他隐藏单元存在不可靠来防止共拟合。

简而言之:Dropout在实践很好工作因为在训阶段阻止神经元的共适应。

Dropout如何工作

Dropout以概率p舍弃神经元并让其它神经元以概率q=1-p保留。每个神经元被关闭的概率是相同的。这意味着:

假设:

h(x)=xW+bdi维的输入xdh维输出空间上的线性投影;

a(h)是激活函数

在训练阶段中,将假设的投影作为修改的激活函数:

650f8f00ffeb3ef346a61ee248670abe173c4acb

其中D=(X1,...,Xdh)dh维的伯努利变量Xi伯努利随机变量具有以下概率质量分布:

32363b313f65d3bf4231c5c57eace39d6fb7cb2c

其中k是可能的输出。

Dropout应用在第i个神经元上:

8899c12575bca1550dfd8127fd7eb0a2912a8f2a

其中P(Xi=0)=p

由于在训练阶段神经元保持q概率,在测试阶段必须仿真出在训练阶段使用的网络集的行为。

为此,作者建议通过系数q来缩放激活函数:

训练阶段fdb59b52bfa583cf08eaf7980e26e8fad453d148

测试阶段d6a2b220ee68540890eaf0dc537188c738600fb7

Inverted Dropout

dropout稍微不同。该方法在训练阶段期间对激活值进行缩放,而测试阶段保持不变。

倒数Dropout的比例因子为223ab9380c566fb9a74ff8a0a127e1174593bdf8,因此:

训练阶段:6ebd718f4256f50134f7428bc5df4d3cc9ddceae

测试阶段6ccbf2b63a56155b6403093e8771952bb3e3515b

Inverted DropoutDropout在各种深度学习框架实践中实现的,因为它有助于一次性定义模型,并只需更改参数(保持/舍弃概率)就可以在同一模型上运行训练和测试过程

一组神经元的Dropout

n个神经元的第h层在每个训练步骤中可以被看作是n个伯努利实验的集合,每个成功的概率等于p

因此舍弃部分神经元后h层的输出等于:

f580cf9006a568171c48ac7ec10f1d8997bf7d81

因为每一个神经元建模为伯努利随机变量,且所有这些随机变量是独立同分布的,舍去神经元的总数也是随机变量,称为二项式:

023627f0453afe34e4bebb9ee10dfb7678d87989

n次尝试中有k次成功的概率由概率质量分布给出:

55460b3bb5d23fc5fbc732366679150a56a67fec

当使用dropout,定义了一个固定的舍去概率p对于选定的层,成比例数量的神经元被舍弃

3be3ad14ec1d82ebafe981d1d3fc40ef6132e020

图可以看出,无论p是多少舍去的平均神经元数量均衡为np

933a160e2ead33c8ea51c1c7d41a69d3bb369eda

此外可以注意到,围绕在p = 0.5附近的分布对称。

Dropout与其它正则化

Dropout通常使用L2归一化以及其他参数约束技术。正则化有助于保持较小的模型参数

L2归一化是损失附加项,其中λ是一种超参数F(W;x)是模型以及ε真值y和预测值y^之间的误差函数。

e596c69e772f833df283a96e806dde994d8b979d

通过梯度下降进行反向传播,减少了更新量。

a762ce896975e697de82661ee4e69a11f6e92fad

Inverted Dropout和其他正则化

由于Dropout不会阻止参数增长和彼此压制,应用L2正则化可以起到作用

明确缩放因子上述等式变为:

337e71fd721fded5b9298cad73ba6c3310057d6c

可以看出使用Inverted Dropout,学习率是由因子q进行缩放 。由于q[0,1]之间,ηq之间的比例变化:

71cf583c223c9f4e2d7a3021640ae747b9f5dacd

q称为推动因素,因为其能增强学习速率,将r(q)称为有效的学习速率

有效学习速率相对于所选的学习速率而言更高:基于此约束参数值的规化可以帮助简化学习速率选择过程。

总结

1 Dropout存在两个版本:直接(不常用)和反转

2 单个神经元上的dropout可以使用伯努利随机变量建模

3 可以使用二项式随机变量来对一组神经元上的舍弃进行建模

4 即使舍弃神经元恰巧为np的概率是低的,但平均上np神经元被舍弃

5 Inverted Dropout提高学习率

6 Inverted Dropout应该与限制参数值的其他归一化技术一起使用,以便简化学习速率选择过程

7 Dropout有助于防止深层神经网络中的过度拟合


作者介绍:Paolo Galeone,计算机工程师以及深度学习研究者,专注于计算机视觉问题的研究


bafcc5518a0f203dc66a08af1dd9a6ce1e386173


Bloghttps://pgaleone.eu/

Linkedinhttps://it.linkedin.com/in/paolo-galeone-6782b311b

Twitterhttps://twitter.com/paolo_galeone

数十款阿里云产品限时折扣中,赶紧点击领劵开始云上实践吧!

以上为译文

本文由北邮@爱可可-爱生活 老师推荐,阿里云云栖社区组织翻译。

文章原标题《Analysis of Dropout》,作者:Paolo Galeone,译者:海棠,审校:我是主题曲哥哥。

文章为简译,更为详细的内容,请查看原文

相关文章
|
3天前
|
机器学习/深度学习 自然语言处理 数据安全/隐私保护
深度学习中的艺术与科学:探索神经网络的奥秘
本文将带您走进深度学习的奇妙世界,一探神经网络背后的科学原理和艺术创造。我们将从基础概念出发,逐步深入到模型训练的技巧,以及如何应对过拟合等常见问题。通过实例分析,我们将展示深度学习技术在图像识别和自然语言处理等领域的应用,并讨论其在未来科技发展中的潜在影响。让我们一同解锁深度学习的力量,发现它如何塑造我们的数字世界。
|
2天前
|
机器学习/深度学习 人工智能 PyTorch
【深度学习】使用PyTorch构建神经网络:深度学习实战指南
PyTorch是一个开源的Python机器学习库,特别专注于深度学习领域。它由Facebook的AI研究团队开发并维护,因其灵活的架构、动态计算图以及在科研和工业界的广泛支持而受到青睐。PyTorch提供了强大的GPU加速能力,使得在处理大规模数据集和复杂模型时效率极高。
112 59
|
2天前
|
机器学习/深度学习 算法 TensorFlow
【深度学习】深度学习语音识别算法的详细解析
深度学习语音识别算法是一种基于人工神经网络的语音识别技术,其核心在于利用深度神经网络(Deep Neural Network,DNN)自动从语音信号中学习有意义的特征,并生成高效的语音识别模型。以下是对深度学习语音识别算法的详细解析
11 5
|
2天前
|
网络协议 前端开发 JavaScript
解析HTTP/2如何提升网络速度
【8月更文挑战第18天】HTTP/1.1通过持久连接、多连接及CDN分片优化了资源加载,但仍受TCP慢启动、带宽竞争及队头阻塞等问题影响。HTTP/2采用单长连接传输所有数据,解决上述问题。
|
2天前
|
机器学习/深度学习 自然语言处理 自动驾驶
【深度学习】深度学习的详细解析:涵盖定义、技术原理及应用场景
深度学习(Deep Learning)是机器学习(Machine Learning)的一个重要分支,它通过使用多层的神经网络来模拟人脑的学习过程,从而实现对数据的分析和理解。以下是关于深度学习的详细解析
10 2
|
3天前
|
存储 人工智能 运维
深度解析 | 什么是超融合数据中心网络?
深度解析 | 什么是超融合数据中心网络?
|
4天前
|
机器学习/深度学习 人工智能 自然语言处理
|
4天前
|
机器学习/深度学习 人工智能 调度
显著提升深度学习 GPU 利用率,阿里云拿下国际网络顶会优胜奖!
显著提升深度学习 GPU 利用率,阿里云拿下国际网络顶会优胜奖!
19 0
|
2天前
|
机器学习/深度学习 人工智能 自然语言处理
【深度学习】Python之人工智能应用篇——音频生成技术
音频生成是指根据所输入的数据合成对应的声音波形的过程,主要包括根据文本合成语音(text-to-speech)、进行不同语言之间的语音转换、根据视觉内容(图像或视频)进行语音描述,以及生成旋律、音乐等。它涵盖了声音结构中的音素、音节、音位、语素等基本单位的预测和组合,通过频谱逼近或波形逼近的合成策略来实现音频的生成。 音频生成技术的发展主要依赖于深度学习模型,如循环神经网络(RNN)、长短时记忆网络(LSTM)、Transformer等。这些模型通过学习大量的音频数据,能够自动生成与人类发音相似甚至超越人类水平的音频内容。近年来,随着大规模预训练模型的流行,如GPT系列模型、BERT、T5等,
12 7
【深度学习】Python之人工智能应用篇——音频生成技术
|
2天前
|
机器学习/深度学习 人工智能 算法
【深度学习】python之人工智能应用篇——图像生成技术(二)
图像生成是计算机视觉和计算机图形学领域的一个重要研究方向,它指的是通过计算机算法和技术生成或合成图像的过程。随着深度学习、生成模型等技术的发展,图像生成领域取得了显著的进步,并在多个应用场景中发挥着重要作用。
15 9

推荐镜像

更多