DCGAN-论文阅读笔记(二)

简介: DCGAN-论文阅读笔记(二)

研究意义


早期的GAN在图像上仅局限MNIST这样的简单数据集中,DCGAN使GAN在图像生成任务上的效果大大提升

DCGAN几乎奠定了GAN的标准架构,之后GAN的研究者们不用再过多关注模型架构和稳定性,可以把更多的精力放在任务本身上,从而促进了GAN在16年的蓬勃发展

开创了GAN在图像编辑上的应用


模型结构



所有的pooling层使用strided卷积(判别器)和fractional-strided卷积(生成器)进行替换

使用Batch Normalization

移除全连接的隐层,让网络可以更深

在生成器上,除了输出层使用Tanh外,其它所有层的激活函数都使用ReLU

判别器所有层的激活函数都使用LeakyReLU


训练细节


训练图像的预处理,只做了到 [-1, 1] 的值域缩放

使用mini-batch随机梯度下降来训练网络, batch size大小为128

采用均值为0 标准差为0.02的正态分布,来对所有权重进行初始化

对于LeakyReLU激活函数,leak的斜率设置为0.2

优化器使用Adam,而不是此前GAN网络用的momentum

Adam的学习速率使用0.0002,而非原论文建议的0.001

Adam的参数momentum term β1,原论文建议的0.9会导致训练震荡和不稳定,将其减少至0.5可以让训练更加稳定


图像生成


LSUN


没有使用 Data Augmentation

在LSUN上训练一个3072-128-3072的自编码器,用它从图像中提取128维特征,再经过ReLU层激活后作为图像的语义hash值

对生成图像和训练集使用上面的编码器,提取128维的语义hash值,进行重复性检测

检测到了大约275000左右数量的重复数据(LSUN数据集大小为300多万)


FACES


从DBpedia上获取人名,并保证他们都是当代人

用这些人名在网络上搜索,收集其中包含人脸的图像,得到了来自1万人的300万张图像

使用OpenCV的人脸检测算法,截取筛选出较高分辨率的人脸,最终得到了大约35万张人脸图像

训练时没有使用 Data Augmentation


无监督表征学习


Unsupervised representation learning


CIFAR-10

在Imagenet-1k上训练DCGAN

使用判别器所有层的卷积特征,分别经过最大池化层,在每一层上得到一个空间尺寸为4*4的特征,再把这些特征做flattened和concatenated,最终得到28672维的向量表示

用一个SVM分类器,基于这些特征向量和类别label进行有监督训练



StreetView House Numbers(SVHN)

使用与CIFAR-10实验相同的处理流程

使用10000个样本来作为验证集,将其用在超参数和模型的选择上

随机选择1000个类别均衡的样本,用来训练正则化线性L2-SVM分类器

使用相同的生成器结构、相同的数据集,从头训练有监督CNN模型,并使用验证集进行超参数搜索

目录
相关文章
|
监控 前端开发
STM32F103标准外设库——RCC时钟(六)
STM32F103标准外设库——RCC时钟(六)
2185 0
STM32F103标准外设库——RCC时钟(六)
|
机器学习/深度学习 人工智能 自然语言处理
视觉 注意力机制——通道注意力、空间注意力、自注意力
本文介绍注意力机制的概念和基本原理,并站在计算机视觉CV角度,进一步介绍通道注意力、空间注意力、混合注意力、自注意力等。
16241 58
|
8月前
|
人工智能 弹性计算 安全
阿里云无影云电脑价格:企业版费用、个人版收费及免费无影云电脑申请流程
阿里云无影云电脑提供企业版与个人版,企业版4核8G低至199元/年,支持办公及GPU设计;个人版黄金款14元/月起,最高黑金款149元/月,畅享云游戏与AI开发。另有免费试用1个月可申请。
2736 159
|
机器学习/深度学习 JavaScript PyTorch
9个主流GAN损失函数的数学原理和Pytorch代码实现:从经典模型到现代变体
生成对抗网络(GAN)的训练效果高度依赖于损失函数的选择。本文介绍了经典GAN损失函数理论,并用PyTorch实现多种变体,包括原始GAN、LS-GAN、WGAN及WGAN-GP等。通过分析其原理与优劣,如LS-GAN提升训练稳定性、WGAN-GP改善图像质量,展示了不同场景下损失函数的设计思路。代码实现覆盖生成器与判别器的核心逻辑,为实际应用提供了重要参考。未来可探索组合优化与自适应设计以提升性能。
1266 7
9个主流GAN损失函数的数学原理和Pytorch代码实现:从经典模型到现代变体
|
Java
String.format 详解
在 Java 中,String.format 是一个用于格式化字符串的静态方法。它允许你按照特定的格式将数据插入到字符串中。String.format 通过使用占位符和格式化标记,可以生成具有指定格式的字符串。
1425 4
|
JavaScript 测试技术 Python
UI自动化测试中的元素等待机制解析
在UI自动化测试中,元素定位失败常因页面存在iframe或缺乏合理等待机制。本文解析三种等待策略及其应用场景:显式等待可精确控制单个元素等待条件,支持自定义轮询;隐式等待全局生效,适合简单页面加载;强制等待仅用于临时调试,正式脚本慎用。通过对比三者执行精度、资源消耗及适用场景,帮助选择最优策略,提升测试效率与稳定性。
|
机器学习/深度学习 人工智能 计算机视觉
YOLOv11 正式发布!你需要知道什么? 另附:YOLOv8 与YOLOv11 各模型性能比较
YOLOv11是Ultralytics团队推出的最新版本,相比YOLOv10带来了多项改进。主要特点包括:模型架构优化、GPU训练加速、速度提升、参数减少以及更强的适应性和更多任务支持。YOLOv11支持目标检测、图像分割、姿态估计、旋转边界框和图像分类等多种任务,并提供不同尺寸的模型版本,以满足不同应用场景的需求。
YOLOv11 正式发布!你需要知道什么? 另附:YOLOv8 与YOLOv11 各模型性能比较
|
运维 安全 网络安全
没有谁不可或缺,宝塔的3个替代品
随着软件数量和复杂度增加,宝塔面板因用户友好的界面和丰富功能成为首选。但技术进步和开源社区发展催生了Websoft9、FastPanel和Urlos等新工具,它们在特定领域提供了与宝塔面板相媲美或更优的解决方案。本文介绍这三款工具的特点,旨在为用户提供更多选择参考。
1815 0
没有谁不可或缺,宝塔的3个替代品
|
编解码 自然语言处理 算法
生成对抗网络的应用有哪些
【10月更文挑战第14天】生成对抗网络的应用有哪些
|
机器学习/深度学习 边缘计算 人工智能
深度学习的未来趋势与挑战
本文探讨了深度学习的最新进展和未来发展方向,并分析了当前面临的主要挑战。通过具体案例和研究数据,揭示了深度学习在多个领域的应用前景及其潜在问题。

热门文章

最新文章