英伟达三代旗舰显卡性能测试:5090、4090、3090

简介: 本文通过ResNet-50模型在CIFAR-10数据集上的PyTorch训练实测,对比RTX 3090/4090/5090三代旗舰显卡性能。结果显示:5090单精/混精吞吐达1076/1822 samples/s,较4090提升约50%,4090较3090提升约45%,为深度学习选卡提供实证参考。

英伟达3090、4090、5090这3张显卡是英伟达三代消费级显卡的旗舰,这里用ResNet-50模型训练的性能测试来比较下这3代旗舰显卡的算力表现,以便于深度学习场景用户更好的选择合适的显卡。

显卡参数规格

RTX5090 RTX4090 RTX3090
架构 Blackwell Ada Lovelace Ampere
CUDA核心 21,760 16,384 10,496
显存容量 32 GB GDDR7 24 GB GDDR6X 24 GB GDDR6X
显存带宽 1792 GB/s 1,008 GB/s 936 GB/s
TDP功耗 575W 450W 350W
FP32 算力 104.8 TFLOPS 82.6 TFLOPS 35.6 TFLOPS
Tensor FP16 算力 419 TFLOPS 330 TFLOPS 142 TFLOPS

为什么使用ResNet-50模型

ResNet-50是经典的计算机视觉模型,一种深度为50 层的卷积神经网络(CNN),是深度学习领域使用最广、最成熟的基准模型之一。
ResNet-50模型平衡,参数数量及显存占用适中,涵盖了深度学习训练的关键计算模式,包含大量矩阵计算,可以评估AI核心的算力;同时各种框架(PyTorch/TensorFlow/JAX/ONNX)都内置,可以直接加载。

这里基于Pytorch框架来训练ResNet-50模型,使用CIFAR-10数据集进行测试。

显卡性能实测

使用不同的模型精度(FP32和FP16混合精度),不同批次大小,多轮运行测试统计指标取平均值。

5090

ResNet50AI性能测试-5090-1.png#622px #540px

4090

ResNet50AI性能测试-4090-1.png#622px #540px

3090

ResNet50AI性能测试-3090-1.png#622px #540px

测试结果分析

指标解释

  • 精度FP32 单精度训练,FP16 混合精度训练
  • BatchSize:训练批次大小
  • Samples/s:每秒样本吞吐量
  • VRAM (MB):平均显存使用量
  • GPU Util (%):平均GPU利用率

取最大的「每秒样本吞吐量」指标进行比较:

RTX5090 RTX4090 RTX3090
最大样本吞吐量(单精度) 1,076 699 489
最大样本吞吐量(混合精度) 1,822 1,224 836

从上表的测试结果分析,使用ResNet-50模型的训练样本吞吐速度。

  • 结合单精度和混合精度模式,5090的样本吞吐速度是4090的1.5倍左右,4090的样本吞吐速度是3090的1.45倍左右
相关文章
|
1月前
|
人工智能 智能设计
阿里云 VISION 进阶 Clouder 认证:千问 Wan+ComfyUI 全套 AI 设计课程
阿里云VISION人工智能设计认证(免费),面向AI时代设计师,聚焦千问Wan视觉大模型与ComfyUI生态,涵盖角色视频生成、概念短片、AI MTV及无影灵构实战,共4章13课时,助你高效入门Design 3.0。阿里云认证中心:https://t.aliyun.com/U/PheOCk
|
1月前
|
人工智能
2026 GOAI 世界人工智能开源大赛—新智基座 Agent Infra 赛道正式启动! ¥190万总奖池等你挑战!
2026 GOAI 世界人工智能开源大赛—新智基座 Agent Infra 赛道正式启动!¥190万总奖池等你挑战!
1624 10
|
1月前
|
存储 人工智能 Kubernetes
阿里云 AgentTeams 解读:当 Agent 开始真正在企业里干活
多 Agent 协作不只是任务并行,更是组织运转。从产品主创团队视角,聊聊 AgentTeams 在安全、协作、弹性、进化四个方向的设计思考。
818 11
|
1月前
|
缓存 UED 开发者
Codex109天重置23次,明天还要再送一次
Codex近109天完成23次额度重置,7月14日将迎来第24次。Tibo高频响应用户反馈:优化GPT-5.6高消耗问题、补发失效福利、调整重置时间——形成“反馈→回应→修复→补偿”正向闭环,彰显以用户为中心的产品哲学。(239字)
1745 12
|
1月前
|
人工智能 安全 数据库连接
明文不扩散,日志仍可用:阿里云可观测敏感数据保护方案
AI Agent 日志既要防止敏感明文扩散,也要保留排障、分析与审计价值。本文介绍阿里云可观测如何通过脱敏、加密等能力,在采集、写入和加工环节构建敏感数据保护体系。
493 11
|
1月前
阿里云 AgentTeams 7月第一周产品动态
阿里云 AgentTeams 7月第一周产品动态
104 12
|
1月前
|
人工智能 监控 API
凌晨2点的PR谁来回?AgentTeams 给 LoongSuite 配了个 7×24h 社区管理员
基于多智能体治理与协作平台 AgentTeams,我们为 LoongSuite 开源项目搭建了一个 7×24 运转的 AI 数字员工,三周自动审查 108 个 PR、处理 48 个 Issue,本文记录了从架构设计到踩坑经验的全过程。
|
1月前
|
人工智能 前端开发 定位技术
本地流量破局:GEO 地理搜索优化实操全教程(AI 开发技术干货)
本文聚焦 GEO 地理搜索优化技术,对比其与传统 SEO 的底层逻辑差异,完整讲解站点地理结构化埋点、地图 API 同步开发、区域分层页面搭建三大实操开发流程,附带本地技术服务行业真实落地优化案例,拆解优化前后流量数据变化。同时梳理开发过程中容易踩中的权重作弊、标签堆砌等技术坑点,给出合规优化方案,帮助开发者搭建全域 SEO + 区域 GEO 双优化技术架构,低成本获取本地精准自然检索流量。
|
1月前
|
缓存 Prometheus 监控
大模型API调用成本控制:Token估算、缓存策略与模型选择实践
本文介绍面向高频查询(日数百次)的大模型成本控制方案,涵盖Token估算、Redis缓存、多模型分级选型(Turbo/Plus/Max)及Prometheus费用监控告警。基于阿里云百炼与DashScope实现,需Python基础及API Key
310 2

热门文章

最新文章