性能优化系列:每个程序员都应该知道的数字

简介: 交流群里最常听到的一句话就是:我项目太垃圾了,面试怎么办。说实话,我听了也感同身受,因为我也是这么走过来的。而且,几乎大部分人都会经历这个过程。所以,不多说了,安排。

目录

前言

正文

看这些数据的目的

1)CPU非常非常快

2)内存很快了,但是相比CPU来说还是太慢了

3)磁盘性能非常非常慢

4)磁盘顺序I/O比随机读I/O快很多

5)网络传输也是比较耗时的,基本都是毫秒级别

总结

最后

推荐阅读


前言


交流群里最常听到的一句话就是:我项目太垃圾了,面试怎么办。说实话,我听了也感同身受,因为我也是这么走过来的。而且,几乎大部分人都会经历这个过程。所以,不多说了,安排。


之所以挑性能优化这个方向,主要有几个原因:

1)性能优化是我很感兴趣的一个方向,同时在过去几年,我在这个方向上积累了一些经验,可以说,我之前的面试,项目上几乎是靠性能优化一招走遍天下。因此,我觉得可以拿出来和大家分享一下。

2)性能优化非常通用,几乎对于所有线上项目都可以适用,大家掌握了之后,立马可以到项目中实践起来。我想,应该不存在不需要性能优化的项目,除非你的项目只有“Hello world”。

3)性能优化大部分内容非常简单,几乎没有门槛,经验较浅的同学也很容易上手,同时性能优化也适用二八原则:掌握20%的内容,足以解决80%的问题。

4)性能优化很容易拿到结果,稍微有经验点的同学应该知道,做需求最怕拿不到结果,性能优化就不一样了,都是很直白的数字。1小时的任务,我优化成5分钟,性能提升就是十来倍,简单粗暴。

不多说了,开怼。


正文



文章的标题来源于 Jeff Dean 在谷歌的内部一次分布式系统的演讲,英文标题为:Numbers Everyone Should Know。

这些数字与我们后续做性能优化息息相关,因此我将这部分内容放在第一篇,帮助大家建立基本的性能概念。

先来看 Jeff Dean 所说的数字是哪些:

注:1μs = 1000ns、1ms = 1000μs


操作

耗时/延迟

耗时*10亿

一级缓存读取(L1)

0.5ns

0.5s

分支错误预测

5ns

5s

二级缓存读取(L2)

7ns

7s

互斥锁的加锁解锁

25ns

25s

内存寻址

100ns

100s

Zippy压缩1KB数据

3000ns(3μs)

50min

在1Gbps网络上发送1KB数据

10,000ns(10μs)

2.8h

从SSD(1GB/s)随机读取4KB数据

150,000ns(150μs)

1.7days

从内存顺序读取1MB数据

250,000ns(250μs)

2.9days

数据包在同数据中心一个往返

500,000ns(500μs)

5.8days

从SSD(1GB/s)顺序读取1MB数据

1,000,000ns(1ms)

11.6days

磁盘寻道

10,000,000ns(10ms)

3.8months

从磁盘顺序读取1MB数据

20,000,000ns(20ms)

7.9months

数据包从美国到荷兰一个往返

150,000,000ns(150ms)

4.75years

表格第三列将耗时数据提升10亿倍,换算成大家更容易看的单位。

这份数据的最初来源为 Peter Norvig 的文章:Teach Yourself Programming in Ten Years,地址:http://norvig.com/21-days.html。

伯克利的 Colin Scott 根据这份数据,通过一定的算法,制作了一个可以根据时间的推移而变化的网站,地址为:https://colin-scott.github.io/personal_website/research/interactive_latency.html,源码中注释有详细解释计算逻辑,例如网络带宽是按每2年增加1倍,DRAM带宽按每3年增加一倍。

根据Colin Scott 的图表来看,到2021年,网络带宽、内存、SSD、磁盘,都有数量级的提升,而 CPU 相关的一二级缓存变化不大,有兴趣的可以自己点进去看一看。


看这些数据的目的


首先,这些数据肯定不是完全准确的,受限于众多环境因素的影响,其实很难有所谓的准确数字。

我们看这些数据更多是了解每个操作的耗时量级,各个操作之间的数量级比率,从而对于我们工作中接触到的一些相关知识有初步的概念。

而我将这个数据放在性能优化系列文章的开篇,主要想先传达给各位同学几个概念:


1)CPU非常非常快


CPU执行大部分简单指令只需要1个时钟周期,我用个人电脑测试时,CPU可以睿频到4.40GHz(见第2点的测试图),也就是说此时执行一个简单指令需要的时间大约是1/4.4ns,也就是0.23ns(纳秒)。

这是什么概念了,举个简单的例子,即使是真空中传播的光,在0.23ns内也只能走不到7厘米。


2)内存很快了,但是相比CPU来说还是太慢了


CPU和内存之间的瓶颈通常称为冯·诺伊曼瓶颈。具体差别有多大了,我用自己的电脑做了个简单的测试。

我电脑是今年刚买的,硬件应该都还比较新,但是配置比较普通,仅供参考。

CPU配置是 11th Gen Intel Core i5-11400F@2.60GHz,睿频4.40GHz,测试结果看也确实跑到了4.40GHz了,内存配置是 DDR4 3200MHz。

测试结果如下图所示:

image.png

从上图看,内存的读取速度为41GB/s,感觉还是挺快的,但是L1 Cache为3TB/s,一比较,相差还是很大。


如果CPU按4.40GHz来算,执行一个简单指令需要的时间大约是0.23ns(纳秒),而内存的延迟是88.7ns,相当于CPU去内存里取一个字节,需要等待386个周期,可以看出,内存相较于CPU来说,确实太慢了。


这也是为什么引入了L1、L2、L3缓存的原因,不过这边我们不深入去研究这些东西,只是对CPU和内存的性能差距有个大概概念。


3)磁盘性能非常非常慢


这个大家估计大家都知道,具体有多慢了,我这边在用自己的电脑做了个简单的测试。

我电脑刚好有两块硬盘,一块256GB的SSD(固态硬盘),一块1T的HDD(机械硬盘)。

SSD测试结果如下图所示:

image.png

忽略队列(Q)和线程(T)的影响,顺序读(SEQ)的性能为1535.67MB/s,随机读(RND)的性能为49.61MB/s。

对比下上面内存的性能41GB/s,尽管是SSD,性能还是存在数量级的差距,另一个就是随机读的性能相比顺序读也是存在数量级的差距。

HDD测试结果如下图所示:

image.png

忽略队列(Q)和线程(T)的影响,顺序读(SEQ)的性能为183.49MB/s,随机读(RND)的性能为0.6MB/s。

对比下上面SSD的性能:顺序读1535.67比183.49,存在一个数量级的差距,随机读49.61比0.6,存在两个数量级的差距。

而HDD顺序读和随机读的性能差距相比SSD就比较严重了,大概有300倍。简直惨不忍睹,不过相信现在的服务器应该基本都是SSD了。如果发现自己公司服务器的磁盘还是HDD,那就赶紧溜吧。


4)磁盘顺序I/O比随机读I/O快很多

这个在上面的测试也看出来了,都是数量级上的差距,特别是在以前的HDD上。有不少技术就是利用了顺序I/O性能好的特点来提升性能,典型的有:kafka顺序写消息、Leveldb和RocksDB底层使用的LSM-Tree等。


5)网络传输也是比较耗时的,基本都是毫秒级别

在开始的表格中可以看到,在同数据中心一个往返,需要0.5ms。

如果是跨城市就更久了,这个相信也不难理解,毕竟信号要顺着网线爬,距离越远,当然所需时间就越久了。

下图是上海到一些城市进行PING操作所需的时间,可以看到张家口已经需要30ms左右了,这也差不多就是北上的延迟。

image.png

image.png

这也是为什么我们在服务器的路由策略上通常会优先使用同机房优先、同中心优先的策略。

这让我想到我之前碰到的一个问题,当时是一个新服务在测试,数据库基本没数据,测试场景也是很简单的增删改查,但是接口的性能就是很差,动不动就上百毫秒。

仔细看了调用链后,发现每次DB操作都需要30ms左右,看了下机房分布后,发现是应用服务器和数据库服务器跨城市了,一个在北京一个在上海,导致会有固定30ms左右的延迟。将两者换到同机房后,基本就是1ms了。


总结


本文着重介绍了业务开发在做性能优化需要掌握的一些核心概念,之所以放在最先介绍,是因为在我做性能优化的过程中,发现绝大多数性能问题都是由于网络I/O和磁盘I/O引起的。对这些概念心中有数后,有利于我们更快的定位出性能瓶颈,从而更快的解决问题。


有同学可能会问,下一篇文章什么时候,不会又是两个月后吧?


答:跟大家聊下为什么更新间隔这么久,一个是确实变懒了,这个毋庸置疑,有一些其他的事情就忘了这边,比如从几个月前开始我坚持每天健身,当然归根到底有很大的原因是动力的问题。


另外一个就是工作确实比较忙,现在做的项目比较有挑战,基本都是几十万上百万的QPS,几十亿的数据量,很多问题都不可同日而语,因此要做的事情很多,挑战比较大,所以需要花比较多的时间去思考和维护。


然后,道理是这样的,很多同学都有白嫖的习惯,这个我不反对,因为我自己也经常白嫖。但是如果你确实觉得这个系列文章对你有帮助,你希望能加快更新速度,那最好的方式是给我点反馈,一键三什么你懂的。


我需要有反馈才能知道文章对大家是否有帮助,如果好的反馈多了,我知道文章对大家帮助很大,自然就会更新的勤快点,通宵什么的说不定也干的出来,我狠起来我自己都怕。


最后



我是囧辉,一个坚持分享原创技术干货的程序员。


推荐阅读


Java 基础高频面试题(2021年最新版)

Java 集合框架高频面试题(2021年最新版)

面试必问的 MySQL,你懂了吗?

面试必问的线程池,你懂了吗?

相关文章
|
人工智能 运维 监控
AI时代云基础设施的技术创新与展望丨ODCC2023
AI时代云基础设施的技术创新与展望丨ODCC2023
|
3月前
|
人工智能
2.4 万亿参数 Qwen3.8-Max 发布,三平台一键上手实操,阿里云百炼预览版限时 1 折优惠
阿里云千问Qwen3.8-Max正式发布,参数量达2.4T,代码与办公场景表现卓越。现可通过百炼TokenPlan、Qoder、QoderWork三渠道抢先体验Preview版,享白天1折、夜间再享2折优惠,正式版即将开源。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
1189 2
|
5月前
|
存储 缓存 边缘计算
AIWCLOUD:CDN在AIGC大模型推理服务中的KV-Cache加速与显存卸载技术
本文提出面向AIGC推理优化的新型CDN架构,突破传统静态缓存局限,创新实现边缘侧KV-Cache语义共享、显存卸载与Prompt去重,显著缓解高并发下的显存墙与重复计算瓶颈,在不增GPU成本前提下提升吞吐与响应速度。(239字)
559 0
|
3月前
|
人工智能
Qwen3.8抢先体验!正式版即将发布并开源!
千问Qwen3.8即将开源,参数达2.4T,进化速度以“天”计,实力媲美Fable 5。预览版Qwen3.8-Max已上线阿里Token Plan等平台,限时优惠:日间Credits低至1折,夜间更优,个人/团队版月付仅35元起!
4978 157
|
9月前
|
存储 人工智能 缓存
实战教学:如何构建一套带“指挥官”能力的 AI Agent 系统
本文介绍2026年企业级AI新范式——“指挥官”架构(Commander-led Architecture),破解单体Agent在复杂任务中的幻觉与断裂难题。系统含指挥中枢、调度路由、专家执行与记忆资产四层,具备意图拆解、智能调度、闭环审计能力,助力构建高确定性AI协作体系。(239字)
1007 4
|
5月前
|
人工智能 Linux API
2026 hermes agent 安装 教程:三步搞定安装优化、模型配置与工具启用
本文详解Hermes Agent(Nous Research开源的自主进化型AI智能体)全流程部署:涵盖环境校验、一键安装(Win/macOS/Linux)、模型接入(Kimi/Anthropic等)、网关配置及工具启用,助你快速避开配置坑,搭建可自我成长的本地化AI助手。
|
JavaScript 前端开发 开发者
vue3+ts配置跨域报错问题解决:> newpro2@0.1.0 serve > vue-cli-service serve ERROR Invalid options in vue.
【6月更文挑战第3天】在 Vue CLI 项目中遇到 "ERROR Invalid options in vue.config.js: ‘server’ is not allowed" 错误是因为尝试在 `vue.config.js` 中使用不被支持的 `server` 选项。正确配置开发服务器(如代理)应使用 `devServer` 对象,例如设置代理到 `http://xxx.com/`: ```javascript module.exports = { devServer: {
982 1
|
机器学习/深度学习 运维 监控
业财融合新纪元:2025预算管控工具如何打通部门壁垒实现数据一体化
本课程深入解析企业预算管理系统,涵盖复杂系统建模、非线性动力学分析与智能决策理论。结合系统动力学、多目标优化与深度学习技术,探讨预算系统的混沌特性、相变现象及智能算法应用,并提供SAP、板栗看板等工具实践参考,助力提升预算管控能力。
375 0
|
关系型数据库 数据处理 PostgreSQL
在 Postgres 中使用 Split Part
【8月更文挑战第11天】
1933 0
在 Postgres 中使用 Split Part

热门文章

最新文章