SnowFlake 雪花算法和原理(分布式 id 生成算法)

简介: SnowFlake 雪花算法和原理(分布式 id 生成算法)

一、概述

SnowFlake 算法:是 Twitter 开源的分布式 id 生成算法。

核心思想:使用一个 64 bit 的 long 型的数字作为全局唯一 id。

image.gif编辑

算法原理

    • 最高位是符号位,始终为0,不可用。
      • 41位的时间序列,精确到毫秒级,41位的长度可以使用69年。时间位还有一个很重要的作用是可以根据时间进行排序。
        • 10位的机器标识,10位的长度最多支持部署1024个节点
          • 12位的计数序列号,序列号即一系列的自增id,可以支持同一节点同一毫秒生成多个ID序号,12位的计数序列号支持每个节点每毫秒产生4096个ID序号

          算法优缺点

          优点

            • 高并发分布式环境下生成不重复 id,每秒可生成百万个不重复 id。
              • 基于时间戳,以及同一时间戳下序列号自增,基本保证 id 有序递增。
                • 不依赖第三方库或者中间件。
                  • 算法简单,在内存中进行,效率高。

                  缺点

                  依赖服务器时间,服务器时钟回拨时可能会生成重复 id。算法中可通过记录最后一个生成 id 时的时间戳来解决,每次生成 id 之前比较当前服务器时钟是否被回拨,避免生成重复 id。

                  二、算法实现

                  <dependency>
                  <groupId>cn.hutool</groupId>
                  <artifactId>hutool-all</artifactId>
                  <version>5.8.11</version>
                  </dependency>

                  image.gif

                  public class IdWorker {
                      //下面两个每个5位,加起来就是10位的工作机器id
                      private long workerId;    //工作id
                      private long datacenterId;   //数据id
                      //12位的序列号
                      private long sequence;
                      public IdWorker(long workerId, long datacenterId, long sequence) {
                          // sanity check for workerId
                          if (workerId > maxWorkerId || workerId < 0) {
                              throw new IllegalArgumentException(String.format("worker Id can't be greater than %d or less than 0", maxWorkerId));
                          }
                          if (datacenterId > maxDatacenterId || datacenterId < 0) {
                              throw new IllegalArgumentException(String.format("datacenter Id can't be greater than %d or less than 0", maxDatacenterId));
                          }
                          System.out.printf("worker starting. timestamp left shift %d, datacenter id bits %d, worker id bits %d, sequence bits %d, workerid %d",
                                  timestampLeftShift, datacenterIdBits, workerIdBits, sequenceBits, workerId);
                          this.workerId = workerId;
                          this.datacenterId = datacenterId;
                          this.sequence = sequence;
                      }
                      //初始时间戳
                      private long twepoch = 1288834974657L;
                      //长度为5位
                      private long workerIdBits = 5L;
                      private long datacenterIdBits = 5L;
                      //最大值
                      private long maxWorkerId = -1L ^ (-1L << workerIdBits);
                      private long maxDatacenterId = -1L ^ (-1L << datacenterIdBits);
                      //序列号id长度
                      private long sequenceBits = 12L;
                      //序列号最大值
                      private long sequenceMask = -1L ^ (-1L << sequenceBits);
                      //工作id需要左移的位数,12位
                      private long workerIdShift = sequenceBits;
                      //数据id需要左移位数 12+5=17位
                      private long datacenterIdShift = sequenceBits + workerIdBits;
                      //时间戳需要左移位数 12+5+5=22位
                      private long timestampLeftShift = sequenceBits + workerIdBits + datacenterIdBits;
                      //上次时间戳,初始值为负数
                      private long lastTimestamp = -1L;
                      public long getWorkerId() {
                          return workerId;
                      }
                      public long getDatacenterId() {
                          return datacenterId;
                      }
                      public long getTimestamp() {
                          return System.currentTimeMillis();
                      }
                      //下一个ID生成算法
                      public synchronized long nextId() {
                          long timestamp = timeGen();
                          //获取当前时间戳如果小于上次时间戳,则表示时间戳获取出现异常
                          if (timestamp < lastTimestamp) {
                              System.err.printf("clock is moving backwards.  Rejecting requests until %d.", lastTimestamp);
                              throw new RuntimeException(String.format("Clock moved backwards.  Refusing to generate id for %d milliseconds",
                                      lastTimestamp - timestamp));
                          }
                          //获取当前时间戳如果等于上次时间戳(同一毫秒内),则在序列号加一;否则序列号赋值为0,从0开始。
                          if (lastTimestamp == timestamp) {
                              sequence = (sequence + 1) & sequenceMask;
                              if (sequence == 0) {
                                  timestamp = tilNextMillis(lastTimestamp);
                              }
                          } else {
                              sequence = 0;
                          }
                          //将上次时间戳值刷新
                          lastTimestamp = timestamp;
                          /**
                           * 返回结果:
                           * (timestamp - twepoch) << timestampLeftShift) 表示将时间戳减去初始时间戳,再左移相应位数
                           * (datacenterId << datacenterIdShift) 表示将数据id左移相应位数
                           * (workerId << workerIdShift) 表示将工作id左移相应位数
                           * | 是按位或运算符,例如:x | y,只有当x,y都为0的时候结果才为0,其它情况结果都为1。
                           * 因为个部分只有相应位上的值有意义,其它位上都是0,所以将各部分的值进行 | 运算就能得到最终拼接好的id
                           */
                          return ((timestamp - twepoch) << timestampLeftShift) |
                                  (datacenterId << datacenterIdShift) |
                                  (workerId << workerIdShift) |
                                  sequence;
                      }
                      //获取时间戳,并与上次时间戳比较
                      private long tilNextMillis(long lastTimestamp) {
                          long timestamp = timeGen();
                          while (timestamp <= lastTimestamp) {
                              timestamp = timeGen();
                          }
                          return timestamp;
                      }
                      //获取系统时间戳
                      private long timeGen() {
                          return System.currentTimeMillis();
                      }
                      //---------------测试---------------
                      public static void main(String[] args) {
                          IdWorker worker = new IdWorker(1, 1, 1);
                          for (int i = 0; i < 30; i++) {
                              System.out.println(worker.nextId());
                          }
                      }
                  }

                  image.gif

                  解决时间回拨问题

                  原生的 Snowflake 算法是完全依赖于时间的,如果有时钟回拨的情况发生,会生成重复的 ID,市场上的解决方案也是不少。简单粗暴的办法有:

                    • 最简单的方案,就是关闭生成唯一 ID 机器的时间同步。
                      • 使用阿里云的的时间服务器进行同步,2017 年 1 月 1 日的闰秒调整,阿里云服务器 NTP 系统 24 小时“消化”闰秒,完美解决了问题。
                        • 如果发现有时钟回拨,时间很短比如 5 毫秒,就等待,然后再生成。或者就直接报错,交给业务层去处理。也可以采用 SonyFlake 的方案,精确到 10 毫秒,以 10 毫秒为分配单元。

                        twitter的雪花算法:GitHub - twitter-archive/snowflake: Snowflake is a network service for generating unique ID numbers at high scale with some simple guarantees.

                        其它全局唯一的分布式ID的方式:如百度的uid-generator美团的Leaf滴滴的TinyId



                        文章下方有交流学习区!一起学习进步!也可以前往官网,加入官方微信交流群你的支持和鼓励是我创作的动力❗❗❗

                        官网:Doker 多克; 官方旗舰店:首页-Doker 多克 多克创新科技企业店-淘宝网 全品优惠

                        目录
                        相关文章
                        |
                        2月前
                        |
                        存储 Dubbo Java
                        分布式 RPC 底层原理详解,看这篇就够了!
                        本文详解分布式RPC的底层原理与系统设计,大厂面试高频,建议收藏。关注【mikechen的互联网架构】,10年+BAT架构经验倾囊相授。
                        分布式 RPC 底层原理详解,看这篇就够了!
                        |
                        2月前
                        |
                        算法 关系型数据库 MySQL
                        分布式唯一ID生成:深入理解Snowflake算法在Go中的实现
                        在分布式系统中,确保每个节点生成的 ID 唯一且高效至关重要。Snowflake 算法由 Twitter 开发,通过 64 位 long 型数字生成全局唯一 ID,包括 1 位标识位、41 位时间戳、10 位机器 ID 和 12 位序列号。该算法具备全局唯一性、递增性、高可用性和高性能,适用于高并发场景,如电商促销时的大量订单生成。本文介绍了使用 Go 语言的 `bwmarrin/snowflake` 和 `sony/sonyflake` 库实现 Snowflake 算法的方法。
                        96 1
                        分布式唯一ID生成:深入理解Snowflake算法在Go中的实现
                        |
                        1月前
                        |
                        存储 算法 安全
                        分布式系统架构1:共识算法Paxos
                        本文介绍了分布式系统中实现数据一致性的重要算法——Paxos及其改进版Multi Paxos。Paxos算法由Leslie Lamport提出,旨在解决分布式环境下的共识问题,通过提案节点、决策节点和记录节点的协作,确保数据在多台机器间的一致性和可用性。Multi Paxos通过引入主节点选举机制,优化了基本Paxos的效率,减少了网络通信次数,提高了系统的性能和可靠性。文中还简要讨论了数据复制的安全性和一致性保障措施。
                        54 1
                        |
                        1月前
                        |
                        机器学习/深度学习 存储 运维
                        分布式机器学习系统:设计原理、优化策略与实践经验
                        本文详细探讨了分布式机器学习系统的发展现状与挑战,重点分析了数据并行、模型并行等核心训练范式,以及参数服务器、优化器等关键组件的设计与实现。文章还深入讨论了混合精度训练、梯度累积、ZeRO优化器等高级特性,旨在提供一套全面的技术解决方案,以应对超大规模模型训练中的计算、存储及通信挑战。
                        84 4
                        |
                        2月前
                        |
                        NoSQL Java 数据处理
                        基于Redis海量数据场景分布式ID架构实践
                        【11月更文挑战第30天】在现代分布式系统中,生成全局唯一的ID是一个常见且重要的需求。在微服务架构中,各个服务可能需要生成唯一标识符,如用户ID、订单ID等。传统的自增ID已经无法满足在集群环境下保持唯一性的要求,而分布式ID解决方案能够确保即使在多个实例间也能生成全局唯一的标识符。本文将深入探讨如何利用Redis实现分布式ID生成,并通过Java语言展示多个示例,同时分析每个实践方案的优缺点。
                        87 8
                        |
                        2月前
                        |
                        存储 缓存 算法
                        分布式缓存有哪些常用的数据分片算法?
                        【10月更文挑战第25天】在实际应用中,需要根据具体的业务需求、数据特征以及系统的可扩展性要求等因素综合考虑,选择合适的数据分片算法,以实现分布式缓存的高效运行和数据的合理分布。
                        |
                        2月前
                        |
                        分布式计算 Java 开发工具
                        阿里云MaxCompute-XGBoost on Spark 极限梯度提升算法的分布式训练与模型持久化oss的实现与代码浅析
                        本文介绍了XGBoost在MaxCompute+OSS架构下模型持久化遇到的问题及其解决方案。首先简要介绍了XGBoost的特点和应用场景,随后详细描述了客户在将XGBoost on Spark任务从HDFS迁移到OSS时遇到的异常情况。通过分析异常堆栈和源代码,发现使用的`nativeBooster.saveModel`方法不支持OSS路径,而使用`write.overwrite().save`方法则能成功保存模型。最后提供了完整的Scala代码示例、Maven配置和提交命令,帮助用户顺利迁移模型存储路径。
                        |
                        4天前
                        |
                        算法 数据安全/隐私保护 计算机视觉
                        基于Retinex算法的图像去雾matlab仿真
                        本项目展示了基于Retinex算法的图像去雾技术。完整程序运行效果无水印,使用Matlab2022a开发。核心代码包含详细中文注释和操作步骤视频。Retinex理论由Edwin Land提出,旨在分离图像的光照和反射分量,增强图像对比度、颜色和细节,尤其在雾天条件下表现优异,有效解决图像去雾问题。
                        |
                        4天前
                        |
                        算法 数据可视化 安全
                        基于DWA优化算法的机器人路径规划matlab仿真
                        本项目基于DWA优化算法实现机器人路径规划的MATLAB仿真,适用于动态环境下的自主导航。使用MATLAB2022A版本运行,展示路径规划和预测结果。核心代码通过散点图和轨迹图可视化路径点及预测路径。DWA算法通过定义速度空间、采样候选动作并评估其优劣(目标方向性、障碍物距离、速度一致性),实时调整机器人运动参数,确保安全避障并接近目标。
                        |
                        14天前
                        |
                        算法 数据安全/隐私保护
                        室内障碍物射线追踪算法matlab模拟仿真
                        ### 简介 本项目展示了室内障碍物射线追踪算法在无线通信中的应用。通过Matlab 2022a实现,包含完整程序运行效果(无水印),支持增加发射点和室内墙壁设置。核心代码配有详细中文注释及操作视频。该算法基于几何光学原理,模拟信号在复杂室内环境中的传播路径与强度,涵盖场景建模、射线发射、传播及接收点场强计算等步骤,为无线网络规划提供重要依据。

                        热门文章

                        最新文章