Infiniband/以太网,算力组网布线方案

简介: 本文详解SuperPOD构建:以32台DGX H100/H200为单元(SU),采用叶脊(Spine-Leaf)网络架构,通过多模光纤/DAC短距连接服务器与叶交换机,单模光纤长距连接叶与脊交换机;支持点对点与结构化布线,提升扩展性、管理效率与运维灵活性。(239字)

⼀、了解SuperPOD的构建

图1.png

图1可扩展单元(SU)

H100/H200算力集群系统中,通常使用可扩展单元(SU),作为一个基本单元进行管理,每个扩展单元包含32台DGX H100/H200服务器,分布在8个机架中,总共256个GPU,配备8台叶交换机(图1示),分别位于叶交换机机架左、右两侧,使服务器到交换机连接距离最短。

图2.png

图2算力集群布线

服务器→叶交换机→脊交换机布线(图2示),是构建高带宽、低延迟、可扩展数据中心网络的核心设计思路,使用叶脊(Spine-Leaf)网络架构将设备进行连接,其中服务器与叶交换机同处于一个SU内,连接距离较短(通常在几米到几十米内),优先使用多模光纤跳线或DAC高速线缆进行点对点布线,叶交换机与脊交换机连接距离较远(在上百米到数公里),使用单模跳线进行点对点或结构化布线,具体选择哪种布线方式,可根据项目需求而定。

二、服务器到叶交换机(点对点布线)

图3.png

图3可扩展单元(SU)内的连接

服务器到叶节点布线(图3示),使用主干或束状两种规格跳线进行布线,目的都是将每台服务器中相应颜色的接口,连接到相同颜色的叶节点交换机(图4示),图中4台服务器的蓝色接口,将连接到蓝色标识叶交换机的01~04口,单台叶交换机可提供32个端口用于连接服务器,而剩余的32个端口将用于连接脊交换机,8台叶交换机组成的交换机机架,可以无损接入32台DGX H100服务器。

图4.png

图4服务器与叶交换机布线选择

三、叶交换机到脊交换机(点对点/结构化布线)

图5.png

图5跨单元之间的连接

跨单元集群组网(图5示),我们除了可以使用跳线进行点对点布线外,也可以使用配线架和模块盒进行结构化布线(图6示),将脊节点/叶节点的所有端口映射到适配器模块上,另一个节点连接到配线架上对应的端口,完成布线工作,结构化布线在大规模集群的集中配线和管理有着显著优势,配线架的标签记录让故障定位、链路追踪、容量管理高效便捷,通过配线架跳接,无需改动主干线路即可轻松完成增加、移除或更改连接设备,支持资源的灵活调度。

图6.png

图6叶交换机与脊交换机布线选择

四、产品清单

图片 1.png

光纤配线架

图片 2.png

适配器模块

图片 3.png

高速线缆MPO/MTP


图片 4.png

结构化布线部署

相关文章
|
Ubuntu
Ubuntu 20.04 多网卡路由规则配置
Ubuntu 20.04 多网卡路由规则配置
6071 0
|
安全 Linux 网络安全
组网神器WireGuard安装与配置教程(超详细)
组网神器WireGuard安装与配置教程(超详细)
72316 2
|
Ubuntu
Ubuntu系统镜像下载,国内镜像站大全(山大/清华/阿里/浙大/中科大...)
装Ubuntu,是很多理工科同学入门的第一个挑战,首先我们就需要找到一个能用的iso镜像,根据你的网络环境的不同,不同的站点下载速度会不一样,下面列举一下几个比较好用的,都是来自Ubuntu官方推荐镜像站链接导航国内分区
43320 1
|
4月前
|
人工智能 数据中心 网络架构
数据中心高密度、模块化、灵活扩展式配线架
MP6高密度配线架专为AI智算、云服务及HPC场景设计,支持LC/CS/SN/MPO等多类型连接器,1U最高达144芯(LC)或288芯(SN),MPO密度高达77760芯/2.2m机架;模块化滑动托盘、前后可插拔、光电混合(1U-24口RJ45+48芯LC)及Slim超浅深度款,全面适配高密、灵活、可扩展的数据中心布线升级需求。(239字)
293 0
|
9月前
|
弹性计算 安全 Linux
2026年阿里云服务器镜像 Alibaba Cloud Linux 3.2104 LTS 64 位特性与适配场景解析
Alibaba Cloud Linux 3.2104 LTS 64 位镜像凭借对 ECS 的深度优化、CentOS 生态兼容性、长期安全支持,成为阿里云服务器的优选操作系统之一,尤其适合追求性能稳定、需要长期维护或从 CentOS 8 迁移的用户。在选择时,需根据业务场景(如是否需要快速启动、是否需等保合规)选择对应变种版本,并注意实例规格与镜像的兼容性。如需进一步了解配置细节或技术支持,可参考阿里云官方文档,确保系统部署符合业务需求。
|
存储 搜索推荐 安全
《对话记忆的进化史:智能体大模型如何实现跨轮次的深度交互》
这段内容介绍了智能体大模型在多轮对话中构建长期记忆的技术与应用。通过数据库、向量数据库和知识图谱等工具,智能体能整合用户信息,提供个性化服务。RAG技术连接当前需求与长期记忆,实现精准信息检索与生成。分层记忆架构模仿人类记忆机制,包括工作记忆、短期记忆和长期记忆,确保对话连贯性与准确性。时间感知与情节化管理优化回忆过程,动态参数更新与个性化微调使模型更“聪明”。此外,MemoryBank、记忆变量等设计保障多用户场景下的信息安全。未来,这些技术将在跨语言、情感交互等领域实现更深层次的应用,让智能体成为用户的贴心伙伴。
823 29
|
开发框架 网络协议 Unix
【嵌入式软件工程师面经】Socket,TCP,HTTP之间的区别
【嵌入式软件工程师面经】Socket,TCP,HTTP之间的区别
1428 1
|
移动开发 安全 虚拟化
VMware ESXi 9.0 下载 - 领先的裸机 Hypervisor
VMware ESXi 9.0 下载 - 领先的裸机 Hypervisor
6579 9

热门文章

最新文章