RDMA

首页 标签 RDMA
# RDMA #
关注
476内容
如何将深度学习训练速度提升一百倍?PAISoar 来了
得力于数据规模增长、神经网络结构的演进和计算能力的增强,深度学习的图像处理、语音识别等领域取得了飞速发展。
阿里推出 PolarFS 分布式文件系统:将存储与计算分开,提升云数据库性能(附论文)
将存储与计算分开来大有意义,对于部署的云数据库而言更是如此。为此,阿里巴巴推出了一种新开发的名为PolarFS的分布式文件系统,旨在确保低延迟和高可用性。这个文件系统与阿里云上自己的PolarDB数据库服务搭配使用。
浅析GPU通信技术(中)-NVLink
1.  背景 上一篇文章《浅析GPU通信技术(上)-GPUDirect P2P》中我们提到通过GPUDirect P2P技术可以大大提升GPU服务器单机的GPU通信性能,但是受限于PCI Expresss总线协议以及拓扑结构的一些限制,无法做到更高的带宽,为了解决这个问题,NVIDIA提出了NVLink总线协议。
[新品发布]全球首个百万IOPS云盘来了 阿里云推出超高性能云盘ESSD
搭配ECS云服务器使用, ESSD可提供单盘高达100万IOPS的随机读写能力和低至0.1毫秒的单路时延,相比SSD云盘分别提升了50倍性能上限和降低80%读写时延,单台云服务器整体存储性能提升500%。
阿里巴巴论文入选全球顶级学术会议SIGCOMM,国内唯一
近日在ACM SIGCOMM 2019上,阿里云两篇论文被主会收录,阿里巴巴作为唯一中国公司作现场报告。核心研究成果将用于新一代高速云网络,同时实现高速云网络的极致性能和超高稳定性。实践成熟有望替代TCP和RDMA协议的拥塞控制算法,在云数据中心大规模应用。
| |
来自: 云原生
在Kubernetes上使用RDMA
### RDMA RDMA(全称RemoteDirect Memory Access) 它为了解决网络传输中服务器端数据处理的延迟而产生。 它的原理是将待传输的数据从一台计算机的内存,直接传输到另一台计算机的内存,整个传输过程无需操作系统和协议栈的介入。
操作系统顶级会议SOSP 阿里云MaxCompute开启NewSQL时代
  近日,第26届操作系统原理大会(SOSP)在上海举行,来自亚洲、欧洲、北美等地区的高校、学术机构和众多科技企业研究人员齐聚一堂。阿里巴巴受邀参加此次会议,除在展区展示系统软件技术的同时,阿里集团副总裁周靖人在BOF环节向参会人员介绍了阿里在数据库、计算、机器学习、网络等领域的多项重点技术。
构建Tensorflow RDMA的Docker镜像
RDMA是一个远程通讯技术,它通过Kernel bypass等方式降低数据传输中的延迟和CPU消耗。 在分布式训练中,由于多个Worker之间或者Worker和Paramater Server 之间需要大量传输模型变量。当GPU到达一定数量后,受制于网络带宽以及TCP协议的延迟,通讯往往会成为计算性能的瓶颈,而在分布式训练中使用RDMA技术能够非常明显地提高训练速度。 #### Tenso
ESSD云盘助力阿里巴巴集团2018年双11
ESSD云盘是阿里云全新一代超高性能云盘,基于新一代分布式块存储软件架构,结合25GE网络和RDMA技术,提供单盘高达100万的随机读写能力和百微妙级别的时延能力,满足OLTP数据库、NoSQL数据库和Elasticsearch日志分析等应用对性能的极致要求。
免费试用