RDMA

首页 标签 RDMA
# RDMA #
关注
480内容
聚搜云专业运维团队:阿里云E-HPC MPI任务集群配置性能实战
阿里云E-HPC把集群调度、MPI运行环境和RDMA网络打包成一项托管服务,研发团队不用从零配置SLURM或编译OpenMPI,就能直接提交并行作业。对于那些跑仿真、做计算化学或者训练中小规模模型、希望把“阿里云E-HPC运行MPI并行任务”这件事变得像提交命令一样简单的团队,这层封装可以大幅缩短从硬件到上线的时间窗口。
利用阿里云E-HPC资源调度优化解决节点利用率低问题
阿里云E-HPC通过多维分层队列、抢占式实例调度、RDMA通信优化与弹性伸缩联动,精准解决HPC节点空转与作业长排队并存难题,在保障计算时效前提下显著提升资源有效利用率,降低综合算力成本。
【洛神公开课】第6期:AI网络白皮书-02训练网络篇
阿里云AI训练网络“三层引擎”(Scale-Up/Out/Across)突破万卡集群瓶颈:NVLink实现单机8卡全互联,HPN+eRDMA将跨机通信时延压至2μs,CEN+TR支撑跨域Tbps级协同。三者协同达成96%线性加速比,显著破解GPU空转难题。(239字)
|
2月前
|
VMware ESX 9.1.0.0100 发布 - 云计算操作系统
VMware ESX 9.1.0.0100(实为ESXi)于2026年6月5日发布,聚焦安全增强与多项新特性:零接触部署、RDMA可观测性、Guest自定义API升级、机密计算(TDX/SEV-SNP正式可用)、Enhanced DirectPath支持AI GPU、内存分层优化等。无功能新增,仅安全改进。(239字)
解读《2025龙蜥社区操作系统白皮书》,这四大亮点值得关注
操作系统在 AI 时代该怎么走,龙蜥社区给出的答案已经越来越清晰。
|
5月前
|
你的GPU正在“等米下锅”:RDMA如何修出一条绕过CPU的高速公路?
本文深度解析现代集群网络的底层革命:从冯·诺依曼瓶颈出发,剖析RDMA如何通过零拷贝、内核旁路与硬件卸载突破TCP/IP桎梏;直击其易用性差、连接爆炸、内存注册昂贵等痛点;并揭示Mooncake(面向LLM KV Cache的张量传输引擎)与Infinistore(万卡级分布式KV底座)如何以内存池化、拓扑感知、RC/UD混合等架构创新, bridging hardware power and software simplicity。
阿里云渠道商:为什么阿里云服务器的网络延迟降低?
阿里云通过RDMA、神龙架构与全球加速网络,实现微秒级延迟和跨境访问提速4倍。覆盖AI训练、实时交互等场景,助力企业高效上云。技术领先,性能卓越,翼龙云提供专业支持与优惠助力。
大模型训练推理优化(5): FlexLink —— NVLink 带宽无损提升27%
本期我们将介绍蚂蚁集团ASystem团队在大模型通信优化上的新工作FlexLink,旨在通过动态聚合多路通信(NVLink,PCIe,RDMA),在H800等典型硬件上将典型通信算子如(AllReduce, All Gather)吞吐提升最高达27%,尤其适合大模型长序列推理(Prefill阶段),及训练等通信密集的带宽bound场景。方案对精度无影响。
免费试用