当计算停留着网格内 Mellanox用智能网络助跑AI

简介:

随着大数据、人工智能和高性能计算的热度不断升温,Mellanox的身影开始出现在越来越多的场合中,其高性能网络被越来越多的用户采用。不论是国外的微软、IBM、Facebook,还是国内的腾讯、阿里巴巴、百度、京东等大型互联网企业均选择Mellanox以太网或InfiniBand网络搭建高性能的IT系统平台。

当计算停留着网格内 Mellanox用智能网络助跑AI

作为RDMA(远程直接内存访问)技术的推动者,Mellanox一直以提供出色性能的网络著称,50%以上的HPC系统和主流人工智能公司均采用其RDMA网络(包括InfiniBand和RoCE)。近日由国际高性能计算咨询委员会主办的第五届大学生RDMA编程挑战赛落幕,作为重要的支持企业,Mellanox在接受至顶网采访时重申了RDMA的魅力以及Mellanox网络被越来越多用户青睐的原因。

当计算停留在网格内

熟悉了TCP/IP的人也许对RDMA感到陌生,其实RDMA作为一种零复制网络技术使网卡可以直接与应用内存相互传输数据,并且应用程序可以访问远程内存,而不占用CPU资源。InfiniBand则是最早实现RDMA的网络协议,被广泛应用到高性能计算中。除此外,RDMA的实现方式还包括RoCE和iWARP。近期,阿里巴巴和百度相继采用Mellanox RDMA以太网(RoCE)构建高性能系统。

当计算停留着网格内 Mellanox用智能网络助跑AI

Mellanox亚太及中国区市场开发高级总监刘通

Mellanox亚太及中国区市场开发高级总监刘通表示,RDMA是解决人工智能时代数据传输瓶颈的最高效网络传输协议。无论是传统的高性能计算应用还是新兴的深度学习框架,RDMA通信方式都是其中的关键环节。

当计算停留着网格内 Mellanox用智能网络助跑AI

Mellanox公司市场部副总裁Gilad Shainer

RDMA所代表的技术体系是CPU卸载,Mellanox公司市场部副总裁Gilad Shainer指出,这也将是未来云发展的趋势,即让计算更靠近数据,数据在网卡里完成计算,Mellanox称其为网络内计算(In-Network Computing)。

当计算停留着网格内 Mellanox用智能网络助跑AI

2年前,Mellanox收购EZchip半导体公司,融合了其ARM CPU技术,加之Mellanox自己的网络芯片,从而把两者整合起来推出一款新的智能网卡为BlueField。“让网络具备计算能力和强大的数据处理能力,无论是加了FPGA还是加ARM CPU,总之这个网卡自己就会处理很多数据。”Gilad Shainer表示,数据一到网卡就已经处理完毕,而不必再经过PCIe到CPU,从而提升数据的运算效率,这就是BlueField所具备的能力。

如果说此前,Mellanox所倡导的“网络计算一部分数据、CPU计算一部分数据”,代表了Mellanox的CPU卸载技术理念,那么网络内计算则更近了一步,即让网络完成了大部分计算。Mellanox认为这种智能网卡将成为未来云计算中心的发展趋势。

Gilad Shainer说到智能网卡几个典型的应用领域,比如高速存储,利用NVMe over Fabrics的存储资源池化解决方案,Mellanox智能网卡可以卸载很多NVMe的通讯协议,从而构建大型存储资源池,实现更低的延迟和更高的性能,满足用户对高性能存储的需求。

智能网卡应用在安全场景也将是其施展拳脚的另一大领域,“把CPU上做的安全算法移到高速网络上面去,让智能网卡做安全,它的安全控制力更强。也就是当数据到网卡这一层,其中恶意流量就已经被拦截。BlueField上面有ARM CPU,可以编程一些复杂的安全算法。”Gilad Shainer说。

在Mellanox看来,智能网卡会在云计算中心大有用武之地,Mellanox的网络无论是性能还是卸载能力,再加上ARM芯片,两者结合起来会让BlueField在云市场十分具有竞争力。

Mellanox InfiniBand不是贵的代名词

很多人提到RDMA,可能会给它加上“昂贵”的标签。说到这,就不得不提英特尔的Omni-Path,近年来英特尔对Omni-Path进行大力推广,其提到的关键词就是“质优价廉”,特别是和Mellanox相比。不过Gilad Shainer却不认同,他用现实案例向记者介绍Mellanox的InfiniBand最终成为用户的选择,即使很多用户曾经选择过Omni-Path。他以BP英国石油举例,去年BP采购1000节点的集群,其中700台为Mellanox InfiniBand网络,300台为英特尔Omni-Path网络。但是经过1年的试用,今年再采购新系统时,BP已经完全不考虑Omni-Path了,而是变成完全采用InfiniBand。

“因为BP测试出,Mellanox网络的系统性能是Omni-Path的2.5倍,这就意味着它其实完全没必要花那么多钱去买那么多的CPU。完成同样的任务,Mellanox的InfiniBand对它来讲整套系统部署的成本更低,而不是单独去考虑网络本身的价格。”在Gilad Shainer看来,用户是很聪明的,他考虑的是整体的投资回报值不值得,所以最后BP切回InfiniBand,其实是省了总体成本。

不过,在性能方面,英特尔和Mellanox却是各说各话,英特尔说它的网络性能跟Mellanox的网络是一样甚至超越后者,所以价格更便宜。不过Mellanox一直回击,Gilad Shainer指出,“英特尔讲到的网络的性能跟我们差不多、价格更便宜,但是其所对比的Mellanox性能都远低于我们自己测试的性能。”

当计算停留着网格内 Mellanox用智能网络助跑AI

“拿实际应用程序的性能做一个基本的标杆进行对比,我们的性能会在8个节点到16个节点超出Omni-Path 40%、50%、70%甚至翻倍,所以这是非常大的区别。”Gilad Shainer说,简单比较带宽、延迟,双方也许差不多,但是如果真的拿应用程序比,我们的优势还是非常非常明显的,这是Mellanox向市场传达的声音。

Gilad Shainer甚至说,如果只是简单地看Linpack测试对用户来讲都是一种误导,只有跑在不同类型的应用程序上,数据才有价值。

当然,各种测试和数据也许搞得用户有点懵,不过Mellanox倒是希望用户拿去做实际应用程序测试,能够正确使用最优化的MPI,比如Mellanox 提供的HPC-X MPI。Mellanox会免费提供产品和技术支持。

小结

实际上抛开产品竞争的因素不说,今天的市场给了以Mellanox为代表的智能网络企业非常大的机遇。人工智能发展到今天,计算力是重要的驱动力, AI既然对计算的要求高,必然是Mellanox发挥重要价值的一个用武之地。实际上,目前已有大量先进的深度学习框架(如TensorFlow、Caffe2、Microsoft Cognitive Toolkit 和百度 PaddlePaddle)借助Mellanox的智能卸载功能,为多台人工智能服务器提供世界领先的性能和近线性扩展能力。

随着未来人工智能在云上大量应用,那就意味着高性能的网络会在AI云上大量被采用,这对于Mellanox及智能网络技术都是一个全新的机会。


原文发布时间为:2017年11月7日

本文作者:陈广成

本文来自云栖社区合作伙伴至顶网,了解相关信息可以关注至顶网。

相关文章
|
22天前
|
人工智能 运维 资源调度
AI 赋能混合云运维:告别手工操作,迈向智能自愈!
AI 赋能混合云运维:告别手工操作,迈向智能自愈!
185 85
|
17天前
|
机器学习/深度学习 人工智能 搜索推荐
BioEmu:微软黑科技炸场!生成式AI重构蛋白质模拟:千倍效率碾压传统计算,新药研发周期砍半
BioEmu 是微软推出的生成式深度学习系统,可在单个 GPU 上每小时生成数千种蛋白质结构样本,支持模拟动态变化、预测热力学性质,并显著降低计算成本。
36 2
BioEmu:微软黑科技炸场!生成式AI重构蛋白质模拟:千倍效率碾压传统计算,新药研发周期砍半
|
12天前
|
人工智能 边缘计算 运维
容器化浪潮下的AI赋能:智能化运维与创新应用
近年来,容器技术以其轻量、高效、可移植的特性成为云原生时代的基石,推动应用开发和部署方式革新。随着容器化应用规模扩大,传统运维手段逐渐力不从心。AI技术的引入为容器化生态带来新活力,实现智能监控、自动化故障诊断与修复及智能资源调度,提升运维效率和可靠性。同时,AI驱动容器化创新应用,如模型训练、边缘计算和Serverless AI服务,带来更多可能性。未来,AI与容器技术的融合将更加紧密,推动更智能、高效的运维平台和丰富的创新应用场景,助力数字化转型。
|
22天前
|
人工智能 运维 自然语言处理
Elasticsearch AI Assistant 集成 DeepSeek,1分钟搭建智能运维助手
Elasticsearch 新支持 DeepSeek 系列模型,使用 AI 助手,通过自然语言交互,为可观测性分析、安全运维管理及数据智能处理提供一站式解决方案。
378 3
Elasticsearch AI Assistant 集成 DeepSeek,1分钟搭建智能运维助手
|
9天前
|
人工智能 运维 架构师
Serverless + AI 让应用开发更简单,加速应用智能化
Serverless + AI 让应用开发更简单,加速应用智能化
|
9天前
|
人工智能 自然语言处理 算法
阿里云「AI实时互动」正式上线,体验“超拟人”智能互动
阿里云「AI实时互动」正式上线,体验“超拟人”智能互动
|
10天前
|
人工智能 自然语言处理 关系型数据库
DMS+AnalyticDB助力钉钉AI助理,轻松玩转智能问数
DMS+AnalyticDB助力钉钉AI助理,轻松玩转智能问数
|
11天前
|
人工智能 算法 安全
中国石油大学(北京)与阿里云达成战略合作 “云+AI”助力石油石化行业智能化转型
2023年8月3日,中国石油大学(北京)与阿里云签署战略合作协议,共同推动能源行业智能化转型。双方将成立能源智能计算联合研究中心,结合中石大在油气科学领域的积累和阿里云的云计算、AI技术优势,打造勘探开发领域行业模型算法库,助力缩短勘探时间,提升作业效率。此次合作旨在通过“云+AI”加速石油石化行业的数字化转型,实现绿色化和可持续发展目标。
25 3
|
10天前
|
人工智能 自然语言处理 搜索推荐
【活动报名】​AI应用启航workshop:AI内容创作——释放智能创意体验、驱动业务创新增长
【活动报名】​AI应用启航workshop:AI内容创作——释放智能创意体验、驱动业务创新增长
|
11天前
|
人工智能 JavaScript 安全
如何在云效中使用 DeepSeek 等大模型实现 AI 智能评审
如何在云效中使用 DeepSeek 等大模型实现 AI 智能评审

热门文章

最新文章