当计算停留着网格内 Mellanox用智能网络助跑AI

简介:

随着大数据、人工智能和高性能计算的热度不断升温,Mellanox的身影开始出现在越来越多的场合中,其高性能网络被越来越多的用户采用。不论是国外的微软、IBM、Facebook,还是国内的腾讯、阿里巴巴、百度、京东等大型互联网企业均选择Mellanox以太网或InfiniBand网络搭建高性能的IT系统平台。

当计算停留着网格内 Mellanox用智能网络助跑AI

作为RDMA(远程直接内存访问)技术的推动者,Mellanox一直以提供出色性能的网络著称,50%以上的HPC系统和主流人工智能公司均采用其RDMA网络(包括InfiniBand和RoCE)。近日由国际高性能计算咨询委员会主办的第五届大学生RDMA编程挑战赛落幕,作为重要的支持企业,Mellanox在接受至顶网采访时重申了RDMA的魅力以及Mellanox网络被越来越多用户青睐的原因。

当计算停留在网格内

熟悉了TCP/IP的人也许对RDMA感到陌生,其实RDMA作为一种零复制网络技术使网卡可以直接与应用内存相互传输数据,并且应用程序可以访问远程内存,而不占用CPU资源。InfiniBand则是最早实现RDMA的网络协议,被广泛应用到高性能计算中。除此外,RDMA的实现方式还包括RoCE和iWARP。近期,阿里巴巴和百度相继采用Mellanox RDMA以太网(RoCE)构建高性能系统。

当计算停留着网格内 Mellanox用智能网络助跑AI

Mellanox亚太及中国区市场开发高级总监刘通

Mellanox亚太及中国区市场开发高级总监刘通表示,RDMA是解决人工智能时代数据传输瓶颈的最高效网络传输协议。无论是传统的高性能计算应用还是新兴的深度学习框架,RDMA通信方式都是其中的关键环节。

当计算停留着网格内 Mellanox用智能网络助跑AI

Mellanox公司市场部副总裁Gilad Shainer

RDMA所代表的技术体系是CPU卸载,Mellanox公司市场部副总裁Gilad Shainer指出,这也将是未来云发展的趋势,即让计算更靠近数据,数据在网卡里完成计算,Mellanox称其为网络内计算(In-Network Computing)。

当计算停留着网格内 Mellanox用智能网络助跑AI

2年前,Mellanox收购EZchip半导体公司,融合了其ARM CPU技术,加之Mellanox自己的网络芯片,从而把两者整合起来推出一款新的智能网卡为BlueField。“让网络具备计算能力和强大的数据处理能力,无论是加了FPGA还是加ARM CPU,总之这个网卡自己就会处理很多数据。”Gilad Shainer表示,数据一到网卡就已经处理完毕,而不必再经过PCIe到CPU,从而提升数据的运算效率,这就是BlueField所具备的能力。

如果说此前,Mellanox所倡导的“网络计算一部分数据、CPU计算一部分数据”,代表了Mellanox的CPU卸载技术理念,那么网络内计算则更近了一步,即让网络完成了大部分计算。Mellanox认为这种智能网卡将成为未来云计算中心的发展趋势。

Gilad Shainer说到智能网卡几个典型的应用领域,比如高速存储,利用NVMe over Fabrics的存储资源池化解决方案,Mellanox智能网卡可以卸载很多NVMe的通讯协议,从而构建大型存储资源池,实现更低的延迟和更高的性能,满足用户对高性能存储的需求。

智能网卡应用在安全场景也将是其施展拳脚的另一大领域,“把CPU上做的安全算法移到高速网络上面去,让智能网卡做安全,它的安全控制力更强。也就是当数据到网卡这一层,其中恶意流量就已经被拦截。BlueField上面有ARM CPU,可以编程一些复杂的安全算法。”Gilad Shainer说。

在Mellanox看来,智能网卡会在云计算中心大有用武之地,Mellanox的网络无论是性能还是卸载能力,再加上ARM芯片,两者结合起来会让BlueField在云市场十分具有竞争力。

Mellanox InfiniBand不是贵的代名词

很多人提到RDMA,可能会给它加上“昂贵”的标签。说到这,就不得不提英特尔的Omni-Path,近年来英特尔对Omni-Path进行大力推广,其提到的关键词就是“质优价廉”,特别是和Mellanox相比。不过Gilad Shainer却不认同,他用现实案例向记者介绍Mellanox的InfiniBand最终成为用户的选择,即使很多用户曾经选择过Omni-Path。他以BP英国石油举例,去年BP采购1000节点的集群,其中700台为Mellanox InfiniBand网络,300台为英特尔Omni-Path网络。但是经过1年的试用,今年再采购新系统时,BP已经完全不考虑Omni-Path了,而是变成完全采用InfiniBand。

“因为BP测试出,Mellanox网络的系统性能是Omni-Path的2.5倍,这就意味着它其实完全没必要花那么多钱去买那么多的CPU。完成同样的任务,Mellanox的InfiniBand对它来讲整套系统部署的成本更低,而不是单独去考虑网络本身的价格。”在Gilad Shainer看来,用户是很聪明的,他考虑的是整体的投资回报值不值得,所以最后BP切回InfiniBand,其实是省了总体成本。

不过,在性能方面,英特尔和Mellanox却是各说各话,英特尔说它的网络性能跟Mellanox的网络是一样甚至超越后者,所以价格更便宜。不过Mellanox一直回击,Gilad Shainer指出,“英特尔讲到的网络的性能跟我们差不多、价格更便宜,但是其所对比的Mellanox性能都远低于我们自己测试的性能。”

当计算停留着网格内 Mellanox用智能网络助跑AI

“拿实际应用程序的性能做一个基本的标杆进行对比,我们的性能会在8个节点到16个节点超出Omni-Path 40%、50%、70%甚至翻倍,所以这是非常大的区别。”Gilad Shainer说,简单比较带宽、延迟,双方也许差不多,但是如果真的拿应用程序比,我们的优势还是非常非常明显的,这是Mellanox向市场传达的声音。

Gilad Shainer甚至说,如果只是简单地看Linpack测试对用户来讲都是一种误导,只有跑在不同类型的应用程序上,数据才有价值。

当然,各种测试和数据也许搞得用户有点懵,不过Mellanox倒是希望用户拿去做实际应用程序测试,能够正确使用最优化的MPI,比如Mellanox 提供的HPC-X MPI。Mellanox会免费提供产品和技术支持。

小结

实际上抛开产品竞争的因素不说,今天的市场给了以Mellanox为代表的智能网络企业非常大的机遇。人工智能发展到今天,计算力是重要的驱动力, AI既然对计算的要求高,必然是Mellanox发挥重要价值的一个用武之地。实际上,目前已有大量先进的深度学习框架(如TensorFlow、Caffe2、Microsoft Cognitive Toolkit 和百度 PaddlePaddle)借助Mellanox的智能卸载功能,为多台人工智能服务器提供世界领先的性能和近线性扩展能力。

随着未来人工智能在云上大量应用,那就意味着高性能的网络会在AI云上大量被采用,这对于Mellanox及智能网络技术都是一个全新的机会。


原文发布时间为:2017年11月7日

本文作者:陈广成

本文来自云栖社区合作伙伴至顶网,了解相关信息可以关注至顶网。

相关文章
|
3天前
|
机器学习/深度学习 人工智能 运维
让AI“接管”网络运维,效率提升不只是传说
让AI“接管”网络运维,效率提升不只是传说
40 16
|
5天前
|
存储 人工智能 Kubernetes
ACK Gateway with AI Extension:面向Kubernetes大模型推理的智能路由实践
本文介绍了如何利用阿里云容器服务ACK推出的ACK Gateway with AI Extension组件,在Kubernetes环境中为大语言模型(LLM)推理服务提供智能路由和负载均衡能力。文章以部署和优化QwQ-32B模型为例,详细展示了从环境准备到性能测试的完整实践过程。
|
11天前
|
人工智能 运维 监控
领先AI企业经验谈:探究AI分布式推理网络架构实践
当前,AI行业正处于快速发展的关键时期。继DeepSeek大放异彩之后,又一款备受瞩目的AI智能体产品Manus横空出世。Manus具备独立思考、规划和执行复杂任务的能力,其多智能体架构能够自主调用工具。在GAIA基准测试中,Manus的性能超越了OpenAI同层次的大模型,展现出卓越的技术实力。
|
20天前
|
人工智能 运维 架构师
Serverless + AI 让应用开发更简单,加速应用智能化
Serverless + AI 让应用开发更简单,加速应用智能化
|
20天前
|
人工智能 自然语言处理 算法
阿里云「AI实时互动」正式上线,体验“超拟人”智能互动
阿里云「AI实时互动」正式上线,体验“超拟人”智能互动
|
22天前
|
人工智能 自然语言处理 关系型数据库
DMS+AnalyticDB助力钉钉AI助理,轻松玩转智能问数
DMS+AnalyticDB助力钉钉AI助理,轻松玩转智能问数
|
2天前
|
人工智能 监控 数据可视化
Manus再遭复刻!开源多智能体协作工具,实时查看每个AI员工的"脑回路"
LangManus 是一个基于分层多智能体系统的 AI 自动化框架,支持多种语言模型和工具集成,能够高效完成复杂任务,适用于人力资源、房产决策、旅行规划等多个场景。
153 0
|
21天前
|
人工智能 搜索推荐 vr&ar
让教育更智能:HarmonyOS助力AI类目标签革新教育行业
在科技飞速发展的当下,教育行业正经历深刻变革,智能化转型成为提升教育质量与效率的关键。AI类目标签技术脱颖而出,通过分析学生多维度数据生成个性化学习标签,助力因材施教;智能管理教学资源,提高备课效率。HarmonyOS NEXT API 12及以上版本的分布式能力和强大的数据安全机制,为多设备协同学习和数据保护提供了有力支持。开发者可利用鸿蒙生态构建创新教育应用,推动教育智能化发展。
|
22天前
|
人工智能 自然语言处理 机器人
对话阿里云CIO蒋林泉:AI时代,企业如何做好智能化系统建设?
对话阿里云CIO蒋林泉:AI时代,企业如何做好智能化系统建设?
|
22天前
|
存储 人工智能 数据管理
媒体声音|专访阿里云数据库周文超博士:AI就绪的智能数据平台设计思路
媒体声音|专访阿里云数据库周文超博士:AI就绪的智能数据平台设计思路

热门文章

最新文章