对话阿里云异构计算掌舵人:人工智能爆发三要素

简介: 计算,正在撬动人工智能产业这个千亿级的市场。 传统通用计算无法满足人工智能对爆发的计算能力需求,异构计算中GPU/FPGA等高并行、高密集的计算能力被认为是现阶段挑起人工智能产业的大梁。 异构计算是指不同类型的指令集和体系架构的计算单元组成的系统的计算方式,如“CPU+GPU”,"CPU+FPGA“等,”更适合深度学习、基因匹配、金融分析等计算密集型领域。

计算,正在撬动人工智能产业这个千亿级的市场。

传统通用计算无法满足人工智能对爆发的计算能力需求,异构计算中GPU/FPGA等高并行、高密集的计算能力被认为是现阶段挑起人工智能产业的大梁。

异构计算是指不同类型的指令集和体系架构的计算单元组成的系统的计算方式,如“CPU+GPU”,"CPU+FPGA“等,”更适合深度学习、基因匹配、金融分析等计算密集型领域。

昨天,阿里云对外展示了异构计算产品家族,将异构计算的能力带到云上对外服务。

image


会后,我们采访了阿里云异构计算掌舵人张献涛。

张献涛,花名旭卿,武汉大学信息安全博士,是Xen、KVM等多个开源虚拟化项目的主要贡献者,目前主要负责阿里云虚拟化技术、高性能计算产品、异构计算产品以及创新类型产品的技术和研发的团队。

在这次对话中,张献涛分享了对人工智能与异构计算的关系,以及对未来计算大战的思考。


人工智能爆发三要素:算法、计算力、数据

人工智能爆发有三要素:算法,计算力,数据。

张献涛指出,人工智能的概念提出60多年了,这几年才呈现出爆发的趋势,不单单是因为算法改进、数据积累,更重要的是计算能力的变革。一般企业都有自己的算法和数据,但在计算力的获取上一直有比较高的门槛。


image


异构计算被认为是更适合人工智能的计算形态,它的优点是具有比传统CPU并行计算更高效率和低延迟的计算性能,在处理物联网场景下的AI应用时,异构计算比CPU的处理效率高30倍以上。张献涛表示。

在过去,异构计算的采购、部署以及使用门槛对绝大多数企业、用户来说都很高,比如小量的用户基本上没有议价能力,特别是购买FPGA板卡,量少的话采购价格特别高。此外,交付周期是另一大痛点,从机型选择、硬件架构设计、供应商选择、机房选择、财务审批通常要几个月时间。采购之后型号就固定了,有新品出现只能追加预算购买,线下的GPU/FP又无法和线上服务打通。


image
面向多场景的异构计算加速平台

张献涛指出,云已经证明了是提供计算能力的最佳交付方式,所以把GPU/FPGA的计算能力放在云端对外服务是一件再自然不过的事。

“阿里云在短时间里先后推出弹性GPU和FPGA解决方案,目的就是降低异构计算资源使用的门槛,对人工智能有计算需求的企业可以随买随用。”张献涛表示,


云是计算能力的放大器

相比CPU,GPU有更高的并行度、更高的单机计算峰值、更高的计算效率;而FPGA则拥有更高的每瓦性能、非规整数据计算更高的性能、更低的设备互联延迟。

“云是计算能力的放大器,将GPU和FPGA解决方案部署在云端意味着优势的进一步放大。”张献涛介绍,虚拟化技术让GPU/FPGA的计算资源可以即买即用,弹性伸缩,无需担心性能瓶颈,还能以更低的价格享受到性能更强的GPU/FPGA计算能力。

image


同时,阿里云提供了从产品、服务、生态各维度的人工智能平台服务,满足企业在人工智能领域不同层次的需求,比如用户可以在阿里云异构平台上快速搭建TensorFlow深度学习框架,同时调用视频识别、图像识别、语音识别等服务,开发出类似ET工业大脑、环境大脑的应用服务,这跟此前需要东拼西凑还要运维的创业方式相比,体验和效率完全不同。

“我们提供了25/100Gb ROCE走RDMA协议直连,可以多机多卡,用非常多的GPU/FPGA设备集群来共同训练一个模型,大大减少用户训练的时间,从几周到一个月缩短到一天或者几个小时的级别。”张献涛强调。


异构计算的未来:GPU、FPGA、ASIC三分天下

从市场角度来看,GPU处理器占据了异构计算的主流地位,但对未来的趋势,张献涛表示,“随着FPGA的生态环境的建立和完善、ASIC芯片的逐渐成熟,未来异构计算领域会呈现GPU、FPGA、ASIC芯片三分天下的局面,GPU、FPGA、ASIC芯片都会有自己独特的特长和应用领域,有自己独特的客户群体。”


image
阿里云提供同时覆盖Intel和Xilinx两大FPGA厂商的解决方案

这也是张献涛团队专注的方向,接下来团队会发布包括8卡/16卡GPU产品、下一代的Volta架构的GPU产品、新一代的FGPA的产品,而ASIC芯片的产品上云也正在研发当中。

目前他所带领的团队主要有两个目标:一方面致力于让异构计算变成用户即买即用的计算资源,提供最为全面的异构计算产品方案;另一方面致力于让用户能够用好异构资源,充分发挥云上各个产品之间的统一调度能力,让阿里云在人工智能方面的服务更具备竞争力,把异构计算变成一种普惠的计算能力。

在10月11日举行的2017杭州云栖大会上,阿里云还将推出更多个性化的人工智能产品及服务,期间将有20余场人工智能相关的峰会和分论坛,涉及基础设施、AI基础技术、AI产品以及AI行业解决方案等领域。阿里巴巴及合作伙伴将分享AI在数据中心、电子商务、工业制造、城市管理、艺术设计等行业的前沿经验,并展示最新技术。

相关实践学习
部署Stable Diffusion玩转AI绘画(GPU云服务器)
本实验通过在ECS上从零开始部署Stable Diffusion来进行AI绘画创作,开启AIGC盲盒。
相关文章
|
22天前
|
人工智能
复旦大学X阿里云:启动人工智能教育教学新合作丨云工开物
在复旦大学建校120周年之际,阿里云与复旦达成人工智能教育教学合作,通过算力资源、实验工具及课程共建等方式支持“AI大课2.0”。此次合作深化了双方在AI for Science领域的实践,从科研拓展至教育领域。自2023年起,双方共建CFFF智算平台,服务超5200名师生;2024年,“云工开物”计划助力复旦AI课程体系建设;2025年启动大模型认证合作,推动AI教育新模式。未来,阿里云将持续赋能复旦的人才培养与教育创新。
|
2月前
|
人工智能 云计算 开发者
南京大学与阿里云联合启动人工智能人才培养合作计划,已将通义灵码引入软件学院课程体系
近日,南京大学与阿里云宣布启动人工智能人才培养合作计划,共同培养适应未来技术变革、具备跨学科思维的AI创新人才。
|
23天前
|
机器学习/深度学习 人工智能 自然语言处理
阿里云人工智能平台 PAI 开源 EasyDistill 框架助力大语言模型轻松瘦身
本文介绍了阿里云人工智能平台 PAI 推出的开源工具包 EasyDistill。随着大语言模型的复杂性和规模增长,它们面临计算需求和训练成本的障碍。知识蒸馏旨在不显著降低性能的前提下,将大模型转化为更小、更高效的版本以降低训练和推理成本。EasyDistill 框架简化了知识蒸馏过程,其具备多种功能模块,包括数据合成、基础和进阶蒸馏训练。通过数据合成,丰富训练集的多样性;基础和进阶蒸馏训练则涵盖黑盒和白盒知识转移策略、强化学习及偏好优化,从而提升小模型的性能。
|
1月前
|
人工智能 弹性计算 程序员
青岛城市学院 × 阿里云 | 云工开物「人工智能+」训练营圆满落幕!
人工智能浪潮席卷而来,大模型、智能编程等前沿技术不断革新,已经成为推动全球经济社会发展和人类文明进步的重要力量。人工智能的发展不仅改变了产业结构,同时也对高等教育的人才培养提出了新的要求,并进一步推动着教育新生态的重构。
|
2月前
|
存储 人工智能 开发者
浙江大学与阿里云宣布合作人工智能通识课,通义灵码系列课程率先落地
浙江大学与阿里云联合宣布共建人工智能通识课,将在“AI+行业”课程方面从产、学、研角度,共同围绕教育、法律、设计、金融、人文和艺术等多个重点学科方向,将真实产业案例深度融入浙江大学人工智能通识课程体系。
|
2月前
|
存储 人工智能
浙江大学与阿里云联合宣布共建人工智能通识课|阿里云云工开物合作动态
浙江大学与阿里云联合共建人工智能通识课,涵盖教育、法律、设计等多学科方向,将产业案例融入课程体系。阿里云开放大模型认证课程资源,提供云服务器、AI算力等支持,并通过“云工开物”计划为学生提供计算资源。双方还将发起“智能体创新大赛”,推动技术创新与人才培养。浙大是国内首批开展全校人工智能通识课的顶尖高校之一,2024年起“人工智能基础”成为全校本科生必修课。
|
3月前
|
人工智能 云计算
南京大学与阿里云签署校企合作协议,以“云工开物”支持人工智能人才培养与科研创新
3月28日,南京大学与阿里云签署全面校企合作协议,共同推动科教融汇与产教融合。双方将启动人工智能人才培养计划,基于阿里云技术优势和南大学科实力,设计通识课程与实践课程,支持“1+X+Y”课程体系建设。阿里云将为南大师生提供免费算力资源,助力教学科研,并通过产学研合作培养新工科拔尖创新人才,推动科技成果转化与高水平自立自强。
|
4月前
|
人工智能 大数据
阿里云云计算ACA、大数据ACA、人工智能ACA三门认证升级调整公告
阿里云云计算ACA、大数据ACA、人工智能ACA三门认证升级调整公告
|
3月前
|
人工智能 城市大脑 分布式计算
课时7:阿里云ET:人工智能可以是这样的
阿里云ET是阿里巴巴集团研发的超级人工智能,具备智能语音交互、图像视频识别、交通预测、情感分析等技能。作为杭州城市大脑的核心,ET依托强大的计算能力,在城市治理、工业制造、健康医疗等领域广泛应用,成为人类可靠的助手。其卓越的感知与思考能力,使ET在复杂局面下迅速做出最优决策。
111 0
|
4月前
|
人工智能 自然语言处理 BI
基于阿里云人工智能平台的智能客服系统开发与部署
随着人工智能技术的发展,智能客服系统成为企业提升服务效率和用户体验的重要工具。阿里云提供包括自然语言处理(NLP)、语音识别(ASR)、机器学习(PAI)等在内的完整AI平台,助力企业快速构建智能客服系统。本文将通过电商平台案例,展示如何基于阿里云AI平台从零开始开发、部署智能客服系统,并介绍其核心优势与最佳实践,涵盖文本和语音客服、知识库管理及数据分析等功能,显著提升客户服务效率和用户满意度。

热门文章

最新文章