对话阿里云异构计算掌舵人:人工智能爆发三要素

简介: 异构计算是指不同类型的指令集和体系架构的计算单元组成的系统的计算方式,如“CPU+GPU”,"CPU+FPGA“等,”更适合深度学习、基因匹配、金融分析等计算密集型领域。

计算,正在撬动人工智能产业这个千亿级的市场。

传统通用计算无法满足人工智能对爆发的计算能力需求,异构计算中GPU/FPGA等高并行、高密集的计算能力被认为是现阶段挑起人工智能产业的大梁。

异构计算是指不同类型的指令集和体系架构的计算单元组成的系统的计算方式,如“CPU+GPU”,"CPU+FPGA“等,”更适合深度学习、基因匹配、金融分析等计算密集型领域。

昨天,阿里云对外展示了异构计算产品家族,将异构计算的能力带到云上对外服务。

image

会后,我们采访了阿里云异构计算掌舵人张献涛。

张献涛,花名旭卿,武汉大学信息安全博士,是Xen、KVM等多个开源虚拟化项目的主要贡献者,目前主要负责阿里云虚拟化技术、高性能计算产品、异构计算产品以及创新类型产品的技术和研发的团队。

在这次对话中,张献涛分享了对人工智能与异构计算的关系,以及对未来计算大战的思考。

1、人工智能爆发三要素:算法、计算力、数据

人工智能爆发有三要素:算法,计算力,数据。

张献涛指出,人工智能的概念提出60多年了,这几年才呈现出爆发的趋势,不单单是因为算法改进、数据积累,更重要的是计算能力的变革。一般企业都有自己的算法和数据,但在计算力的获取上一直有比较高的门槛。

image

异构计算被认为是更适合人工智能的计算形态,它的优点是具有比传统CPU并行计算更高效率和低延迟的计算性能,在处理物联网场景下的AI应用时,异构计算比CPU的处理效率高30倍以上。张献涛表示。

在过去,异构计算的采购、部署以及使用门槛对绝大多数企业、用户来说都很高,比如小量的用户基本上没有议价能力,特别是购买FPGA板卡,量少的话采购价格特别高。此外,交付周期是另一大痛点,从机型选择、硬件架构设计、供应商选择、机房选择、财务审批通常要几个月时间。采购之后型号就固定了,有新品出现只能追加预算购买,线下的GPU/FP又无法和线上服务打通。

image
面向多场景的异构计算加速平台

张献涛指出,云已经证明了是提供计算能力的最佳交付方式,所以把GPU/FPGA的计算能力放在云端对外服务是一件再自然不过的事。

“阿里云在短时间里先后推出弹性GPU和FPGA解决方案,目的就是降低异构计算资源使用的门槛,对人工智能有计算需求的企业可以随买随用。”张献涛表示,

2、云是计算能力的放大器

相比CPU,GPU有更高的并行度、更高的单机计算峰值、更高的计算效率;而FPGA则拥有更高的每瓦性能、非规整数据计算更高的性能、更低的设备互联延迟。

“云是计算能力的放大器,将GPU和FPGA解决方案部署在云端意味着优势的进一步放大。”张献涛介绍,虚拟化技术让GPU/FPGA的计算资源可以即买即用,弹性伸缩,无需担心性能瓶颈,还能以更低的价格享受到性能更强的GPU/FPGA计算能力。

image

同时,阿里云提供了从产品、服务、生态各维度的人工智能平台服务,满足企业在人工智能领域不同层次的需求,比如用户可以在阿里云异构平台上快速搭建TensorFlow深度学习框架,同时调用视频识别、图像识别、语音识别等服务,开发出类似ET工业大脑、环境大脑的应用服务,这跟此前需要东拼西凑还要运维的创业方式相比,体验和效率完全不同。

“我们提供了25/100Gb ROCE走RDMA协议直连,可以多机多卡,用非常多的GPU/FPGA设备集群来共同训练一个模型,大大减少用户训练的时间,从几周到一个月缩短到一天或者几个小时的级别。”张献涛强调。

3、异构计算的未来:GPU、FPGA、ASIC三分天下

从市场角度来看,GPU处理器占据了异构计算的主流地位,但对未来的趋势,张献涛表示,“随着FPGA的生态环境的建立和完善、ASIC芯片的逐渐成熟,未来异构计算领域会呈现GPU、FPGA、ASIC芯片三分天下的局面,GPU、FPGA、ASIC芯片都会有自己独特的特长和应用领域,有自己独特的客户群体。”

image
阿里云提供同时覆盖Intel和Xilinx两大FPGA厂商的解决方案

这也是张献涛团队专注的方向,接下来团队会发布包括8卡/16卡GPU产品、下一代的Volta架构的GPU产品、新一代的FGPA的产品,而ASIC芯片的产品上云也正在研发当中。

目前他所带领的团队主要有两个目标:一方面致力于让异构计算变成用户即买即用的计算资源,提供最为全面的异构计算产品方案;另一方面致力于让用户能够用好异构资源,充分发挥云上各个产品之间的统一调度能力,让阿里云在人工智能方面的服务更具备竞争力,把异构计算变成一种普惠的计算能力。

在10月11日举行的2017杭州云栖大会上,阿里云还将推出更多个性化的人工智能产品及服务,期间将有20余场人工智能相关的峰会和分论坛,涉及基础设施、AI基础技术、AI产品以及AI行业解决方案等领域。阿里巴巴及合作伙伴将分享AI在数据中心、电子商务、工业制造、城市管理、艺术设计等行业的前沿经验,并展示最新技术。

相关实践学习
在云上部署ChatGLM2-6B大模型(GPU版)
ChatGLM2-6B是由智谱AI及清华KEG实验室于2023年6月发布的中英双语对话开源大模型。通过本实验,可以学习如何配置AIGC开发环境,如何部署ChatGLM2-6B大模型。
相关文章
|
8月前
|
人工智能 文字识别 监控
|
8月前
|
云安全 人工智能 安全
Dify平台集成阿里云AI安全护栏,构建AI Runtime安全防线
阿里云 AI 安全护栏加入Dify平台,打造可信赖的 AI
3979 166
|
8月前
|
云安全 人工智能 自然语言处理
阿里云x硅基流动:AI安全护栏助力构建可信模型生态
阿里云AI安全护栏:大模型的“智能过滤系统”。
2735 120
|
9月前
|
消息中间件 人工智能 运维
事件驱动重塑 AI 数据链路:阿里云 EventBridge 发布 AI ETL 新范式
“一个简单的数据集成任务,开始时总是轻松愉快的,但随着业务扩展,数据源越来越多,格式越来越乱,整个数据链路就会变得一团糟。”陈涛在演讲中指出了当前 AI 数据处理的普遍困境。扩展难、运维难、稳定性差,这三大挑战已成为制约 AI 应用创新和落地的关键瓶颈。针对这些痛点,在2025云栖大会期间,阿里云重磅发布了事件驱动 AI ETL 新范式,其核心产品 EventBridge 通过深度集成 AI 能力,为开发者提供了一套革命性的解决方案,旨在彻底改变 AI 时代的数据准备与处理方式。
958 75
|
9月前
|
人工智能 安全 中间件
阿里云 AI 中间件重磅发布,打通 AI 应用落地“最后一公里”
9 月 26 日,2025 云栖大会 AI 中间件:AI 时代的中间件技术演进与创新实践论坛上,阿里云智能集团资深技术专家林清山发表主题演讲《未来已来:下一代 AI 中间件重磅发布,解锁 AI 应用架构新范式》,重磅发布阿里云 AI 中间件,提供面向分布式多 Agent 架构的基座,包括:AgentScope-Java(兼容 Spring AI Alibaba 生态),AI MQ(基于Apache RocketMQ 的 AI 能力升级),AI 网关 Higress,AI 注册与配置中心 Nacos,以及覆盖模型与算力的 AI 可观测体系。
1688 88
|
8月前
|
人工智能 vr&ar UED
获奖公布|第十九届"挑战杯"竞赛2025年度中国青年科技创新"揭榜挂帅"擂台赛阿里云“AI技术助力乡村振兴”专题赛拟授奖名单公示
获奖公布|第十九届"挑战杯"竞赛2025年度中国青年科技创新"揭榜挂帅"擂台赛阿里云“AI技术助力乡村振兴”专题赛拟授奖名单公示
|
8月前
|
人工智能 数据处理 API
阿里云、Ververica、Confluent 与 LinkedIn 携手推进流式创新,共筑基于 Apache Flink Agents 的智能体 AI 未来
Apache Flink Agents 是由阿里云、Ververica、Confluent 与 LinkedIn 联合推出的开源子项目,旨在基于 Flink 构建可扩展、事件驱动的生产级 AI 智能体框架,实现数据与智能的实时融合。
1443 6
阿里云、Ververica、Confluent 与 LinkedIn 携手推进流式创新,共筑基于 Apache Flink Agents 的智能体 AI 未来
|
8月前
|
机器学习/深度学习 人工智能 Serverless
吉利汽车携手阿里云函数计算,打造新一代 AI 座舱推理引擎
当前吉利汽车研究院人工智能团队承担了吉利汽车座舱 AI 智能化的方案建设,在和阿里云的合作中,基于星睿智算中心 2.0 的 23.5EFLOPS 强大算力,构建 AI 混合云架构,面向百万级用户的实时推理计算引入阿里云函数计算的 Serverless GPU 算力集群,共同为智能座舱的交互和娱乐功能提供大模型推理业务服务,涵盖的场景如针对模糊指令的复杂意图解析、文生图、情感 TTS 等。

热门文章

最新文章