AMD力挺OpenCL 用GPU打造通用计算神话

简介: 本文讲的是AMD力挺OpenCL 用GPU打造通用计算神话,日前,中国高性能计算年会在长沙召开,展会公布了2009年最新的中国TOP 100,国防科技大学研制的天河一号超级计算机以1 PFlops(千万亿次)的计算速度夺得了中国超算排行榜的第一名。

 本文讲的是AMD力挺OpenCL 用GPU打造通用计算神话,【IT168 专稿】日前,中国高性能计算年会在长沙召开,展会公布了2009年最新的中国TOP 100,国防科技大学研制的天河一号超级计算机以1 PFlops(千万亿次)的计算速度夺得了中国超算排行榜的第一名。各家厂商就目前日渐火热的高性能计算市场做出表示,认为随着金融危机的发生,企业逐步认识到高性能计算在工程和研发领域具有高效率、低成本等特点,从而使得高性能计算市场开始增加。

    大会现场,我们看到了AMD将其新近推出的最新HD5000系列显卡和有关GPU通用高性能计算的相关应用案例做了展示。据了解,已经有很多实验性算法是基于OpenCL标准,面向最新的HD 5000系列GPU架构制作的。AMD举办的中国高校GPU加速计算竞赛中,前后有6个代表队以出色的GPU编程脱颖而出。

    Super-LU-killer团队在稠密矩阵LU分解的OpenCL实现中,使用了HD 5870系列显卡的GPU作为运算核心,使得该算法的核心计算峰值达到了28GFlops(矩阵规模n=10240),相对于传统CPU的穿行LU分解版本得到了很高的加速。AMD的工程市介绍,这组算法的设计充分使用了HD 5870的特点,采用Foat4向量化,Memory Coalescing存储优化等方式提高了程序的性能。

    类似的还有Sokudo团队利用GPU单元上的扫描原语和它在PageRank中的应用。据AMD工程师介绍,Sokudo团队将Google著名的PageRank算法从x86平台迁移到了GPU图形加速架构上,其计算速度相比普通四核CPU处理器,获得了24倍的提升。

    据AMD负责GPU通用计算的工程师介绍,“HD 5870的SIMD阵列从10组增倍到20组,每组依然是16个5-D流处理单元和4个纹理单元,因而总计拥有多达1600个流处理器和80个纹理单元,另外还有32个ROP光栅化单元,是Radeon HD 4800系列的两倍。”

    此外,HD 5870 RV870核心采用台积电40nm工艺制造,集成晶体管超过20亿个,核心面积338平方毫米,而55nm工艺的Radeon HD 4870 RV770为9.56亿个/260平方毫米,Radeon HD 4890 RV790则是9.59亿个/282平方毫米,也就是说新核心的晶体管数量翻了一番还多,核心面积却只增加了20-30%,由此可见40nm工艺功不可没。


原文发布时间为:2009-10-29
本文作者:IT168 孟庆
本文来自云栖社区合作伙伴IT168,了解相关信息可以关注IT168。
原文标题:AMD力挺OpenCL 用GPU打造通用计算神话
相关实践学习
在云上部署ChatGLM2-6B大模型(GPU版)
ChatGLM2-6B是由智谱AI及清华KEG实验室于2023年6月发布的中英双语对话开源大模型。通过本实验,可以学习如何配置AIGC开发环境,如何部署ChatGLM2-6B大模型。
目录
相关文章
|
11月前
|
人工智能 并行计算 PyTorch
以Lama Cleaner的AI去水印工具理解人工智能中经常会用到GPU来计算的CUDA是什么? 优雅草-卓伊凡
以Lama Cleaner的AI去水印工具理解人工智能中经常会用到GPU来计算的CUDA是什么? 优雅草-卓伊凡
966 4
|
11月前
|
机器学习/深度学习 人工智能 芯片
42_大语言模型的计算需求:从GPU到TPU
随着2025年大语言模型技术的持续突破和规模化应用,计算资源已成为推动AI发展的关键驱动力。从最初的CPU计算,到GPU加速,再到专用AI加速器的崛起,大语言模型的计算需求正在重塑全球数据中心的基础设施架构。当前,全球AI半导体市场规模预计在2027年将达到2380亿美元(基本情境)甚至4050亿美元(乐观情境),这一增长背后,是大语言模型对计算能力、内存带宽和能效比的极致追求。
1171 0
|
机器学习/深度学习 人工智能 容灾
硅谷GPU云托管:驱动AI革命的下一代计算基石
在人工智能与高性能计算席卷全球的今天,硅谷作为科技创新的心脏,正通过GPU云托管服务重新定义计算能力的边界。无论您是初创公司的机器学习工程师,还是跨国企业的研究团队,硅谷GPU云托管已成为实现突破性创新的关键基础设施。
|
并行计算 PyTorch 算法框架/工具
融合AMD与NVIDIA GPU集群的MLOps:异构计算环境中的分布式训练架构实践
本文探讨了如何通过技术手段混合使用AMD与NVIDIA GPU集群以支持PyTorch分布式训练。面对CUDA与ROCm框架互操作性不足的问题,文章提出利用UCC和UCX等统一通信框架实现高效数据传输,并在异构Kubernetes集群中部署任务。通过解决轻度与强度异构环境下的挑战,如计算能力不平衡、内存容量差异及通信性能优化,文章展示了如何无需重构代码即可充分利用异构硬件资源。尽管存在RDMA验证不足、通信性能次优等局限性,但该方案为最大化GPU资源利用率、降低供应商锁定提供了可行路径。源代码已公开,供读者参考实践。
1629 3
融合AMD与NVIDIA GPU集群的MLOps:异构计算环境中的分布式训练架构实践
|
机器学习/深度学习 弹性计算 人工智能
阿里云服务器架构有啥区别?X86计算、Arm、GPU异构、裸金属和高性能计算对比
阿里云ECS涵盖x86、ARM、GPU/FPGA/ASIC、弹性裸金属及高性能计算等多种架构。x86架构采用Intel/AMD处理器,适用于广泛企业级应用;ARM架构低功耗,适合容器与微服务;GPU/FPGA/ASIC专为AI、图形处理设计;弹性裸金属提供物理机性能;高性能计算则针对大规模并行计算优化。
1516 7
|
机器学习/深度学习 并行计算 算法
GPU加速与代码性能优化:挖掘计算潜力的深度探索
【10月更文挑战第20天】GPU加速与代码性能优化:挖掘计算潜力的深度探索
|
机器学习/深度学习 弹性计算 编解码
阿里云服务器计算架构X86/ARM/GPU/FPGA/ASIC/裸金属/超级计算集群有啥区别?
阿里云服务器ECS提供了多种计算架构,包括X86、ARM、GPU/FPGA/ASIC、弹性裸金属服务器及超级计算集群。X86架构常见且通用,适合大多数应用场景;ARM架构具备低功耗优势,适用于长期运行环境;GPU/FPGA/ASIC则针对深度学习、科学计算、视频处理等高性能需求;弹性裸金属服务器与超级计算集群则分别提供物理机级别的性能和高速RDMA互联,满足高性能计算和大规模训练需求。
1005 6
|
并行计算 API 数据处理
GPU(图形处理单元)因其强大的并行计算能力而备受关注。与传统的CPU相比,GPU在处理大规模数据密集型任务时具有显著的优势。
GPU(图形处理单元)因其强大的并行计算能力而备受关注。与传统的CPU相比,GPU在处理大规模数据密集型任务时具有显著的优势。
|
11月前
|
人工智能 算法 调度
阿里云ACK托管集群Pro版共享GPU调度操作指南
本文介绍在阿里云ACK托管集群Pro版中,如何通过共享GPU调度实现显存与算力的精细化分配,涵盖前提条件、使用限制、节点池配置及任务部署全流程,提升GPU资源利用率,适用于AI训练与推理场景。
867 1

热门文章

最新文章