阿里云研发工程师:HPC优化实例动手实验讲解

简介: 近日,全球领先的云计算厂商阿里云宣布最新HPC优化实例hpc8ae的正式商业化,该实例依托阿里云自研的「飞天+CIPU」架构体系,搭载第四代AMD EPYC处理器,专为高性能计算应用优化,特别适用于计算流体、有限元分析、多物理场模拟等仿真类应用,CAE场景下的性价比最少提升50%。


 

引言:近日,全球领先的云计算厂商阿里云宣布最新HPC优化实例hpc8ae的正式商业化,该实例依托阿里云自研的「飞天+CIPU」架构体系,搭载第四代AMD EPYC处理器,专为高性能计算应用优化,特别适用于计算流体、有限元分析、多物理场模拟等仿真类应用,CAE场景下的性价比最少提升50%。


本文整理自阿里云高性能计算研发工程师曹杭在【HPC优化实例商业化发布会】中的动手实验分享,集中讲解HPC优化实例动手实验Demo细节。


【 单节点的摩托车外流场仿真实验 & 多节点大规模并行的6000万网格风电场模拟实验 demo讲解 】

 

HPC8ae实例性能解读


Hpc8ae优化实例有以下几个特点。


首先它是基于AMD一站式的Zen4 Genoa处理器,基频是3.4GHZ,BOOST3.75GHZ,其次比较重要的是其有内存带宽的增强,适用于仿真HPC应用,比如气候气象、CFD的Fluent等等工业仿真应用。



第三点是其支持云上的eRDMA,支持大规模的并行运行应用的通信需求。最后一点是,这是首次AMD实例支持向量指令集AVX512。上图右侧给出一些细节参数,包括eRDMA 8us时延,实测了浮点峰值3.63GFlops,实测内存带宽,stream带宽603GB/S。


【 HPC应用性能提升表现 】


基于E-HPC的单节点摩托车外流场仿真实验



上述实验我们依然是基于ehpc来做,包括以下几个步骤:


1、使用EHPC集群创建HPC集群;

2、部署OpenFoam环境,使用开源的CFD仿真软件,用其做实验;

3、EHPC-Portal算例前处理演示;

4、提交“作业”进行计算运行;

5、可视化结果。



上图右侧是ehpc界面展示。


以下为【单节点的摩托车外流场仿真实验】详细操作分解:


1、首先创建一个集群。大部分选项可以选默认,之后选关键节点,选择从c8ae小规格实例作为管理节点,保存配置。配置计算队列,选高带宽低时延eRDMA网络。可用区切换到M区,实例规格选择HPC8ae优化实例;


2、选择存储。如果有创建可以直接默认,软件部分会有OPEN Foam,后续会添加OPEN Foam环境;登录节点修改成c8ae实例;保存配置,确认配置没有问题后,可以直接设立密码和创建集群。(由于时间关系,我们直接关注已经创建出来的现成集群),扩容时选择HPC8ae实例扩容,此处已经扩容出实例,有6个节点;


3、直接登录上集群。OPEN Foam环境已经部署好;回到控制台,从portal进入,重新登录,进入到submit,提交OPEN Foam作业,已经编排好的摩托车的仿真实验的作业模板;


4、选择作业队列。下面是计算节点和任务数,直接点击提交作业;作业正在RUNNING,也可以从portal进入看到步骤;通过会话管理进到VNC,新建一个会话localhost提交作业;窗口打开了VNC的terminal,因为作业还在运行,先看前处理部分,这是仿生的摩托车模型;


5、等作业运行32个进程。VNC通过调度器命令可以直接看作业运行状态,作业已经结束了,状态可以看到是一个compute状态;回到VNC,再看一下后处理流程。这里用parafoam看一下结果文件;来到paraview界面,查看速度场的变量情况;点击wireframe可以看到仿真速度场结果,这是后处理速度场部分。


到这里,第一个实验,单节点的摩托车外流场仿真实验已经结束,大家可以参照上面的步骤及视频来动手操作。



多节点大规模并行的6000万网格风电场模拟实验


第二个实验,多节点大规模并行的6000万网格风电场模拟实验。和第一个实验操作流程类似,这个模型更大,六千万网格的风电场模拟实验,这一部分主要区别是性能表现。



Demo实验亮点的总结


第一点,单节点性能的大幅领先;第二点,大规模并行HPC集群一键部署与仿真的作业管理支持;第三点,HPC实例+eRDMA,通信低时延高带宽并行效率有明显保证。第四点,E-HPC PORTAL对HPC业务的一站式前后处理支持。


后续OpenFOAm在E-HPC优化实践的实验,HPC的优化实践的实验也会上架到EHPC控制台。后续会直接给出一个集群模板,一键部署OpenFOAm集群例如气候、气象、集群等。

相关文章
|
消息中间件 存储 网络协议
ZMQ/ZeroMQ简介
ZMQ/ZeroMQ简介
|
7月前
|
机器学习/深度学习 人工智能 编解码
阿里云GPU云服务器解析:产品优势与应用场景,最新收费标准与活动价格参考
随着随着AI等领域发展,GPU云服务器需求大增。阿里云GPU云服务器结合GPU与CPU优势,适用于深度学习等多个领域,支持月付和年付。其优势包括弹性能力强、优化加速好、故障恢复快、机密计算安全及购买方式灵活。应用场景涵盖直播视频转码、AI训练与推理、云端图形工作站等。收费标准因配置和付费方式而异,且阿里云提供多种优惠券和补贴。用户通过了解收费、场景和优惠,可选到合适方案,降低成本并提升效率。
1208 7
|
8月前
|
人工智能 弹性计算 编解码
阿里云gpu云服务器介绍:产品功能、收费标准、应用场景及最新活动价格参考
GPU云服务器提供了GPU加速计算能力,实现GPU计算资源的即开即用和弹性伸缩。作为阿里云弹性计算家族的一员,其结合了GPU计算力与CPU计算力,满足您在人工智能、高性能计算、专业图形图像处理等场景中的需求,例如,在并行运算方面,使用GPU云服务器可显著提高计算效率。本文为大家介绍gpu云服务器的产品功能和收费标准以及最新活动价格情况。
|
7月前
|
自然语言处理 测试技术 API
动动嘴就能编程!阿里云千问Qwen3.5-Omni发布:全模态全球最强,支持113种语言,免费体验
阿里云发布全模态大模型Qwen3.5-Omni官网:https://t.aliyun.com/U/JbblVp 测试全球第一,支持113种语言识别与36种语音合成,首创“音视频Vibe Coding”——对镜头口述需求即可生成APP/网页/游戏代码。免费开放体验,开发者可通过阿里云百炼调用API。
3992 2
|
4月前
|
人工智能 自然语言处理 Java
2026年了,还不知道ATS怎么筛简历?每投10份可能浪费8份
ATS(申请人追踪系统)是企业招聘的“第一关面试官”,自动解析、筛选简历。数据显示,超半数简历因匹配度低未被HR看到。本文详解ATS运作逻辑、国内使用现状、五层筛选机制,并给出定制简历、单栏排版、关键词布局三大实操法则。
1468 2
|
10月前
|
数据采集 存储 编解码
智源RoboCOIN重磅开源!全球本体数最多、标注最精细、使用最便捷的高质量双臂机器人真机数据集来了
北京智源研究院联合多家机构发布全球首个“本体数最多、标注最精细、使用最便捷”的双臂机器人真机数据集RoboCOIN,覆盖15类机器人、18万条轨迹、421项任务,首创“层级能力金字塔”标注体系,推动具身智能迈向真实场景应用。
1195 11
 智源RoboCOIN重磅开源!全球本体数最多、标注最精细、使用最便捷的高质量双臂机器人真机数据集来了
|
4月前
|
人工智能 安全 机器人
【AI 尝鲜实验室】上新 | QwenPaw:本地优先的多渠道个人 AI 助手,让 AI 分身住进你的钉钉与飞书
QwenPaw 是 AgentScope 团队开源的本地优先个人 AI 助手(GitHub 17.4k+ Stars,Apache-2.0 协议),非普通 ChatBot,而是具备长期记忆、多渠道接入(钉钉/飞书/微信/Discord)、本地跑模型、多 Agent 协作能力的“AI 分身”。本实验通过阿里云计算巢一键云端部署,浏览器安全代理即可快速配置使用。
|
6月前
|
存储 运维 监控
互成软件终端智能告警体系(SIEM)设计与实施:从多源采集到多渠道通知的闭环方案
互成软件终端智能告警体系,覆盖违规外联、设备使用、安全风险、硬件/软件/配置/磁盘/性能等八大风险维度;支持动态模板通知、邮件短信双通道触达、多级关联聚合与降噪,并兼顾合规隐私。实现从事件检测到闭环处置的全链路安全运营。(239字)
|
数据采集 人工智能 Java
1天消化完Spring全家桶文档!DevDocs:一键深度解析开发文档,自动发现子URL并建立图谱
DevDocs是一款基于智能爬虫技术的开源工具,支持1-5层深度网站结构解析,能将技术文档处理时间从数周缩短至几小时,并提供Markdown/JSON格式输出与AI工具无缝集成。
702 1
1天消化完Spring全家桶文档!DevDocs:一键深度解析开发文档,自动发现子URL并建立图谱
|
弹性计算 Kubernetes 容器
k8s基于flannel VXLAN模式网络无法跨主机ping通其他节点上pod
基于云ECS搭建的k8s,通常网络问题需要从网络配置,路由表、iptables 规则 以及FDB配置去判断问题,另外需要注意的是阿里云有一层企业安全组配置会对网络有影响,遇到配置问题都正常需要从安全组的角度去考虑了
8955 0
k8s基于flannel VXLAN模式网络无法跨主机ping通其他节点上pod

热门文章

最新文章