通过MemVerge Memory Machine扩展内存

简介: MemVerge Memory Machine是一款大内存加速软件,支持DRAM/PMEM虚拟化与跨节点内存池化,无需改代码即可提升AI/ML、HPC等大内存应用性能,并提供企业级数据高可用服务。(239字)

MemVerge Memory Machine是一款大内存算例加速软件,它可以将DRAM和PMEM进行虚拟化,实现无需更改代码即可访问新的PMEM内存介质,支持可横向扩展的内存节点集群,以提供实时分析和 AI/ML、HPC应用程序所需的大规模内存容量,以及内存系统的企业级数据服务和数据高可用性。本文介绍如何在E-HPC集群中部署和使用Memory Machine。

背景信息

在HPC生命科学和EDA等领域,业务流程涉及到的大量应用算例都强依赖于大内存计算资源。这些算例会将数据先Load到内存,然后作计算分析,完成后将数据存储到存储设备中。因此该类场景对算力的内存和存储IO规格都有着较高要求,使得一些通用的单ECS实例仅能实现该类算例的单作业并发,无法充分利用CPU资源,导致大量CPU资源浪费。

基于上述场景,E-HPC引入了大内存计算领域的MemVerge Memory Machine。通过对MemVerge Memory Machine的集成,能极大优化对内存的使用管理、减少存储I/O、并充分利用CPU资源,实现单实例的多作业并发运行,提升生产环境的性价比。

步骤一:创建部署Memory Machine的E-HPC集群

以下步骤主要介绍部署Memory Machine需要注意的一些配置。创建集群的详细配置说明,请参见使用向导创建集群

  1. 进入集群创建页面。

    1. 登录弹性高性能计算控制台

    2. 在顶部菜单栏左上角处,选择地域。

    3. 在左侧导航栏,单击集群

    4. 集群页面右上角,单击创建集群

  2. 硬件配置页,完成硬件配置,然后单击下一步

    配置硬件时,由于Memory Machine基于Intel Optane PMEM,因此计算节点规格必须选择相应的规格。目前支持以下两种规格族:

    • 性能增强型本地盘实例规格族i4p

    • 持久内存型实例规格族re6p

本文以ecs.i4p.2xlarge规格作为示例,其它配置参数请根据需要进行配置。

![MemVerge1](https://help-static-aliyun-doc.aliyuncs.com/assets/img/zh-CN/8423190761/p534506.png)
  1. 软件配置页,配置软件,然后单击下一步

    配置软件时,镜像需选择E-HPC与MemVerge的集成镜像,镜像版本由MemVerge自行更新并在计算巢中进行维护。参数说明如下:

    • 镜像类型:选择计算巢部署物

    • 计算巢部署物:选择MemoryMachine_EHPC

    • 镜像:选择计算巢部署物对应的镜像。该镜像由ISV提供,对应不同的MemVerge软件版本。

    • 调度器:请根据需要进行选择,本文使用opengridscheduler(即SGE调度器)作为示例。

    • 域账号服务:请根据需要进行选择,本文使用nis作为示例。

![MemVerge2](https://help-static-aliyun-doc.aliyuncs.com/assets/img/zh-CN/0312701761/p535692.png)
  1. 基础信息页,配置基本信息和登录信息。

  2. 在右侧配置清单区域确认集群配置信息,阅读并选中服务条款,然后单击确认

    创建完成后,返回集群页面,等待集群状态由创建中变更为运行中,则表示创建成功。

步骤二:配置并访问Memory Machine管理页

创建部署Memory Machine的E-HPC集群后,需要配置安全组规则,才能访问Memory Machine管理页。

  1. 配置安全组规则。

    访问Memory Machine需要通过8081端口,您需要为集群所属安全组添加对应的入方向规则。

    1. 在集群列表中单击目标集群的详情

    2. 在集群详情页,单击安全组ID。

    3. 单击安全组规则,然后添加入方向规则,放开8081端口的访问。具体操作,请参见添加安全组规则

      MemVerge4

  2. 访问并登录Memory Machine管理页。

    1. 查看集群管控节点的公网IP。

      节点与队列页面,选择目标集群,节点类型选择管控节点,即可在下方节点列表中获取管控节点的公网IP。

    2. 打开浏览器,输入Memory Machine管理页的访问地址。

      访问地址为https://集群管控节点公网IP:8081,例如https://47.116.XX.XX:8081

      MemVerge5

    3. 使用root用户和创建集群时设置的登录密码,登录Memory Machine管理页。

      MemVerge6

步骤三:申请并上传Memory Machine License

E-HPC集群中部署Memory Machine后,默认未加载License,您需要在云市场购买License,然后上传。

  1. 访问云市场Memory Machine购买页,购买License。

    请根据自身需求选择版本和购买时长。

    MemVerge3

  2. 在Memory Machine管理页面上传License。

    1. 访问并登录Memory Machine管理页。

    2. 在左侧导航栏,单击MemVerge图标,然后选择License

    3. 单击右上角的Change Mode

    4. 在弹出的对话框中,单击Upload License File,然后单击Change

      MemVerge7

    5. Upload License对话框中,完成License上传。

      MemVerge8

步骤四:使用Memory Machine

上传License后,您可以使用Memory Machine。常用使用方式如下,详细使用方式请参见Memory Machine User Guide

  1. 配置内存大页,供Memory Machine使用。

    以将vm.nr_hugepages配置为50GB(1024*50/2=25600)为例:

    sysctl -w vm.nr_hugepages=25600
    
  2. 修改配置文件/etc/memverge/mvmalloc.yml。

    DramCacheGB: 50
    HugePageDram: true
    AccessDetector: advanced
    

    应用会优先使用DramTier配置的内存,超出后使用PMEM内存继续使用。

  3. 运行应用。

    /usr/local/share/memverge/sbin/mm [-c|--config config_file] app_name app_cl_parms
    

    基于SGE调度器提交作业的示例如下:

    #!/bin/bash
    
    #$ -cwd
    #$ -N sge-demo
    #$ -q pmemq
    #$ -pe smp 8
    #$ -o /home/xiaofan/
    #$ -e /home/xiaofan/
    
    echo "demo start, sleep 10s and ping localhost"
    sleep 10
    ping -c 10 localhost
    
    echo "run memverge cases"
    /usr/local/share/memverge/sbin/mm [-c|--config config_file] app_name app_cl_parms
    
    echo "demo complete"
    
  4. 动态调整DramTier大小。

    /usr/local/share/memverge/sbin/mvmcli -h
    mvmcli dram resize -s new-size -p pid -g true|false
    
  5. 查看DRAM和PMEM。

    mvmcli show-usage -v
    

相关文档

您也可以使用计算巢来部署EHPC+MemVerge方案,更多信息,请参见MemVerge服务计算巢模式部署文档

相关文章
|
2月前
|
人工智能 自然语言处理 API
阿里云通义千问API!Python极简代码实现智能问答与文案生成
通义千问是阿里云自研大模型,原生适配全生态,接口稳定、成本低、免复杂部署。本文提供30行极简Python代码,快速实现智能问答、文案创作与代码纠错,直连DashScope API,零门槛接入FC/ECS等服务,助力开发者低成本落地AI功能。(239字)
685 0
|
2月前
|
人工智能 数据可视化 数据挖掘
阿里云百炼 Harness 工具全解:联网 / 代码解释 / 识图,Qwen 内置增强组件使用指南
Harness是阿里云百炼Token Plan为Qwen3.8-Max-Preview等旗舰模型内置的增强工具集,支持联网搜索、代码解释器、网页抓取、文搜图、图搜图等多模态能力,开箱即用、按调用计费,助力AI编程与智能体高效执行复杂任务。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
|
2月前
|
存储 监控 安全
基于YOLO11的溺水检测模型训练:从数据集构建到云上工程化实践
本文介绍基于YOLO11的溺水检测模型全流程实践:涵盖9984张多场景水域图像的数据构建、三类别(溺水/游泳/出水)标注、云上存储与版本管理、训练配置与调优,以及模型评估与工程化部署,助力公共水域智能安全监控。
|
6月前
|
存储 人工智能 监控
AI 智能体的开发流程
国内AI智能体开发已步入企业级全生命周期管理阶段。本文系统梳理2026主流实践:从业务拆解、模型选型、核心能力构建(规划/记忆/工具/角色)、工作流编排,到测试评估、安全部署与持续运营,覆盖国产化落地关键路径。(239字)
|
2月前
|
数据挖掘
Tushare接口文档:个股资金流向(moneyflow)
本文旨在对Tushare的个股资金流向`moneyflow`数据接口进行介绍,提供更多参考示例和使用说明。 本接口可获取沪深A股票资金流向数据,分析大单小单成交情况,用于判别资金动向。本文除了从交易日、个股方面简单介绍如何快速获取数据外,还演示了如何计算主力资金流向及对单支股票主力资金流向绘制趋势图,最后演示了如何筛选主力资金净流入top 10的个股。
575 9
|
2月前
|
存储 数据可视化 对象存储
云上实践:基于YOLO11的仪表盘指针位置检测模型训练全流程
本文详解基于YOLO11的仪表盘指针检测云上训练全流程:涵盖数据集构建(9052张标注图)、Label Studio转YOLO格式、多尺度增强、模型选型与训练调优,以及mAP评估、ONNX部署和读数计算,助力工业巡检自动化。(239字)
云上实践:基于YOLO11的仪表盘指针位置检测模型训练全流程
|
2月前
|
API 开发工具
DeepSeek官方公告:两个模型名7月24日停用,抓紧处理!
DeepSeek 官方宣布:旧模型名 `deepseek-chat` 与 `deepseek-reasoner` 将于2026年7月24日23:59停用。请立即全局搜索并替换为 `deepseek-v4-flash` 或 `deepseek-v4-pro`,同步调整思考模式(`thinking` 参数)及工具调用链路,避免调用失败。
|
2月前
|
存储 大数据 Serverless
分链路差异化设计的DSP准实时数仓|钛动科技基于阿里云实时计算 Flink 版 + DLF Paimon + EMR Serverless StarRocks 的实践
钛动科技针对DSP广告业务9.6PB数据规模及多场景SLA差异,将原StarRocks All-in-One架构重构为三条差异化链路:NRR链路利用DLF Paimon存储低频数据,降低60%成本;BT链路依托EMR Serverless StarRocks主键表,实现2分钟新鲜度及P99<5ms在线点查;CT链路负责数据归并。通过解耦实时点查与BI物化视图,该方案在保障故障隔离的同时,兼顾了低成本、高性能与高稳定性,实现了阿里云大数据产品栈的高效协同。
217 0
|
2月前
|
人工智能 Rust JavaScript
用 Claude Code 重构百万行代码?官方教程终于来了!
怎么用 Claude Code 跑大规模代码迁移?Anthropic 官方的《六步迁移法》保姆级教程来了,手把手讲透规则驱动、试跑验证、多 Agent 流水线,几万行项目重构直接套用。
323 0
|
2月前
|
设计模式 人工智能 自然语言处理
63场景全覆盖:金融AI Skill全景实战
--- title: "我用AI搭建了63个金融场景:从对公开户到跨境出海的完整智能体生态" description: "分享63个金融AI场景的完整开发实录——覆盖银行、证券、基金、保险四大行业,从对公开户到跨境出海,从ESG研究到量化回测" tags: ["金融AI", "开源", "智能体", "企业微信", "场景覆盖"] --- 我用AI搭建了63个金融场景:从对公开户到跨