通过MemVerge Memory Machine扩展内存

简介: MemVerge Memory Machine是一款大内存加速软件,支持DRAM/PMEM虚拟化与跨节点内存池化,无需改代码即可提升AI/ML、HPC等大内存应用性能,并提供企业级数据高可用服务。(239字)

MemVerge Memory Machine是一款大内存算例加速软件,它可以将DRAM和PMEM进行虚拟化,实现无需更改代码即可访问新的PMEM内存介质,支持可横向扩展的内存节点集群,以提供实时分析和 AI/ML、HPC应用程序所需的大规模内存容量,以及内存系统的企业级数据服务和数据高可用性。本文介绍如何在E-HPC集群中部署和使用Memory Machine。

背景信息

在HPC生命科学和EDA等领域,业务流程涉及到的大量应用算例都强依赖于大内存计算资源。这些算例会将数据先Load到内存,然后作计算分析,完成后将数据存储到存储设备中。因此该类场景对算力的内存和存储IO规格都有着较高要求,使得一些通用的单ECS实例仅能实现该类算例的单作业并发,无法充分利用CPU资源,导致大量CPU资源浪费。

基于上述场景,E-HPC引入了大内存计算领域的MemVerge Memory Machine。通过对MemVerge Memory Machine的集成,能极大优化对内存的使用管理、减少存储I/O、并充分利用CPU资源,实现单实例的多作业并发运行,提升生产环境的性价比。

步骤一:创建部署Memory Machine的E-HPC集群

以下步骤主要介绍部署Memory Machine需要注意的一些配置。创建集群的详细配置说明,请参见使用向导创建集群

  1. 进入集群创建页面。

    1. 登录弹性高性能计算控制台

    2. 在顶部菜单栏左上角处,选择地域。

    3. 在左侧导航栏,单击集群

    4. 集群页面右上角,单击创建集群

  2. 硬件配置页,完成硬件配置,然后单击下一步

    配置硬件时,由于Memory Machine基于Intel Optane PMEM,因此计算节点规格必须选择相应的规格。目前支持以下两种规格族:

    • 性能增强型本地盘实例规格族i4p

    • 持久内存型实例规格族re6p

本文以ecs.i4p.2xlarge规格作为示例,其它配置参数请根据需要进行配置。

![MemVerge1](https://help-static-aliyun-doc.aliyuncs.com/assets/img/zh-CN/8423190761/p534506.png)
  1. 软件配置页,配置软件,然后单击下一步

    配置软件时,镜像需选择E-HPC与MemVerge的集成镜像,镜像版本由MemVerge自行更新并在计算巢中进行维护。参数说明如下:

    • 镜像类型:选择计算巢部署物

    • 计算巢部署物:选择MemoryMachine_EHPC

    • 镜像:选择计算巢部署物对应的镜像。该镜像由ISV提供,对应不同的MemVerge软件版本。

    • 调度器:请根据需要进行选择,本文使用opengridscheduler(即SGE调度器)作为示例。

    • 域账号服务:请根据需要进行选择,本文使用nis作为示例。

![MemVerge2](https://help-static-aliyun-doc.aliyuncs.com/assets/img/zh-CN/0312701761/p535692.png)
  1. 基础信息页,配置基本信息和登录信息。

  2. 在右侧配置清单区域确认集群配置信息,阅读并选中服务条款,然后单击确认

    创建完成后,返回集群页面,等待集群状态由创建中变更为运行中,则表示创建成功。

步骤二:配置并访问Memory Machine管理页

创建部署Memory Machine的E-HPC集群后,需要配置安全组规则,才能访问Memory Machine管理页。

  1. 配置安全组规则。

    访问Memory Machine需要通过8081端口,您需要为集群所属安全组添加对应的入方向规则。

    1. 在集群列表中单击目标集群的详情

    2. 在集群详情页,单击安全组ID。

    3. 单击安全组规则,然后添加入方向规则,放开8081端口的访问。具体操作,请参见添加安全组规则

      MemVerge4

  2. 访问并登录Memory Machine管理页。

    1. 查看集群管控节点的公网IP。

      节点与队列页面,选择目标集群,节点类型选择管控节点,即可在下方节点列表中获取管控节点的公网IP。

    2. 打开浏览器,输入Memory Machine管理页的访问地址。

      访问地址为https://集群管控节点公网IP:8081,例如https://47.116.XX.XX:8081

      MemVerge5

    3. 使用root用户和创建集群时设置的登录密码,登录Memory Machine管理页。

      MemVerge6

步骤三:申请并上传Memory Machine License

E-HPC集群中部署Memory Machine后,默认未加载License,您需要在云市场购买License,然后上传。

  1. 访问云市场Memory Machine购买页,购买License。

    请根据自身需求选择版本和购买时长。

    MemVerge3

  2. 在Memory Machine管理页面上传License。

    1. 访问并登录Memory Machine管理页。

    2. 在左侧导航栏,单击MemVerge图标,然后选择License

    3. 单击右上角的Change Mode

    4. 在弹出的对话框中,单击Upload License File,然后单击Change

      MemVerge7

    5. Upload License对话框中,完成License上传。

      MemVerge8

步骤四:使用Memory Machine

上传License后,您可以使用Memory Machine。常用使用方式如下,详细使用方式请参见Memory Machine User Guide

  1. 配置内存大页,供Memory Machine使用。

    以将vm.nr_hugepages配置为50GB(1024*50/2=25600)为例:

    sysctl -w vm.nr_hugepages=25600
    
  2. 修改配置文件/etc/memverge/mvmalloc.yml。

    DramCacheGB: 50
    HugePageDram: true
    AccessDetector: advanced
    

    应用会优先使用DramTier配置的内存,超出后使用PMEM内存继续使用。

  3. 运行应用。

    /usr/local/share/memverge/sbin/mm [-c|--config config_file] app_name app_cl_parms
    

    基于SGE调度器提交作业的示例如下:

    #!/bin/bash
    
    #$ -cwd
    #$ -N sge-demo
    #$ -q pmemq
    #$ -pe smp 8
    #$ -o /home/xiaofan/
    #$ -e /home/xiaofan/
    
    echo "demo start, sleep 10s and ping localhost"
    sleep 10
    ping -c 10 localhost
    
    echo "run memverge cases"
    /usr/local/share/memverge/sbin/mm [-c|--config config_file] app_name app_cl_parms
    
    echo "demo complete"
    
  4. 动态调整DramTier大小。

    /usr/local/share/memverge/sbin/mvmcli -h
    mvmcli dram resize -s new-size -p pid -g true|false
    
  5. 查看DRAM和PMEM。

    mvmcli show-usage -v
    

相关文档

您也可以使用计算巢来部署EHPC+MemVerge方案,更多信息,请参见MemVerge服务计算巢模式部署文档

相关文章
|
26天前
|
人工智能 数据可视化 数据挖掘
阿里云百炼 Harness 工具全解:联网 / 代码解释 / 识图,Qwen 内置增强组件使用指南
Harness是阿里云百炼Token Plan为Qwen3.8-Max-Preview等旗舰模型内置的增强工具集,支持联网搜索、代码解释器、网页抓取、文搜图、图搜图等多模态能力,开箱即用、按调用计费,助力AI编程与智能体高效执行复杂任务。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
|
5月前
|
存储 人工智能 监控
AI 智能体的开发流程
国内AI智能体开发已步入企业级全生命周期管理阶段。本文系统梳理2026主流实践:从业务拆解、模型选型、核心能力构建(规划/记忆/工具/角色)、工作流编排,到测试评估、安全部署与持续运营,覆盖国产化落地关键路径。(239字)
|
26天前
|
数据挖掘
Tushare接口文档:个股资金流向(moneyflow)
本文旨在对Tushare的个股资金流向`moneyflow`数据接口进行介绍,提供更多参考示例和使用说明。 本接口可获取沪深A股票资金流向数据,分析大单小单成交情况,用于判别资金动向。本文除了从交易日、个股方面简单介绍如何快速获取数据外,还演示了如何计算主力资金流向及对单支股票主力资金流向绘制趋势图,最后演示了如何筛选主力资金净流入top 10的个股。
495 9
|
26天前
|
人工智能 运维 IDE
最新版 Qwen Code(终端 AI 编程工具) 功能介绍及接入阿里云百炼 Coding Plan、Token Plan 教程
在现代高效软件工程迭代体系中,传统IDE插件类AI工具普遍存在界面割裂、项目感知碎片化、依赖图形环境、无法适配纯终端远程开发等痛点。多数编程辅助工具仅支持单文件代码补全与简单问答,不具备全局项目理解、批量工程重构、自动化代码审查、任务自主编排能力,且海外模型接口调用波动大、计费模式单一、长期使用成本高昂,难以适配开发者常态化、低成本、稳定化的智能编码需求。
280 0
|
27天前
|
人工智能 Rust JavaScript
用 Claude Code 重构百万行代码?官方教程终于来了!
怎么用 Claude Code 跑大规模代码迁移?Anthropic 官方的《六步迁移法》保姆级教程来了,手把手讲透规则驱动、试跑验证、多 Agent 流水线,几万行项目重构直接套用。
195 0
|
1月前
|
运维 自然语言处理 监控
把运维能力装进 Qoder,一句话就能定位根因
每个研发都踩过这个坑:遇到线上故障时,定位根因要跨五个平台,学数套查询语法,故障排查半小时起步。当STAROps长在Qoder里,在对话框里用自然语言提问:跨域诊断、多轮追问、生成修复代码、自动提 MR,全程不出 Qoder。三步上手,3 分钟看见效果。
292 12
|
10月前
|
Web App开发 前端开发 JavaScript
如何优化CSS代码以提高性能?
如何优化CSS代码以提高性能?
462 138
|
28天前
|
人工智能 安全 IDE
新版 阿里云 Qoder CN AI编程智能体功能介绍
在软件工程规模化迭代、全栈开发需求爆发的2026年,传统AI编码工具普遍存在功能单一、仅支持单行补全、无法理解整体工程架构、多文件联动薄弱、模型固化、团队规范难统一等问题,只能辅助简单代码编写,无法参与完整项目开发流程。为解决开发者编码效率低、工程迭代慢、重复工作量大、跨文件开发繁琐的痛点,阿里云完成**通义灵码品牌全面升级**,正式推出全新 **Qoder CN 编程智能体**,区别于传统辅助型编码插件,Qoder CN是面向软件开发全生命周期的**自主工程级AI智能体**,实现从单行代码补全、单文件编辑,升级为需求拆解、多文件批量修改、架构梳理、自动测试、部署调试的全流程自主开发能力,是目
807 0
|
2月前
|
人工智能 安全 API
连微软都嫌AI太贵:正测试 DeepSeek V4 平替 Copilot 昂贵底层模型
微软因Copilot Cowork智能体调用成本过高(GPT/Claude账单“不可持续”),拟引入中国开源模型DeepSeek V4作为低成本选项,并转向按Token计费。此举标志AI行业从“模型崇拜”转向“成本工程”。
257 0
|
6月前
|
人工智能 API 开发工具
开发者必看!阿里云百炼Coding Plan套餐、价格、订阅限制一次看懂
阿里云百炼Coding Plan是专为AI编程打造的订阅服务,整合Qwen、GLM、Kimi等顶级模型及Claude Code等工具,提供代码理解、智能补全能力。Lite版首月7.9元,Pro版首月39.9元,含用量限制与严格使用规范。(240字)
3630 4