阿里云架构师马颂:云上高性能计算助力基因测序

本文涉及的产品
云服务器 ECS,每月免费额度200元 3个月
云服务器ECS,u1 2核4GB 1个月
简介: 基于E-HPC的大内存实例解决方案:算得快、成本低、简运维、助生态

摘要:本文整理自阿里云行业解决方案架构师马颂(栖逸),在阿里云计算情报局的分享。本篇内容主要分为三个部分:

1.  寻因生物简介

2.  单细胞测序及其痛点

3.  寻因生物基于E-HPC的大内存实例解决方案


01 寻因生物简介


1.png


寻因生物创始团队及公司于2018年正式启动组建运营,是一家专注于单细胞技术的生物科技企业。致力于通过自主研发的高通量单细胞产品实验及生信分析全链条服务,将单细胞技术普适化,助力临床诊断和药物研发,推动精准医疗进入2.0时代。


这家成立于2018年,驻扎在北大医疗产业园的初创企业,在2022年1月获得D轮融资,并在上海、广州和成都设立地方实验室。公司面向临床及科研工作者的实际需求,搭建了从样本保存、解离到生信分析的全链条单细胞测序产品及服务解决方案。客户将样本送到寻因生物上海、广州或成都的实验室。


样品采集到之后,在实验室中通过实验进行序列加工和信号放大,将分子循环扩增,给每一个分子和细胞加上标签。辅助识别检测的分子来自哪个细胞、哪个基因。而后通过物流的方式送到北京进行测序。测序的结果上传到寻因的阿里云OSS或通过专线下载到本地,再做单细胞分析。


02 单细胞测序及痛点


2.png


单细胞测序作为2009年首次问世的技术,无疑是现在生命科学基础研究的最大热门。2013年单细胞RNA测序被nature method评为年度技术。2015年单细胞测序技术再度登上science转化医学封面。


单细胞测序,顾名思义是在单个细胞水平,对细胞的基因表达等信息进行检测,对于多细胞生物来说,细胞与细胞之间是有差异的。


相对于传统的测序研究,局限于器官与组织。群体细胞的表达水平,最终得到的信号值,丢失了抑制性信息。单细胞测序可以更高分辨率,解释细胞间的差异,及其在环境中的功能情况,防止细胞间的滥竽充数。


该技术已经应用在基础科研、临床诊断、新药研发等各个领域。作为一项高效的医疗辅助手段,基因测序在预防出生缺陷、检测遗传性疾病、肿瘤用药等领域提供了有效帮助。

3.png


单细胞测序技术的蓬勃发展,也助力了寻因生物业务起步。公司自2021年3月份商业化销售以来,已与100家客户建立科研合作关系。通过屏幕左侧典型单细胞数据分析的步骤流程图,可以看到,在单细胞测序的最后一步,数据分析环节需要针对单细胞测序数据,进行数据预处理。


比如质控、归一化、数据矫正、特征选择、聚类分析、轨迹分析、差异表达分析、基因动力学、亚稳态分析、成分分析等。仅一个单细胞测序的文件大小可达100GB以上。随着一个单细胞项目包含的样本量越来越多,细胞数据级别往往达到数百GB甚至TB。


其次,单细胞数据的分析复杂需要反复做数据读取和参数调整。导致处理海量细胞样本的分析任务,通常要数小时甚至数天才能完成。


当样品量上来,各个样品之间又要做各种关联,或者是更复杂的计算,对于算力的消耗量就会非常大,对算力的要求更高


超大数据量和分析复杂性会导致任务并发数低,数据加载速率慢。除此之外,生物信息行业缺少一个覆盖全程的开源软件。通常一个生物计算项目需要多个软件配合,随着单细胞检测的成本逐渐降低,应用面越来越广,生信数据将是指数级的增长。


生信分析的惯用操作是将样本参数调低,或者仅运行一个比较大型的单细胞分析任务。但在测序任务多的情况下,多个单细胞分析项目只能排队执行。


03 基于E-HPC的大内存实例解决方案


4.png


为了解决上述问题,阿里云为寻因生物搭建了基于E-HPC的大内存实例解决方案。这套方案主要由三部分组成。第一部分是大内存云实例,搭配合作伙伴推出的内存虚拟化软件


2017年,英特尔奥腾SSD推出;2020年,英特尔发布奥腾持久内存100系列,成功完成大规模的商业化;2021年,英特尔发布第三代英特尔至强可扩展处理器,及英特尔奥腾持久内存200系列。同年,阿里云基于以上产品开发了性能更加强大的不同实例规格。


其中,I4P能够提供性能极高的本地盘延时可以缩短至170纳秒,非常适用于重IO型应用帮助此类应用突破性能瓶颈。


寻因生物的单细胞测序分析任务,部署在了基于第三代英特尔至强可扩展处理器,和第二代英特尔奥腾持久内存,I4P持久内存型实例上。配合第一款虚拟化内存硬件的软件Memory Machine,对容量、性能、可用性和移动性进行精细化的资源调配。


在透明内存服务的基础上,还提供了另一个行业第一的技术Zero Io内存快照。该技术可以在几秒钟内封装数TB的应用程序状态,并以内存速度实现数据管理。


第二部分,阿里云的计算巢模式。云厂商开放给企业应用服务商和其客户服务管理的PaaS平台。阿里云让Memory Machine大内存虚拟化软件与云平台的标准化集成加速软件交付部署,并标准化运维管理,大幅提升了业务效率。


第三部分,阿里云弹性高性能计算平台E-HPC,可将寻因生物底层使用的不同规格ECS及存储实例自动纳管和调度。一键安装部署生命科学相关的软件及其运行环境。


自动在业务高峰扩容低谷释放,避免资源浪费,大大节省运维成本。此外,E-HPC可将HPC和软件一键安装部署,免去每个实例,分别安装软件的繁复工作。

5.png


阿里云的大内存实例解决方案,在以下四方面助力寻因生物业务。


第一,算得快。E-HPC解决方案简化编写流程、监控任务投递,以及任务运算的过程。数据加载和导出性能从1000秒缩至2.5秒;单任务的样本规模是原来的2倍。在运行时间和单任务的运行时间几乎差不多的情况下,测序任务的井发运行数由原来的1个提升到了5个,任务处理效率提升了5倍之多。


第二,成本低。E-HPC保证整体算力的同时,动态创建/删除计算节点,避免了资源浪费;提高作业质量及速度,输出丰富云原生能力支撑ECS支持抢占式实例,OSS支持冷归档:付费模式多元,结合业务的需求及数据保存的性能和周期,支持成本出发的精细化调整。


第三,简运维。E-HPC将寻因生物底层使用的不同规格ECS实例自动纳管与调度,可将生命科学相关的HPC软件及其运行环境一键安装部署,将带有MemVerge软件的ECS实例自动纳管与调度,大大节省运维成本通过阿里云的计算巢蟆式将MemoryMachine大内存虚拟化软件与云平台的标准化集成,加速软件交付部署井标准化运维管理,大幅提升了业务效率。


第四,助生态。阿里云多年深耕生物信息行业,已形成多种服务方案和客户资源,能够为上下游生物科技企业的互联互通提供更多支持寻因,基于阿里云开发出直接向用户提供服务的单细胞分析平台,赋予科研用户和药物研发用户分析单细胞数据的能力。


点击这里,观看嘉宾的演讲视频回放。

相关文章
|
3月前
|
存储 监控 安全
360 企业安全浏览器基于阿里云数据库 SelectDB 版内核 Apache Doris 的数据架构升级实践
为了提供更好的日志数据服务,360 企业安全浏览器设计了统一运维管理平台,并引入 Apache Doris 替代了 Elasticsearch,实现日志检索与报表分析架构的统一,同时依赖 Doris 优异性能,聚合分析效率呈数量级提升、存储成本下降 60%....为日志数据的可视化和价值发挥提供了坚实的基础。
360 企业安全浏览器基于阿里云数据库 SelectDB 版内核 Apache Doris 的数据架构升级实践
|
4月前
|
Cloud Native 关系型数据库 分布式数据库
阿里云瑶池助力九州通B2B电商平台,完成100%云原生架构升级
九州通数字化转型,通过引入阿里云云原生数据库PolarDB,云原生内存数据库Tair等产品,完美支撑了医药电商平台数据库100%云原生化,实现了统一、高效、标准化和可跟踪的B2B医药平台。
389 4
|
4月前
|
安全 网络虚拟化 云计算
阿里云转发路由器Transit Router:构建云上高效、灵活且安全的网络架构之利器
本评测报告围绕阿里云转发路由器Transit Router(TR)在跨地域跨VPC网络互通、企业云上网络架构规划和第三方SD-WAN设备对接三个场景的表现进行了详细评估。评测结果显示,TR凭借强大的路由控制能力和灵活的互通策略,在云上构建高效、灵活且安全的网络架构方面表现出色。同时,TR与第三方SD-WAN设备的良好兼容性也为企业提供了更多组网选择。本报告旨在为企业在云上网络架构规划和部署过程中提供参考和指导。
|
3月前
|
存储 数据可视化 数据管理
基于阿里云服务的数据平台架构实践
本文主要介绍基于阿里云大数据组件服务,对企业进行大数据平台建设的架构实践。
750 2
|
4天前
|
弹性计算 数据库 Docker
学习阿里云架构设计知识2-翀举
VPC分区清晰架构,VSW网络分隔,CEN连通VPC,按量付费小规格,均衡策略,ESS/ACK内置SNAT,ECS用NAT上网。建DMZ需VPC、VSW、NAT、EIP。主系统多VPC/VSW配ECS和Redis,CEN全连接。CEN设路由表,外网访问设DMZ、CEN、EIP,加堡垒机。Web系统ACR部署WordPress,配数据库。验证WordPress、弹性伸缩,测外访、发文、负载。含架构图。
15 1
学习阿里云架构设计知识2-翀举
|
3天前
|
弹性计算 负载均衡 容灾
应用阿里云弹性计算:打造高可用性云服务器ECS架构
阿里云弹性计算助力构建高可用云服务器ECS架构,通过实例分布、负载均衡、弹性IP、数据备份及多可用区部署,确保业务连续稳定。自动容错和迁移功能进一步增强容灾能力,提供全方位高可用保障。
15 0
|
13天前
|
人工智能 分布式计算 Cloud Native
阿里云PAI平台架构介绍
阿里云PAI平台架构介绍
27 0
|
27天前
|
人工智能 Serverless 数据处理
利用阿里云函数计算实现 Serverless 架构的应用
阿里云函数计算是事件驱动的Serverless服务,免服务器管理,自动扩展资源。它降低了基础设施成本,提高了开发效率,支持Web应用、数据处理、AI和定时任务等多种场景。通过实例展示了如何用Python实现图片压缩应用,通过OSS触发函数自动执行。阿里云函数计算在云计算时代助力企业实现快速迭代和高效运营。
|
2月前
|
存储 机器学习/深度学习 并行计算
阿里云服务器X86计算、Arm计算、GPU/FPGA/ASIC、高性能计算架构区别
在我们选购阿里云服务器的时候,云服务器架构有X86计算、ARM计算、GPU/FPGA/ASIC、弹性裸金属服务器、高性能计算可选,有的用户并不清楚他们之间有何区别,本文主要简单介绍下不同类型的云服务器有何不同,主要特点及适用场景有哪些。
阿里云服务器X86计算、Arm计算、GPU/FPGA/ASIC、高性能计算架构区别
|
2月前
|
安全 数据处理 云计算
阿里云神龙架构的背景
阿里云神龙架构的背景