云上高性能计算助力基因测序
摘要:本文整理自阿里云行业解决方案架构师马颂(栖逸),在阿里云计算情报局的分享。本篇内容主要分为三个部分:
1. 寻因生物简介
2. 单细胞测序及痛点
3. 寻因生物基于E-HPC的大内存实例解决方案
一、寻因生物简介
寻因生物创始团队及公司于2018年正式启动组建运营,是一家专注于单细胞技术的生物科技企业。致力于通过自主研发的高通量单细胞产品实验及生信分析全链条服务,将单细胞技术普适化,助力临床诊断和药物研发。推动精准医疗进入2.0时代。
这家成立于2018年,驻扎在北大医疗产业园的初创企业,在2022年1月获得D轮融资,并在上海、广州和成都设立地方实验室。公司面向临床及科研工作者的实际需求,搭建了从样本保存、解离到生信分析的全链条单细胞测序产品及服务解决方案。客户将样本送到寻因生物上海、广州或成都的实验室。
样品采集到之后,在实验室中通过实验进行序列加工和信号放大,将分子循环扩增,给每一个分子和细胞加上标签。辅助识别检测的分子来自哪个细胞、哪个基因。而后通过物流的方式送到北京进行测序。测序的结果上传到寻因的阿里云OSS或通过专线下载到本地,再做单细胞分析。
二、单细胞测序及痛点
单细胞测序作为2009年首次问世的技术,无疑是现在生命科学基础研究的最大热门。2013年单细胞RNA测序被nature method评为年度技术。2015年单细胞测序技术再度登上science转化医学封面。
单细胞测序,顾名思义是在单个细胞水平,对细胞的基因表达等信息进行检测,对于多细胞生物来说,细胞与细胞之间是有差异的。
相对于传统的测序研究,局限于器官与组织。群体细胞的表达水平,最终得到的信号值,丢失了抑制性信息。单细胞测序可以更高分辨率,解释细胞间的差异,及其在为环境中的功能情况。防止细胞间的滥竽充数。
该技术已经应用在基础科研、临床诊断、新药研发等各个领域。作为一项高效的医疗辅助手段,基因测序在预防出生缺陷、检测遗传性疾病、肿瘤用药等领域提供了有效帮助。
单细胞测序技术的蓬勃发展,也助力了寻因生物业务起步。公司自2021年3月份商业化销售以来,予以100家客户建立科研合作关系。通过屏幕左侧典型单细胞数据分析的步骤流程图,可以看到,在单细胞测序的最后一步,数据分析环节需要针对单细胞测序数据,进行数据预处理。
比如质控、归一化、数据矫正、特征选择、聚类分析、轨迹分析、差异表达分析、基因动力学、亚稳态分析、成分分析等。仅一个单细胞测序的文件大小可达100GB以上。随着一个单细胞项目包含的样本量越来越多,细胞数据级别往往达到数百GB甚至TB。
其次,单细胞数据的分析复杂需要反复做数据读取和参数调整。导致处理海量细胞样本的分析任务,通常要数小时甚至数天才能完成。
当样品量上来,各个样品之间又要做各种关联,或者是更复杂的计算,对于算力的消耗量就会非常大,对算力的要求更高。
超大数据量和分析复杂性会导致任务并发数低,数据加载速率慢。除此之外,生物信息行业缺少一个覆盖全程的开源软件。通常一个生物计算项目需要多个软件配合,随着单细胞检测的成本逐渐降低,应用面越来越广,生信数据将是指数级的增长。
生信分析的惯用操作是将样本参数调低,或者仅运行一个比较大型的单细胞分析任务。但在测序任务多的情况下,多个单细胞分析项目只能排队执行。
三、寻因生物基于E-HPC的大内存实例解决方案
为了解决上述问题,阿里云为寻因生物搭建了基于E-HPC的大内存实例解决方案。这套方案主要由三部分组成。第一部分是,大内存云实例,搭配合作伙伴推出的内存虚拟化软件。
2017年,英特尔奥腾SSD推;出2020年,英特尔发布奥腾持久内存100系列,成功完成大规模的商业化;2021年,英特尔发布第三代英特尔至强可扩展处理器,及英特尔奥腾持久内存200系列。同年,阿里云基于以上产品开发了性能更加强大的不同实例规格。
其中,I4P能够提供性能极高的本地盘延时可以缩短至170纳秒,非常适用于重IO型应用帮助此类应用突破性能瓶颈。
寻因生物的单细胞测序分析任务,部署在了基于第三代英特尔至强可扩展处理器,和第二代英特尔奥腾持久内存,I4P持久内存型实例上。配合第一款虚拟化内存硬件的软件Memory Machine,对容量、性能、可用性和移动性进行精细化的资源调配。
在透明内存服务的基础上,还提供了另一个行业第一的技术Zero Io内存快照。该技术可以在几秒钟内封装数TB的应用程序状态,并以内存速度实现数据管理。
第二部分,阿里云的计算巢模式。云厂商开放给企业应用服务商和其客户服务管理的pass平台。阿里云让Memory Machine大内存虚拟化软件与云平台的标准化集成加速软件交付部署,并标准化运维管理,大幅提升了业务效率。
第三部分,阿里云弹性高性能计算平台E-HPC,可将寻因生物底层使用的不同规格ECS及存储实例自动纳管和调度。一键安装部署生命科学相关的软件及其运行环境。
自动在业务高峰扩容低谷释放,避免资源浪费,大大节省运维成本。此外,E-HPC可将HPC和软件一键安装部署,免去每个实例,分别安装软件的繁复工作。
阿里云的大内存实例解决方案,在以下四方面助力寻因生物业务。
第一,算得快。E-HPC解决方案简化编写流程、监控任务投递,以及任务运算的过程。数据加载和导出性能从1000秒缩至2.5秒;单任务的样本规模是原来的2倍。在运行时间和单任务的运行时间几平差不多的情况下,测序任务的井发运行数由原来的1个提升到了5个,任务处理效率提升了5倍之多。
第二,成本低。E-HPC保证整体算力的同时,动态创建/删除计算节点,避免了资源浪费;提高作业质量及速度,输出丰富云原生能力支撑ECS支持抢占式实例,OSS支持冷归档:付费模式多元,结合业务的需求及数据保存的性能和周期,支持成本出发的精细化调整。
第三,简运维。E-HPC将寻因生物底层使用的不同规格ECS实例自动纳管与调度,可将生命科学相关的HPC软件及其运行环境一键安装部署,将带有MemVerge软件的ECS实例自动纳管与调度,大大节省运维成本通过阿里云的计算巢蟆式将MemoryMachine大内存虚拟化软件与云平台的标准化集成,加速软件交付部署井标准化运维管理,大幅提升了业务效率。
第四,助生态。阿里云多年深耕生物信息行业,已形成多种服务方案和客户资源,能够为上下游生物科技企业的互联互通提供更多支持寻因,基于阿里云开发出直接向用户提供服务的单细胞分析平台,赋予科研用户和药物研发用户分析单细胞数据的能力。