医疗领域应用大数据技术的难题:收集信息

本文涉及的产品
云原生大数据计算服务MaxCompute,500CU*H 100GB 3个月
简介:

科技博客网站recode.net今天发表文章称,许多机构的研究人员正在探索如何利用人工智能和大数据,为癌症等疑难病症找到更好治疗方法,目前已取得进展,但他们在收集患者信息上遇到难题。


文章主要内容如下:

IBM、波士顿制药公司 Berg Pharma、纪念斯隆-凯特琳癌症中心(Memorial Sloan Kettering)、加州大学伯克利分校(UC Berkeley)及其它机构的研究人员,正在探索如何利用人工智能和大数据,找到更好的疾病治疗方法。


但是,在医疗领域充分利用这些计算工具面临的最大挑战是,这方面的海量数据被束之高阁——或者说从一开始就没有数字化。


早期的医学研究成果或病人的病历,往往锁在医药公司的档案或医生办公室的文件柜中。病人的隐私问题、公司间的利益冲突以及纯粹缺乏电子病历,阻碍着医疗领域的信息共享,让每一次治疗都像一个孤立的事件。如果医疗领域的信息共享能取得进展,人们很有可能发现更具普遍意义的治疗方案。


加州大学旧金山分校的讲师迈克尔·凯泽(Michael Keiser)指出,当你能够对10万个病人的临床试验数据、基因组数据和电子病历进行分析时,与以往只能接触少数病人的信息相比,你将能发现以往所不能发现的治疗方案。


鉴于这样的前景,一些组织开始着手将医疗数据整合在一起。去年年底,美国临床肿瘤学会(American Society of Clinical Oncology,ASCO)宣布了旗下“CancerLinQ”项目的初步进展情况。“CancerLinQ”是一个“快速学习系统”,允许研究人员进入、访问和分析匿名癌症患者的病历。


今年4月,一个有众多主要制药公司参与的非营利性组织——“癌症生命科学协会CEO圆桌会(the CEO Roundtable on Cancer)”,宣布推出PDS计划(Project Data Sphere)。该计划将打造一个第三阶段癌症临床试验数据共享和分析平台,初始数据集已由阿斯利康、拜耳、新基医药(Celgene)、纪念斯隆-凯特琳癌症中心、辉瑞、赛诺菲等共同提供。


这些数据已去除患者的个人信息,并进行了统一编号,供生命科学公司、医院、医疗机构以及独立研究者可以免费使用。他们可以访问平台内置的分析工具,或者将数据插入到自己的软件中。癌症CEO圆桌会议首席执行官马丁·墨菲(Martin Murphy)表示,PDS计划可能有助于发现鲜为人知的癌症候选药物,这些药物可能对某些癌变有一定的疗效。而在某一特定研究中,这些药物可能会因为没有达到研究的主要目标而被抛弃。


其它推进医疗领域信息共享的努力还包括:由从多医疗机构、研究型大学、生命科学公司等组建的全球基因组学与健康联盟(Global Alliance for Genomics and Health)、欧洲生物信息研究所(EMBL-EBI)维护的分子生物数据库,以及美国国立卫生研究院(National Institute of Health, NIH)成立的“生物标记共同体(Biomarker Consortium)”等。


与此同时,用大数据服务肿瘤医疗行业的初创公司Flatiron Health上月完成了1.3亿美元 B 轮融资,由谷歌旗下风投机构谷歌风投(Google Ventures)领投。Flatiron Health 打造了一个“肿瘤学云平台(OncologyCloud)”,能提取和整合病人电子病历(EMR)中的临床数据以及医疗费用数据。


该系统使在医生办公室和医院以不可持续和非结构化格式留存的数据变得有意义,从而能够对大规模癌症患者群体的治疗情况进行分析。理想情况下,它可以发现哪种治疗方法对哪些类型的癌症患者有效。


Flatiron Health 联合创始人奈特·特纳(Nat Turner)表示:“Flatiron Health专注于所谓‘真实世界’患者的临床资料。在美国,只有4%的癌症患者会参与前瞻性临床试验,因此我们正在努力提取和整合剩下96%患者的数据。”


他说:“要真正了解什么对癌症有效,其他患者正在接受什么样的治疗,以及癌症领域的研究取得了什么样的成果,相关机构应该开放“去识别(de-identified)”的医疗数据和匿名的典型病例,这是Flatiron Health愿景的一部分。”


隐私风险

可以肯定的是,推进医疗信息的开放应该非常谨慎。医疗信息是高度敏感的,所以任何隐私风险需求应慎重考虑。


医疗信息能开放到什么程度,取决于全社会所做出的让步。许多人坚定地持有这样的观点:挽救生命最重要。但受旧习惯和过时规章制度的影响,社会的转变速度还不够快,这一点加州大学伯克利分校的计算机科学教授大卫·帕特森(David Patterson)深有感触。帕特森致力于用于癌症研究的机器学习工具。


他说:“对于计算机领域的研究人员,我们习惯于互联网时间和摩尔定律。但现在我们无法让官方达成一致,让我们能够大量快餐收集数据并进行整合,这是非常令人沮丧的。”


他指出:“患者的隐私很重要,但争取癌症治疗领域取得进展同样很重要。将大量治疗信息汇集在一起的好处是,我们可以在攻克这种可怕疾病方面取得进展。”


这些接受采访的专家,还没有谁能例举出目前为止大数据等计算技术对癌症治疗带来了什么突破。毕竟,这些技术都是新的,而且医疗数据集刚刚整合在一起,临床试验又需要数年时间。

但几乎所有人都同意,在癌症治疗方面,研究人员正处于重大突破的边缘。


墨菲称,如果把攻克癌症比喻为一座高山,目前已接近顶峰的边缘,这一高度是前所未有的。

原文发布时间为:2014-06-09

本文来自云栖社区合作伙伴“大数据文摘”,了解相关信息可以关注“BigDataDigest”微信公众号

相关实践学习
基于Hologres轻松玩转一站式实时仓库
本场景介绍如何利用阿里云MaxCompute、实时计算Flink和交互式分析服务Hologres开发离线、实时数据融合分析的数据大屏应用。
基于MaxCompute的热门话题分析
Apsara Clouder大数据专项技能认证配套课程:基于MaxCompute的热门话题分析
相关文章
|
21天前
|
数据采集 人工智能 分布式计算
ODPS在AI时代的发展战略与技术演进分析报告
ODPS(现MaxCompute)历经十五年发展,从分布式计算平台演进为AI时代的数据基础设施,以超大规模处理、多模态融合与Data+AI协同为核心竞争力,支撑大模型训练与实时分析等前沿场景,助力企业实现数据驱动与智能化转型。
98 4
|
27天前
|
SQL 分布式计算 大数据
我与ODPS的十年技术共生之路
ODPS十年相伴,从初识的分布式计算到共生进化,突破架构边界,推动数据价值深挖。其湖仓一体、隐私计算与Serverless能力,助力企业降本增效,赋能政务与商业场景,成为数字化转型的“数字神经系统”。
|
1月前
|
存储 供应链 数据可视化
Java 大视界 -- 基于 Java 的大数据可视化在企业供应链风险预警与决策支持中的应用(204)
本篇文章探讨了基于 Java 的大数据可视化技术在企业供应链风险预警与决策支持中的深度应用。文章系统介绍了从数据采集、存储、处理到可视化呈现的完整技术方案,结合供应链风险预警与决策支持的实际案例,展示了 Java 大数据技术如何助力企业实现高效、智能的供应链管理。
|
1月前
|
存储 SQL Java
Java 大视界 -- Java 大数据在智能医疗手术风险评估与术前方案制定中的应用探索(203)
本文探讨了Java大数据技术在智能医疗手术风险评估与术前方案制定中的创新应用。通过多源数据整合、智能分析模型构建及知识图谱技术,提升手术风险预测准确性与术前方案制定效率,助力医疗决策智能化,推动精准医疗发展。
|
2月前
|
机器学习/深度学习 Java 大数据
Java 大视界 -- Java 大数据在智能政务公共资源交易数据分析与监管中的应用(202)
本篇文章深入探讨了 Java 大数据在智能政务公共资源交易监管中的创新应用。通过构建高效的数据采集、智能分析与可视化决策系统,Java 大数据技术成功破解了传统监管中的数据孤岛、效率低下和监管滞后等难题,为公共资源交易打造了“智慧卫士”,助力政务监管迈向智能化、精准化新时代。
|
2月前
|
数据采集 机器学习/深度学习 Java
Java 大视界 -- Java 大数据在智能体育赛事运动员体能监测与训练计划调整中的应用(200)
本篇文章聚焦 Java 大数据在智能体育赛事中对运动员体能监测与训练计划的智能化应用。通过构建实时数据采集与分析系统,结合机器学习模型,实现对运动员体能状态的精准评估与训练方案的动态优化,推动体育训练迈向科学化、个性化新高度。
|
2月前
|
数据采集 自然语言处理 分布式计算
大数据岗位技能需求挖掘:Python爬虫与NLP技术结合
大数据岗位技能需求挖掘:Python爬虫与NLP技术结合
|
2月前
|
机器学习/深度学习 分布式计算 Java
Java 大视界 -- Java 大数据机器学习模型在遥感图像土地利用分类中的优化与应用(199)
本文探讨了Java大数据与机器学习模型在遥感图像土地利用分类中的优化与应用。面对传统方法效率低、精度差的问题,结合Hadoop、Spark与深度学习框架,实现了高效、精准的分类。通过实际案例展示了Java在数据处理、模型融合与参数调优中的强大能力,推动遥感图像分类迈向新高度。
|
2月前
|
数据采集 分布式计算 DataWorks
ODPS在某公共数据项目上的实践
本项目基于公共数据定义及ODPS与DataWorks技术,构建一体化智能化数据平台,涵盖数据目录、归集、治理、共享与开放六大目标。通过十大子系统实现全流程管理,强化数据安全与流通,提升业务效率与决策能力,助力数字化改革。
72 4
|
2月前
|
分布式计算 DataWorks 数据处理
在数据浪潮中前行:记录一次我与ODPS的实践、思考与展望
本文详细介绍了在 AI 时代背景下,如何利用阿里云 ODPS 平台(尤其是 MaxCompute)进行分布式多模态数据处理的实践过程。内容涵盖技术架构解析、完整操作流程、实际部署步骤以及未来发展方向,同时结合 CSDN 博文深入探讨了多模态数据处理的技术挑战与创新路径,为企业提供高效、低成本的大规模数据处理方案。
162 3

热门文章

最新文章