案例| 用大数据预测登革热

本文涉及的产品
云原生大数据计算服务 MaxCompute,5000CU*H 100GB 3个月
云原生大数据计算服务MaxCompute,500CU*H 100GB 3个月
简介:


用手机数据(左图)预测登革热的流行范围比传统的扩散模型(右图)更为准确。图片来自《Impact of human mobility on the emergence of dengue epidemics in Pakistan》,该文发表于PNAS。


由于手机总是会自动连接到最近的信号发射塔,因此可以利用通话记录在某个特定的时间点对人进行定位,这一原理常常被法律界用来作为不在场证据或是定罪的依据。现在,哈佛大学公共卫生学院的研究人员发现了通话记录还可能具有拯救生命的功能:预测流行病的蔓延情况。


通过整合4000万巴基斯坦手机用户(占全国人口的22%)的通话记录和天气数据,哈佛的研究人员预测出了登革热的蔓延趋势。登革热是巴基斯坦很常见的一种可能致死的热带疾病。研究人员将2013年登革热病毒的传播轨迹和手机用户的出行模式进行了匹配,发现后者能相当准确地预测前者。流行病学系的助理教授,该研究的通讯作者 Caroline Buckee说:“相比于其它利用环境变量或人类交通的代替物(比如公路网络)的方法,这种方法能更加准确地预测出登革热可能会出现在哪里。”另一位博士后研究员,该研究的第一作者Amy Wesolowski补充说:“对于公路网络并不发达的低收入国家来说,手机数据对于追踪疫情的发展显得尤其重要。”


由于登革热既没有疫苗预防也没有有效的方法治疗,预测疫情爆发对于控制其蔓延至关重要。Buckee说:“做好充分的准备工作,即预测可能发生的时间地点,是我们可以做的为数不多的事情之一。”由于该疾病主要发生在城市地区,而城市地区的手机信号比较密集,因此非常适合用手机网络作为代替物来预测追踪登革热。Wesolowski表示,他们正在努力将这一发现介绍给巴基斯坦卫生防疫部门的官员。


哈佛大学的这项研究代表了到目前为止最大的用来分析预测人类流动性的通话记录数据集。这是和巴基斯坦第二大电信业务运营商Telenor合作完成的。同时,研究者们也尽了最大努力保护这些用户的隐私权。Buckee说:“这些手机通话记录都是匿名的,我们希望这项研究能成为将来公共卫生研究人员和电信行业继续合作的一个良好的先例。”



原文发布时间为:2015-11-09

本文来自云栖社区合作伙伴“大数据文摘”,了解相关信息可以关注“BigDataDigest”微信公众号

相关实践学习
基于MaxCompute的热门话题分析
本实验围绕社交用户发布的文章做了详尽的分析,通过分析能得到用户群体年龄分布,性别分布,地理位置分布,以及热门话题的热度。
SaaS 模式云数据仓库必修课
本课程由阿里云开发者社区和阿里云大数据团队共同出品,是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法,从场景到实践,体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库,助力开发者学习了解先进的技术栈,并能在实际业务中敏捷的进行大数据分析,赋能企业业务。 通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景,可应用MaxCompute实现数仓搭建,快速进行大数据分析。适合大数据工程师、大数据分析师 大量数据需要处理、存储和管理,需要搭建数据仓库?学它! 没有足够人员和经验来运维大数据平台,不想自建IDC买机器,需要免运维的大数据平台?会SQL就等于会大数据?学它! 想知道大数据用得对不对,想用更少的钱得到持续演进的数仓能力?获得极致弹性的计算资源和更好的性能,以及持续保护数据安全的生产环境?学它! 想要获得灵活的分析能力,快速洞察数据规律特征?想要兼得数据湖的灵活性与数据仓库的成长性?学它! 出品人:阿里云大数据产品及研发团队专家 产品 MaxCompute 官网 https://www.aliyun.com/product/odps 
相关文章
|
2月前
|
分布式计算 监控 大数据
大数据-131 - Flink CEP 案例:检测交易活跃用户、超时未交付
大数据-131 - Flink CEP 案例:检测交易活跃用户、超时未交付
83 0
|
2月前
|
SQL 分布式计算 NoSQL
大数据-164 Apache Kylin Cube优化 案例1 定义衍生维度与对比 超详细
大数据-164 Apache Kylin Cube优化 案例1 定义衍生维度与对比 超详细
36 1
大数据-164 Apache Kylin Cube优化 案例1 定义衍生维度与对比 超详细
|
2月前
|
分布式计算 大数据 Linux
大数据体系知识学习(二):WordCount案例实现及错误总结
这篇文章介绍了如何使用PySpark进行WordCount操作,包括环境配置、代码实现、运行结果和遇到的错误。作者在运行过程中遇到了Py4JJavaError和JAVA_HOME未设置的问题,并通过导入findspark初始化和设置环境变量解决了这些问题。文章还讨论了groupByKey和reduceByKey的区别。
38 1
|
2月前
|
消息中间件 存储 druid
大数据-156 Apache Druid 案例实战 Scala Kafka 订单统计
大数据-156 Apache Druid 案例实战 Scala Kafka 订单统计
48 3
|
2月前
|
存储 大数据 分布式数据库
大数据-165 Apache Kylin Cube优化 案例 2 定义衍生维度及对比 & 聚合组 & RowKeys
大数据-165 Apache Kylin Cube优化 案例 2 定义衍生维度及对比 & 聚合组 & RowKeys
47 1
|
2月前
|
消息中间件 druid 大数据
大数据-153 Apache Druid 案例 从 Kafka 中加载数据并分析(二)
大数据-153 Apache Druid 案例 从 Kafka 中加载数据并分析(二)
40 2
|
2月前
|
消息中间件 分布式计算 druid
大数据-153 Apache Druid 案例 从 Kafka 中加载数据并分析(一)
大数据-153 Apache Druid 案例 从 Kafka 中加载数据并分析(一)
60 1
|
2月前
|
存储 SQL 分布式计算
大数据-142 - ClickHouse 集群 副本和分片 Distributed 附带案例演示
大数据-142 - ClickHouse 集群 副本和分片 Distributed 附带案例演示
240 0
|
2月前
|
存储 SQL 分布式计算
大数据-139 - ClickHouse 集群 表引擎详解4 - MergeTree 实测案例 ReplacingMergeTree SummingMergeTree
大数据-139 - ClickHouse 集群 表引擎详解4 - MergeTree 实测案例 ReplacingMergeTree SummingMergeTree
35 0
|
2月前
|
SQL 大数据 API
大数据-132 - Flink SQL 基本介绍 与 HelloWorld案例
大数据-132 - Flink SQL 基本介绍 与 HelloWorld案例
56 0
下一篇
DataWorks