找不到数据?这20个公开的大数据资源你应该知道

本文涉及的产品
云原生大数据计算服务 MaxCompute,5000CU*H 100GB 3个月
云原生大数据计算服务MaxCompute,500CU*H 100GB 3个月
简介:

我总是在证明这样一个论点,即数据无处不在——并且很多都是免费的。在开始大数据分析之前,公司不一定要建立自己的大规模数据仓库。企业和政府将大量信息投入到公共领域的举措,使得每个人都能够获得海量数据。

迄今为止,从大蓝筹企业到极小型创业公司,都可以使用比以往更多的数据。我的很多客户都在向我寻求他们在向大数据方面努力时可以使用的顶尖数据源,下面描述的就是如今可以获得的,一些好用同时免费的大数据来源。

  1. Data.gov

美国政府去年承诺使所有政府数据都能在网上免费获得。这个网站是第一阶段,作为一个门户网站,囊括了从气候到犯罪的一切惊人的信息。

  1. 美国人口普查局

一个关于美国公民生活的丰富信息,包括人口数据,地域数据以及教育。

  1. 欧洲联盟开放数据门户

如上所述,但它是基于欧洲联盟机构的数据。

  1. Data.gov.uk

来自英国政府的数据,包括《英国国家书目》——自1950以来所有的英国书籍以及出版物的元数据。

  1. 中情局世界概况

267个国家历史、人口、经济、政府、基础设施以及军事信息。

  1. Healthdata.gov

125年来美国的医疗保健数据,包括索赔型医保数据,流行病学和人口统计。

  1. NHS 健康和社会保健信息中心

来自英国国民健康服务的健康状况数据集。

  1. Amazon网络服务公共数据集

巨型公共数据源,包括1000个基因组工程,试图建立最全面的人类遗传信息数据库和美国宇航局的卫星图像数据库。

  1. Facebook Graph

虽然Facebook用户个人资料中的很多信息是私有的,但很多也不是——Facebook提供Graph API作为查询大量信息的一种方式,它的用户很乐意与世界分享(或者说是不能隐藏,因为他们还没有制定如何设置隐私功能)。

  1. Gapminder

世界卫生组织和世界银行的数据集合,包括世界各地的经济、医疗以及社会统计数据。

  1. Google Trends

自2004年以来,对所有关键字的搜索量(作为总搜索的比例)的数据统计。

  1. Google财经

40年的股票市场数据,并实时更新。

  1. Google Books Ngrams

搜索和分析数以百万计的数字图书全文,作为Google图书项目的一部分。

  1. 国家气候数据中心

从美国国家气候数据中心收集的环境、气象以及气候数据集。全球最大的天气数据存档。

  1. DBPedia

维基百科包含数以百万计的数据,生活中每个事物的结构化和非结构化信息。DBpedia的是一个用来分类的大型工程,并创建了一个公共的,免费发布的并允许任何人来分析这些数据的数据库。

  1. Topsy

免费而全面的社交媒体数据是很难得到的——毕竟这些数据是为那些大玩家(Facebook,Twitter等)产生利润的,所以他们不想轻易送人。然而Topsy提供了一个可搜索回溯至2006年公共微博的数据库,和现在一些用来分析会话的工具。

  1. Likebutton

在全球范围内,从你自己的网络中挖掘Facebook的公共数据,来了解在某个时刻人们“喜欢”什么。

  1. New York Times《纽约时报》

可搜索的新闻文章的索引档案,可以追溯到1851年。

  1. Freebase

一个关于人,地点和事物的结构化数据的社区数据库,记录数超过45万个。

  1. 百万歌曲数据集

超过一百万首歌曲和音乐作品的元数据。部分属于亚马逊网络服务。

本文转自d1net(转载)

相关实践学习
基于MaxCompute的热门话题分析
本实验围绕社交用户发布的文章做了详尽的分析,通过分析能得到用户群体年龄分布,性别分布,地理位置分布,以及热门话题的热度。
SaaS 模式云数据仓库必修课
本课程由阿里云开发者社区和阿里云大数据团队共同出品,是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法,从场景到实践,体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库,助力开发者学习了解先进的技术栈,并能在实际业务中敏捷的进行大数据分析,赋能企业业务。 通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景,可应用MaxCompute实现数仓搭建,快速进行大数据分析。适合大数据工程师、大数据分析师 大量数据需要处理、存储和管理,需要搭建数据仓库?学它! 没有足够人员和经验来运维大数据平台,不想自建IDC买机器,需要免运维的大数据平台?会SQL就等于会大数据?学它! 想知道大数据用得对不对,想用更少的钱得到持续演进的数仓能力?获得极致弹性的计算资源和更好的性能,以及持续保护数据安全的生产环境?学它! 想要获得灵活的分析能力,快速洞察数据规律特征?想要兼得数据湖的灵活性与数据仓库的成长性?学它! 出品人:阿里云大数据产品及研发团队专家 产品 MaxCompute 官网 https://www.aliyun.com/product/odps 
目录
相关文章
|
1天前
|
SQL 机器学习/深度学习 分布式计算
MaxCompute产品使用合集之数据删除之后,是否支持回滚
MaxCompute作为一款全面的大数据处理平台,广泛应用于各类大数据分析、数据挖掘、BI及机器学习场景。掌握其核心功能、熟练操作流程、遵循最佳实践,可以帮助用户高效、安全地管理和利用海量数据。以下是一个关于MaxCompute产品使用的合集,涵盖了其核心功能、应用场景、操作流程以及最佳实践等内容。
|
1天前
|
消息中间件 分布式计算 DataWorks
MaxCompute产品使用合集之如何在DataWorks中引用MC资源
MaxCompute作为一款全面的大数据处理平台,广泛应用于各类大数据分析、数据挖掘、BI及机器学习场景。掌握其核心功能、熟练操作流程、遵循最佳实践,可以帮助用户高效、安全地管理和利用海量数据。以下是一个关于MaxCompute产品使用的合集,涵盖了其核心功能、应用场景、操作流程以及最佳实践等内容。
|
2天前
|
SQL 分布式计算 DataWorks
MaxCompute产品使用合集之整库离线同步至MC的配置中,是否可以清除原表所有分区数据的功能
MaxCompute作为一款全面的大数据处理平台,广泛应用于各类大数据分析、数据挖掘、BI及机器学习场景。掌握其核心功能、熟练操作流程、遵循最佳实践,可以帮助用户高效、安全地管理和利用海量数据。以下是一个关于MaxCompute产品使用的合集,涵盖了其核心功能、应用场景、操作流程以及最佳实践等内容。
|
2天前
|
机器学习/深度学习 分布式计算 DataWorks
MaxCompute产品使用合集之如何将数据映射成Holo表的语句
MaxCompute作为一款全面的大数据处理平台,广泛应用于各类大数据分析、数据挖掘、BI及机器学习场景。掌握其核心功能、熟练操作流程、遵循最佳实践,可以帮助用户高效、安全地管理和利用海量数据。以下是一个关于MaxCompute产品使用的合集,涵盖了其核心功能、应用场景、操作流程以及最佳实践等内容。
|
1天前
|
分布式计算 运维 DataWorks
MaxCompute操作报错合集之用户已在DataWorks项目中,并有项目的开发和运维权限,下载数据时遇到报错,该如何解决
MaxCompute是阿里云提供的大规模离线数据处理服务,用于大数据分析、挖掘和报表生成等场景。在使用MaxCompute进行数据处理时,可能会遇到各种操作报错。以下是一些常见的MaxCompute操作报错及其可能的原因与解决措施的合集。
|
1天前
|
SQL 分布式计算 DataWorks
MaxCompute操作报错合集之使用sql查询一个表的分区数据时遇到报错,该如何解决
MaxCompute是阿里云提供的大规模离线数据处理服务,用于大数据分析、挖掘和报表生成等场景。在使用MaxCompute进行数据处理时,可能会遇到各种操作报错。以下是一些常见的MaxCompute操作报错及其可能的原因与解决措施的合集。
|
1天前
|
SQL 分布式计算 大数据
MaxCompute产品使用合集之PyODPS Python类的开发如何用MC的资源
MaxCompute作为一款全面的大数据处理平台,广泛应用于各类大数据分析、数据挖掘、BI及机器学习场景。掌握其核心功能、熟练操作流程、遵循最佳实践,可以帮助用户高效、安全地管理和利用海量数据。以下是一个关于MaxCompute产品使用的合集,涵盖了其核心功能、应用场景、操作流程以及最佳实践等内容。
|
2天前
|
数据采集 分布式计算 大数据
MaxCompute产品使用合集之数据集成中进行数据抽取时,是否可以定义使用和源数据库一样的字符集进行抽取
MaxCompute作为一款全面的大数据处理平台,广泛应用于各类大数据分析、数据挖掘、BI及机器学习场景。掌握其核心功能、熟练操作流程、遵循最佳实践,可以帮助用户高效、安全地管理和利用海量数据。以下是一个关于MaxCompute产品使用的合集,涵盖了其核心功能、应用场景、操作流程以及最佳实践等内容。
|
1天前
|
机器学习/深度学习 分布式计算 大数据
MaxCompute产品使用合集之如何查看空间资源、CPU和内存以及存储空间容量
MaxCompute作为一款全面的大数据处理平台,广泛应用于各类大数据分析、数据挖掘、BI及机器学习场景。掌握其核心功能、熟练操作流程、遵循最佳实践,可以帮助用户高效、安全地管理和利用海量数据。以下是一个关于MaxCompute产品使用的合集,涵盖了其核心功能、应用场景、操作流程以及最佳实践等内容。
|
12天前
|
数据采集 自然语言处理 大数据
​「Python大数据」词频数据渲染词云图导出HTML
使用Python,本文展示数据聚类和办公自动化,焦点在于通过jieba分词处理VOC数据,构建词云图并以HTML保存。`wordCloud.py`脚本中,借助pyecharts生成词云,如图所示,关键词如"Python"、"词云"等。示例代码创建了词云图实例,添加词频数据,并输出到"wordCloud.html"。
36 1
​「Python大数据」词频数据渲染词云图导出HTML

热门文章

最新文章