人工智能、大数据、数据挖掘、机器学习-数据集来源(中)

简介: 人工智能、大数据、数据挖掘、机器学习-数据集来源(中)

Datamob.org


http://datamob.org/datasets


Factual


http://www.factual.com/topics/browse


Freebase


http://www.freebase.com/


Google


http://www.google.com/publicdata/directory


infochimps: http://www.infochimps.com/


numbray


http://numbrary.com/


Quora


https://www.quora.com/Data/Where-can-I-find-large-datasets-open-to-the-public


RS Collection 100+


http://rs.io/2014/05/29/list-of-data-sets.html


Sample R data sets


http://stat.ethz.ch/R-manual/R-patched/library/datasets/html/00Index.html


SourceForge 研究数据


http://www.nd.edu/ oss / 数据 / 研究司


StatSci.org


http://www.statsci.org/datasets.html


UFO 报告


http://www.nuforc.org/webreports.html


维基解密 911 寻呼机截取


http://911.wikileaks.org/files/index.html


Stats4Stem.org:R 数据集


http://www.stats4stem.org/data-sets.html


《华盛顿邮报》名单


http://www.washingtonpost.com/wp-srv/metro/data/datapost.html


科学


农业实验


http://www.insider.org/packages/cran/agridat/docs/agridat


气候数据


http://www.cru.uea.ac.uk/cru/data/temperature/#datter


and ftp://ftp.cmdl.noaa.gov/


Gene Expression Omnibus


http://www.ncbi.nlm.nih.gov/geo/


Geo Spatial Data


http://geodacenter.asu.edu/datalist/


Human Microbiome Project


http://www.hmpdacc.org/reference_genomes/reference_genomes.php


MIT Cancer Genomics Data


http://www.broadinstitute.org/cgibin/cancer/datasets.cgi


NASA


http://nssdc.gsfc.nasa.gov/nssdc/obtaining_data.html


NIH Microarray data


ftp://ftp.ncbi.nih.gov/pub/geo/DATA/supplementary/series/GSE6532/®


Protein structure


http://www.infobiotic.net/PSPbenchmarks/


Public Gene Data


http://www.pubgene.org/


斯坦福大学的微阵列数据


http://smd.stanford.edu/


社会科学


综合社会调查


http://www3.norc.org/GSS + 网站 /


ICPSR


http://www.icpsr.umich.edu/icpsrweb/ICPSR/access/index.jsp


皮尤研究


http://www.pewinternet.org/datasets/pages/2/


加州大学洛杉矶分校的社会科学档案


http://dataarchives.ss.ucla.edu/Home.DataPortals.html


UPJOHN 本月


http://www.upjohn.org/erdc/erdc.html


时间序列


时间序列数据库


http://robjhyndman.com/TSDL/


澳大利亚手语数据


http://kdd.ics.uci.edu/databases/auslan/auslan.html


高质量的澳大利亚手语数据


http://kdd.ics.uci.edu/databases/auslan2/auslan.html


脑电图数据


http://kdd.ics.uci.edu/databases/eeg/eeg.html


日本的元音


http://kdd.ics.uci.edu/databases/JapaneseVowels/JapaneseVowels.html


Pioneer-1 移动机器人数据


http://kdd.ics.uci.edu/databases/pioneer/pioneer.html


伪周期合成时间序列


http://kdd.ics.uci.edu/databases/synthetic/synthetic.html


合成控制图时间序列


http://kdd.ics.uci.edu/databases/synthetic_control/synthetic_control.html


大学


卡内基梅隆大学安然电子邮件


http://www.cs.cmu.edu/~ 安然 /


卡内基梅隆大学 StatLab


http://lib.stat.cmu.edu/datasets/


龙骨存储库


http://sci2s.ugr.es/keel/datasets.php


卡内基梅隆大学 JASA 数据归档


http://lib.stat.cmu.edu/jasadata/


俄亥俄州立大学财务数据


http://fisher.osu.edu/fin/osudata.htm


加州大学伯克利分校


http://ucdata.berkeley.edu/


加州大学洛杉矶分校


http://aws.amazon.com/datasets


加州大学河滨分校时间序列


http://www.cs.ucr.edu/ / time_series_data /


相关实践学习
基于MaxCompute的热门话题分析
本实验围绕社交用户发布的文章做了详尽的分析,通过分析能得到用户群体年龄分布,性别分布,地理位置分布,以及热门话题的热度。
SaaS 模式云数据仓库必修课
本课程由阿里云开发者社区和阿里云大数据团队共同出品,是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法,从场景到实践,体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库,助力开发者学习了解先进的技术栈,并能在实际业务中敏捷的进行大数据分析,赋能企业业务。 通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景,可应用MaxCompute实现数仓搭建,快速进行大数据分析。适合大数据工程师、大数据分析师 大量数据需要处理、存储和管理,需要搭建数据仓库?学它! 没有足够人员和经验来运维大数据平台,不想自建IDC买机器,需要免运维的大数据平台?会SQL就等于会大数据?学它! 想知道大数据用得对不对,想用更少的钱得到持续演进的数仓能力?获得极致弹性的计算资源和更好的性能,以及持续保护数据安全的生产环境?学它! 想要获得灵活的分析能力,快速洞察数据规律特征?想要兼得数据湖的灵活性与数据仓库的成长性?学它! 出品人:阿里云大数据产品及研发团队专家 产品 MaxCompute 官网 https://www.aliyun.com/product/odps 
相关文章
|
9天前
|
数据采集 运维 数据挖掘
API电商接口大数据分析与数据挖掘 (商品详情店铺)
API接口、数据分析以及数据挖掘在商品详情和店铺相关的应用中,各自扮演着重要的角色。以下是关于它们各自的功能以及如何在商品详情和店铺分析中协同工作的简要说明。
|
9天前
|
机器学习/深度学习 数据可视化 数据挖掘
探索大数据时代的关键技术:数据挖掘、可视化和数据仓库
探索大数据时代的关键技术:数据挖掘、可视化和数据仓库
138 0
|
1天前
|
机器学习/深度学习 小程序 计算机视觉
机器学习寻找数据集—动态网站获取
机器学习寻找数据集—动态网站获取
|
6天前
|
机器学习/深度学习 数据采集 人工智能
论文介绍:机器学习中数据集规模增长的极限分析
【5月更文挑战第17天】论文《机器学习中数据集规模增长的极限分析》探讨了数据集大小对AI模型性能的影响,预测语言数据可能在2026年前耗尽,图像数据在2030-2060年可能面临相同问题。研究显示数据积累速度无法跟上数据集增长,可能在2030-2040年间导致训练瓶颈。然而,算法创新和新数据源的发展可能缓解这一问题。[链接](https://arxiv.org/pdf/2211.04325.pdf)
29 2
|
9天前
|
机器学习/深度学习 分布式计算 并行计算
【机器学习】怎样在非常大的数据集上执行K-means算法?
【5月更文挑战第13天】【机器学习】怎样在非常大的数据集上执行K-means算法?
|
9天前
|
机器学习/深度学习 数据采集 数据可视化
基于数据挖掘与机器学习揭秘脱发主因
基于数据挖掘与机器学习揭秘脱发主因
|
9天前
|
机器学习/深度学习 数据采集 SQL
【Python机器学习专栏】使用Pandas处理机器学习数据集
【4月更文挑战第30天】本文介绍了如何使用Python的Pandas库处理机器学习数据集,涵盖数据读取、概览、清洗、转换、切分和保存等步骤。通过Pandas,可以从CSV等格式加载数据,进行缺失值、异常值处理,数据类型转换,如归一化、类别编码,并实现训练集与测试集的划分。此外,还展示了如何保存处理后的数据,强调了Pandas在数据预处理中的重要性。
|
9天前
|
JSON 分布式计算 MaxCompute
MaxCompute问题之创建数据集失败如何解决
MaxCompute数据包含存储在MaxCompute服务中的表、分区以及其他数据结构;本合集将提供MaxCompute数据的管理和优化指南,以及数据操作中的常见问题和解决策略。
36 0
|
9天前
|
分布式计算 关系型数据库 MySQL
MaxCompute数据问题之创建数据集失败如何解决
MaxCompute数据包含存储在MaxCompute服务中的表、分区以及其他数据结构;本合集将提供MaxCompute数据的管理和优化指南,以及数据操作中的常见问题和解决策略。
31 2
|
9天前
|
机器学习/深度学习 JavaScript 前端开发
机器学习 - [源码实现决策树小专题]决策树中子数据集的划分(不允许调用sklearn等库的源代码实现)
机器学习 - [源码实现决策树小专题]决策树中子数据集的划分(不允许调用sklearn等库的源代码实现)
41 0

热门文章

最新文章