开发者社区> 大数据与机器学习> 开源大数据平台 E-MapReduce

开源大数据平台 E-MapReduce

关注

阿里云EMR是云原生开源大数据平台,为客户提供简单易集成的Hadoop、Hive、Spark、Flink、Presto、ClickHouse、StarRocks、Delta、Hudi等开源大数据计算和存储引擎,计算资源可以根据业务的需要调整。EMR可以部署在阿里云公有云的ECS和ACK平台。

0
今日
1634
内容
13
活动
5421
关注
|
存储 分布式计算 大数据
|

使用E-MapReduce服务处理阿里云文件存储(NAS)的数据

给大家介绍一个使用场景,可以将E-MapReduce的Hadoop作业和文件存储(NAS)结合在一起,发挥分布式存储和分布式计算在一起的威力

4331 0
|
消息中间件 分布式计算 Kafka
|

使用E-MapReduce服务将Kafka数据导入OSS

kafka是一个开源社区常用的消息队列,虽然kafka官方(Confluent公司)提供插件从Kafka直接导入数据到HDFS的connector,但对阿里云对文件存储系统OSS却没有官方的支持。本文会举一个简单的例子,实现kafka的数据写入阿里云OSS。因为阿里云E-MapReduce服...

8088 0
|
SQL 分布式计算 搜索推荐
|

开源大数据周刊-第31期

数据生态治理要啃硬骨头、将人类送上火星、大数据框架对比、SQL on Hadoop

2586 0
|
SQL 分布式计算 大数据
|

HIVE MapJoin异常问题处理总结

HIVE被很广泛的使用,使用过程中也会遇到各种千奇百怪的问题。这里就遇到的MapJoin Local 内存不足的问题进行讨论,从问题描述、mapjion原理以及产生该问题的原因,解决方案做一下介绍,最后对该问题进行了进一步的思考,希望对解决该类问题的朋友有所帮助。

15429 1
|
分布式计算 算法 大数据
|

开源大数据周刊-第29期

1910 0
|
分布式计算 大数据 Hadoop
|

开源大数据周刊-第26期

云栖社区开源大数据专题回顾、后Hadoop时代圆桌讨论、Hadoop上云的冰与火、Flink的未来、城市大脑、大数据时代几个关键问题剖析

2705 0
|
机器学习/深度学习 分布式计算 大数据
|

开源大数据周刊-第25期

云栖大会开源大数据分享、空间大数据、银行大数据、Hbase迁移到EMR、机器学习python、R及TensorFlow深度学习

2050 0
|
SQL 分布式计算 大数据
|

开源大数据周刊-第24期

本周关注:意图搜索、hadoop3.0、大数据架构BI、大数据农业应用

2505 0
|
Shell 对象存储
|

E-MapReduce集群脚本-包年包月集群修改软件环境的利器

集群,特别是包年报月集群,在使用过程中,可能会有新的安装第三方软件,修改集群运行环境的需求。 E-MapReduce控制台1.5.0版本提供了集群脚本的功能,可以在集群创建好后批量选择节点,运行您指定的脚本,以实现个性化的需求。

2086 0
|
SQL 大数据 对象存储
|

E-MapReduce的Presto组件默认支持访问oss数据

阿里云E-MapReduce从EMR-2.1.0版本镜像开始,Presto组件默认就支持访问oss数据了,不再需要引导操作额外支持。

2725 0
|
SQL 分布式计算 Scala
|

尝新阿里云E-MapReduce MetaService服务

阿里云E-MapReduce从EMR-2.1.0版本镜像开始,将在VPC集群中提供MetaService服务。

4171 0
|
机器学习/深度学习 人工智能 分布式计算
|

开源大数据周刊-第22期

本周关注:大数据部门、数据科学家、机器学习发展与机遇、spark2.0 Structured Streaming、Hbase运维、Sqoop、Flink的第一本书籍。

2659 0
|
资源调度 分布式计算 Hadoop
|

E-MapReduce集群搭建HAWQ实践

HAWQ是一种基于HDFS的MPP(Massively Parallel Processing) SQL引擎,支持标准SQL/事务处理,性能比原生Hive快几百倍。本文介绍在E-MapReduce集群上面如何搭建HAWQ。

5880 0
|
SQL 关系型数据库 MySQL
|

Hive MetaStore同步方法

6140 0
|
分布式计算 大数据 Spark
|

开源大数据周刊-第21期

本周关注:大数据教育、翻译行业应用,大数据与管理的关系、hadoop与mpp的关系、Facebook 60T+的spark应用

3633 0
|
SQL Java 分布式数据库
|

csv导入HBase

csv文件导入HBase

7242 0
|
SQL 分布式计算 算法
|

开源大数据周刊-第19期

本周关注:马云谈云计算、大数据、人工智能未来三十年,E-MapReduce存储计算分离,真实的大数据故事,spark session及spark mmlib、presto+oss

3989 0
|
SQL 分布式计算 Hadoop
|

E-MapReduce 集群环境小记

大家在使用E-MapReduce的时候,都想对E-MapReduce的集群环境细节有些了解。这里根据实践,总结一下E-MapReduce集群环境与应用启动与停止,供大家在实际使用中进行参考。

3046 0
|
分布式计算 NoSQL 大数据
|

开源大数据周刊-第16期

spark2.0已经发布,本期整理了一些spark的好文(包括最佳实践、原理等)推荐给大家。

4882 0
|
SQL 分布式计算 大数据
|

开源大数据周刊-第14期

大数据人才状况;大数据平台相关:数据采集、数据指标的量化、大数据平台建设的选型;性能优化相关:hive、hbase、jvm gc的优化;

3541 0
|
分布式计算 安全 大数据
|

开源大数据周刊-第12期

本周包括 全景洞察大数据全貌、数据分析师的职业规划、打造智能聊天机器人、E-Mapreduce的相关实践及动态、最近值得关注的大数据会议。

5082 0
|
监控 网络安全 流计算
|

如何在E-MapReduce上使用storm

Storm 使用指南 集群创建 目前E-MapReduce已经支持了apache社区的1.0.1版本的storm。用户可以通过选择E-MapReduce 最新的镜像版本EMR-2.0.0(以及后续的以上版本),通过在控制台软件列表中勾选storm软件进行安装,选择完毕后即可登录到master节点

3835 0
|
存储 分布式计算 大数据
|

5W1H(六何分析法)全景洞察大数据

我们从大数据的特征说起,谈到了大数据的价值,再聊什么时候做,谁去做,选择什么平台,最后聊到了怎么做的问题。通过对一些真实的场景分析,了解了大数据的全貌。

11532 58
|
分布式数据库 Hbase
|

E-MapReduce的HBase集群使用Hue

E-MapReduce的HBase集群中使用Hue,方便用户访问查询数据

7339 0
|
SQL 缓存 大数据
|

Presto实现原理(转)

Presto架构 Presto查询引擎是一个Master-Slave的架构,由一个Coordinator节点,一个Discovery Server节点,多个Worker节点组成,Discovery Server通常内嵌于Coordinator节点中。Coordinator负责解析SQL语句,生

7592 0

E-MapReduce集群使用Oozie工作流简单示例

本文简单介绍了,如何在E-MapReduce上提交Oozie workflow job。提供了可以直接下载运行的示例代码,欢迎使用。

3141 0
|
分布式数据库 Python Hbase
|

E-MapReduce 2.0.0 版本发布

本次发布包括: 修改了界面的版本选择,新增了2.0.0版本,隐去了1.x版本(用SDK仍然可以继续创建,但我们强烈建议升级到最新版本),合并了Hadoop和HBase的版本选择。 Hadoop版本进行了升级,2.6.0 -> 2.7.2 集群JDK版本升级,1.7.0 -> 1.8.0 新增

3770 0
|
分布式计算 Hadoop Java
|

E-MapReduce集群支持预装Phoenix

Apache Phoenix是构建在HBase上的SQL中间层,它可以让开发者使用SQL语言对HBase进行相关操作,E-MapReduce在emr-2.0.0版本开始支持集群预装Phoenix,本文对此进行了介绍。

3120 0
|
机器学习/深度学习 SQL 分布式计算
|

开源大数据周刊-第10期

云上Hadoop之最佳实践

2329 0
|
分布式计算 资源调度 Hadoop
|

E-MapReduce集群如何使用Phoenix on HBase

E-MapReduce的emr-2.0.0以下(emr-2.0.0已默认集成Phoenix)的HBase集群中并不包含Phoenix,也没有启动yarn,下面介绍一种通过创建集群时设置的引导操作来完成集群上Phoenix的部署。

4739 0
|
SQL 分布式计算 大数据
|

E-MapReduce解决hive comment中文乱码问题

在最新版本的EMR-1.3.0已经解决了hive comment中文乱码问题。如果已经申请了包年包月的集群,用的是老版本,那么可以过下面介绍的步骤解决这个问题。

4611 0
|
分布式计算 大数据 Hadoop
|

开源大数据周刊-第8期

阿里云李津谈布局专有云的深层用意,2016年杭州第四次spark meetup见闻

2816 0
|
分布式计算 大数据 Hadoop
|

开源大数据周刊-第7期

运行于云端的Hadoop——数据即服务的论证,预先知晓Hadoop3.0新特性。

3190 0
|
SQL 数据可视化 关系型数据库
|

E-MapReduce结合DataV进行数据展现

6651 0
|
JSON 安全 BI
|

通过ZeppelinHub viewer来分享zeppelin的notebook和报表数据

最近有使用E-MapReduce的同学咨询如果将zeppelin中的表表数据进行共享。这里就介绍一下在Aliyun E-MapReduce的集群中使用ZeppelinHub来进行notebook和报表的分享。

7178 0
|
分布式计算 大数据 Hadoop
|

开源大数据周刊-第6期

大数据的未来就像在沙子里淘金

2173 0
|
存储 监控 Java
|

Flume NG 简介及配置实战

最近在做日志采集相关的开发,了解了flume原理和实现,转载一篇文章,一起学习。

9839 0
|
分布式计算 大数据 Hadoop
|

2016年北京中国云计算技术大会见闻

广告有,技术也有。云化是方向,新技术需要很强的把控力;spark还是最火的。

4294 1
|
分布式计算 大数据 Hadoop
|

开源大数据周刊-第5期

浅谈大数据在传统行业的落地之痛,Spark如何简化大数据工作

2541 0
|
分布式计算 大数据 分布式数据库
|

HBase写性能优化

本文介绍了三种HBase数据写入的方法(1种多线程,2种mapreduce),并介绍了各类性能调优的方法

8662 0
|
SQL 缓存 分布式计算
|

通过可视化更好的了解你的Spark应用

图的最大价值是它会推动我们去注意到那些我们从未预料到的东西。 – John Tukey Spark 1.4中对Spark UI进行改进,更加突出可视化的效果。我们来看一下他的主要的改动,主要包含三个方面: Spark事件的时间线视图 执行的DAG图 Spark Streaming 的可视化

6045 0
|
SQL 分布式计算 网络安全
|

如何在Aliyun E-MapReduce集群上使用Zeppelin和Hue

目前Aliyun E-MapReduce支持了zeppelin和hue,在Aliyun E-MapReduce集群上可以很方便的使用zeppelin和hue。本文将详细介绍如何在Aliyun E-MapReduce玩转Zeppelin和Hue!

13261 23
|
SQL 关系型数据库
|

在Aliyun E-MapReduce集群上 使用sqoop高级特性

sqoop简介 sqoop是什么 Sqoop是一款开源的软件工具,提供了Hadoop和关系型数据库中的数据相互转移的功能。可以将一个关系型数据库(例如 : MySQL)中的数据导进到Hadoop的HDFS中,也可以将HDFS的数据导进到关系型数据库中。 在E-MapReduce集群中使用sqo

3673 0
|
分布式计算 大数据 Hadoop
|

开源大数据周刊-第2期

第二期准备了一些本周好的大数据技术的文章;列了近期一些大数据会议;业务方面还是大数据+各种各样的点,没有过多的列出;大数据融资领域还是融资不断;E-Mapreduce团队计划下周发布VPC方案,敬请期待;Aliyun-emapreduce-demo发布在github上,敬请关注。

3656 0
|
分布式计算 Hadoop 云计算
|

2015年上海hadoop in china见闻

市场在发生剧烈的变化,未来10年后的大公司有可能就是现在的小公司。技术也正在发生快速的变革,未来,谁说得好呢?!

2069 0
|
SQL 分布式计算 Hadoop
|

2015年上海hadoop in china见闻

今天过来参加《china hadoop summit》,听了不少的场次。从技术栈上分类,大致为了 硬件、linux等基础软件、hadoop生态圈、分析与应用。我目前主要关注底层的软件技术,主要听了sql on hadoop及hadoop系统架构两个分会场的一些内容。

1978 0
|
分布式计算 资源调度 Hadoop
|

2013年北京hadoop in china见闻

谈下这次参加中国hadoop技术峰会的收获,两天大约听了20场次,上午的是必听的,下午就听了一些关心。大数据峰会肯定是包括技术和技术之上的应用的。各个公司结合自己的业务特点来构建集群,特别听到了电信和银行类的公司在用hadoop或者尝试去用。应用的情况简单的出出报表,复杂点可能会涉及到一些机器学习和

1738 0
我要发布