2013年北京hadoop in china见闻

本文涉及的产品
EMR Serverless StarRocks,5000CU*H 48000GB*H
简介: 谈下这次参加中国hadoop技术峰会的收获,两天大约听了20场次,上午的是必听的,下午就听了一些关心。大数据峰会肯定是包括技术和技术之上的应用的。各个公司结合自己的业务特点来构建集群,特别听到了电信和银行类的公司在用hadoop或者尝试去用。应用的情况简单的出出报表,复杂点可能会涉及到一些机器学习和

谈下这次参加中国hadoop技术峰会的收获,两天大约听了20场次,上午的是必听的,下午就听了一些关心。大数据峰会肯定是包括技术和技术之上的应用的。各个公司结合自己的业务特点来构建集群,特别听到了电信和银行类的公司在用hadoop或者尝试去用。应用的情况简单的出出报表,复杂点可能会涉及到一些机器学习和深度挖掘。

非技术的来看,本次大会传递的信息有:

  • 银行、电信也在用hadoop
  • hadoop生态圈依然是大数据相关技术的首选
  • 国内很多大小公司正在使用hadoop
  • 因为开源,所以繁荣

技术来看,本次大会传递的信息有:

  • YARN将是下一代hadoop平台,多种计算模型即将随YARN一起整合资源。
  • 硬件结合hadoop来提升性能。
  • 可以尝试在虚拟机上做YARN,如EMR。
  • 准实时的时代即将到来,也可以说spark等基于内存的分布式时代即将到来。
    数据的收集、交换、存储、计算 (分析)、管理及监控等共同构成了大数据的技术生态圈。基本每个公司都会涉及到其中的方方面面,小的公司可能比较简单直接用社区的版本去做,大点的就直接成立相关的团队专门研发相关的工具及维护相当大的集群。

目前,其中计算之上的分析能带来实际的价值,技术一般包括:实时计算、图计算、流式计算、机器学习相关、数据挖掘相关。这些实际应用于广告、个性化推荐、搜索、社交图谱及基于特定行业的多维分析等等。

说说BAT吧,百度没有人来讲,比较可惜。腾讯走corona+CDH,随后也将考虑YARN的方案。阿里分享了跨机房方案,这可不是2T直接换4T所能解决的,计算层面阿里也将走YARN的方案。目前阿里和腾讯都有团队在走社区的方案。
不能说小公司就没有大数据,适合自己的业务系统的才是最合适的。如用YARN,小公司可以直接用,对于阿里就有很大的历史包袱。

如果想学习大数据特别是hadoop,把分布式的理论弄清楚,实际部署这些分布式的软件,多看看源码,多关注业界的动态。

最后比较感谢 Hadoop中国技术峰会 提供这样的学习交流机会。不过 纠结的是 还有一场是CSDN办理的。
其他具体的可以参考:http://www.it168.com/redian/Hadoop2013/

相关实践学习
基于EMR Serverless StarRocks一键玩转世界杯
基于StarRocks构建极速统一OLAP平台
快速掌握阿里云 E-MapReduce
E-MapReduce 是构建于阿里云 ECS 弹性虚拟机之上,利用开源大数据生态系统,包括 Hadoop、Spark、HBase,为用户提供集群、作业、数据等管理的一站式大数据处理分析服务。 本课程主要介绍阿里云 E-MapReduce 的使用方法。
目录
相关文章
|
分布式计算 Hadoop 大数据
2016年北京hadoop in china见闻
笔者有幸参加了今年在北京主办的hadoop in china,在与会中有不少的感受与大家分享。今年的议题是假设参加会议的同学有一定的基础,没有过多的去介绍基础的内容,比如,没有人说hadoop是啥了,单刀直入,趋势、产品、新技术。大数据改变人类的未来,正在渗透到每个行业中,甚至是人的基因分析。
3287 0
|
分布式计算 Hadoop 云计算
2015年上海hadoop in china见闻
市场在发生剧烈的变化,未来10年后的大公司有可能就是现在的小公司。技术也正在发生快速的变革,未来,谁说得好呢?!
1952 0
|
SQL 分布式计算 Hadoop
2015年上海hadoop in china见闻
今天过来参加《china hadoop summit》,听了不少的场次。从技术栈上分类,大致为了 硬件、linux等基础软件、hadoop生态圈、分析与应用。我目前主要关注底层的软件技术,主要听了sql on hadoop及hadoop系统架构两个分会场的一些内容。
1886 0
|
3天前
|
存储 分布式计算 资源调度
两万字长文向你解密大数据组件 Hadoop
两万字长文向你解密大数据组件 Hadoop
25 11
|
2月前
|
存储 分布式计算 Hadoop
|
2月前
|
图形学 数据可视化 开发者
超实用Unity Shader Graph教程:从零开始打造令人惊叹的游戏视觉特效,让你的作品瞬间高大上,附带示例代码与详细步骤解析!
【8月更文挑战第31天】Unity Shader Graph 是 Unity 引擎中的强大工具,通过可视化编程帮助开发者轻松创建复杂且炫酷的视觉效果。本文将指导你使用 Shader Graph 实现三种效果:彩虹色渐变着色器、动态光效和水波纹效果。首先确保安装最新版 Unity 并启用 Shader Graph。创建新材质和着色器图谱后,利用节点库中的预定义节点,在编辑区连接节点定义着色器行为。
97 0
|
2月前
|
分布式计算 资源调度 Hadoop
Hadoop入门基础(五):Hadoop 常用 Shell 命令一网打尽,提升你的大数据技能!
Hadoop入门基础(五):Hadoop 常用 Shell 命令一网打尽,提升你的大数据技能!
|
2月前
|
存储 SQL 分布式计算
Hadoop生态系统概述:构建大数据处理与分析的基石
【8月更文挑战第25天】Hadoop生态系统为大数据处理和分析提供了强大的基础设施和工具集。通过不断扩展和优化其组件和功能,Hadoop将继续在大数据时代发挥重要作用。
|
2月前
|
资源调度 分布式计算 Hadoop
揭秘Hadoop Yarn背后的秘密!它是如何化身‘资源大师’,让大数据处理秒变高效大戏的?
【8月更文挑战第24天】在大数据领域,Hadoop Yarn(另一种资源协调者)作为Hadoop生态的核心组件,扮演着关键角色。Yarn通过其ResourceManager、NodeManager、ApplicationMaster及Container等组件,实现了集群资源的有效管理和作业调度。当MapReduce任务提交时,Yarn不仅高效分配所需资源,还能确保任务按序执行。无论是处理Map阶段还是Reduce阶段的数据,Yarn都能优化资源配置,保障任务流畅运行。此外,Yarn还在Spark等框架中展现出灵活性,支持不同模式下的作业执行。未来,Yarn将持续助力大数据技术的发展与创新。
31 2
|
2月前
|
分布式计算 Hadoop 大数据
Spark 与 Hadoop 的大数据之战:一场惊心动魄的技术较量,决定数据处理的霸权归属!
【8月更文挑战第7天】无论是 Spark 的高效内存计算,还是 Hadoop 的大规模数据存储和处理能力,它们都为大数据的发展做出了重要贡献。
70 2

相关实验场景

更多
下一篇
无影云桌面