参加2013中国大数据技术大会(BDTC2013)

本文涉及的产品
云原生大数据计算服务 MaxCompute,5000CU*H 100GB 3个月
云原生大数据计算服务MaxCompute,500CU*H 100GB 3个月
简介:

2013年12月5日-6日参加了为期两天的2013中国大数据技术大会(Big Data Technology Conference, BDTC2013),本期会议主题是:“应用驱动的架构与技术 ”。大数据概念最近真是火得不行,从大会多达7个的“大数据架构与系统”、“大数据技术”、“大数据应用”、“大数据研究与发展”、“大数据基准测试”“智能交通与大数据”以及“传统行业如何驾驭大数据”主题论坛,再到现场爆棚的人群,可见大家拥抱大数据的高涨热情。

DSC00103

在9月份读完了一本《大数据时代》,后面又听大学老师介绍了一次Hadoop的HDFS以及MapReduce,就敢修改了一篇勘探大数据立项报告。当看了Hadoop生态系统的框架图后,直接被一堆代号搞得晕头转向,慢慢地只明白了其中几个简单意思,随便一个系统就能庞大得把你淹死,大数据,胆小者慎入!

clip_image002

大数据白皮书与发展趋势

5号会议以主席致辞和院士讲话开始。

马上就是程学旗发布《大数据白皮书》,据说这本书马上就会在CSDN免费发布,内容包括:大数据的发展背景、典型的业务大数据、大数据技术体系、大数据产业链与生态环境、大数据人才培养以及大数据发展趋势等。

程学旗报告的后半部分重点介绍了大数据的10大发展趋势,网上有一篇报道发得挺快的讲了这个内容。

clip_image004

1. 大数据从概念化走向价值化

2. 大数据处理架构的多样化模式并存

3. 大数据安全与隐私越来越重要

4. 大数据分析与可视化成为热点

5. 大数据产业成为战略性产业

6. 数据的商品化和数据共享的联盟化

7. 基于大数据推荐和预测正逐步流行

8. 大数据性能成为支撑性的技术

9. 数据科学的兴起

10. 大数据生态环境逐步完善

BDAS

在大数据创新大赛颁奖之后,是一篇主题演讲Taming Big Data with Berkeley Data Analytics Stack(BDAS),这里介绍一个Hadoop之外的一个大数据分析框架,试验室的名称叫AMPLab(来自于Algorithms, Machines, Person)。

BDAS的目标:

clip_image006

腾讯的报告:大数据处理的规模化与实时化演进

云计算是挖掘大数据价值的核心基础这张片子介绍传统处理方式与大数据处理的对比。

clip_image008

后面讲到了RCFile和ORCFile(Optimized Row Columnar)数据的存储格式,还不了解。

 

The Stae of Apache HBase

下午吃完饭后直接犯困,有2个演讲人的声音几乎没有什么起伏,一会就要睡过去。其中有一篇讲互联网金融的,我也不感兴趣。

只是大概听了一个老外介绍The Stae of Apache HBase,下图中被人头挡住的部分是HDFS。

clip_image010

 

 

6号的会议我一直在大数据技术主题论坛里呆着。

 

百度:基于大数据的硬盘故障预测

 

DSC00191

从HDFS里学了一个三副本概念,这里才知道还有各种纠删码的方案,有一个重要评价指标叫MTTDL(Mean Time To Data Loss平均无数据丢失时长?)。

DSC00193

浙大:机器学习与大数据

何晓飞教授从人脸识别讲到机器学习,先介绍了机器学习的发展历程。

DSC00211

大数据时代的机器学习现在都在朝着深度学习和在线学习攻关。

DSC00213

后面介绍了最近邻搜索中的哈希索引等技术问题。

 

大数据时代可视化和可视分析的机遇与挑战

报告从The Top 10 Challenges in Extreme-Scale Visual Analytics这篇论文引出了北大在可视化方面的工作。

下图给出了通过出租车GPS数据来分析北京交通情况。

DSC00256

还讲到一个多维数据拼图系统。http://vis.pku.edu.cn/mddv/val/sketch#CarData

DSC00290

 

这篇大数据可视化的报告有PDF在CSDN上可以下载

 

Extending MPI to Big Data Computing: Challenges and Benefits of DataMPI

这篇报告中探讨了如何让MPI改造为大数据时代的并行计算,以前有大量MPI并行代码可以看看这篇文章。

本文转自申龙斌的程序人生博客园博文,原文链接:http://www.cnblogs.com/speeding/p/3460540.html,如需转载请自行联系原作者

http://www.cnblogs.com/speeding/ 

相关实践学习
基于MaxCompute的热门话题分析
本实验围绕社交用户发布的文章做了详尽的分析,通过分析能得到用户群体年龄分布,性别分布,地理位置分布,以及热门话题的热度。
SaaS 模式云数据仓库必修课
本课程由阿里云开发者社区和阿里云大数据团队共同出品,是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法,从场景到实践,体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库,助力开发者学习了解先进的技术栈,并能在实际业务中敏捷的进行大数据分析,赋能企业业务。 通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景,可应用MaxCompute实现数仓搭建,快速进行大数据分析。适合大数据工程师、大数据分析师 大量数据需要处理、存储和管理,需要搭建数据仓库?学它! 没有足够人员和经验来运维大数据平台,不想自建IDC买机器,需要免运维的大数据平台?会SQL就等于会大数据?学它! 想知道大数据用得对不对,想用更少的钱得到持续演进的数仓能力?获得极致弹性的计算资源和更好的性能,以及持续保护数据安全的生产环境?学它! 想要获得灵活的分析能力,快速洞察数据规律特征?想要兼得数据湖的灵活性与数据仓库的成长性?学它! 出品人:阿里云大数据产品及研发团队专家 产品 MaxCompute 官网 https://www.aliyun.com/product/odps 
相关文章
|
机器学习/深度学习 分布式计算 大数据
|
人工智能 安全 搜索推荐
|
机器学习/深度学习 算法 大数据
BDTC2014中国大数据技术大会 会议记录
1、落地、跨界、效率、领导见面就谈大数据;2、大数据成为主流产业需要5到10年;3、数据是表象,实质是问题;4、Doug Cutting:Fuel for change:data, EDH, Style catches on:ecosySystem, the Data Multi-Tool, C...
872 0
|
30天前
|
存储 机器学习/深度学习 分布式计算
大数据技术——解锁数据的力量,引领未来趋势
【10月更文挑战第5天】大数据技术——解锁数据的力量,引领未来趋势
|
9天前
|
数据采集 监控 数据管理
数据治理之道:大数据平台的搭建与数据质量管理
【10月更文挑战第26天】随着信息技术的发展,数据成为企业核心资源。本文探讨大数据平台的搭建与数据质量管理,包括选择合适架构、数据处理与分析能力、数据质量标准与监控机制、数据清洗与校验及元数据管理,为企业数据治理提供参考。
42 1
|
1月前
|
分布式计算 关系型数据库 MySQL
大数据-88 Spark 集群 案例学习 Spark Scala 案例 SuperWordCount 计算结果数据写入MySQL
大数据-88 Spark 集群 案例学习 Spark Scala 案例 SuperWordCount 计算结果数据写入MySQL
47 3
|
3天前
|
存储 大数据 定位技术
大数据 数据索引技术
【10月更文挑战第26天】
13 3
|
3天前
|
存储 大数据 OLAP
大数据数据分区技术
【10月更文挑战第26天】
18 2
|
6天前
|
消息中间件 分布式计算 大数据
数据为王:大数据处理与分析技术在企业决策中的力量
【10月更文挑战第29天】在信息爆炸的时代,大数据处理与分析技术为企业提供了前所未有的洞察力和决策支持。本文探讨了大数据技术在企业决策中的重要性和实际应用,包括数据的力量、实时分析、数据驱动的决策以及数据安全与隐私保护。通过这些技术,企业能够从海量数据中提取有价值的信息,预测市场趋势,优化业务流程,从而在竞争中占据优势。
32 1

热门文章

最新文章