【2018杭州云栖】大数据计算专场:带你感知无处不在的超大规模大数据计算

本文涉及的产品
云原生大数据计算服务MaxCompute,500CU*H 100GB 3个月
云原生大数据计算服务 MaxCompute,5000CU*H 100GB 3个月
简介: 云栖大会首日,与主论坛一同亮相的大数据计算专场获得了极大关注。阿里巴巴计算平台六位技术专家与衣二三公司CTO,共同引领开发者们直击阿里巴巴超大规模的大数据计算服务,解构数据世界,分享大数据计算前沿科技。整个下午座无虚席,众多来宾站立参与全程。

9月19日-22日杭州云栖小镇,2018超精彩的云计算盛会—云栖大会进行中, 大会共170余场前沿技术、产品及行业峰会, 加速科技普惠, 驱动数字中国!

云栖大会首日,与主论坛一同亮相的大数据计算专场获得了极大关注。阿里巴巴计算平台六位技术专家与衣二三公司CTO,共同引领开发者们直击阿里巴巴超大规模的大数据计算服务,解构数据世界,分享大数据计算前沿科技。整个下午座无虚席,众多来宾站立参与全程。

image

作为阿里巴巴集团旗舰级大数据平台, MaxCompute承载了阿里集团99%的数据存储及95%的计算能力。在2015和2016年的Sort Benchmark中,MaxCompute打破多项世界纪录; 2017年10月,将TPC的benchmark适配到MaxCompute,进行全球首次基于公共云的bigbench大数据基准测试,数据规模被拓展到100TB,性能达到7830QPM,成为首个突破7000分的引擎。 2018年该性能结果被提升超过2倍,达到18176.71QPM,再次用实力证明“中国计算,世界能力。”

MaxCompute不仅是阿里巴巴集团的统一大数据平台,更是数以万计的云上客户的“水电煤”。也许你感觉不到它的存在,但它却是无处不在。

当日下午,阿里巴巴计算平台研究员,阿里巴巴通用计算平台负责人关涛,从计算力、生态化、智能化、图关系四个方面概括介绍了MaxCompute作为新一代大数据计算引擎在过去一年取得的成果以及未来发展的方向。从关涛的介绍中不难看出,MaxCompute提供的不仅是单一的计算引擎,而是具备EB级规模的云原生、高性能、面向企业完整的大数据服务。

image

(图为:阿里巴巴计算平台研究员 阿里巴巴通用计算平台负责人 关涛)


接下来几位分享嘉宾分别从智能化、生态化、计算力、图关系几个方面对MaxCompute产品和技术演进做了深入的解析与分享。

Auto Data Warehouse:让MaxCompute自动驾驶

image

(图为:阿里巴巴计算平台 高级技术专家 张轩丞)


MaxCompute目前在全球有数十个数据中心、数百万的数据表以及每天数百万的作业运行,传统的基于专家经验的数据排布、资源管理以及作业优化等工作已经无法满足需求。MaxCompute通过对历史作业特征的学习,将技术专家对大数据处理的理解赋能机器,让算法和系统帮助用户自动、透明、高效地进行数仓管理和重构优化工作,做到先你所想,更好地理解数据,实现数据智能排布,作业全球调度,做到大数据处理领域的“自动驾驶”。

MaxCompute 联合计算平台解析:Spark 在 MaxCompute 中的应用

image

(图为:阿里巴巴计算平台 技术专家 陈明)


内容中,陈明为现场及线上来宾们首先介绍了MaxCompute为什么要拥抱开源?在开源过程中是如何解决最小化引入开源技术成本及打通数据、适配开源接口等诸多问题。深入解析了Spark on MaxCompute 的实现方式以及联合计算平台如何助力开源引擎安全的运行在 MaxCompute上。

基于MaxCompute构建智能化运营工具

image

(图为:衣二三网络技术有限公司 CTO 程异丁)


衣二三网络技术有限公司CTO程异丁先生出席了本次大数据计算专场的分享,作为亚洲最大的共享时装月租平台,衣二三基于MaxCompute构建起个性化、智能化运营工具,用于用户和商品的运营,完成了精准的商品分析和采购指导,在业务上实现了选衣页推荐点击率提升70%,相关单品推荐点击率提升150%,人均点击数提升110%。

MaxCopmute SQL全新进展

image

(图为:阿里巴巴计算平台 高级技术专家 吴金朋)


在过去的一年中,MaxCompute全面升级2.0版本,在保证迭代中稳定性的前提下,从系统性能,兼容开源生态,语言能力和开发体验等几个方面做了全面的提升。具备了更完备的SQL语法功能,更灵活的SQL扩展能力,更方便的数据接入,更清晰的思维方式以及更强大的开发工具支持。

基于MaxCompute 的大规模科学计算

image

(图为:阿里巴巴计算平台 技术专家 秦续业)


本话题中,分享嘉宾带来了基于MaxCompute 的开源大规模科学计算引擎(兼容 NumPy)的介绍。对Mars的背景、核心以及原理做了详细的介绍。最后公布了Mars后续计划开放源代码,也希望有感兴趣或需求的开发者可以一起加入。

阿里图计算场景、挑战与下一代引擎技术

image

(图为:阿里巴巴计算平台 资深技术专家 钱正平)


钱正平在专场的压轴主题分享中从图计算的角度为大家带来了全新视角的解读。
今天的阿里巴巴拥有多样化的海量数据,有效的数据分析与挖掘不仅可以提高在线服务质量,更是公司的核心竞争力。图模型可以更自然的表达数据间的语义关联。利用这些关联特征,可以增强大数据分析,提供更精准和可靠的信息。钱正平着重介绍图计算在阿里的重要应用场景,包括它们需要的多样化的图操作、算法和对图计算系统提出的新挑战。会后很多客户对图计算产生浓厚兴趣,纷纷表示希望可以尽快实现产品商业化,惠及到更多的企业和开发者。

image


大数据计算服务MaxCompute不仅承办大数据计算专场,MaxCompute通用计算平台负责人,阿里巴巴计算平台研究员关涛还分别在云栖大会主论坛以及云栖大会智能计算峰会进行精彩演讲与直播分享,同时MaxCompute也在数据智能展区和阿里巴巴信息平台展区震撼亮相。

点击了解超大规模的大数据计算服务MaxCompute

相关实践学习
基于MaxCompute的热门话题分析
本实验围绕社交用户发布的文章做了详尽的分析,通过分析能得到用户群体年龄分布,性别分布,地理位置分布,以及热门话题的热度。
SaaS 模式云数据仓库必修课
本课程由阿里云开发者社区和阿里云大数据团队共同出品,是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法,从场景到实践,体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库,助力开发者学习了解先进的技术栈,并能在实际业务中敏捷的进行大数据分析,赋能企业业务。 通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景,可应用MaxCompute实现数仓搭建,快速进行大数据分析。适合大数据工程师、大数据分析师 大量数据需要处理、存储和管理,需要搭建数据仓库?学它! 没有足够人员和经验来运维大数据平台,不想自建IDC买机器,需要免运维的大数据平台?会SQL就等于会大数据?学它! 想知道大数据用得对不对,想用更少的钱得到持续演进的数仓能力?获得极致弹性的计算资源和更好的性能,以及持续保护数据安全的生产环境?学它! 想要获得灵活的分析能力,快速洞察数据规律特征?想要兼得数据湖的灵活性与数据仓库的成长性?学它! 出品人:阿里云大数据产品及研发团队专家 产品 MaxCompute 官网 https://www.aliyun.com/product/odps 
目录
相关文章
|
2月前
|
SQL 存储 分布式计算
ODPS技术架构深度剖析与实战指南——从零开始掌握阿里巴巴大数据处理平台的核心要义与应用技巧
【10月更文挑战第9天】ODPS是阿里巴巴推出的大数据处理平台,支持海量数据的存储与计算,适用于数据仓库、数据挖掘等场景。其核心组件涵盖数据存储、计算引擎、任务调度、资源管理和用户界面,确保数据处理的稳定、安全与高效。通过创建项目、上传数据、编写SQL或MapReduce程序,用户可轻松完成复杂的数据处理任务。示例展示了如何使用ODPS SQL查询每个用户的最早登录时间。
169 1
|
4月前
|
分布式计算 搜索推荐 物联网
大数据及AI典型场景实践问题之通过KafKa+OTS+MaxCompute完成物联网系统技术重构如何解决
大数据及AI典型场景实践问题之通过KafKa+OTS+MaxCompute完成物联网系统技术重构如何解决
|
4月前
|
人工智能 分布式计算 架构师
大数据及AI典型场景实践问题之基于MaxCompute构建Noxmobi全球化精准营销系统如何解决
大数据及AI典型场景实践问题之基于MaxCompute构建Noxmobi全球化精准营销系统如何解决
|
4月前
|
机器学习/深度学习 搜索推荐 算法
飞天大数据平台产品问题之AIRec在阿里巴巴飞天大数据平台中的功能如何解决
飞天大数据平台产品问题之AIRec在阿里巴巴飞天大数据平台中的功能如何解决
|
4月前
|
SQL 存储 分布式计算
MaxCompute 入门:大数据处理的第一步
【8月更文第31天】在当今数字化转型的时代,企业和组织每天都在产生大量的数据。有效地管理和分析这些数据变得至关重要。阿里云的 MaxCompute(原名 ODPS)是一个用于处理海量数据的大规模分布式计算服务。它提供了强大的存储能力以及丰富的数据处理功能,让开发者能够快速构建数据仓库、实时报表系统、数据挖掘等应用。本文将介绍 MaxCompute 的基本概念、架构,并演示如何开始使用这一大数据处理平台。
728 0
|
4月前
|
SQL 分布式计算 大数据
"大数据计算难题揭秘:MaxCompute中hash join内存超限,究竟该如何破解?"
【8月更文挑战第20天】在大数据处理领域,阿里云的MaxCompute以高效稳定著称,但复杂的hash join操作常导致内存超限。本文通过一个实例解析此问题:数据分析师小王需对两个共计300GB的大表进行join,却遭遇内存不足。经分析发现,单个mapper任务内存默认为2GB,不足以支持大型hash表的构建。为此,提出三种解决方案:1) 提升mapper任务内存;2) 利用map join优化小表连接;3) 实施分而治之策略,将大表分割后逐一处理再合并结果。这些方法有助于提升大数据处理效率及稳定性。
103 0
|
2月前
|
存储 机器学习/深度学习 分布式计算
大数据技术——解锁数据的力量,引领未来趋势
【10月更文挑战第5天】大数据技术——解锁数据的力量,引领未来趋势
|
1月前
|
存储 分布式计算 数据挖掘
数据架构 ODPS 是什么?
数据架构 ODPS 是什么?
361 7
|
1月前
|
存储 分布式计算 大数据
大数据 优化数据读取
【11月更文挑战第4天】
53 2
|
1月前
|
数据采集 监控 数据管理
数据治理之道:大数据平台的搭建与数据质量管理
【10月更文挑战第26天】随着信息技术的发展,数据成为企业核心资源。本文探讨大数据平台的搭建与数据质量管理,包括选择合适架构、数据处理与分析能力、数据质量标准与监控机制、数据清洗与校验及元数据管理,为企业数据治理提供参考。
90 1

相关产品

  • 云原生大数据计算服务 MaxCompute