|
分布式计算 MaxCompute
|

MaxCompute优化系列-如何使用`MAPJOIN` ?

MAPJOIN 当一个大表和一个或多个小表做JOIN时,最好使用MAPJOIN,性能比普通的JOIN要快很多。 另外,MAPJOIN 还能解决数据倾斜的问题。 MAPJOIN的基本原理是:在小数据量情况下,SQL会将用户指定的小表全部加载到执行JOIN操作的程序的内存中,从而加快JOIN的执行速度。

10344 0
来自: 大数据计算 MaxCompute  版块
|
存储 分布式计算 MaxCompute
|

基于MaxCompute的图计算实践分享-图加载过程

一、前言 MaxCompute Graph 是基于飞天平台实现的面向迭代的图处理框架,为用户提供了类似于 Pregel 的编程接口。MaxCompute Graph(以下简称 Graph )作业包含图加载和计算两个阶段: 加载,将存储在表中的数据载入到内存中,以点和边的形式存在;

6516 1
来自: 大数据计算 MaxCompute  版块
|
SQL 分布式计算 大数据
|

MaxCompute(原ODPS)开发入门指南——计量计费篇

近期介绍大量数据上云用户关于MaxCompute的一些问题,现就MaxCompute产品线的一些工具栈可以和大家进行交流,也欢迎大家拍砖和来扰,一起学习一起进步!也希望能够在帮助到大家!

7639 0
来自: 大数据计算 MaxCompute  版块
|
SQL 大数据
|

SQL优化器原理-Metadata

这是MaxCompute有关SQL优化器原理的系列文章之一。我们会陆续推出SQL优化器有关优化规则和框架的其他文章。添加钉钉群“关系代数优化技术”(群号11719083)可以获取最新文章发布动态(二维码在文章末尾)。

6640 0
来自: 大数据计算 MaxCompute  版块
|
分布式计算 大数据 测试技术
|

手把手,教你用MaxCompute+OpenSearch搭建分布式搜索引擎

最近,经常有客户咨询如何低成本搭建高性能的海量数据搜索引擎,比如实现公众号检索、影讯检索等等。由于客户的数据在阿里云上,所以希望找到云上解决方案。笔者开始调研一些云上产品,很多人向我推荐了OpenSearch,所以花了点时间好好研究了下,用过之后发现效果不错,自带分词、云数据库同步功能,在研究过程中也发现了一些问题,分享给大家。

7101 0
来自: 大数据计算 MaxCompute  版块
|
存储 分布式计算 MaxCompute
|

MaxCompute 存储优化技巧

文章转自duzhuan本文主要介绍一些ODPS表操作的优化技巧,通过这些技巧,可以有效节省ODPS存储空间和计算量。 合理设置分区表 ODPS支持分区表的概念,分区表指的是在创建表时指定的partition的分区空间,即指定表内的某几个字段作为分区列。在大多数情况下,用户可以将分区类比为文件系统

7245 0
来自: 大数据计算 MaxCompute  版块

你了解的技术宅是这样吗?

闷骚!邋遢! 黑白灰!加班是唯一爱好?他们不用睡觉的吧?请不要再给我们加这些标签了!!! 我们也主动撩妹子!我们也天天洗澡的!我们也有洋气的衣服!谁tm爱加班!你才不用睡觉!我们一摸键盘就开挂,我们钱多事儿少活儿还好。

6171 0
来自: 大数据计算 MaxCompute  版块
|
SQL 分布式计算 监控
|

hive在E-MapReduce集群的实践(一)hive异常排查入门

hive是hadoop集群最常用的数据分析工具,只要运行sql就可以分析海量数据。初学者在使用hive时,经常会遇到各种问题,不知道该怎么解决。 本文是hive实践系列的第一篇,以E-MapReduce集群环境为例,介绍常见的hive执行异常,定位和解决方法,以及hive日志查看方法。

7896 0
|
资源调度 算法 大数据
|

【大数据技术干货】阿里云伏羲(fuxi)调度器FuxiMaster功能简介(一) 多租户(QuotaGroup)管理

转载自xingbao     各位好,这是介绍阿里云伏羲(fuxi)调度器系列文章的第一篇,今天主要介绍多租户(QuotaGroup)管理的实现 一、FuxiMaster简介 FuxiMaster和Yarn非常相似,定位于分布式系统中资源管理与分配的角色:一个典型的资源分配流程图如下所

8308 0
来自: 大数据计算 MaxCompute  版块
|
机器学习/深度学习 自然语言处理 算法
|

【玩转数据系列十一】机器学习PAI眼中的《人民的名义》

最近热播的反腐神剧“人民的名义”掀起来一波社会舆论的高潮,这部电视剧之所能得到广泛的关注,除了老戏骨们精湛的演技,整部剧出色的剧本也起到了关键的作用。笔者在平日追剧之余,也尝试通过机器学习算法对人民的名义的部分剧集文本内容进行了文本分析,希望从数据的角度得到一些输入。

6976 0
来自: 人工智能平台PAI  版块
|
搜索推荐 自然语言处理 开发者
|

云栖硬核回顾|企查查搜索引擎演进之路

企查查作为企业征信行业的搜索引擎,一直以来都与阿里云开放搜索团队有深度合作。本次朱总独家揭秘,开放搜索陪伴企查查从创业初期到成为企业征信行业的独角兽的过程中,是如何满足企查查产品海量数据的精准搜索需求的。

9843 0
来自: 智能搜索推荐  版块
|
SQL 分布式计算 Apache
|

EMR Spark Relational Cache如何支持雪花模型中的关联匹配

我们需要找到一种方式可以通过单个Relational Cache支持优化多个关联查询的方式,从而在加速用户查询的同时,减少创建和更新relational cache的代价。Record Preserve Join是支持这种优化的非常有效的方式。

6109 0
|
分布式计算 安全 大数据
|

企查查支撑8000万+企业数据的大数据平台技术选型与实现

企查查终端所有企业工商信息均实时同步更新,汇集了目前国内市场中的80个产业链,8000个行业,6000个市场以及8000多万家企业数据。

8878 0
来自: 大数据计算 MaxCompute  版块
|
分布式计算 监控 大数据
|

利用MaxCompute内建函数及UDTF转换json格式日志数据

本文介绍了如何使用MaxCompute UDF对JSON格式的日志进行信息提取和转换。

18330 0
来自: 大数据计算 MaxCompute  版块
|
大数据 容器
|

1次演讲13次提到技术,马云在阿里巴巴年会上都说了什么?

阿里巴巴是一个奇迹,18年前的今天,阿里巴巴只有18人和50万人民币,18年后的今天,拥有54421名员工,市值4426亿美金,亚洲第1,全球第6。慕名上门拜访的各国高级政要更是络绎不绝,企业做到这份上,阿里巴巴算是独一家。

6146 0
来自: 大数据计算 MaxCompute  版块
|
分布式数据库 Hbase
|

E-MapReduce启动/停止HBase集群

E-MapReduce的HBase集群启动/停止方式

5855 0
|
分布式计算 监控 搜索推荐
|

MaxCompute帮你五步实现用户画像的数据加工

6648 0
来自: 大数据计算 MaxCompute  版块
|
存储 大数据 流计算
|

【阿里内部应用】基于Blink为新商业调控打造实时大数据交互查询服务

基于Blink为新商业调控打造实时大数据交互查询服务 从IT到DT、从电商到新商业,阿里巴巴的每个细胞都存在大数据的DNA,如何挖掘大数据的价值成为抢占未来先机的金钥匙!传统的大数据开发主要基于离线计算平台MaxCompute(ODPS)进行天级别、小时级别的批量数据分析,但近些年随着618、99.

7381 0
来自: 实时计算 Flink  版块
|
新零售 存储 分布式计算
|

技术与架构,解析如何将大数据最快落地到实践

3月9日14点,业内首个结合技术与应用的在线大数据技术峰会即将展开,届时6位阿里技术大咖与4位行业资深实践者将从技术与业务两个方面,与大家探讨大数据如何最快落地到实践。较为有看点的是: 最深入的实践:本次在线峰会上,6个阿里规模的大数据实践将被深入分享,包括大数据平台的性能调优、流式增量计算、持续发布与演进、机器学习平台打造等。

6089 0
来自: 大数据计算 MaxCompute  版块
|
自然语言处理 算法
|

交互搜索中的自然语言理解技术

交互搜索 交互搜索是一种新的产品形态,可以和用户对话,记住用户的购物需求和偏好,提供购物知识和建议。在搜索页面下拉就可以进入了,类似于微信的小程序的进入方式。 自然语言理解 对话和搜索的最大区别就是对话是多轮的,而搜索是单轮的。

6716 0
来自: 智能搜索推荐  版块
|
分布式计算 监控 数据可视化
|

美甲帮:玩转指甲上的大数据平台

美甲帮APP目前有几百万的用户,然而不同用户喜好和动机不同,譬如是想提升美甲技艺,还是想通过美甲图片选款,或者是想在商城里购买美甲产品,如何挖掘用户需求并以此进行精准化营销或个性化推荐,提升客户体验同时又可以增加收入,这些都是美甲帮最关注的问题。

6644 0
来自: 大数据计算 MaxCompute  版块
|
编解码
|

【云上ELK系列】Logstash迁移Elasticsearch数据方法解读

用Logstash实现Elasticsearch集群快速迁移,解读Logstash中metadata的功效,避免踩坑

7517 0
|
机器学习/深度学习
|

【X-Pack解读】阿里云Elasticsearch X-Pack 机器学习组件功能详解

阿里云Elasticsearch集成了Elastic Stack商业版的X-Pack组件包,包括安全、告警、监控、报表生成、图分析、机器学习等组件,用户可以开箱即用。本文将对X-Pack 的机器学习功能进行详细解读。

7583 0
|
资源调度 分布式计算 Hadoop
|

E-MapReduce集群搭建HAWQ实践

HAWQ是一种基于HDFS的MPP(Massively Parallel Processing) SQL引擎,支持标准SQL/事务处理,性能比原生Hive快几百倍。本文介绍在E-MapReduce集群上面如何搭建HAWQ。

6084 0
|
SQL 资源调度 测试技术
|

YARN ResourceManager重启作业保留机制

YARN可以通过相关配置支持ResourceManager重启过程中,不影响正在运行的作业,即重启后,作业还能正常继续运行直到结束

8271 0
|
大数据
|

DT时代已经悄然来临,IT人您跟上了吗?

什么是DT时代?         在2015年中国(深圳)IT领袖峰会上,马云发表演讲:过去7年我们从互联网创业到互联网产业,很快进入互联网经济,而且正在从IT走向DT时代,也许昨天称为IT领袖峰会,未来要称DT领袖峰会,DT不仅仅是技术提升,而是思想观念的提升。

6402 0
来自: 大数据计算 MaxCompute  版块
|
人工智能 监控 算法
|

阿里小二的日常工作要被TA们“接管”了!

昨天有人偷偷告诉我说    阿里巴巴其实是一家科技公司! 我想了整整一夜 究竟是谁走漏了风声 那么重点来了,阿里到底是如何在内部的办公、生活中,玩转“黑科技”的呢? AI取名:给你专属的“武侠”花名 花名是阿里巴巴独特的文化,也是阿里员工独一无二的“身份”。

6815 0
来自: 大数据计算 MaxCompute  版块
|
SQL 存储 消息中间件
|

Flink SQL 功能解密系列 —— 阿里云流计算/Blink支持的connectors

Connector 是连接外部数据和blink计算框架的桥梁,也是流计算的入口和出口。目前,blink支持了集团内部绝大多数的上下游(如下图),详细的接入方法可以见官方文档,本文主要阐述connector设计和使用上需要注意的问题。

7961 1
来自: 实时计算 Flink  版块
|
资源调度 算法 大数据
|

【大数据技术干货】阿里云伏羲(fuxi)调度器FuxiMaster功能简介(二) 调度模型

转载自xingbao各位好,这是介绍阿里云伏羲(fuxi)调度器系列文章的第二篇,今天主要介绍调度模型和FIFO\FAIR调度策略 一、FuxiMaster简介 FuxiMaster和Yarn非常相似,定位于分布式系统中资源管理与分配的角色:一个典型的资源分配流程图如下所示: 作为调度器,目前F

7344 0
来自: 大数据计算 MaxCompute  版块
|
分布式计算 大数据 MaxCompute
|

MaxCompute Studio使用心得系列1——本地数据上传下载

通过MaxCompute Studio工具界面,轻松完成tunnel命令能完成的本地数据导入导出工作。打破大数据开发套件中本地数据文件导入10M的限制,和打破下载只能下载查询结果最多10000行的限制。

6522 0
来自: 大数据计算 MaxCompute  版块
|
机器学习/深度学习 算法 BI
|

AQN:一种通过交替量化对深度学习模型压缩以及加速推理的方法

本文提供了一种对深度学习模型量化压缩以及加速推理的方法

7561 0
来自: 智能搜索推荐  版块
|
分布式计算 数据可视化 MaxCompute
|

MaxCompute Studio使用心得系列4——可视化查看所有job并分析运行情况

“通过`show p -all;`命令查看所有执行过的job,再通过`wait instanceid;`查看这个job的logview,最后通过logview再查看具体的执行日志。” 这样的方式查看所有job并分析运行情况实在太麻烦,MaxCompute Studio已经可以轻松完成了。

6171 0
来自: 大数据计算 MaxCompute  版块
|
分布式计算 MaxCompute
|

如何理解maxcompute常见报错信息?【阿里云MVP月度分享】

貌似大部分人在遇到报错的时候,都懒得用翻译软件翻译报错信息,一般直接抛出来问,甚至连报错信息都懒得复制,直接截图出来。所以这里特地总结了一下,最近一段时间有人经常在群里问到的报错信息。 ODPS-0130252:Cartesian product is not allowed “不允许笛卡尔积”主要是为了防止用户误操作,不小心漏了关联条件,造成大量的资源的耗费。

10264 0
来自: 大数据计算 MaxCompute  版块
|
存储 分布式计算 算法
|

基于MaxCompute的媒体大数据开放平台建设

摘要:随着自媒体的发展,传统媒体面临着巨大的压力和挑战,新华智云运用大数据和人工智能技术,致力于为媒体行业赋能。通过媒体大数据开放平台,将媒体行业全网数据汇总起来,借助平台数据处理能力和算法能力,将有价值数据内容和能力开放给用户。

6147 0
来自: 大数据计算 MaxCompute  版块
|
安全 API 索引
|

【X-Pack解读】阿里云Elasticsearch X-Pack Graph组件功能详解

阿里云Elasticsearch集成了Elastic Stack商业版的X-Pack组件包,包括安全、告警、监控、报表生成、图分析、机器学习等组件,用户可以开箱即用。本文将对X-Pack 的Graph组件功能进行详细解读。

7416 0
|
SQL 分布式计算 资源调度
|

阿里云大数据MaxCompute计算资源分布以及LogView分析优化

MaxCompute(原ODPS)的概念 海量数据处理平台,服务于批量结构化数据的存储和计算,提供海量数据仓库的解决方案以及针对大数据的分析建模服务.(官方文档有这里就不多做介绍了)官方文档链接 优势 用户不必关心分布式计算细节,从而达到分析大数据的目的。

7095 0
来自: 大数据计算 MaxCompute  版块
|
SQL 存储 分布式计算
|

三分钟教你学会分析MaxCompute消费明细

很多用户经常被MaxCompute收费所困扰,比如执行了一条 select xxx from yyy 然后扣费1元 ,不知道如何查询到明细,也无法做优化。 接下来,我来教大家学习如何通过控制台消费功能查看你在MaxCompute(DataWorks/Studio)中的每一条SQL/MR计算、存储、下载的消费明细。

7479 110
来自: 大数据计算 MaxCompute  版块
|
机器学习/深度学习 新零售 人工智能
|

阿里推荐与搜索引擎 - AI·OS综述

AI·OS(Online Serving),大数据深度学习在线服务体系,由我们工程、算法、效率的同事们砥砺十年而成,支撑起海内外阿里电商全部的搜索和推荐业务,时刻置身大数据主战场,引导成交占据集团大盘主体;此外,作为中台技术中坚,AI·OS已是包括电商、阿里云、优酷、菜鸟、盒马、钉钉等等在内全集团的基础设施;更为重要的是,AI·OS体系的云产品矩阵服务于全球开发者,今年预期在数千万级的营收规模。

12760 0
来自: 智能搜索推荐  版块
|
搜索推荐 大数据 API
|

OpenSearch:轻松构建大数据搜索服务

如何从海量的历史、实时数据中快速获取有用信息,令搜索变得越来越具挑战性。OpenSearch是阿里云推出的一款云搜索服务,本文将介绍OpenSearch的发展历程、基本功能、以及实现原理和架构,以实际应用场景为例讲述应用实践过程。

9349 0
来自: 大数据计算 MaxCompute  版块
|
资源调度 算法 应用服务中间件
|

阿里巴巴搜索无状态服务的秒级弹性调度

目前阿里巴巴搜索的分布式服务一般都是基于Hippo+Carbon来调度的,包括部署、扩缩容、名字服务注册。如下图: ![carbon-hippo.png](https://private-alipayobjects.

6657 0
来自: 智能搜索推荐  版块
|
流计算 网络协议 Apache
|

咱们从头到尾讲一次 Flink 网络流控和反压剖析

文章将从网络流控的概念与背景、TCP的流控机制、Flink TCP-based 反压机制(before V1.5)、Flink Credit-based 反压机制 (since V1.5)、总结与思考等几个方面进行分享。

7033 1
来自: 实时计算 Flink  版块
|
分布式计算 大数据 API
|

R语言和大数据

分布式的R

6056 0
来自: 大数据计算 MaxCompute  版块
|
算法 大数据 BI
|

大数据打造你的变美频道——数加平台上小红唇的大数据实践

在2017在线峰会——票选最美云上大数据暨大数据技术峰会上,来自小红唇的王洋分享了数加平台上小红唇的大数据实践。他对数据仓储解决方案和搜索引擎进行了详细介绍。通过算法平台应用的基于视频元信息的回归、近义词、业务总线三个案例具体介绍了数加平台的大数据应用实践。

6229 0
来自: 大数据计算 MaxCompute  版块
|
存储 关系型数据库 监控
|

释放存储与计算压力,MySQL用户升级到EB级数据仓库MaxCompute攻略

在过去三年里产生的数据量比以往四万年的数据量还要大。大数据可以来自方方面面,从日常生活购物到社交网络,从地理位置定位到在线视频都会有大量的数据。云计算的蓬勃发展,进一步催生了大数据的价值。廉价的存储和计算,高效的海量数据处理,我们已经进入了“大数据时代”。

5621 0
来自: 大数据计算 MaxCompute  版块
|
机器学习/深度学习 人工智能 分布式计算
|

微信“小程序" 未完, 数据的"小程序" 又来了

微信小程序是一种不需要下载安装即可使用的应用,它实现了应用“触手可及”的梦想,用户扫一扫或者搜一下即可打开应用。也体现了“用完即走”的理念,用户不用关心是否安装太多应用的问题。应用将无处不在,随时可用,但又无需安装卸载,非常方便。   在DT时代,数据人的小程序在哪里,今天我们介绍阿里云数加的数

5657 0
来自: 大数据计算 MaxCompute  版块
|
分布式计算 流计算 Spark
|

[译]利用贝叶斯推理做硬件故障率的准实时预测

你可能已经不知不觉中在数据科学项中用上了贝叶斯相关技术!如果你还没用上,这个技术可以增强你的数据分析能力。本文会展示这项技术在现实世界中的应用案例:通过传感器收集的流式数据预测硬件故障率。

5970 0
|
机器学习/深度学习 分布式计算 安全
|

基于阿里云 MaxCompute 构建企业云数据仓库CDW的最佳实践建议

通过我们背后的指导思想和我们给出的技术解决方案,希望与大家能够一起探索一些新的基于云上的数据仓库构建的最佳实践,从而尽量避免走弯路。这就是我今天想跟大家分享的内容与目的。

6040 0
来自: 大数据计算 MaxCompute  版块
|
机器学习/深度学习 消息中间件 存储
|

携程实时智能检测平台建设实践

rophet基本覆盖了携程所有业务线,监控指标的数量达到10K+,覆盖了携程所有订单、支付等重要的业务指标。Prophet将时间序列的数据作为数据输入,以监控平台作为接入对象,以智能告警实现异常的告警功能,并基于Flink实时计算引擎来实现异常的实时预警,提供一站式异常检测解决方案。

6485 0
来自: 实时计算 Flink  版块
|
SQL 存储 分布式计算
|

阿里云 MaxCompute 2020-2 月刊

MaxCompute2020年2月刊为您带来Python UDF 支持Python 3 ,MaxCompute存储格式全面升级AliORC等九项最新发布功能。欢迎阅读。

5524 0
来自: 大数据计算 MaxCompute  版块
|
大数据 数据中心 云计算
|

Gartner公布2017年全球云计算魔力象限:阿里云进入前四

据媒体报道,6月16日,国际知名调研机构Gartner公布了2017年全球云计算IaaS魔力象限,阿里云强势崛起成为这一核心领域的前四名。这也是中国云计算厂商首次进入Gartner的IaaS魔力象限。

5626 0
来自: 大数据计算 MaxCompute  版块

大数据与机器学习

大数据领域前沿技术分享与交流,这里不止有技术干货、学习心得、企业实践、社区活动,还有未来。

2
今日
70368
内容
128
活动
440234
关注
你好!
登录掌握更多精彩内容

活跃用户

相关产品

  • 大数据开发治理平台 DataWorks
  • 检索分析服务 Elasticsearch版
  • 日志服务