|
流计算 资源调度 Java
|

Apache Flink 零基础入门(二):开发环境搭建和应用的配置、部署及运行

本文主要面向于初次接触 Flink、或者对 Flink 有了解但是没有实际操作过的同学。希望帮助大家更顺利地上手使用 Flink,并着手相关开发调试工作。

9295 0
来自: 实时计算 Flink  版块
|
监控 算法 测试技术
|

iGraph自动化流量预估及大规模数据智能调度

## 引言 iGraph是一个在线图存储和查询服务,从2015年年初正式上线到现在,已经平稳经历了3次双十一大促的历练。这一些长期投入让iGraph赢得了越来越多集团客户的信任,其中包括集团的核心搜索和推荐业务。

4136 0
来自: 智能搜索推荐  版块
|
分布式计算 BI 数据库
|

基于MaxCompute打造轻盈的人人车移动端数据平台

2019年1月18日,由阿里巴巴MaxCompute开发者社区和阿里云栖社区联合主办的“阿里云栖开发者沙龙大数据技术专场”走近北京联合大学,本次技术沙龙上,人人车大数据平台负责人吴水永从人人车数据平台的整体架构、如何基于阿里云打造一个轻盈的数据平台以及人人车企业基于阿里云技术开发的BI数据报表平台等三个方面进行了精彩分享。

3529 0
来自: 大数据计算 MaxCompute  版块
|
机器学习/深度学习 分布式计算 大数据
|

学者贵于行,报名参加线上大数据技术峰会的4个理由

云栖社区启动了“票选最美云上大数据”活动,为用户带来了10+行业的实际大数据应用,同时得票TOP 4的企业更将与6位阿里大数据技术大牛一起,于3月9日线上“大数据技术峰会”为大家全面解析大数据技术与应用。

3250 0
来自: 大数据计算 MaxCompute  版块
|
机器学习/深度学习 人工智能 算法
|

开源大数据周刊-第52期

利用yarn capacity scheduler在EMR集群上实现大集群的多租户的集群资源隔离和quota限制 本文结合EMR集群,讲述了如何利用yarn capacity scheduler在EMR集群上实现大集群的多租户的集群资源quota限制与管控。

3297 0
|
机器学习/深度学习 人工智能 分布式计算
|

开源大数据周刊-第22期

本周关注:大数据部门、数据科学家、机器学习发展与机遇、spark2.0 Structured Streaming、Hbase运维、Sqoop、Flink的第一本书籍。

2794 0
|
分布式计算 Cloud Native 大数据
|

从 Spark 到 Kubernetes — MaxCompute 的云原生开源生态实践之路

MaxCompute依托于阿里云的飞天基础架构,与今天业界常见的依托虚拟机技术 + 开源引擎的云原生方案有很大的不同。 随着联合计算平台的推出,MaxCompute 从可以无缝集成 Spark,到今天可以通过提供标准的 Kubernetes 拥抱更加丰富的开源生态,一直秉承“保持自研优势,拥抱开源生态”的原则,走出了一条与众不同的实践之路。

3885 0
来自: 大数据计算 MaxCompute  版块
|
人工智能 搜索推荐 异构计算
|

从HA3到AI·OS -- 全图化引擎破茧之路

9395 0
来自: 智能搜索推荐  版块
|
分布式计算 大数据 Devops
|

【直播回顾】通过MaxCompute Studio实践大数据时代的DevOps

内容简介:阿里云大数据平台 MaxCompute 系统为开发者提供全托管的、PB 级的数据仓库解决方案,MaxCompute Studio 是 MaxCompute 新推出的数据集成开发环境(IDE),为开发者提供了 数据开发调试 - 命令行工具集成 - 自助作业分析诊断 的全面解决方案。

3205 0
来自: 大数据计算 MaxCompute  版块
|
SQL
|

MaxCompute 费用暴涨之新增SQL分区裁剪失败

现象:因业务需求新增了SQL任务,这SQL扫描的表为分区表,且SQL条件里表只指定了一个分区,按指定的分区来看数据量并不大,但是SQL的费用非常高。费用比预想的结果相差几倍甚至10倍以上。 若只知道总体费用暴涨,但是没明确是什么任务暴涨,可以可以参考查看账单详情-使用记录文档,找出费用异常的记录。

4087 0
来自: 大数据计算 MaxCompute  版块

E-MapReduce集群使用Oozie工作流简单示例

本文简单介绍了,如何在E-MapReduce上提交Oozie workflow job。提供了可以直接下载运行的示例代码,欢迎使用。

3296 0
|
机器学习/深度学习 SQL 人工智能
|

阿里重磅开源全球首个批流一体机器学习平台Alink,Blink功能已全部贡献至Flink

11月28日,Flink Forward Asia 2019 在北京国家会议中心召开,阿里在会上发布Flink 1.10版本功能前瞻,同时宣布基于Flink的机器学习算法平台Alink正式开源,这也是全球首个批流一体的算法平台,旨在降低算法开发门槛,帮助开发者掌握机器学习的生命全周期。

4210 0
来自: 实时计算 Flink  版块
|
分布式计算 监控 DataWorks
|

MaxCompute/DataWorks账号权限及依赖整理-持续更新

经常有人问在MaxCompute和Dataworks中,主子账号的权限分别对应哪些操作,是否可以用子账号创建Project?是否用子账号购买资源?子账号是否可以做数据同步? 今天抽时间整理了一些用户经常遇到的MaxCompute/DataWorks权限问题,后续还会逐步更新。

3484 125
来自: 大数据计算 MaxCompute  版块
|
分布式计算 资源调度 Spark
|

Spark中的内存管理(一)

Spark应用经常遇到的问题很多都是内存问题,本文对Driver和Executor的内存管理机制进行了相关介绍。

4429 0
|
人工智能 分布式计算 大数据
|

全新一代人工智能计算引擎MaxCompute杭州开服,强化阿里云大数据能力,比肩谷歌微软

3月22日,阿里云将正式开服售卖华东1(杭州)节点的大数据计算服务MaxCompute,以进一步提升对华东区域客户服务的响应速度,推动杭州大数据、人工智能产业的加速发展。

3766 0
来自: 大数据计算 MaxCompute  版块
|
分布式计算 Spark 机器学习/深度学习
|

Apache Spark3.0什么样?一文读懂Apache Spark最新技术发展与展望

阿里巴巴高级技术专家李呈祥带来了《Apache Spark 最新技术发展和3.0+ 展望》的全面解析,为大家介绍了Spark在整体IT基础设施上云背景下的新挑战和最新技术进展,同时预测了Spark 3.0即将重磅发布的新功能。

3707 0
|
网络协议 Linux 分布式数据库
|

TCP的backlog导致的HBase超时问题排查

TCP的backlog导致的超时问题排查

3404 0
|
SQL Web App开发 分布式计算
|

阿里云MaxCompute 2018-5月刊

5月,MaxCompute提供全表扫描的设置操作,可允许或禁止全表扫描;支持OSS上的Hive文件格式;支持OSS压缩格式GZIP。。。更多新功能新体验,欢迎阅读本文了解。

3197 0
来自: 大数据计算 MaxCompute  版块
|
人工智能 分布式计算 大数据
|

阿里云MaxCompute印度开服,加速大数据产业升级

2018年1月18日,阿里云大数据计算服务MaxCompute将在印度正式开服。通过MaxCompute强大的计算能力,阿里云将加速印度大数据产业的全面升级。

3077 0
来自: 大数据计算 MaxCompute  版块
|
消息中间件 大数据 测试技术
|

如何在E-MapReduce上提交Storm作业处理Kafka数据

本文演示如何在E-MapReduce上部署Storm集群和Kafka集群,并运行Storm作业消费Kafka数据。

3092 0
|
SQL 分布式计算 MaxCompute
|

MaxCompute2.0新功能介绍

在过去的两年内,MaxCompute进行了翻天覆地的重构,从1.0版本全面升级到了2.0版本。而大家或许对于MaxCompute 2.0的一些新特性并不了解,在本文中,MaxCompute技术专家秋鹏就为大家详细介绍MaxCompute 2.0的新特性。

3500 0
来自: 大数据计算 MaxCompute  版块
|
分布式计算 大数据 MaxCompute
|

MaxCompute UDF系列之拼音转换

汉字转换拼音在日常开发中是个很常见的问题。例如我们伟大的12306,在地名中输入“WH”,就会出现“武汉”“芜湖”“威海”等地名,输入“WUHU”就会出现“芜湖”。 我们在MaxCompute开发中也会遇到此类问题,今天为大家提供一个转换的UDF,下载地址见附件。

4100 0
来自: 大数据计算 MaxCompute  版块
|
分布式计算 DataWorks 调度
|

采云间DPC迁移方案实施计划

迁移计划概述: 第一阶段:前期沟通&准备 1、 请先熟悉Dataworks的相关操作,比如节点的新增、执行、调度运维等相关操作; 2、 本次迁移只把用户在采云间里面的任务迁移到DataWorks里面,需要用户提前确认采云间用到的odps项目在DataWorks中是否已经创建且可用;如果用户

3074 0
来自: 大数据计算 MaxCompute  版块
|
机器学习/深度学习 人工智能 大数据
|

开源大数据周刊-第81期

2941 0
|
自然语言处理 索引 算法
|

OpenSearch自定义分词服务

背景 OpenSearch是一个以云服务方式提供给广大开发者使用的搜索引擎平台。在搜索引擎中,分词是最基础但很重要的功能,其效果会直接影响文档的召回。分词歧义会导致引擎无法召回目标文档。例如: 乒乓球拍卖完了 ==> 乒乓球/拍卖/完了 乒乓球拍 ==> 乒乓/球拍 在上面的case中,短语“乒乓球拍”不同的上下文中分词的结果不一样。

5130 0
来自: 智能搜索推荐  版块
|
消息中间件 弹性计算 分布式计算
|

大数据搬站step by step

IDC,ECS自建和云数据库之间的数据搬站 1 IDC -> MaxCompute / EMR **【方案】:使用“独享数据集成资源组”,绑定可以连通用户IDC的用户VPC,然后提工单,由阿里云数据集成开发人员在独享数据集成资源组上配置路由,使独享数据集成资源组可以访问IDC内数据源。

3234 0
来自: 大数据计算 MaxCompute  版块
|
大数据 云计算
|

什么是飞天?全球级大数据计算平台,自主研发!

飞天大数据平台就是数字化时代的核心技术。这是中国在新一轮科技革命中把握机遇的关键。

4036 0
来自: 大数据计算 MaxCompute  版块
|
流计算 存储 调度
|

日均处理万亿数据!Flink在快手的应用实践与技术演进之路

本次的分享包括以下三个部分: 1. 介绍 Flink 在快手的应用场景以及目前规模; 2. 介绍 Flink 在落地过程的技术演进过程; 3. 讨论 Flink 在快手的未来计划。

5412 0
来自: 实时计算 Flink  版块
|
JavaScript 大数据 Java
|

(ElasticsSearch学习)歌词检索Demo的实现:一. 爬取歌词信息,写入ES

一个ElasticSearchDemo,讲解如何使用Jsoup爬取歌词数据写入阿里云Elasticsearch,并搭建Web框架实现歌词的全文检索。

4638 0
|
分布式计算 搜索推荐 大数据
|

融合大数据能力,解决在存量时代下的力分之困

上月,有微博爆料逻辑思维计划在2018年提交IPO申请,2019年底前创业板上市。虽然很快罗振宇方面就出面否认,但从近日阿里应用分发发布的2017年Q2应用行业报告显示,5家知识付费平台同比增长率均在50%以上,目前用户已达到5000万,知识付费正处于高速增长中。

2979 0
来自: 大数据计算 MaxCompute  版块
|
存储 大数据 分布式数据库
|

开源大数据周刊-第85期

资讯 美国公布长达35页的《2016-2045年新兴科技趋势报告》, Hadoop社区最新动态

2612 0
|
弹性计算 分布式计算 大数据
|

阿里云大数据计算服务MaxCompute(原ODPS)华南1(深圳)Region即将开服!

2017年9月7日,阿里云数加·MaxCompute(原ODPS)华南1(深圳)数据中心正式开服售卖,这是数加·MaxCompute在国内开服的第二个区域。届时MaxCompute将会针对新服开展促销活动,具体活动规则敬请期待!

3124 0
来自: 大数据计算 MaxCompute  版块
|
人工智能 分布式计算 物联网
|

昨日广州云栖“大算”受追捧,今日揭秘阿里双11技术核武器MaxCompute,感恩节再放福利!(活动已结束)

MaxCompute感谢最最亲爱的客户,感谢您信任的将我选择,感谢您期待的将未来托付,更感谢您包容的与我比肩同行。感恩不应只在今天说出,而是在有你们支持走过的每一天。为亲爱的客户们奉上载满MaxCompute团队伙伴们感恩和祝福的话儿 “感恩有你,一路同行”。(文末有福利哦~)

3022 0
来自: 大数据计算 MaxCompute  版块
|
数据采集 分布式计算 监控
|

基于MaxCompute的数仓数据质量管理

数据对一个企业来说已经是一项重要的资产,既然是资产,肯定需要管理。随着业务的增加,数据的应用越来越多,企业在创建的数仓过程中对数据的管理也提出了更高的要求,而数据质量也是数仓建设过程不容忽视的环节。本文针对MaxCompute数仓建设过程中如何做数据质量给出规范建议,为实际数据治理提供依据及指导。

4352 0
来自: 大数据计算 MaxCompute  版块
|
SQL 分布式计算 资源调度
|

带你玩转Logview: MaxCompute Logview参数详解和问题排查

对于Logview上的诸多参数信息,究竟应该怎么“拨开云雾”,发现问题所在呢?又如何通过Logview了解每个instance、task运行状态及资源占用情况,如何分析执行计划,分析query存在问题,找到Long-Tails task,让数据分析业务高效又省钱呢?本文中,阿里巴巴计算平台产品专家云花将为大家揭晓答案。

4988 0
来自: 大数据计算 MaxCompute  版块
|
运维 数据可视化 Linux
|

借助Beats快速搭建可视化运维系统

本例实现了一个对个人PC的可视化运维dashboard。拓展至N个节点的集群也同理可以实现。对于个人或者企业而言,约等于0成本的对接,将一步迈入可视化运维监控的阶段。

4309 0
|
分布式计算 druid 对象存储
|

EMR Druid 探索(二)

EMR Druid 探索(二) EMR Druid 上文介绍了 Druid 的特点、使用场景以及性能。EMR 在 3.11.0 引入了 Druid,并专门推出了一种新的集群类型:Druid 集群。在具体使用时,Druid 集群可以与 Hadoop 集群结合,以 HDFS 集群作为 deep storage 的存储,以 YARN 作为批量索引的计算引擎。

3046 0
|
消息中间件 数据采集 分布式计算
|

在 Cloudera Data Flow 上运行你的第一个 Flink 例子

本文主要是介绍如何在 CDH6.3 中安装 Flink 1.9 以及运行你的第一个 Flink 例子。

3156 0
来自: 实时计算 Flink  版块
|
SQL 流计算
|

Blink 漫谈系列 - HelloWorld

3360 0
来自: 实时计算 Flink  版块
|
监控 安全 大数据
|

阿里云Elasticsearch11月2日正式商业化,双十一大促最低5折

阿里云Elasticsearch是阿里云和Elasticsearch开源公司Elasitc联合打造的重磅产品,经过了2个月的公测锤炼,已于11月2日正式商业化。我们决定在双十一期间(11月10日~11日)以最低5折的产品优惠回馈广大用户。

2999 0
|
大数据
|

7月21日 企业大数据平台仓库架构建设思路直播视频

想了解如何搭建一个好的数据仓库?来听听阿里云高级技术专家-李金波 有何建议?精彩不容错过哦!

2758 0
来自: 大数据计算 MaxCompute  版块
|
分布式计算 大数据 Hadoop
|

开源大数据周刊-第5期

浅谈大数据在传统行业的落地之痛,Spark如何简化大数据工作

2697 0
|
机器学习/深度学习 人工智能 分布式计算
|

用炸弹开路——加速到来的证券投资行业人工智能时代

去年开始涉足人工智能技术应用于证券投资领域的研究,将近两年的研究实践,发现公开资料上很多关于人工智能(AI)对证券投资业发展影响的文章都存在几个明显的思维误区:①一个是对人工智能的认识有误。人工智能是个广域笼统的概念,但基石是机器学习,以机器学习算法构建逻辑和规则为基石的人工智能与自动化程序软件及通过数据回测构建起来的以固定逻辑运行的量化投资模型是完全不同的事物,区别就好比活鸡和模型鸡,需要明白自动化软件不是人工智能,国内大多数所谓智能投顾其实还不是真正意义上的人工智能投顾;②另一个是曲解了人工智能在证券投资行业的应用。

2958 0
来自: 大数据计算 MaxCompute  版块
|
机器学习/深度学习 人工智能 算法
|

PAI智能答疑机器人上线啦

随着人工智能相关产业的持续火热,越来越多的同学开始尝试使用机器学习算法去解决问题。阿里云机器学习PAI平台作为人工智能行业的黑产物,每天都会收到用户们大量的咨询。为了更好地服务PAI平台的用户,同时也为了缓解售后同学的工作量。

3637 0
来自: 人工智能平台PAI  版块
|
机器学习/深度学习 人工智能 分布式计算
|

开源大数据周刊-第62期

2724 0
|
分布式计算 Spark 容器
|

Spark on Kubernetes原生支持浅析

概述 Kubernetes自推出以来,以其完善的集群配额、均衡、故障恢复能力,成为开源容器管理平台中的佼佼者。从设计思路上,Spark以开放Cluster Manager为理念,Kubernetes则以多语言、容器调度为卖点,二者的结合是顺理成章的。

5294 0
|
分布式计算 数据可视化 MaxCompute
|

MaxCompute Studio 2.8.1 新版本发布啦!

MaxCompute Studio 2.8.1 新版本发布,重磅介绍可视化作业自助分析等功能!

2813 0
来自: 大数据计算 MaxCompute  版块
|
消息中间件 分布式计算 监控
|

最新消息!Cloudera 全球发行版正式集成 Apache Flink

近期 Cloudera Hadoop 大神 Arun 在 Twitter 上宣布 Cloudera Data Platform 正式集成了 Flink 作为其流计算产品,Apache Flink PMC Chair Stephan 也回应:“此举意义重大。

3523 0
来自: 实时计算 Flink  版块
|
分布式计算 大数据 Hadoop
|

开源大数据周刊-第8期

阿里云李津谈布局专有云的深层用意,2016年杭州第四次spark meetup见闻

2970 0
|
新零售 分布式计算 大数据
|

双11奇迹背后的大数据平台,不喧哗,自有声!

大数据技术时代,企业争相数字化转型,任何成功项目的背后,离不开数据平台的支撑,更别说2135亿的大项目,这背后的数据平台要多健壮,多安全,多稳定?

2820 0
来自: 大数据计算 MaxCompute  版块

大数据与机器学习

大数据领域前沿技术分享与交流,这里不止有技术干货、学习心得、企业实践、社区活动,还有未来。

0
今日
70059
内容
128
活动
440145
关注
你好!
登录掌握更多精彩内容

相关产品

  • 大数据开发治理平台 DataWorks
  • 检索分析服务 Elasticsearch版
  • 日志服务