|
流计算 SQL 消息中间件
|

趣头条基于 Flink 的实时平台建设实践

本文由趣头条实时平台负责人席建刚分享趣头条实时平台的建设,整理者叶里君。文章将从平台的架构、Flink 现状,Flink 应用以及未来计划四部分分享。

4100 0
来自: 实时计算 Flink  版块
|
SQL 分布式计算 大数据
|

MaxCompute如何对SQL查询结果实现分页获取

 由于MaxCompute SQL本身不提供类似数据库的select * from table limit x offset y的分页查询逻辑。但是有很多用户希望在一定场景下能够使用获取类似数据库分页的逻辑,对查询结果进行分页/分批获取结果,本文将介绍几种方法,来实现上述场景。

6119 0
来自: 大数据计算 MaxCompute  版块
|
流计算 资源调度 Java
|

Apache Flink 零基础入门(二):开发环境搭建和应用的配置、部署及运行

本文主要面向于初次接触 Flink、或者对 Flink 有了解但是没有实际操作过的同学。希望帮助大家更顺利地上手使用 Flink,并着手相关开发调试工作。

9297 0
来自: 实时计算 Flink  版块
|
监控 算法 测试技术
|

iGraph自动化流量预估及大规模数据智能调度

## 引言 iGraph是一个在线图存储和查询服务,从2015年年初正式上线到现在,已经平稳经历了3次双十一大促的历练。这一些长期投入让iGraph赢得了越来越多集团客户的信任,其中包括集团的核心搜索和推荐业务。

4137 0
来自: 智能搜索推荐  版块
|
机器学习/深度学习 分布式计算 大数据
|

学者贵于行,报名参加线上大数据技术峰会的4个理由

云栖社区启动了“票选最美云上大数据”活动,为用户带来了10+行业的实际大数据应用,同时得票TOP 4的企业更将与6位阿里大数据技术大牛一起,于3月9日线上“大数据技术峰会”为大家全面解析大数据技术与应用。

3251 0
来自: 大数据计算 MaxCompute  版块
|
分布式计算 大数据 测试技术
|

DCA公布第七批大数据产品能力评测结果,阿里云MaxCompute超大规模集群引关注

MaxCompute(原ODPS)是一项大数据计算服务,它能提供快速、完全托管的PB级数据仓库解决方案,使您可以经济并高效的分析处理海量数据。

3643 0
来自: 大数据计算 MaxCompute  版块
|
分布式计算 Cloud Native 大数据
|

从 Spark 到 Kubernetes — MaxCompute 的云原生开源生态实践之路

MaxCompute依托于阿里云的飞天基础架构,与今天业界常见的依托虚拟机技术 + 开源引擎的云原生方案有很大的不同。 随着联合计算平台的推出,MaxCompute 从可以无缝集成 Spark,到今天可以通过提供标准的 Kubernetes 拥抱更加丰富的开源生态,一直秉承“保持自研优势,拥抱开源生态”的原则,走出了一条与众不同的实践之路。

3886 0
来自: 大数据计算 MaxCompute  版块
|
分布式计算 大数据 Devops
|

【直播回顾】通过MaxCompute Studio实践大数据时代的DevOps

内容简介:阿里云大数据平台 MaxCompute 系统为开发者提供全托管的、PB 级的数据仓库解决方案,MaxCompute Studio 是 MaxCompute 新推出的数据集成开发环境(IDE),为开发者提供了 数据开发调试 - 命令行工具集成 - 自助作业分析诊断 的全面解决方案。

3206 0
来自: 大数据计算 MaxCompute  版块
|
SQL 分布式计算 MaxCompute
|

MaxCompute SQL 2.0全新的计算引擎

本文PPT来自阿里云数据事业部专家少杰于10月15日在2016年杭州云栖大会上发表的《MaxCompute SQL 2.0全新的计算引擎》。

3198 0
来自: 大数据计算 MaxCompute  版块
|
SQL Web App开发 分布式计算
|

阿里云MaxCompute 2018-5月刊

5月,MaxCompute提供全表扫描的设置操作,可允许或禁止全表扫描;支持OSS上的Hive文件格式;支持OSS压缩格式GZIP。。。更多新功能新体验,欢迎阅读本文了解。

3198 0
来自: 大数据计算 MaxCompute  版块
|
SQL 分布式计算 MaxCompute
|

解决MaxCompute SQL count distinct多个字段的方法

按照惯性思维,统计一个字段去重后的条数我们的sql写起来如下: Distinct的作用是用于从指定集合中消除重复的元组,经常和count搭档工作,语法如下 COUNT( { [ DISTINCT ] expression ] | * } ) 这时,可能会碰到如下情况,你想统计同时有多列字段重复的数目,你可能会立马想到如下方法: select count( distinct col1 , col2 , col3 , .......) from table 但是,这样是有问题的,如果值包含空,那么我们的结果是什么呢?如果你实验过,正如你实验的一样,结果会比实际少。

6220 0
来自: 大数据计算 MaxCompute  版块
|
存储 API 调度
|

Mars 如何分布式地执行

先前,我们已经介绍过 Mars 是什么。如今 Mars 已在 Github 开源并对内上线试用,本文将介绍 Mars 已实现的分布式执行架构,欢迎大家提出意见。 架构 Mars 提供了一套分布式执行 Tensor 的库。

3749 0
来自: 大数据计算 MaxCompute  版块

心脏病预测案例

心脏病是人类健康的头号杀手。全世界1/3的人口死亡是因心脏病引起的,而我国,每年有几十万人死于心脏病。 所以,如果可以通过提取人体相关的体侧指标,通过数据挖掘的方式来分析不同特征对于心脏病的影响,对于预测和预防心脏病将起到至关重要的作用。本文将会通过真实的数据,通过阿里云机器学习平台搭建心脏病预测案例。<br />数据源:UCI<br />数据大小:7.49 KB<br />字段数量:15<br />使用组件:归一化,拆分,过滤式特征选择,SQL脚本,读数据表,类型转换<br />

3199 1
来自: 人工智能平台PAI  版块
|
分布式计算 MaxCompute 人工智能
|

爽!MaxCompute老铁们再也不用点点点了!

MaxCompute实现预付费项目自动续费。

3043 0
来自: 大数据计算 MaxCompute  版块
|
消息中间件 弹性计算 分布式计算
|

大数据搬站step by step

IDC,ECS自建和云数据库之间的数据搬站 1 IDC -> MaxCompute / EMR **【方案】:使用“独享数据集成资源组”,绑定可以连通用户IDC的用户VPC,然后提工单,由阿里云数据集成开发人员在独享数据集成资源组上配置路由,使独享数据集成资源组可以访问IDC内数据源。

3235 0
来自: 大数据计算 MaxCompute  版块
|
资源调度 网络性能优化 调度
|

阿里巴巴搜索在离线统一调度

1. 发展历程         Hippo是搜索事业部调度系统团队自研的支撑集团内外多个BU搜索与推荐体系和阿里云上Opensearch/ES等的调度系统,经过了5年的快速发展,提供了可靠、简单、低成本的资源及应用托管方案,通过自动化运维、机器合池、智能弹性调度、混部和在离线统一调度等手段解决成本和效率的问题。

5895 0
来自: 智能搜索推荐  版块
|
SQL 分布式计算 资源调度
|

带你玩转Logview: MaxCompute Logview参数详解和问题排查

对于Logview上的诸多参数信息,究竟应该怎么“拨开云雾”,发现问题所在呢?又如何通过Logview了解每个instance、task运行状态及资源占用情况,如何分析执行计划,分析query存在问题,找到Long-Tails task,让数据分析业务高效又省钱呢?本文中,阿里巴巴计算平台产品专家云花将为大家揭晓答案。

4989 0
来自: 大数据计算 MaxCompute  版块
|
分布式计算 关系型数据库 测试技术
|

DRDS到MaxCompute(原ODPS)数据归档性能优化测试

3240 0
来自: 大数据计算 MaxCompute  版块
|
分布式计算 druid 对象存储
|

EMR Druid 探索(二)

EMR Druid 探索(二) EMR Druid 上文介绍了 Druid 的特点、使用场景以及性能。EMR 在 3.11.0 引入了 Druid,并专门推出了一种新的集群类型:Druid 集群。在具体使用时,Druid 集群可以与 Hadoop 集群结合,以 HDFS 集群作为 deep storage 的存储,以 YARN 作为批量索引的计算引擎。

3047 0
|
大数据
|

7月21日 企业大数据平台仓库架构建设思路直播视频

想了解如何搭建一个好的数据仓库?来听听阿里云高级技术专家-李金波 有何建议?精彩不容错过哦!

2759 0
来自: 大数据计算 MaxCompute  版块
|
机器学习/深度学习 人工智能 分布式计算
|

开源大数据周刊-第62期

2725 0
|
分布式计算 Spark 容器
|

Spark on Kubernetes原生支持浅析

概述 Kubernetes自推出以来,以其完善的集群配额、均衡、故障恢复能力,成为开源容器管理平台中的佼佼者。从设计思路上,Spark以开放Cluster Manager为理念,Kubernetes则以多语言、容器调度为卖点,二者的结合是顺理成章的。

5295 0
|
流计算 存储 Apache
|

Apache Flink 进阶(三):Checkpoint 原理解析与应用实践

大家好,今天我将跟大家分享一下 Flink 里面的 Checkpoint,共分为四个部分。首先讲一下 Checkpoint 与 state 的关系,然后介绍什么是 state,第三部分介绍如何在 Flink 中使用state,第四部分则介绍 Checkpoint 的执行机制。

10585 2
来自: 实时计算 Flink  版块
|
新零售 分布式计算 大数据
|

双11奇迹背后的大数据平台,不喧哗,自有声!

大数据技术时代,企业争相数字化转型,任何成功项目的背后,离不开数据平台的支撑,更别说2135亿的大项目,这背后的数据平台要多健壮,多安全,多稳定?

2822 0
来自: 大数据计算 MaxCompute  版块
|
存储 机器学习/深度学习 运维
|

Ververica Platform-阿里巴巴全新Flink企业版揭秘

本文主要从Ververica由来开始谈起,着重讲了Ververica Platform的四个核心插件App Manager、Libra Service、Stream Ledger、Gemini,以及阿里巴巴实时计算云原生版本相关特性及典型应用场景。

7406 1
来自: 实时计算 Flink  版块
|
SQL 存储 大数据
|

大数据列式存储 Parquet 和 ORC 简介

随着大数据 Hadoop/Spark 开源生态的不断发展和成熟,TextFile、CSV这些文本格式存储效率低,查询速度慢,往往不能很好地满足大数据系统中存储和查询的需求,列式存储也在大数据社区逐渐兴起到成熟。

6446 0
|
存储 分布式计算 大数据
|

MaxCompute,基于Serverless的高可靠大数据服务

2019年1月18日,由阿里巴巴MaxCompute开发者社区和阿里云栖社区联合主办的“阿里云栖开发者沙龙大数据技术专场”走近北京联合大学,本次技术沙龙上,阿里巴巴高级技术专家吴永明为大家分享了MaxCompute,基于Serverless的高可用大数据服务,以及MaxCompute低计算成本背后的秘密。

3897 0
来自: 大数据计算 MaxCompute  版块
|
SQL 分布式计算 DataWorks
|

MaxCompute安全管理指南-案例篇

通过《MaxCompute安全管理-基础篇》了解到MaxCompute和DataWorks的相关安全模型、两个产品安全方面的关联,以及各种安全操作后,本篇主要给出一些安全管理案例,给安全管理的成员作为参考。

2846 0
来自: 大数据计算 MaxCompute  版块
|
分布式计算 Java MaxCompute
|

MaxCompute_SDK_开发指南

方便和辅助 MaxCompute 开发人员使用 Java / Python SDK 方式进行日常代码的开发工作。

5028 0
来自: 大数据计算 MaxCompute  版块
|
机器学习/深度学习 人工智能 安全
|

开源大数据周刊-第79期

资讯 警惕大数据成了互联网的“PX项目” 新年伊始 BAT 三家关于数据安全的新闻就成功的吸引了公众的目光,也引发了公众对于大公司收集并使用用户数据的担忧。这篇文章比较客观的分析了公众的忧虑,以及互联网公司如何使用这些数据,可以说是一个很好数据安全的科普。

2398 0
|
存储 分布式计算 Apache
|

7月24日晚Spark社区直播:【Apache Spark 基于 Apache Arrow 的列式存储优化】

Apache Arrow 是一个基于内存的列式存储标准,旨在解决数据交换和传输过程中,序列化和反序列化带来的开销。目前,Apache Spark 社区的一些重要优化都在围绕 Apache Arrow 展开,本次分享会介绍 Apache Arrow 并分析通过 Arrow 将给 Spark 带来哪些特性。

2763 0
|
大数据 流计算
|

Flink China 社区运营成果报告(7月-9月)

为进一步提升Apache Flink在国内的技术影响力,实时计算组运营团队在过去两个月的时间里,对Flink China社区持续进行品牌包装与推广,现将运营效果通过生态建设 / 活动运营 / 问卷调研 / 社区共建 / 内容输出 / 运营计划 六个方面展示。

2941 0
来自: 实时计算 Flink  版块
|
分布式计算 算法 搜索推荐
|

Spark排序算法系列之GBTs使用方式介绍

在本篇文章中你可以学到: Spark MLLib包中的GBDT使用方式 模型的通过保存、加载、预测 PipeLine ML包中的GBDT

3203 0
|
SQL 分布式计算 流计算
|

通过WebUI查看Structured Streaming作业统计信息

前言 从EMR-3.18.1版本开始,EMR将提供Spark Streaming SQL预览版功能。本次作为新特性的一部分,EMR将扩展现有Spark WebUI,支持Structured Streaming Query的统计信息查看。

2747 0
|
SQL 分布式计算 大数据
|

MaxCompute全表扫描新功能,给你“失误”的机会

MaxCompute提供了在不修改代码的前提下,在MapReduce或自定义函数(UDF) 代码中,通过某个固定的资源名读取不同资源(数据)的需求。

2894 0
来自: 大数据计算 MaxCompute  版块
|
机器学习/深度学习 分布式计算 大数据
|

开源大数据周刊-第57期

ECM功能上线北京region,用户可以通过EMR-3.2.0版本创建新集群体验,ECM提供组件的配置修改/起停等操作

2444 0
|
分布式计算 Spark SQL
|

【译】Delta Lake 0.4.0 新特性演示:使用 Python API 就地转换与处理 Delta Lake 表

本文以案例演示在最新的 Delta Lake 0.4.0 中,如何转换 Delta Lake 表,使用全新的 Python API 执行 upsert 与删除数据,用时间旅行 (time travel) 查询数据的旧版本,以及 vacuum 语句清理旧版本。

3220 0
|
分布式计算 大数据 TensorFlow
|

开源大数据周刊-第68期

资讯: 2020年我国大数据产业将破万亿 近日,《2017中国大数据产业发展白皮书》发布。《每日经济新闻》记者对照工信部及各地出台的大数据发展规划进行梳理后发现,到2020年,我国大数据相关产品和服务业务收入将突破1万亿元,年均复合增长率保持30%左右。

2542 0
|
分布式计算 DataWorks TensorFlow
|

MaxCompute Mars 完全指南

Mars 能利用并行和分布式技术,加速 Python 数据科学栈,包括 numpy、pandas 和 scikit-learn。同时,也能轻松与 TensorFlow、PyTorch 和 XGBoost 集成。

4682 0
来自: 大数据计算 MaxCompute  版块
|
SQL 机器学习/深度学习 运维
|

必看!Apache Flink 运维&实战系列直播,揭秘生产环境技术难点

随着 Flink 社区的快速发展,其技术也逐渐走向成熟。在 2019 年,国内已经有大量的本土互联网公司开始采用 Apache Flink 作为主流的实时计算解决方案。同时,在全球范围内,优步、网飞、微软和亚马逊等国际互联网公司也逐渐开始使用 Apache Flink。

4552 0
来自: 实时计算 Flink  版块
|
监控 算法 大数据
|

【阿里内部应用】基于Blink构建搜索全链路debug系统快速定位搜索问题

一、背景介绍 以往在处理用户投诉或者开发过程中遇到的(特定商品在淘宝搜索中搜不到,排序靠后,价格不正确,打标不准,结果不准确等)问题或线上故障时,分析定位此类问题的过程非常繁琐: 根据用户或者搜索标识提交ODPS离线任务,捞取用户的搜索日志信息; 人工构造搜索串,重新请求引擎得到搜索复现数据; 解.

4313 0
来自: 实时计算 Flink  版块
|
算法
|

ALS算法实现用户音乐打分预测

很多人在决定是否看一部电影之前都会去豆瓣看下评分作为参考,看完电影也会给一个自己的分数。每个人对每个商品或者电影或是音乐都有一个心理的分数,这个分数标明用户是否对这个内容满意。作为内容的提供方,如果可以预测出每个用户对于内容的心理分数,就能更好的理解用户,并给用户提供好的内容推荐。

4185 2
来自: 人工智能平台PAI  版块
|
流计算 Apache 大数据
|

首届!Apache Flink 极客挑战赛强势来袭,重磅奖项等你拿,快来组队报名啦

首届 Apache Flink 极客挑战赛发布,聚焦机器学习与计算性能两大热门赛题,提供 Apache Flink 强大的大数据计算平台与 Intel Analytics Zoo 深度学习计算平台,帮助参赛队伍实现机器学习的实践应用,完成计算性能的优化挑战。

2741 0
来自: 实时计算 Flink  版块
|
SQL 分布式计算 Scala
|

[转载] 是时候学习真正的 spark 技术了

spark sql 可以说是 spark 中的精华部分了,我感觉整体复杂度是 spark streaming 的 5 倍以上,现在 spark 官方主推 structed streaming, spark streaming 维护的也不积极了, 我们基于 spark 来构建大数据计算任务,重心也要...

2893 0
|
SQL 分布式计算 大数据
|

MaxCompute_SQL_开发指南

背景及目的 本文结果都是在SQL标准语义模式下的推导结果,希望大家都能够按照标准的SQL语义来写SQL,这样才能保证后续SQL的可移植性。 SQL概述 MaxCompute SQL适用于海量数据(GB、TB、EB级别),离线批量计算的场合。

4240 1
来自: 大数据计算 MaxCompute  版块
|
存储 消息中间件 人工智能
|

开源大数据周刊-第51期

2417 0
|
算法 搜索推荐 Python
|

Graphical Model在收藏夹作弊行为识别上的应用

Graphical Model通常应用在问题本身带有多个相互联系的变量的场景,并提供了一种基于图的表达方式让你去建模这些联系从而挖掘潜在的因果关系。在本文中,我们创新性地将概率图模型应用到了淘宝平台收藏作弊行为检测的任务中,取得了远超传统分类模型的结果(Top1%记录中召回60%的作弊行为)。

2823 0
来自: 智能搜索推荐  版块
|
流计算 Apache SQL
|

Flink 实战:如何解决生产环境中的技术难题?

Apache Flink 作为业界公认为最好的流计算引擎,不仅仅局限于做流处理,而是一套兼具流、批、机器学习等多种计算功能的大数据引擎,以其高吞吐低延时的优异实时计算能力、支持海量数据的亚秒级快速响应帮助企业和开发者实现数据算力升级,并成为阿里、腾讯、滴滴、美团、字节跳动、Netflix、Lyft 等国内外知名公司建设实时计算平台的首选。

3590 0
来自: 实时计算 Flink  版块
|
SQL Apache 算法框架/工具
|

回顾 | Apache Flink Meetup ·上海站(附PPT下载链接)

9 月 7 日,Apache Flink Meetup 上海站,上海的同学再次演绎了站无虚席的爆满场面。现场来自阿里巴巴、intel、趣头条的技术专家们分享了 Zeppelin 中玩转 Flink 与 Hive、趣头条的应用实践、Flink 性能优化、TensorFlow 与 Flink 的应用实践等众多干货内容,并有 Demo 演示环节。

3241 0
来自: 实时计算 Flink  版块

大数据与机器学习

大数据领域前沿技术分享与交流,这里不止有技术干货、学习心得、企业实践、社区活动,还有未来。

0
今日
70059
内容
128
活动
440146
关注
你好!
登录掌握更多精彩内容

相关产品

  • 大数据开发治理平台 DataWorks
  • 检索分析服务 Elasticsearch版
  • 日志服务