精彩回顾 | 大数据+AI Meetup 2020 第二季 ·上海站(附PPT下载)

本文涉及的产品
EMR Serverless StarRocks,5000CU*H 48000GB*H
简介: 开源届前浪后浪全员凶猛,合体也成为主流。此次 Meetup 分享了 Flink 和 Iceberg,Flink 和 Hologres,Flink 和 Pulsar 的深度融合探索实践、Spark 高性能向量化查询引擎解析、热度冲天的数据湖存储架构选型、bilibili 和滴滴的 kafka 平台优化方案;还 有Elasticsearch、开源流式存储系统 Pravega 的企业级实践。

11月1日,大数据+AI Meetup 第二季·上海站成功举办!来自阿里巴巴、DellEMC、Databricks、滴滴、bilibili、StreamNative、上海力萌的9位技术专家齐聚魔都,集中解读上半年大数据的热门话题。

开源届前浪后浪全员凶猛,合体也成为主流。此次 Meetup 干货满满,不仅分享了 Flink和Iceberg,Flink和 Hologres,Flink和Pulsar的深度融合的探索实践、Spark高性能向量化查询引擎解析,还有热度冲天的数据湖存储架构选型、bilibili 和滴滴的kafka平台优化方案;以及Elasticsearch、开源流式存储系统 Pravega 的企业级实践。

IMG_6531.JPG

9大主题 PPT 合集免费下载

微信扫描下方二维码,后台发送关键字【1101上海站】即可下载大数据+AI Meetup 上海站9位嘉宾分享的ppt合集~

公众号.jpg

直播精彩回顾:
https://developer.aliyun.com/live/245461

议题精彩回顾

《更低延时和更高吞吐量的流存储, Pravega性能详解》

嘉宾简介:雷璐,DellEMC, Senior Principal Engineer, 在分布式对象存储和流存储产品上有着10年+设计架构经验。现主要专注于流式系统上数据全文检索方向-Pravega Search.

演讲简介:

流式系统要求在只追加(Append-Only)数据结构之上实现高效的读写访问以及较低的端到端延迟。随着流式数据容量的不断增长,流式系统面临的挑战也越来越大,不仅要能够以低延迟处理工作负载,还要以高吞吐量容纳大容量数据。Pravega作为开源流式存储系统,不仅实现了读写路径的低延迟和高吞吐,同时还可以达到弹性、持久性和一致性的要求。更重要是,今天公用云提供的标准硬件让不同开源产品之间的性能对比变的透明和公平。本次分享中,雷璐老师选取了流系统几个标准场景去比较Pravega, Kafka, and Pulsar性能,并详细分享了所有技术细节。

《Kafka practice at bilibili》

嘉宾简介:张辰安,bilibili 资深开发工程师

演讲简介:

张老师本次分享了 Kafka 在 bilibili 的实践。从kafka在b站的规模,架构着手,介绍了在大流量下 kafka 的痛点及解决方案,如:如何解决写入抖动问题、为何需要修改kafka限流功能、kafka在多盘上的问题及解决方案、物理隔离任务优先级的方案等。

《数据湖存储架构选型》

嘉宾简介:郑锴,花名铁杰,阿里巴巴高级技术专家,Apache Hadoop PMC。深耕分布式系统开发和开源大数据多年,目前专注于在阿里云上研发业界领先的 Hadoop/Spark 大数据平台和数据湖解决方案产品。

演讲简介:

数据湖技术在大数据领域炙手可热,随着在云上的广泛部署和应用,其业务价值逐渐获得业界共识。传统的大数据平台如何基于数据湖架构进行平台升级,享受新一轮的技术发展红利?郑老师着重跟大家分享了数据湖架构和应用在存储上面临的主要挑战,以及方案选型和最佳实践。

《Flink + Hologres 云原生实时数仓最佳实践》

嘉宾简介:刘一鸣,花名合一, 阿里云高级产品专家,主要负责Hologres产品的演进和商业化。在大数据、数据仓库、开源软件行业有10年以上工作经验,Apache Kylin PMC & Committer。

演讲简介:

Hologres是基于云原生能力设计的,支持高吞吐数据实时写入、实时分析的分布式数据仓库产品,与Flink的实时加工能力相结合,满足实时数仓的建设、运维需求。此次分享,刘老师介绍了Hologres设计理念和架构体系,解析了大数据是如何支持分析服务一体化的,并重点分享了实时数仓建设实践案例。

《万亿级消息队列Kafka在滴滴的实践》

嘉宾简介:张亮,滴滴大数据架构部,高级技术专家, 2014年加入滴滴,主持构建过任务调度系统、监控系统、日志服务、实时计算、同步中心等平台设计与研发工作,目前在负责LogAgent、Kafka 、ElasticSearch、OLAP的引擎建设工作,具有丰富的高并发、高吞吐场景的架构设计与研发经验。

演讲简介:

Kafka作为滴滴大数据消息队列,每天承载万亿级消息的生产与消费,面对60GB/S峰值流量,在集群稳定性,运维友好性上遇到了很大的挑战,在本次演讲中,张亮老师分享了滴滴在Kafka高可用建设上在架构与引擎上的针对性优化;在Kafka可观察性与运维友好性上在Kafka云平台的建设实践。

《基于spark的高性能向量化查询引擎》

嘉宾简介:范文臣,Databricks 开源组技术主管,Apache Spark Committer、PMC成员,Spark开源社区核心开发之一。

演讲简介:

随着IO硬件性能的不断提升,越来越多的查询引擎针对CPU进行优化。本次演讲中,范老师跟大家分享了Databricks在构建向量化查询引擎过程中的一些实践经验。

《Apache Pulsar + Flink:统一批流处理最佳实践》

嘉宾简介:赵建云,StreamNative 工程师,Apache Pulsar Contributor

演讲简介:Apache Flink 是一个框架和分布式处理引擎,用于在无边界和有边界数据流上进行有状态的计算。尽管 Apache Flink 支持统一的批处理和流计算,但大多数流式存储系统均不支持它。 Apache Pulsar 的独特设计与当前正在开发的一些新功能相结合,解决了这个问题。在本演讲中,赵老师介绍了批流融合带来的新特性,例如并行批处理读取使用批处理工作负载、Key_Shared订阅等,并分享了批流融合处理的最佳实践案例。

《Elasticsearch 大数据应用能力探查》

嘉宾简介:李猛,上海力萌信息科技有限公司 数据技术专家。Elastic Stack深度用户,Elastic官方认证工程师,国内首批21人通过者之一。2012年接触Elasticsearch,对Elastic Stack技术栈开发、架构、运维、源码、算法等方面有深入体验,实践过多种Elastic Stack项目,主导过数据规模PB级以上的项目,包括大数据分析领域,复杂业务系统领域,日志采集处理分析领域,系统指标监控领域等。业余为企业和个人提供Elastic Stack咨询培训以及调优实施。

演讲简介:
1.全面介绍Elastic Stack自有大数据的处理能力、应用场景案例。
2.了解Elasticsearch与其它大数据产品混合能力、应用场景案例。

《Iceberg+Flink 应用场景深度分析》

嘉宾简介:李劲松,花名之信,阿里巴巴技术专家,Apache Flink&Iceberg Committer,长期专注于流批一体的计算与数仓架构。

演讲简介:

数据湖的概念从被提出至今热度不减,Iceberg 也是数据湖方向备受瞩目的存在。如何将数据湖与强大算力相结合是大数据领域一直在探索的主题。本次分享,Apache Flink Committer 李劲松介绍了数据湖的概念及 Iceberg 技术详情,并从如何构建数仓 Data Pipeline、数仓实时化以及如何构建CDC Pipeline三个方面跟大家分享了 Flink + Iceberg 的相关实践。


关注及了解后续大数据+AI meetup 详情,可钉钉扫码加入大数据+AI技术交流群,下一站 Meetup 去哪里?敬请期待!

大数据+ai.jpg

相关实践学习
基于MaxCompute的热门话题分析
本实验围绕社交用户发布的文章做了详尽的分析,通过分析能得到用户群体年龄分布,性别分布,地理位置分布,以及热门话题的热度。
SaaS 模式云数据仓库必修课
本课程由阿里云开发者社区和阿里云大数据团队共同出品,是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法,从场景到实践,体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库,助力开发者学习了解先进的技术栈,并能在实际业务中敏捷的进行大数据分析,赋能企业业务。 通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景,可应用MaxCompute实现数仓搭建,快速进行大数据分析。适合大数据工程师、大数据分析师 大量数据需要处理、存储和管理,需要搭建数据仓库?学它! 没有足够人员和经验来运维大数据平台,不想自建IDC买机器,需要免运维的大数据平台?会SQL就等于会大数据?学它! 想知道大数据用得对不对,想用更少的钱得到持续演进的数仓能力?获得极致弹性的计算资源和更好的性能,以及持续保护数据安全的生产环境?学它! 想要获得灵活的分析能力,快速洞察数据规律特征?想要兼得数据湖的灵活性与数据仓库的成长性?学它! 出品人:阿里云大数据产品及研发团队专家 产品 MaxCompute 官网 https://www.aliyun.com/product/odps 
相关文章
|
11天前
|
人工智能 IDE 程序员
通义灵码 2.0 AI 程序员下载安装
通义灵码2.0 AI程序员支持JetBrains IDEs、Visual Studio Code及远程开发场景,暂不支持Visual Studio。用户可通过插件市场搜索“TONGYI Lingma”安装,确保版本升级至2.0以上。安装后登录阿里云账号即可使用,个人版和企业版均免费。新手可参考官方指南进行IDE安装配置。
493 9
|
1月前
|
数据采集 人工智能 分布式计算
MaxFrame:链接大数据与AI的高效分布式计算框架深度评测与实践!
阿里云推出的MaxFrame是链接大数据与AI的分布式Python计算框架,提供类似Pandas的操作接口和分布式处理能力。本文从部署、功能验证到实际场景全面评测MaxFrame,涵盖分布式Pandas操作、大语言模型数据预处理及企业级应用。结果显示,MaxFrame在处理大规模数据时性能显著提升,代码兼容性强,适合从数据清洗到训练数据生成的全链路场景...
93 5
MaxFrame:链接大数据与AI的高效分布式计算框架深度评测与实践!
|
1月前
|
人工智能 分布式计算 DataWorks
大数据& AI 产品月刊【2024年12月】
大数据& AI 产品技术月刊【2024年12月】,涵盖本月技术速递、产品和功能发布、市场和客户应用实践等内容,帮助您快速了解阿里云大数据& AI 方面最新动态。
|
1月前
|
人工智能 分布式计算 大数据
MaxFrame 产品评测:大数据与AI融合的Python分布式计算框架
MaxFrame是阿里云MaxCompute推出的自研Python分布式计算框架,支持大规模数据处理与AI应用。它提供类似Pandas的API,简化开发流程,并兼容多种机器学习库,加速模型训练前的数据准备。MaxFrame融合大数据和AI,提升效率、促进协作、增强创新能力。尽管初次配置稍显复杂,但其强大的功能集、性能优化及开放性使其成为现代企业与研究机构的理想选择。未来有望进一步简化使用门槛并加强社区建设。
74 7
|
1月前
|
人工智能 运维 物联网
云大使 X 函数计算 FC 专属活动上线!享返佣,一键打造 AI 应用
如今,AI 技术已经成为推动业务创新和增长的重要力量。但对于许多企业和开发者来说,如何高效、便捷地部署和管理 AI 应用仍然是一个挑战。阿里云函数计算 FC 以其免运维的特点,大大降低了 AI 应用部署的复杂性。用户无需担心底层资源的管理和运维问题,可以专注于应用的创新和开发,并且用户可以通过一键部署功能,迅速将 AI 大模型部署到云端,实现快速上线和迭代。函数计算目前推出了多种规格的云资源优惠套餐,用户可以根据实际需求灵活选择。
|
29天前
|
人工智能 算法 前端开发
OmAgent:轻松构建在终端设备上运行的 AI 应用,赋能手机、穿戴设备、摄像头等多种设备
OmAgent 是 Om AI 与浙江大学联合开源的多模态语言代理框架,支持多设备连接、高效模型集成,助力开发者快速构建复杂的多模态代理应用。
189 72
OmAgent:轻松构建在终端设备上运行的 AI 应用,赋能手机、穿戴设备、摄像头等多种设备
|
14天前
|
人工智能 自然语言处理 搜索推荐
【上篇】-分两篇步骤介绍-如何用topview生成和自定义数字人-关于AI的使用和应用-如何生成数字人-优雅草卓伊凡-如何生成AI数字人
【上篇】-分两篇步骤介绍-如何用topview生成和自定义数字人-关于AI的使用和应用-如何生成数字人-优雅草卓伊凡-如何生成AI数字人
89 24
【上篇】-分两篇步骤介绍-如何用topview生成和自定义数字人-关于AI的使用和应用-如何生成数字人-优雅草卓伊凡-如何生成AI数字人
|
9天前
|
机器学习/深度学习 存储 人工智能
MNN-LLM App:在手机上离线运行大模型,阿里巴巴开源基于 MNN-LLM 框架开发的手机 AI 助手应用
MNN-LLM App 是阿里巴巴基于 MNN-LLM 框架开发的 Android 应用,支持多模态交互、多种主流模型选择、离线运行及性能优化。
762 14
MNN-LLM App:在手机上离线运行大模型,阿里巴巴开源基于 MNN-LLM 框架开发的手机 AI 助手应用
|
6天前
|
人工智能 开发框架 数据可视化
Eino:字节跳动开源基于Golang的AI应用开发框架,组件化设计助力构建AI应用
Eino 是字节跳动开源的大模型应用开发框架,帮助开发者高效构建基于大模型的 AI 应用。支持组件化设计、流式处理和可视化开发工具。
120 27
|
5天前
|
存储 人工智能 NoSQL
Airweave:快速集成应用数据打造AI知识库的开源平台,支持多源整合和自动同步数据
Airweave 是一个开源工具,能够将应用程序的数据同步到图数据库和向量数据库中,实现智能代理检索。它支持无代码集成、多租户支持和自动同步等功能。
50 14