开发者社区 > 大数据与机器学习 > 开源大数据平台 E-MapReduce > 正文

Data Lake Delta 不同点有什么?

Data Lake Delta 不同点有什么? 求大佬解答

展开
收起
爱吃鱼的程序员 2020-12-28 11:24:00 911 0
1 条回答
写回答
取消 提交回答
  • https://developer.aliyun.com/profile/5yerqm5bn5yqg?spm=a2c6h.12873639.0.0.6eae304abcjaIB

    Delta的定位是流批一体的DataLake存储层,支持update/delete/merge。由于出自Databricks,spark的所有数据写入方式,包括基于dataframe的批式、流式,以及SQL的Insert、InsertOverwrite等都是支持的(开源的SQL写暂不支持,EMR做了支持)。与Iceberg类似,Delta不强调主键,因此其update/delete/merge的实现均是基于spark的join功能。在数据写入方面,Delta与Spark是强绑定的,这一点Hudi是不同的:Hudi的数据写入不绑定Spark(可以用Spark,也可以使用Hudi自己的写入工具写入)。

    2020-12-28 12:00:14
    赞同 展开评论 打赏

阿里云EMR是云原生开源大数据平台,为客户提供简单易集成的Hadoop、Hive、Spark、Flink、Presto、ClickHouse、StarRocks、Delta、Hudi等开源大数据计算和存储引擎,计算资源可以根据业务的需要调整。EMR可以部署在阿里云公有云的ECS和ACK平台。

相关电子书

更多
Blink_Data_Lake 立即下载
MODERNISE YOUR EDW – DATA LAKE 立即下载
Scaling 30 TB’s of Data Lake with Apache HBase and Scala DSL at Production 立即下载