开源大数据周刊-第99期-阿里云开发者社区

开发者社区> 阿里云EMR> 正文
登录阅读全文

开源大数据周刊-第99期

简介: 资讯 谷歌重磅开源强化学习框架Dopamine谷歌推出了一款全新的开源强化学习框架 Dopamine,该框架基于 TensorFlow,主打灵活性、稳定性、复现性,能够提供快速的基准测试。 整合AI和数据科学新利器:基于Apache Spark的Hydrogen项目以往数据集的准备以及模型的训练工作是分开的,这两部分工作相当于存在两套系统中。

资讯

技术

  • 为什么已有Kafka,我们最终却选择了Apache Pulsar?
    本文主要介绍了一家商业公司在使用 Kafka 作为事件总线时遇到的问题,主要是性能、可扩展性以及一些技术性限制。比如 Kafka Broker 是绑定存储状态的,扩展或缩小 Kafka 集群需要重新平衡分区,而 Pulsar Broker 是无状态的,真正的做到了计算和存储分离。Pulsar 还有一些其他的优点。这篇文章可以说是消息系统选型的一个良好案例。
  • 先过滤后解析:斯坦福开源数据解析引擎Sparser,解析提速22倍
    很多大型数据应用程序通常在非结构化或半结构化的原始数据格式(如 JSON)上运行。查询这些文件常常是非常耗时的,尤其是那些探索性应用程序,数据科学家用来运行查询以探索及更好地理解其数据。令人惊讶的是,这些应用程序实际上有 80%-90% 的执行时间是用于解析数据,而不是用于评估实际查询本身。因此,解析实际上才是瓶颈。这篇文章介绍了介绍 Sparser,一个来自斯坦福 DAWN 团队的一个研究项目,该项目解决了这个性能瓶颈。
  • Apache Flink状态管理和容错机制介绍
    本文详细介绍了Flink的状态管理和容错机制,内容包括有状态的流数据处理、Flink中的状态接口、状态管理和容错机制实现等。
  • Apache HBase中等对象存储MOB压缩分区策略介绍
    Apache HBase 中等对象存储(Medium Object Storage, 下面简称 MOB)的特性是由 HBASE-11339 引入的。该功能可以提高 HBase 对中等尺寸文件的低延迟读写访问(理想情况下,文件大小为 100K 到 10MB),这个功能使得 HBase 非常适合存储文档,图片和其他中等尺寸的对象。本文对这一特性进行了详细的介绍。

版权声明:本文内容由阿里云实名注册用户自发贡献,版权归原作者所有,阿里云开发者社区不拥有其著作权,亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容,填写侵权投诉表单进行举报,一经查实,本社区将立刻删除涉嫌侵权内容。

分享:
+ 订阅

阿里巴巴开源大数据技术团队成立阿里云EMR技术圈, 每周推送前沿技术文章,直播分享经典案例、在线答疑,营造纯粹的开源大数据氛围,欢迎加入!加入钉钉群聊阿里云E-MapReduce交流2群,点击进入查看详情 https://qr.dingtalk.com/action/joingroup?code=v1,k1,cNBcqHn4TvG0iHpN3cSc1B86D1831SGMdvGu7PW+sm4=&_dt_no_comment=1&origin=11

官方博客
官网链接