开源大数据周刊-第100期-阿里云开发者社区

开源大数据周刊-第100期

2018-09-20 2259

版权

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

简介：

资讯

领英开源TonY：构建在Hadoop YARN上的TensorFlow框架
领英在 YARN 上构建了一个 TensorFlow 框架 TonY 并将其开源。本文介绍了 TonY 的内部细节、领英实现并用来在 Hadoop 上扩展分布式 TensorFlow 的功能以及实验结果。
Databricks：96%的企业在执行AI项目时面临着数据相关的问题
Databricks发布了美国和欧洲大型公司的AI难题的调查结果。只有1/3的人工智能项目取得了成功，更重要的是企业从概念转向生产需要六个多月。这些挑战背后的主要原因是96%的企业面临着数据相关的问题，如孤岛和不一致的数据集。80%的企业引发了重大的组织摩擦，如数据科学家和数据工程师之间缺乏协作。90%的受访者表示在整个机器学习生命周期中统一数据科学和数据工程的方法将克服AI难题。
Spark、Flink、CarbonData技术实践最佳案例解析
作为Spark Structured Streaming最核心的开发人员、Databricks工程师，Tathagata Das（以下简称“TD”）在开场演讲中介绍了Structured Streaming的基本概念，及其在存储、自动流化、容错、性能等方面的特性，在事件时间的处理机制，最后带来了一些实际应用场景。

技术

如何构建一个企业的大数据分析平台
大数据分析处理平台就是整合当前主流的各种具有不同侧重点的大数据处理分析框架和工具，实现对数据的挖掘和分析，一个大数据分析平台涉及到的组件众多，如何将其有机地结合起来，完成海量数据的挖掘是一项复杂的工作。在搭建大数据分析平台之前，要先明确业务需求场景以及用户的需求，通过大数据分析平台，想要得到哪些有价值的信息，需要接入的数据有哪些，明确基于场景业务需求的大数据平台要具备的基本的功能，来决定平台搭建过程中使用的大数据处理工具和框架。
30PB数据1年内迁移到Spark，eBay的经验有何可借鉴之处？
eBay 使用 Teradata 已经有二十年的历史，这个数仓系统中积累了 60PB 数据和上万张核心表，他们支撑着 eBay 最核心的商务逻辑和站点功能。从今年开始，eBay 开始将这个庞大的数仓由 Teradata 向 Spark 做迁移，使用 eBay 自己开发的工具，迁移过程中 90% 的工作都可以由自动化完成。与此同时，研究人员通过优化 Spark 框架，节省了一半的内存。
比拼生态和未来，Spark和Flink哪家强？
在前一篇文章《Spark 比拼 Flink：下一代大数据计算引擎之争，谁主沉浮？》中，作者对 Spark 和 Flink 的引擎做了对比。但对于用户来说，引擎并不是考虑数据产品的唯一方面。开发和运维相关的工具和环境、技术支持、社区等等，对能不能在引擎上面做出东西来都很重要，这些构成了一个产品的生态。可以说，引擎决定了功能和性能的极限，而生态能让这些能力真正发挥出作用。。
喜大普奔！TensorFlow终于支持A卡了
近日，Google 宣布推出适用于 ROCm GPU 的 TensorFlow v1.8，其中包括 Radeon Instinct MI25。对于 AMD 正在进行的深度学习加速工作而言，这是一座重大的里程碑。 ROCm 即 Radeon 开放生态系统 (Radeon Open Ecosystem)，是我们在 Linux 上进行 GPU 计算的开源软件基础。而 TensorFlow 实现则使用了 MIOpen，这是一个适用于深度学习的高度优化 GPU 例程库。

开源大数据周刊-第100期

资讯

技术

开源大数据平台 E-MapReduce

热门文章

最新文章

相关课程

相关电子书