开发者社区大数据文章正文

【Hadoop Summit Tokyo 2016】Hivemall: Apache Hive/Spark/Pig 的可扩展机器学习库

2017-02-26 2933

版权

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

简介： 本讲义出自 Makoto YUI与NTT Takashi Yamamuro在Hadoop Summit Tokyo 2016上的演讲，主要介绍了Hivemall的相关知识以及Hivemall在Spark上的应用，Hivemall是可以用于Apache Hive/Spark/Pig 的可扩展机器学习库。

本讲义出自 Makoto YUI与NTT Takashi Yamamuro在Hadoop Summit Tokyo 2016上的演讲，主要介绍了Hivemall的相关知识以及Hivemall在Spark上的应用，Hivemall是可以用于Apache Hive/Spark/Pig 的可扩展机器学习库。

38a72cf50b1487f735d04f99b8ba12a1c651cd26

8b0ffbbf49e9286af7777af51ea3c5ed57f6e887

d6e244ce25007e23917e2389b265bd79261f8c35

35ffac456343b8b96ac26aaac8577804cb55444e

af9c67fd51ebc8284ef43980b9b8bc8979e60130

628bfb3565fa941d64a4be4408653016ac4d0852

62888374bea14c6fdb47f27c66d2ab364f131f56

079d02bcfd1c2b7c9f397d4764adadb59982fc0b

2654487cd4371799929ce934bb45d08f3787365c

79dbaf7f384b6517ea45521d040be3a44c501a20

d3cbc17d7482485ed8171f23395f905646b357ff

7f72c44d30fcd5e21465027805b47330ff517ecb

aff11182286cff4cbf2b185b2c8528f646871dd1

de897829bbea1c74f53688e6e6d73c48ba928e5f

2479f6eb185758ee114f9dd0670d12eab9289342

5fd6235a5869e642c533d9dc7963d53fc32b8e4f

4012fc3adbb819825d3cebfd636b140d3e52fe4c

17a4e6d124aefe3b545b4e6482459654a3936e5a 740d1424c657dbfb3faa80b9e1ec8bfdc5df1df1 baf178493e2ecf11fb10ada72320a91ea3d9d287

b3b11d76ca0607225e0d342492cdd294b3ef0a76

2a8d9d8a5b9d0b44f13c94a4b4d7d693f4d0fb48

8ac1f5fe8ae78569ca4b0f5d4d6b53bf378b2009

1e064739492ee36459273b00f131b17aefaa9456

c169fe59e1507c9bb3f38136e9a2926426247ffa

81d8f5126adb59fc9355ba1d5591c0e32ffae7bd

63fe9dfc1e197bfe8dce0279552789208fcfe558

1e166f0606ccec3858311433affedc56c09c03ab

83cdf0c700e94a0ef82c099f3501b9fb8ffbbdc4

b1baffac432242bfbc37533110790270b4887fe0

4d651eaa0567337e69d62dd3dea5260e773ea6de

ab614afd1bf2dc69cb07532518a4573f56225a42

e286be70ee3500ab7e79eeeb599e40dd3c7a157b

4ab723820d39e3eb1fb3702d8d70e72b59b9be36

17359a0c821101b47382374603cef0ed74855e29

1011b08ddd3ab2dbf097e04bb3258d63fbf8c60f

023bb401e90c10e11dde191ab168f5c45c6f612a

9edc50bfd2ae28e4863d43bde9935ea771271b58

f4f26cf3ab7c3e926b7b90da4b31471a48d308d2

092ef23077cdebf8176073af08cafdced717cc11

71b325afe0f40462fe1495c18be6bbaf181b6e04

71d331bf84eef3374e7245aac43d7fb7f346efca

71303ceec8ad1e2954e484ee3e6bd18609424878

a14d37905fe3c19cdf968a29d47e92c3a9bdb07b

697c99f7eeea33230f0553784b302d22302750e1

0853f684760854c56665a7f643bd8922313cf62f

990ccf55cd570b6e25f309bc2efafcc2786ae318

656780437717dfc2f98796e6752b58201ee75d36

ccdb1e555698618f6c098f647a440a25e685a9a2

e798c8e8fa69b798a4d7ad5abad0345a9aa523be

1ffb2e165171419514ab9cca2818a5c9f25f48a5

93e0f432d159854e2969005e6fed07928a450a22

32d9bbad9ad7e04895beb877e8bedae63a46bc93

6ec5b3ef2409197faf2360d19dd6319a42daadb1

bf908ca3e45efa77998915d3cb10de19ea3c8dc8

fbc1acba4fc906300ebbf03209d883dff1c0b14c

f6246d3f09198e49529a5d6eae089de088a47e86

文章标签：

人工智能平台 PAI

Apache

分布式计算

Spark

SQL

HIVE

关键词：

hadoop apache spark

hadoop spark

Hive spark

hive apache spark

spark人工智能平台 PAI

相关实践学习

使用PAI+LLaMA Factory微调Qwen2-VL模型，搭建文旅领域知识问答机器人

使用PAI和LLaMA Factory框架，基于全参方法微调 Qwen2-VL模型，使其能够进行文旅领域知识问答，同时通过人工测试验证了微调的效果。

机器学习概览及常见算法

机器学习(Machine Learning, ML)是人工智能的核心，专门研究计算机怎样模拟或实现人类的学习行为，以获取新的知识或技能，重新组织已有的知识结构使之不断改善自身的性能，它是使计算机具有智能的根本途径，其应用遍及人工智能的各个领域。本课程将带你入门机器学习，掌握机器学习的概念和常用的算法。

小猫吃鱼569

武子康

分布式计算 Kubernetes Hadoop

大数据-82 Spark 集群模式启动、集群架构、集群管理器 Spark的HelloWorld + Hadoop + HDFS

武子康

1223 6 6

Echo_Wish

存储分布式计算 Hadoop

从“笨重大象”到“敏捷火花”：Hadoop与Spark的大数据技术进化之路

Echo_Wish

793 79 80

武子康

分布式计算资源调度 Hadoop

大数据-80 Spark 简要概述系统架构部署模式与Hadoop MapReduce对比

武子康

560 2 2

蓝易云

SQL 分布式计算 IDE

如何在IDE中通过Spark操作Hive

通过以上方法和代码示例，你可以在IDE中成功通过Spark操作Hive，实现大规模数据处理和分析。确保理解每一步的实现细节，应用到实际项目中时能有效地处理各种复杂的数据场景。

蓝易云

758 28 28

aliyun6039169770-29419

SQL 分布式计算关系型数据库

基于云服务器的数仓搭建-hive/spark安装

本文介绍了在本地安装和配置MySQL、Hive及Spark的过程。主要内容包括： - **MySQL本地安装**：详细描述了内存占用情况及安装步骤，涉及安装脚本的编写与执行，以及连接MySQL的方法。 - **Hive安装**：涵盖了从上传压缩包到配置环境变量的全过程，并解释了如何将Hive元数据存储配置到MySQL中。 - **Hive与Spark集成**：说明了如何安装Spark并将其与Hive集成，确保Hive任务由Spark执行，同时解决了依赖冲突问题。 - **常见问题及解决方法**：列举了安装过程中可能遇到的问题及其解决方案，如内存配置不足、节点间通信问题等。

aliyun6039169770-29419

687 1 1

瓴羊Dataphin

SQL 分布式计算资源调度

Dataphin功能Tips系列（48)-如何根据Hive SQL/Spark SQL的任务优先级指定YARN资源队列

如何根据Hive SQL/Spark SQL的任务优先级指定YARN资源队列

瓴羊Dataphin

530 4 4

阿里云大数据

机器学习/深度学习分布式计算大数据

阿里云 EMR Serverless Spark 在微财机器学习场景下的应用

面对机器学习场景下的训练瓶颈，微财选择基于阿里云 EMR Serverless Spark 建立数据平台。通过 EMR Serverless Spark，微财突破了单机训练使用的数据规模瓶颈，大幅提升了训练效率，解决了存算分离架构下 Shuffle 稳定性和性能困扰，为智能风控等业务提供了强有力的技术支撑。

阿里云大数据

792 15 15

土木林森

存储分布式计算 Hadoop

数据湖技术：Hadoop与Spark在大数据处理中的协同作用

【10月更文挑战第27天】在大数据时代，数据湖技术凭借其灵活性和成本效益成为企业存储和分析大规模异构数据的首选。Hadoop和Spark作为数据湖技术的核心组件，通过HDFS存储数据和Spark进行高效计算，实现了数据处理的优化。本文探讨了Hadoop与Spark的最佳实践，包括数据存储、处理、安全和可视化等方面，展示了它们在实际应用中的协同效应。

土木林森

776 2 2

土木林森

存储分布式计算 Hadoop

数据湖技术：Hadoop与Spark在大数据处理中的协同作用

【10月更文挑战第26天】本文详细探讨了Hadoop与Spark在大数据处理中的协同作用，通过具体案例展示了两者的最佳实践。Hadoop的HDFS和MapReduce负责数据存储和预处理，确保高可靠性和容错性；Spark则凭借其高性能和丰富的API，进行深度分析和机器学习，实现高效的批处理和实时处理。

土木林森

710 1 1

武子康

SQL 分布式计算关系型数据库

Hadoop-21 Sqoop 数据迁移工具简介与环境配置云服务器 ETL工具 MySQL与Hive数据互相迁移导入导出

武子康

481 3 3

【Hadoop Summit Tokyo 2016】Hivemall: Apache Hive/Spark/Pig 的可扩展机器学习库

热门文章

最新文章

相关课程

相关电子书

相关实验场景

探索云世界

热门

云计算

大数据

云原生

人工智能

数据库

开发与运维

活动广场

任务中心

训练营

直播

乘风者计划

下载

镜像站

技术资料

【Hadoop Summit Tokyo 2016】Hivemall: Apache Hive/Spark/Pig 的可扩展机器学习库

热门文章

最新文章

相关课程

相关电子书

相关实验场景