Sqoop数据分析引擎安装与使用-阿里云开发者社区

Sqoop数据分析引擎安装与使用

2017-11-13 1033

版权

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

简介：

Sqoop数据分析引擎安装与使用

==>什么是Sqoop ?

Sqoop 是一个开源的数据处理引擎，主要是通过 JDBC 为媒介，在Hadoop（Hive）与传统的关系型数据库(Oracle, MySQL,Postgres等)间进行数据的传递

HDFS Hive HBase < JDBC > Oracle, MySQL,

==> Sqoop 的安装：

1. 将安装包解压：tar zxf sqoop-1.4.6.bin__hadoop-0.23.tar.gz -C /app

2. 配置环境变量：

vim ~/.bash_profile

SQOOP_HOME=/app/sqoop-1.4.6.bin__hadoop-0.23

export SQOOP_HOME

PATH=$SQOOP_HOME/bin:$PATH

================================================================

3. 因为需要通过 JDBC 与数据库进行数据传输，所以需要将数据库的 JDBC 工具包放入到 lib 目录下

打开oracle 安装目录： C:\oracle\product\10.2.0\db_1\jdbc\lib

将 ojdbc14.jar 文件复制到 sqoop 的 bin 目录下： /app/sqoop-1.4.6.bin__hadoop-0.23/bin

==> Sqoop 的命令详解：(注意：在oracle 中，用户名和表名要全部大写)

codegen ---> 将关系数据库表映射为一个Java 文件， Java class类，以及相关的 jar 包

sqoop codegen \

--connect jdbc:oracle:thin:@192.168.10.210:1521:orcl \

--username SCOTT --password oracle \

--table EMP

================================================================

create-hive-table ---> 生成与关系数据库表结构对应的 Hive 表

sqoop create-hive-table \

--connect jdbc:oracle:thin:@192.168.10.210:1521:orcl \

--username SCOTT --password oracle \

--table EMP

--hive-table emphive

================================================================

eval ---> 快速地使用 SQL 语句对关系数据库进行操作

这可以在使用的 import 这种工具进行数据导入的时候，检查 SQL 语句是否正确，并将结果显示在控制台

sqoop eval \

--connect jdbc:oracal:thin:@192.168.10.210:1521:orcl \

--username SCOTT --password oracle

--query "select * from emp"

================================================================

export ---> 从hdfs 中导数据到关系数据库中

sqoop export \

--connect jdbc:oracle:thin:@192.168.10.210:1521:orcl \

--username SCOTT --password oracle \

--table STUDENTS # 表

--export-dir /students # HDFS 中的数据表

================================================================

import ---> 将数据库表的数据导入到 HDFS 中

sqoop export \

--connect jdbc:oracle:thin:@192.168.10.210:1521:orcl \

--username SCOTT --password oracle

--table EMP \

--target-dir /emp

-------------------------------------------------------------------------------------------------------------

--->将数据导入到HBase 中（需要先将表创建）

sqoop import \

--connect jdbc:oracle:thin:@192.168.10.210:1521:orcl \

--username SCOTT --password oracle \

--table EMP --columns empno, ename, sal, deptno \

--hbase-table emp --hbase-row-key empno --column-family empinfo

row-key 列族

================================================================

import-all-tables ---> 将数据库中所有的表的数据导入到 HDFS 中

sqoop import-all-tables \

--connect jdbc:oracle:thin:@192.168.10.210:1521:orcl \

--username SCOTT --password oracle \

--m 1

================================================================

job --> 用来生成一个 Sqoop 的任务，生成后，该任务不执行，除非使用命令执行该任务

================================================================

list-databases ---> 打印出关系数据库所有数据库名

sqoop list-databases \

--connect jdbc:oracle:thin:@192.168.10.210:1521:orcl

--username SYSTEM --password oracle

================================================================

list-table ---> 打印出关系数据库中所有的表名

sqoop list-table \

--connect jdbc:oracle:thin:@192.168.10.210:1521:orcl \

--username SCOTT --password oracle \

-m 1

================================================================

merge ---> 将 HDFS 中不同目录下的数据合在一起，并存放在指定的目录中

================================================================

metastore ---> 记录 Sqoop job 的元数据信息

================================================================

version ---> 显示 Sqoop 版本信息

================================================================

本文转自 tianshuai369 51CTO博客，原文链接:http://blog.51cto.com/songqinglong/2060384

相关实践学习

lindorm多模间数据无缝流转

展现了Lindorm多模融合能力——用kafka API写入，无缝流转在各引擎内进行数据存储和计算的实验。

云数据库HBase版使用教程

  相关的阿里云产品：云数据库 HBase 版面向大数据领域的一站式NoSQL服务，100%兼容开源HBase并深度扩展，支持海量数据下的实时存储、高并发吞吐、轻SQL分析、全文检索、时序时空查询等能力，是风控、推荐、广告、物联网、车联网、Feeds流、数据大屏等场景首选数据库，是为淘宝、支付宝、菜鸟等众多阿里核心业务提供关键支撑的数据库。了解产品详情: https://cn.aliyun.com/product/hbase   ------------------------------------------------------------------------- 阿里云数据库体验：数据库上云实战开发者云会免费提供一台带自建MySQL的源数据库 ECS 实例和一台目标数据库 RDS实例。跟着指引，您可以一步步实现将ECS自建数据库迁移到目标数据库RDS。点击下方链接，领取免费ECS&RDS资源，30分钟完成数据库上云实战！https://developer.aliyun.com/adc/scenario/51eefbd1894e42f6bb9acacadd3f9121?spm=a2c6h.13788135.J_3257954370.9.4ba85f24utseFl

Sqoop数据分析引擎安装与使用

热门文章

最新文章

相关课程

相关电子书

相关实验场景

热门

活动广场

任务中心

开发者评测

高校计划

乘风者计划

训练营

阿里云MVP

话题

直播

下载

镜像站

技术资料

插件

Sqoop数据分析引擎安装与使用

热门文章

最新文章

相关课程

相关电子书

相关实验场景