【大数据学习篇2】Hadoop集群安装(三)

简介: 【大数据学习篇2】Hadoop集群安装

7.3 改目录名称

hd@master apps]$ mv hadoop-3.0.0 hadoop

[hd@master apps]$ ll

total 324644

drwxr-xr-x. 12 hd hd       192 Jul 11 00:09 hadoop

7.4 修改hadoop配置文件

7.4.1 修改hadoop-env.sh

[hd@master ~]$ cd /home/hd/apps/hadoop/etc/hadoop/

[hd@master hadoop]$ pwd

/home/hd/apps/hadoop/etc/hadoop

[hd@master hadoop]$ vi hadoop-env.sh

#在文件的尾部(按“G”可以跳到文档的尾部),增加

export JAVA_HOME=/home/hd/apps/java

7.4.2 修改core-site.xml

<configuration>

   <!-- 指定HADOOP所使用的文件系统schema(URI),HDFS的老大(NameNode)的地址 -->

   <property>

       <name>fs.defaultFS</name>

       <value>hdfs://master:9000</value>

   </property>

   <!-- 指定hadoop运行时产生文件的存储目录 -->

   <property>

       <name>hadoop.tmp.dir</name>

       <value>/home/hd/apps/hadoop/tmpdata</value>

   </property>

</configuration>

7.4.3 修改hdfs-site.xml

<configuration>

   <!-- 指定HDFS副本的数量 -->

   <property>

       <name>dfs.replication</name>

       <value>2</value>

   </property>

   <!-- 设置namenode的http通讯地址 -->

   <property>

       <name>dfs.namenode.http-address</name>

       <value>master:50070</value>

   </property>

   <!-- 设置secondarynamenode的http通讯地址 -->

   <property>

       <name>dfs.namenode.secondary.http-address</name>

       <value>master:50090</value>

   </property>

   <!-- 设置namenode存放的路径 -->

   <property>

       <name>dfs.namenode.name.dir</name>

       <value>/home/hd/apps/hadoop/namenode</value>

   </property>

   <!-- 设置datanode存放的路径 -->

   <property>

       <name>dfs.datanode.data.dir</name>

       <value>/home/hd/apps/hadoop/datanode</value>

   </property>

</configuration>

7.4.4 修改mapred-site.xml

<configuration>

   <!-- 指定mr运行在yarn上 -->

   <property>

       <name>mapreduce.framework.name</name>

       <value>yarn</value>

   </property>

   <property>

       <name>yarn.app.mapreduce.am.env</name>

       <value>HADOOP_MAPRED_HOME=/home/hd/apps/hadoop</value>

   </property>

   <property>

         <name>mapreduce.map.env</name>

         <value>HADOOP_MAPRED_HOME=/home/hd/apps/hadoop</value>

   </property>

   <property>

         <name>mapreduce.reduce.env</name>

         <value>HADOOP_MAPRED_HOME=/home/hd/apps/hadoop</value>

   </property>

</configuration>

7.4.5 修改yarn-site.xml

<configuration>

   <!-- 指定YARN的老大(ResourceManager)的地址 -->

   <property>

       <name>yarn.resourcemanager.hostname</name>

       <value>master</value>

   </property>

   <!-- reducer获取数据的方式 -->

   <property>

       <name>yarn.nodemanager.aux-services</name>

       <value>mapreduce_shuffle</value>

   </property>

</configuration>

7.4.6 修改workers

[hd@master hadoop]$ vi workers

slave01

slave02

7.4.7 修改环境变量

[hd@master hadoop]$ su root

Password:

[root@master hadoop]# vi /etc/profile

#增加

export HADOOP_HOME=/home/hd/apps/hadoop

#增加

export PATH=$PATH:$JAVA_HOME/bin:$HADOOP_HOME/bin:$HADOOP_HOME/sbin

7.5 拷贝到第二,三台机

[root@master hadoop]# su hd

[hd@master hadoop]$ scp  -r /home/hd/apps/hadoop hd@slave01:/home/hd/apps/

[hd@master hadoop]$ scp  -r /home/hd/apps/hadoop hd@slave02:/home/hd/apps/

[hd@master hadoop]$ su root

Password:

[root@master hadoop]# scp /etc/profile root@slave01:/etc/

root@slave01's password:

profile                                                                                                        100% 1896     1.9KB/s   00:00    

[root@master hadoop]# scp /etc/profile root@slave02:/etc/

profile                                                                                                        100% 1896     1.9KB/s   00:00    

在第三台机器里加载环境


[root@master hadoop]#  source /etc/profile

[hd@master hadoop]$ hadoop version

Hadoop 3.0.0

7.6 格式化

[hd@master hadoop]$ ll /home/hd/apps/hadoop/namenode

ls: cannot access /home/hd/apps/hadoop/namenode: No such file or directory

[hd@master hadoop]$ hadoop namenode -format

7.7 启动hadoop

start-dfs.sh 启动HDFS分布式文件系统,停止stop-dfs.sh


start-yarn.sh 启动Yarn资源管理器,停止stop-yarn.sh


start-all.sh HDFS分布式文件系统与Yarn启动,停止stop-all.sh


7.8 jps查看进程

[hd@master ~]$ jps

23668 SecondaryNameNode

23467 NameNode

23903 ResourceManager

24207 Jps

[hd@slave01 ~]$ jps

22341 DataNode

22649 Jps

22458 NodeManager

[hd@slave02 ~]$ jps

23367 Jps

23176 NodeManager

23051 DataNode

7.9 测试

hdfs 文件系统访问地址:http://192.168.126.128:50070/dfshealth.html#tab-overview


Yarn资源管理器访问地址:http://192.168.126.128:8088/cluster


相关实践学习
基于MaxCompute的热门话题分析
Apsara Clouder大数据专项技能认证配套课程:基于MaxCompute的热门话题分析
目录
相关文章
|
负载均衡 算法 关系型数据库
大数据大厂之MySQL数据库课程设计:揭秘MySQL集群架构负载均衡核心算法:从理论到Java代码实战,让你的数据库性能飙升!
本文聚焦 MySQL 集群架构中的负载均衡算法,阐述其重要性。详细介绍轮询、加权轮询、最少连接、加权最少连接、随机、源地址哈希等常用算法,分析各自优缺点及适用场景。并提供 Java 语言代码实现示例,助力直观理解。文章结构清晰,语言通俗易懂,对理解和应用负载均衡算法具有实用价值和参考价值。
大数据大厂之MySQL数据库课程设计:揭秘MySQL集群架构负载均衡核心算法:从理论到Java代码实战,让你的数据库性能飙升!
|
存储 分布式计算 Hadoop
从“笨重大象”到“敏捷火花”:Hadoop与Spark的大数据技术进化之路
从“笨重大象”到“敏捷火花”:Hadoop与Spark的大数据技术进化之路
860 79
|
数据采集 搜索推荐 算法
Java 大视界 -- Java 大数据在智能教育学习社区用户互动分析与社区活跃度提升中的应用(274)
本文系统阐述 Java 大数据技术在智能教育学习社区中的深度应用,涵盖数据采集架构、核心分析算法、活跃度提升策略及前沿技术探索,为教育数字化转型提供完整技术解决方案。
|
负载均衡 算法 关系型数据库
大数据新视界--大数据大厂之MySQL数据库课程设计:MySQL集群架构负载均衡故障排除与解决方案
本文深入探讨 MySQL 集群架构负载均衡的常见故障及排除方法。涵盖请求分配不均、节点无法响应、负载均衡器故障等现象,介绍多种负载均衡算法及故障排除步骤,包括检查负载均衡器状态、调整算法、诊断修复节点故障等。还阐述了预防措施与确保系统稳定性的方法,如定期监控维护、备份恢复策略、团队协作与知识管理等。为确保 MySQL 数据库系统高可用性提供全面指导。
zdl
|
消息中间件 运维 大数据
大数据实时计算产品的对比测评:实时计算Flink版 VS 自建Flink集群
本文介绍了实时计算Flink版与自建Flink集群的对比,涵盖部署成本、性能表现、易用性和企业级能力等方面。实时计算Flink版作为全托管服务,显著降低了运维成本,提供了强大的集成能力和弹性扩展,特别适合中小型团队和业务波动大的场景。文中还提出了改进建议,并探讨了与其他产品的联动可能性。总结指出,实时计算Flink版在简化运维、降低成本和提升易用性方面表现出色,是大数据实时计算的优选方案。
zdl
907 56
|
存储 分布式计算 大数据
Flume+Hadoop:打造你的大数据处理流水线
本文介绍了如何使用Apache Flume采集日志数据并上传至Hadoop分布式文件系统(HDFS)。Flume是一个高可用、可靠的分布式系统,适用于大规模日志数据的采集和传输。文章详细描述了Flume的安装、配置及启动过程,并通过具体示例展示了如何将本地日志数据实时传输到HDFS中。同时,还提供了验证步骤,确保数据成功上传。最后,补充说明了使用文件模式作为channel以避免数据丢失的方法。
1095 4
|
SQL 存储 大数据
单机顶集群的大数据技术来了
大数据时代,分布式数仓如MPP成为热门技术,但其高昂的成本让人望而却步。对于多数任务,数据量并未达到PB级,单体数据库即可胜任。然而,由于SQL语法的局限性和计算任务的复杂性,分布式解决方案显得更为必要。esProc SPL作为一种开源轻量级计算引擎,通过高效的算法和存储机制,实现了单机性能超越集群的效果,为低成本、高效能的数据处理提供了新选择。
|
存储 分布式计算 Hadoop
数据湖技术:Hadoop与Spark在大数据处理中的协同作用
【10月更文挑战第27天】在大数据时代,数据湖技术凭借其灵活性和成本效益成为企业存储和分析大规模异构数据的首选。Hadoop和Spark作为数据湖技术的核心组件,通过HDFS存储数据和Spark进行高效计算,实现了数据处理的优化。本文探讨了Hadoop与Spark的最佳实践,包括数据存储、处理、安全和可视化等方面,展示了它们在实际应用中的协同效应。
823 2
|
存储 负载均衡 监控
揭秘 Elasticsearch 集群架构,解锁大数据处理神器
Elasticsearch 是一个强大的分布式搜索和分析引擎,广泛应用于大数据处理、实时搜索和分析。本文深入探讨了 Elasticsearch 集群的架构和特性,包括高可用性和负载均衡,以及主节点、数据节点、协调节点和 Ingest 节点的角色和功能。
1050 0
|
分布式计算 Ubuntu Hadoop
Hadoop 的安装和使用(基于Linux~Ubuntu的虚拟机)
Hadoop 的安装和使用(基于Linux~Ubuntu的虚拟机)
1529 0
Hadoop 的安装和使用(基于Linux~Ubuntu的虚拟机)

热门文章

最新文章