大数据快速搭建环境

简介: 大数据快速搭建环境

1 准备工作

CDH QuickStart VM可以看到官方已经不对之后的版本维护了,直接下架,但是可以下载原有的镜像进行操作,本环境只适合小白进行快速搭建一套环境,之后熟悉一些操作,看了一些现有博客比较乱,整合一下

a6b22666f7ee4a6e9db490b0c5dd53c5.png

  1. 下载虚拟机镜像包。

链接:https://pan.baidu.com/s/1TVn6GcqO9yVweX9zMkOBpg 提取码:nnkk

–来自百度网盘超级会员V5的分享

  1. 虚拟机镜像文件压缩包解压得到cloudera-quickstart-vm-5.12.0-0-vmware文件夹。
  2. 进入解压文件夹,单击cloudera-quickstart-vm-5.12.0-0-vmware.vmx,使用VMWare打开该虚拟机。

官网给的推荐配置是2cores、8G内存,建议在启动前先修改虚拟机配置。如果已经启动的虚拟机,则可以停止虚拟机后,删除本地的镜像文件(主要不要从VMware中删除,而是直接删除本地文件),然后重新解压一遍到上次删除的文件位置。此时,再修改VMware中的虚拟机配置,再启动即可。

1.1 配置文件

/etc下可以自行配置

2 cloudera-quickstart-vm的使用

2.1 用户说明

Ø 该镜像的OS用户包括root/cloudera和cloudera/cloudera。


Ø Hue UI的用户名和密码是cloudera/cloudera。


Ø 如果还有其它用户,那么用户名和密码都应该是cloudera/cloudera,比如Cloudera Manager。


Ø root用户名的密码是cloudera

3 安装

我这边下载的是cloudera-quickstart-vm-5.13.0-0-vmware.zip版本,解压后目录为:cloudera-quickstart-vm-5.13.0-0-vmware。

打开VMware,File -> Open,选择刚才解压的文件夹,选择cloudera-quickstart-vm-5.13.0-0-vmware.vmx,就出现了如下页面。


对虚机做资源配置,一般来说内存要在8G以上,否则后续启动或者是使用的时候会有问题。这里内存配置32G,4核,300G磁盘。

确定后启动虚机,进入虚机界面。

点击Launch Cloudera Express,开始启动。

怎么进入管理界面呢?

运行桌面的cloudera express命令脚本即可。

如果出现以下错误,说明你的虚拟机没有设置到8g内存和两个处理器,请设置完毕再重新打开这个虚拟机。

想强制启动的话,可以在终端运行以下命令:

sudo /home/cloudera/cloudera-manager --express --force

不出意外的话,启动成功了:

接下来可以去浏览器直接管理了。

打开内置的火狐,输入网址:http://quickstart.cloudera:7180

登录账号:cloudera

登录密码:cloudera

登陆之后,就可以看到管理界面了:

可以看到,左边是整合的大数据工具,点击对应的下拉按钮,就可以启动,关闭,管理这些组件了。

4 修改windows的host文件方便访问

C:\Windows\System32\drivers\etc

和linux匹配目录为/etc/hosts

相关实践学习
基于MaxCompute的热门话题分析
Apsara Clouder大数据专项技能认证配套课程:基于MaxCompute的热门话题分析
目录
相关文章
|
数据采集 搜索推荐 Java
Java 大视界 -- Java 大数据在智能教育虚拟学习环境构建与用户体验优化中的应用(221)
本文探讨 Java 大数据在智能教育虚拟学习环境中的应用,涵盖多源数据采集、个性化推荐、实时互动优化等核心技术,结合实际案例分析其在提升学习体验与教学质量中的成效,并展望未来发展方向与技术挑战。
|
SQL 机器学习/深度学习 分布式计算
大数据-81 Spark 安装配置环境 集群环境配置 超详细 三台云服务器
大数据-81 Spark 安装配置环境 集群环境配置 超详细 三台云服务器
1147 1
|
传感器 分布式计算 大数据
“用大数据盯着天看地”——聊聊环境监测的精准化升级
“用大数据盯着天看地”——聊聊环境监测的精准化升级
277 0
|
传感器 机器学习/深度学习 算法
Java 大视界 -- Java 大数据在智能农业温室环境调控与作物生长模型构建中的应用(189)
本文探讨了Java大数据在智能农业温室环境调控与作物生长模型构建中的关键应用。通过高效采集、传输与处理温室环境数据,结合机器学习算法,实现温度、湿度、光照等参数的智能调控,提升作物产量与品质。同时,融合多源数据构建精准作物生长模型,助力农业智能化、精细化发展,推动农业现代化进程。
|
SQL 安全 Java
开启 Kerberos 安全认证的大数据环境中如何正确指定 HS2 的 jdbc url 地址?
开启 Kerberos 安全认证的大数据环境中如何正确指定 HS2 的 jdbc url 地址?
|
存储 大数据 数据处理
大数据环境下的性能优化策略
大数据环境下的性能优化策略
680 2
|
存储 数据可视化 数据挖掘
大数据环境下的房地产数据分析与预测研究的设计与实现
本文介绍了一个基于Python大数据环境下的昆明房地产市场分析与预测系统,通过数据采集、清洗、分析、机器学习建模和数据可视化技术,为房地产行业提供决策支持和市场洞察,探讨了模型的可行性、功能需求、数据库设计及实现过程,并展望了未来研究方向。
981 4
大数据环境下的房地产数据分析与预测研究的设计与实现
|
JSON 分布式计算 大数据
MaxCompute操作报错合集之连接环境时,出现报错:TypeError: access_id and secret_access_key,该怎么解决
MaxCompute是阿里云提供的大规模离线数据处理服务,用于大数据分析、挖掘和报表生成等场景。在使用MaxCompute进行数据处理时,可能会遇到各种操作报错。以下是一些常见的MaxCompute操作报错及其可能的原因与解决措施的合集。
395 6
|
分布式计算 DataWorks 大数据
MaxCompute产品使用问题之如何同步两个环境的参数
MaxCompute作为一款全面的大数据处理平台,广泛应用于各类大数据分析、数据挖掘、BI及机器学习场景。掌握其核心功能、熟练操作流程、遵循最佳实践,可以帮助用户高效、安全地管理和利用海量数据。以下是一个关于MaxCompute产品使用的合集,涵盖了其核心功能、应用场景、操作流程以及最佳实践等内容。
274 6