大数据入门

本文涉及的产品
云原生大数据计算服务 MaxCompute,5000CU*H 100GB 3个月
云原生大数据计算服务MaxCompute,500CU*H 100GB 3个月
简介: 大数据入门

20190731140749404.png


推荐系统项目架构----以及数据流程:

20190731141022433.png


linux 主机集群的搭建------通过VMware虚拟机进行对其中的一台主机进行克隆,然后在分别修改每台机器的静态IP

20190731143639635.png

20190731143713429.png20190731143754402.png

 进入这个位置进行修改IP地址,进入之后:

1,使用  dd 操作删除eth0所在的配置行

2.使用   ctr l + $  定位到文本的最后一行,并修改成eth0,同时复制   ATTR(address)  后面的 mac 地址

20190731144030708.png

对机器进行网络的配置:

20190731144312348.png

 vim   /etc / sysconfig / network - script / ifcfg - eth0

20190731144954632.png

修改其中的  硬件地址 跟我们设置的 IP地址ude

20190731145203824.png

20190731145226828.png


修改主机名称:

2019073114540174.png

20190731145434692.png


查看主机名映射是否配置好:

2019073114554741.png

20190731145605445.png


创建一个具有  root  权限的用户名:

20190731150235880.png

20190731150251841.png

20190731150603254.png

20190731151043511.png


进行环境变量的设置:

20190731151125191.png

#####JAVA_HOMT

export  JAVA_HOME=/opt/module/jdk1.8.0_144

export  PATH=$PATH:$JAVA_HOME/bin

20190731151405159.png

20190731151536956.png

再执行  source    /etc/profile   使用配置文件


================================================================================================


开始配置:

              配置输入环境,将    etc /   下面的配置文件复制到 新穿件的  input  目录下面

20190731154305368.png


执行案例:(grep案例)

20190805002306268.png


其中output必须为空

20190731160049159.png

20190731155930796.png

20190731160454758.png


伪分布式模式:

  etc/hadoop/hadoop-enc.sh   中进行如下配置:

2019080521380012.png

20190805003004425.png

20190805223252350.png


完全分布式:

20190806134307457.png


踩坑:(分布式集群搭建成功之后----使用  start-dfs.sh------再使用jps查看不到namenode的启动------一定要在启动集群的时候使用hadoop  namenode   format   对集群进行格式化)

20190806154420751.png

20190806161115238.png

20190806161318847.png

2019080617170132.png

相关实践学习
基于MaxCompute的热门话题分析
本实验围绕社交用户发布的文章做了详尽的分析,通过分析能得到用户群体年龄分布,性别分布,地理位置分布,以及热门话题的热度。
SaaS 模式云数据仓库必修课
本课程由阿里云开发者社区和阿里云大数据团队共同出品,是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法,从场景到实践,体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库,助力开发者学习了解先进的技术栈,并能在实际业务中敏捷的进行大数据分析,赋能企业业务。 通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景,可应用MaxCompute实现数仓搭建,快速进行大数据分析。适合大数据工程师、大数据分析师 大量数据需要处理、存储和管理,需要搭建数据仓库?学它! 没有足够人员和经验来运维大数据平台,不想自建IDC买机器,需要免运维的大数据平台?会SQL就等于会大数据?学它! 想知道大数据用得对不对,想用更少的钱得到持续演进的数仓能力?获得极致弹性的计算资源和更好的性能,以及持续保护数据安全的生产环境?学它! 想要获得灵活的分析能力,快速洞察数据规律特征?想要兼得数据湖的灵活性与数据仓库的成长性?学它! 出品人:阿里云大数据产品及研发团队专家 产品 MaxCompute 官网 https://www.aliyun.com/product/odps 
相关文章
|
5月前
|
存储 分布式计算 Hadoop
大数据之hadoop3入门到精通(一)
大数据之hadoop3入门到精通(一)
265 1
|
4月前
|
SQL 存储 分布式计算
ODPS开发大全:入门篇(3)
ODPS开发大全:入门篇
190 19
|
4月前
|
SQL 存储 分布式计算
ODPS开发大全:入门篇(1)
ODPS开发大全:入门篇
451 14
|
5月前
|
分布式计算 Hadoop 分布式数据库
Hadoop生态系统介绍(二)大数据技术Hadoop入门理论系列之一----hadoop生态圈介绍
Hadoop生态系统介绍(二)大数据技术Hadoop入门理论系列之一----hadoop生态圈介绍
171 2
|
5月前
|
分布式计算 大数据 数据处理
Python入门与大数据处理环境配置指南
**Python入门与大数据处理环境配置** Python作为高级编程语言,因其简洁语法和丰富库资源,成为数据处理、AI和大数据分析首选。本文旨在介绍Python基础和环境配置,特别是针对大数据处理的环境搭建。首先,讲解Python语言基础,包括语言概述、基本语法(变量、数据类型、控制流语句、函数和模块)。接着,讨论如何安装Python环境,以及安装NumPy、Pandas等大数据处理库。对于大数据处理,可以选择本地环境或搭建分布式环境,如Hadoop和Spark,并提供相关API示例。最后,列出环境配置中可能遇到的问题及解决方案,如版本不兼容、库安装失败等,并提供参考资料以供深入学习。
140 3
|
3月前
|
分布式计算 资源调度 Hadoop
Hadoop入门基础(五):Hadoop 常用 Shell 命令一网打尽,提升你的大数据技能!
Hadoop入门基础(五):Hadoop 常用 Shell 命令一网打尽,提升你的大数据技能!
|
3月前
|
SQL 存储 分布式计算
MaxCompute 入门:大数据处理的第一步
【8月更文第31天】在当今数字化转型的时代,企业和组织每天都在产生大量的数据。有效地管理和分析这些数据变得至关重要。阿里云的 MaxCompute(原名 ODPS)是一个用于处理海量数据的大规模分布式计算服务。它提供了强大的存储能力以及丰富的数据处理功能,让开发者能够快速构建数据仓库、实时报表系统、数据挖掘等应用。本文将介绍 MaxCompute 的基本概念、架构,并演示如何开始使用这一大数据处理平台。
538 0
|
4月前
|
SQL 分布式计算 MaxCompute
ODPS开发大全:入门篇(2)
ODPS开发大全:入门篇
114 14
|
3月前
|
分布式计算 大数据 Java
Scala 入门指南:从零开始的大数据开发
Scala 入门指南:从零开始的大数据开发
|
4月前
|
存储 SQL 机器学习/深度学习
阿里云数加大数据计算服务MaxCompute学习路线图:从入门到精通
将所学知识应用于实际工作中并不断进行实践和创新是提升技术能力的关键所在。用户可以结合业务需求和技术发展趋势积极探索新的应用场景和解决方案,并在实践中不断总结经验和教训以提升自己的技术水平和实践能力。