Scala 学习 进击大数据Spark生态圈

简介: Scala 学习 进击大数据Spark生态圈

第一章:简单讲解了一下Scala的优劣势

第二章:

   val:常量(值)  会自动生成get方法

   var: 变量        自动生成get/set方法

   lazy属性是遇到Action操作才会执行

   优点:大数据需要提前加载的时候不会占用整个系统很多资源

   缺点:不判断程序或加载数据的对错,只有在Action运行时才发现

   IDEA开发工具的使用:

       1、windows下载maven,配置环境变量

       2、plugins 可以手动添加Scala包,也可以idea下载

第三章:def 函数名

(可以无参数,也可以有参数): 返回类型(Unit无返回类型) {

   //函数体

   如果有返回类型,最后一行被当做是返回类型,不需要return

   }

   如果函数名(无参数) 调用时可以直接函数名

   默认参数:可以写一个默认参数函数名(a:Int = 3),如果没有赋予其它参数,默认a=3

   命名参数:参数名对应好了,顺序可以错乱

   循环:

1 to 10 (1,2,3,4,5,6,7,8,9,10) 1.to(10)
    1 until 10 (1,2,3,4,5,6,7,8,9) 1.until(10)
    Range(1,10) (1,2,3,4,5,6,7,8,9)
    for(变量 <- 要遍历的数据) 
    for(变量 <- 要遍历的数据   条件)
    x.foreach()等价于for循环
    while(循环条件)

根据输入的数据不定参数进行计算

   例:

println(num(1,2,3))
        println(num(1,2,3,4))
        def num(no:Int*) = {
          var result = 0
          for(i <- no){
            result += i
          }
          result
        }

第四章

封装:属性、方法封装到类中(类是被抽象出来的)

属性:person  

private int id, String name, date birthday   geter/seter

       方法:eat sleep run

   继承:

       父类和子类之间的关系

           子类继承父类,并且还可以重写override

           子类继承父类,如果父类有的属性,子类可以不加var/val,父类的方法会执行

       重写:子类需要修改父类的方法、属性时需要进行重写 override xxx

       抽象类:类的一个或者多个方法、属性没有实现(只有定义)

               想要调用,必须实现所有的类、方法,否则不能被调用

        多态:父类的引用指向子类

Person person = new Person()
        User user = new User()
        val p = new User()  //父类接口,子类实现功能

          类的定义:

private 只在当前类中调用
        _ 占位符,使用占位符必须指定var的数据类型

     构造器:

       主构造器:

跟在类名后面的属性叫主构造器 class Person(val name:String, val age:Int)
        附属构造器:
            def this(name:String, age:Int, gender:String){
                this(name,age)   //附构造器第一句话必须调用主构造器或者其它附属构造器
                this.gender=gender
            }

   伴生类、伴生对象:

如果有一个class,还有一个和class同名的object, class是object的伴生类,object是class的伴生对象
        object类可以直接val p = Person()

   APPLY方法:

       在object的apply方法中new class

       类名() 调用的object.apply

       对象() 调用的class.apply

   case class:通常用在模式匹配中,调用时不用new,直接调用即可

   trait:需要多个继承的时候with链接

第五章:Array 定长数组,定义以后数组长度不能改变

   可变数组:scala.collection.mutable.ArrayBuffer   +增加数据,++需要加入Array

   不可变数组:scala.collection.immutable._

   List: Nil 是一个不可变的空集合List,是有序的可以重复的   :_* 可以将Seq转化为list

   Buffer:ListBuffer、ArrayBuffer 带Buffer都是可变的

   Set:数据是不能重复的

   Map:(key-value)键值对操作

第六章

   匹配模式:

变量 match{
            case x => xxx  
            case _ => xxx   //相当于java的 default
        }

   条件模式匹配:

变量 match{
            case x => xxx  
            case _ if(xxx) => xxx   //注意执行的先后顺序
            case _ => xxx   //相当于java的 default
        }

   数组匹配:

def NameScore(array: Array[String]): Unit ={
            array match{
              case Array("zhangsan") => println("zhangsan")
              case Array(x,y) => println("x,y")
              case Array("zhangsan", _*) => println("Hi:zhangsan other one")   // _* 无限匹配
              case _ => println("erveryone")
            }
        }
        NameScore(Array("zhangsan"))
        NameScore(Array("zhangsan","lisi", "wangwu"))
        NameScore(Array("zhangwu"))

   List匹配

def NameScroe(list: List[String]): Unit ={
        list match{
          case "zhangsan"::Nil => println("zhangsan")
          case x::y::Nil => println("x,y")
          case "zhangsan":: tail => println("Hi:zhangsan other one")
          case _ => println("erveryone")
        }
      }
        NameScroe(List("zhangsan","wangwu"))
        NameScroe(List("zhangsan","lisi", "wangwu"))
        NameScroe(List("zhangwu"))

   类型匹配:

def ObjType(obj: Any){
        obj match{
          case x:Int => println("Int")
          case x:String => println("String")
          case x:Map[_,_] => x.foreach(print)
          case _ => println("other")
        }
      }
      ObjType(1)
      ObjType("1")
      ObjType(Map("key"->"value"))

   异常处理:

try{
        //要执行的代码
    }catch{
        //可以代码执行错误后,要进行提示或其它信息写到这里
    }finally{
        //一定会执行,记得要把资源关闭
    }
    case class 对类进行模式匹配,必须要定义一个顶级的类

   Some&None  模式匹配:

val b = Map("PK" -> 18, "zhangsan" -> 12, "lisi" -> 20)
      def gredeTest(name:String): Unit ={
        val getGred = b.get(name)
        getGred match{
          case Some(getGred) => println("this some")
          case None => println("this None")
        }
      }
      gredeTest("PK")
      gredeTest("lisi")
      gredeTest("wangwu")

第七章:字符串高级操作:

多行:借助于s"$常量或$变量" 进行打印

val a = "Hello"
          val b = "World"
          val c = s"$a $b!"
          println(c)
            使用""""""进行多行打印 Shift + "" 按3次
          val a1 =
            """
              |Hello
              |Wolrd
              |!
            """.stripMargin
          println(a1)

   匿名函数:匿名函数没有函数名,可以赋值给变量或常量或匿名函数

val a = (x:Int) => x+1  a(10)  结果:11
        val add = (x:Int, y:Int) => x + y  add(2,3) 结果:5

   柯里化:将原来接收多个参数的函数变换成接收一个单一的参数

   高阶函数:

Map:Map(x => (x,1))  可以把数据进行Tuple(key-value)操作、柯里化
        filter:根据条件过滤数据
        faltten:将数据进行shuffle, 
            val l = List(List(1,2), List(3,4))
            l.flatten
            结果:List[Int] = List(1, 2, 3, 4)

       FlatMap:结合了flatten和map的特点

       reduce:数据进行计算,例如加法:reduce(_+_)

           reduceLeft、reduceRight 从左或右开始计算

       fold: 数据进行计算,可以再进行单独加一些数据,例如加法,累加后额外再加1:reduce(1)(_+_)

           foldLeft、foldRight 数据进行计算,例如加法:reduce(_+_)

       foreach:循环遍历与for循环类似

   偏函数:{}内的没有match的一组case语句可以进行模式匹配

//PartialFunction[String, String] 偏函数特征[输入参数,输出参数]
      def moshi:PartialFunction[String, String] = {
        case "wangwu" => "王五"
        case "lisi" => "李四"
        case _ => "None"
      }
      println(moshi("wangwu"))

第八章

   隐士转换:通过implicit进行隐士转换,最好把隐士转换都放到一个类里面,方便调用------------面试重点

implicit def manToSuperMan(man: Man):SuperMan = new SuperMan(man.name)
          val superMan = new SuperMan("lisi")
          superMan.fly()
        class Man(val name:String){
          def eat(): Unit ={
            println(s"$name  is eat.....")
          }
        }
        class SuperMan(val name:String){
          def fly(): Unit ={
            println(s"$name is fly ......")
          }
        }

   隐士参数:对参数增加implicit

def testParam(implicit name:String){
        println(name + "====================")
      }
      implicit val name = "zhangsan"
      testParam
     隐士类:对类增加implicit
     implicit class classTest(x:String){
        def add(a:Int) = a + x
      }
      println("12345".length)

第九章

   读取文件:Source.fromFIle(文件路径)(文件编码可以不写),getLines整行读取

   读取MySQL数据:classOf[com.mysql.jdbc.Driver]

   读取XML:this.getClass.getClassLoader.getResource("xml文件")

       \  某一层

       \\ 所有


相关实践学习
基于MaxCompute的热门话题分析
Apsara Clouder大数据专项技能认证配套课程:基于MaxCompute的热门话题分析
相关文章
|
人工智能 分布式计算 大数据
大数据≠大样本:基于Spark的特征降维实战(提升10倍训练效率)
本文探讨了大数据场景下降维的核心问题与解决方案,重点分析了“维度灾难”对模型性能的影响及特征冗余的陷阱。通过数学证明与实际案例,揭示高维空间中样本稀疏性问题,并提出基于Spark的分布式降维技术选型与优化策略。文章详细展示了PCA在亿级用户画像中的应用,包括数据准备、核心实现与效果评估,同时深入探讨了协方差矩阵计算与特征值分解的并行优化方法。此外,还介绍了动态维度调整、非线性特征处理及降维与其他AI技术的协同效应,为生产环境提供了最佳实践指南。最终总结出降维的本质与工程实践原则,展望未来发展方向。
706 0
|
分布式计算 大数据 Apache
ClickHouse与大数据生态集成:Spark & Flink 实战
【10月更文挑战第26天】在当今这个数据爆炸的时代,能够高效地处理和分析海量数据成为了企业和组织提升竞争力的关键。作为一款高性能的列式数据库系统,ClickHouse 在大数据分析领域展现出了卓越的能力。然而,为了充分利用ClickHouse的优势,将其与现有的大数据处理框架(如Apache Spark和Apache Flink)进行集成变得尤为重要。本文将从我个人的角度出发,探讨如何通过这些技术的结合,实现对大规模数据的实时处理和分析。
1265 2
ClickHouse与大数据生态集成:Spark & Flink 实战
|
9月前
|
分布式计算 Kubernetes 调度
Kubeflow-Spark-Operator-架构学习指南
本指南系统解析 Spark Operator 架构,涵盖 Kubebuilder 开发、控制器设计与云原生集成。通过四阶段学习路径,助你从部署到贡献,掌握 Kubernetes Operator 核心原理与实战技能。
545 0
|
存储 分布式计算 Hadoop
从“笨重大象”到“敏捷火花”:Hadoop与Spark的大数据技术进化之路
从“笨重大象”到“敏捷火花”:Hadoop与Spark的大数据技术进化之路
795 79
|
机器学习/深度学习 人工智能 自然语言处理
3 秒音频也能克隆?拆解 Spark-TTS 架构的极致小样本学习
本文深入解析了 Spark-TTS 模型的架构与原理,该模型仅需 3 秒语音样本即可实现高质量的零样本语音克隆。其核心创新在于 BiCodec 单流语音编码架构,将语音信号分解为语义 Token 和全局 Token,实现内容与音色解耦。结合大型语言模型(如 Qwen 2.5),Spark-TTS 能直接生成语义 Token 并还原波形,简化推理流程。实验表明,它不仅能克隆音色、语速和语调,还支持跨语言朗读及情感调整。尽管面临相似度提升、样本鲁棒性等挑战,但其技术突破为定制化 AI 声音提供了全新可能。
1035 35
|
存储 分布式计算 Hadoop
数据湖技术:Hadoop与Spark在大数据处理中的协同作用
【10月更文挑战第27天】在大数据时代,数据湖技术凭借其灵活性和成本效益成为企业存储和分析大规模异构数据的首选。Hadoop和Spark作为数据湖技术的核心组件,通过HDFS存储数据和Spark进行高效计算,实现了数据处理的优化。本文探讨了Hadoop与Spark的最佳实践,包括数据存储、处理、安全和可视化等方面,展示了它们在实际应用中的协同效应。
779 2
|
存储 分布式计算 Hadoop
数据湖技术:Hadoop与Spark在大数据处理中的协同作用
【10月更文挑战第26天】本文详细探讨了Hadoop与Spark在大数据处理中的协同作用,通过具体案例展示了两者的最佳实践。Hadoop的HDFS和MapReduce负责数据存储和预处理,确保高可靠性和容错性;Spark则凭借其高性能和丰富的API,进行深度分析和机器学习,实现高效的批处理和实时处理。
712 1
|
分布式计算 Java 开发工具
阿里云MaxCompute-XGBoost on Spark 极限梯度提升算法的分布式训练与模型持久化oss的实现与代码浅析
本文介绍了XGBoost在MaxCompute+OSS架构下模型持久化遇到的问题及其解决方案。首先简要介绍了XGBoost的特点和应用场景,随后详细描述了客户在将XGBoost on Spark任务从HDFS迁移到OSS时遇到的异常情况。通过分析异常堆栈和源代码,发现使用的`nativeBooster.saveModel`方法不支持OSS路径,而使用`write.overwrite().save`方法则能成功保存模型。最后提供了完整的Scala代码示例、Maven配置和提交命令,帮助用户顺利迁移模型存储路径。
|
分布式计算 JavaScript 前端开发
大数据进阶之路——Scala入门
大数据进阶之路——Scala入门 8
418 0
大数据进阶之路——Scala入门
|
分布式计算 大数据 Java
大数据-87 Spark 集群 案例学习 Spark Scala 案例 手写计算圆周率、计算共同好友
大数据-87 Spark 集群 案例学习 Spark Scala 案例 手写计算圆周率、计算共同好友
318 5