【Spark】Day01-入门、模块组成、运行模式、案例实操(spark分析过程)
一、概述
1、概念
基于内存的大数据分析计算引擎
2、Spark内置模块
Core:基本功能、弹性Resilient 分布式数据集RDD
SQl:数据查询
Streaming:流式计算
Mlib
二、Spark运行模式:单机模式与集群模式
1、分类
Local、Standalone(自带的任务调度)、YARN、Mesos
2、集群角色
守护进程:Master(类似RM)和Worker(类似NM)
临时程序:Driver和Executor
3、配置历史服务、高可用HA
4、运行流程
standalone-client和standalone-cluster:区别在于Driver的运行节点
5、Yarn模式
客户端直接连接yarn,无需额外构建spark集群
三、WordCount案例实操
编写程序、maven打包、bin/spark-submit执行任务、查询结果hadoop fs -cat /output/*