【Spark】Day01-入门、模块组成、运行模式、案例实操(spark分析过程)


一、概述

1、概念

基于内存的大数据分析计算引擎

2、Spark内置模块

Core:基本功能、弹性Resilient 分布式数据集RDD

SQl:数据查询

Streaming:流式计算

Mlib

二、Spark运行模式:单机模式与集群模式

1、分类

Local、Standalone(自带的任务调度)、YARN、Mesos

2、集群角色

守护进程:Master(类似RM)和Worker(类似NM)

临时程序:Driver和Executor

3、配置历史服务、高可用HA

4、运行流程

standalone-client和standalone-cluster:区别在于Driver的运行节点

5、Yarn模式

客户端直接连接yarn,无需额外构建spark集群

三、WordCount案例实操

编写程序、maven打包、bin/spark-submit执行任务、查询结果hadoop fs -cat /output/*