首页
Spark分区
默认采用的是Hash分区
缺点:可能导致每个分区中数据量的不均匀,极端情况下会导致某些分区拥有RDD的全部数据
Ranger分区
要求RDD中的KEY类型必须可以排序
自定义分区
根据需求,自定义分区
spark
相关
spark 数据流输出
Spark 安装部署与快速上手
Spark面试题(八)——Spark的Shuffle配置调优
spark参数调优
spark jvm参数优化(fullgc)
hadoop系列整理---PySpark
【Spark】Day02:Spark-Core:RDD、编程、数据读取保存、累加器、广播变量、top10
Flume+Kafka+SparkStreaming打造实时流处理框架
Spark SQL知识点与实战
【Spark学习笔记】广播变量和累加器
【Spark学习笔记】01-Spark简介
spark中agg函数的使用
标签