Hive详解(05) - 压缩和存储


Hive详解(05) - 压缩和存储

Hadoop压缩配置

MR支持的压缩编码

压缩格式

算法

文件扩展名

是否可切分

http://google.github.io/snappy/

On a single core of a Core i7 processor in 64-bit mode, Snappy compresses at about 250 MB/sec or more and decompresses at about 500 MB/sec or more.

在64位模式的core i7处理器的单核上,Snappy以大约250 MB/秒或更高的速度压缩,并以大约500 MB/秒或更高的速度解压缩。

压缩参数配置

要在Hadoop中启用压缩,可以配置如下参数(mapred-site.xml文件中):

参数

默认值

阶段

建议

https://cwiki.apache.org/confluence/display/Hive/LanguageManual+ORC

ORC存储方式的压缩:

Key

Default

Notes

orc.compress

ZLIB

high level compression (one of NONE, ZLIB, SNAPPY)

orc.compress.size

262,144

number of bytes in each compression chunk

orc.stripe.size

268,435,456

number of bytes in each stripe

orc.row.index.stride

10,000

number of rows between index entries (must be >= 1000)

orc.create.index

true

whether to create row indexes

orc.bloom.filter.columns

""

comma separated list of column names for which bloom filter should be created

orc.bloom.filter.fpp

0.05

false positive probability for bloom filter (must >0.0 and <1.0)

注意:所有关于ORCFile的参数都是在HQL语句的TBLPROPERTIES字段里面出现

  • 创建一个ZLIB压缩的ORC存储方式

(1)建表语句

create table log_orc_zlib(

id string,

line string

)

row format delimited fields terminated by '\t'

stored as orc

tblproperties("orc.compress"="ZLIB");

(2)插入数据

insert into log_orc_zlib select * from log_text;

(3)查看插入后数据

hive (default)> dfs -du -h /user/hive/warehouse/log_orc_zlib/ ;

2.78 M /user/hive/warehouse/log_orc_none/000000_0

  • 创建一个SNAPPY压缩的ORC存储方式

(1)建表语句

create table log_orc_snappy(

id string,

line string

)

row format delimited fields terminated by '\t'

stored as orc

tblproperties("orc.compress"="SNAPPY");

(2)插入数据

insert into log_orc_snappy select * from log_text;

(3)查看插入后数据

hive (default)> dfs -du -h /user/hive/warehouse/log_orc_snappy/ ;

3.75 M /user/hive/warehouse/log_orc_snappy/000000_0

ZLIB比Snappy压缩的还小。原因是ZLIB采用的是deflate压缩算法。比snappy压缩的压缩率高。

  • 创建一个SNAPPY压缩的parquet存储方式

(1)建表语句

create table log_parquet_snappy(

id string,

line string

)

row format delimited fields terminated by '\t'

stored as parquet

tblproperties("parquet.compression"="SNAPPY");

(2)插入数据

insert into log_parquet_snappy select * from log_text;

(3)查看插入后数据

hive (default)> dfs -du -h /user/hive/warehouse/log_parquet_snappy / ;

6.39 MB /user/hive/warehouse/ log_parquet_snappy /000000_0

存储方式和压缩总结

在实际的项目开发当中,hive表的数据存储格式一般选择:orc或parquet。压缩方式一般选择snappy,lzo。