1、数据倾斜的现象
部分Reduce一直运行,时间明显比已完成的长20倍以上
2、解决办法
2.1 单表聚合(group by+sum())
1、开启map端预聚合:hive.map.aggr=true
2、打散、二次聚合:
开启参数:hive.groupby.skewindata=true
sql手动实现
2.2 多表关联(join)
1、大小表:map join
2、大大表:
方法一:将倾斜的key单独拿出来做mapjoin
hive。optimize。skewjoin=true
方法二:打散倾斜key,扩容对方的key
sql手动实现
3、倾斜原因
1、数据本身是不均匀的(最常见,最正常的)
2、null值
没有意义的null值,过滤掉
有意义的null值,正常处理