hive join 优化,hivejoin


1、小、大表 join

在小表和大表进行join时,将小表放在前边,效率会高,hive会将小表进行缓存。

2、mapjoin

使用mapjoin将小表放入内存,在map端和大表逐一匹配,从而省去reduce。

例子:

select /*+MAPJOIN(b)*/ a.a1,a.a2,b.b2 from tablea a JOIN tableb b ON a.a1=b.b1

在0.7版本后,也可以用配置来自动优化

set hive.auto.convert.join=true;



hadoop hive join性可以的问题

个人感觉是shuffle出问题了。我碰到过相同的问题,就是map 100%, reduce 0% 一直这样打印。后来就是发现shuffle出问题了。这种情况就说,一直在retry, 最后如果次数到了,就直接跳过了。没收到的map的输出就不要了。这当然会导致结果不准确。这种情况,最好能用Eclipse跟一下,就很容易找到出错的地方。
 

怎优化hive

优化hive必须得了解MR编程,因为hive的语句都是转化成MR程序执行的,基于MR的逻辑优化
 

相关内容