hive join 优化，hivejoin

文章由LinuxBoy分享于2019-03-27 05:03:15热评（213）

hive join 优化，hivejoin

1、小、大表 join

在小表和大表进行join时，将小表放在前边，效率会高，hive会将小表进行缓存。

2、mapjoin

使用mapjoin将小表放入内存，在map端和大表逐一匹配，从而省去reduce。

例子：

select /*+MAPJOIN(b)*/ a.a1,a.a2,b.b2 from tablea a JOIN tableb b ON a.a1=b.b1

在0.7版本后，也可以用配置来自动优化

set hive.auto.convert.join=true;

hadoop hive join性可以的问题

个人感觉是shuffle出问题了。我碰到过相同的问题，就是map 100%, reduce 0% 一直这样打印。后来就是发现shuffle出问题了。这种情况就说，一直在retry, 最后如果次数到了，就直接跳过了。没收到的map的输出就不要了。这当然会导致结果不准确。这种情况，最好能用Eclipse跟一下，就很容易找到出错的地方。

怎优化hive

优化hive必须得了解MR编程，因为hive的语句都是转化成MR程序执行的，基于MR的逻辑优化

推荐文章：

hive join 优化，hivejoin

hive join 优化，hivejoin

hadoop hive join性可以的问题

怎优化hive

最新云计算教程

Linux头条

hive join 优化，hivejoin

hive join 优化，hivejoin

hadoop hive join性可以的问题

怎优化hive

相关内容

最新云计算教程

Linux头条