Hive_内部排序(Sort By)

本文转载自查看原文 2019-11-06 20:47 320 Hive

每个MapReduce内部排序（Sort By）

Sort By：对于大规模的数据集order by的效率非常低。在很多情况下，并不需要全局排序，此时可以使用sort by。

Sort by为每个reducer产生一个排序文件。每个Reducer内部进行排序，对全局结果集来说不是排序。

1．设置reduce个数

hive (default)> set mapreduce.job.reduces=3;

2．查看设置reduce个数

hive (default)> set mapreduce.job.reduces;

3．根据部门编号降序查看员工信息

hive (default)> select * from emp sort by deptno desc;

4．将查询结果导入到文件中（按照部门编号降序排序）

hive (default)> insert overwrite local directory '/opt/module/datas/sortby-result'
select * from emp sort by d

本站转载的文章为个人学习借鉴使用，本站对版权不负任何法律责任。如果侵犯了您的隐私权益，请联系本站邮箱yoyou2525@163.com删除。

猜您在找 Hive_分区排序(Distribute By) Hive_分区排序(Distribute By) Hive_优缺点 Hive_创建表 Hive_空字段赋值 Hive_创建数据库 Hive_解析 get_json_object ( ) Python对列表内部的字典进行排序 --lambda,sort Hive_行转列(多行转一个集合/数组) Hive_列转行(集合/数组转多行)