Apache Tez on hive


———————————————————— 調配 Hadoop  ————————————————————

1 將 編譯好的 TEZ .tar.gz 文件上傳到 HDFS 中。
 
hdfs fs -put complete-tez-0.7.0.tar.gz /tez
 

2 創建 tez-site.xml

需要在 hadoop 的 master 節點上面的 ${HADOOP_HOME}/etc/hadoop 目錄下面創建一個 tez-site.xml 文件,里面填寫如下內容

<?xml version="1.0" encoding="UTF-8"?>
<?xml-stylesheet type="text/xsl" href="configuration.xsl"?>
<configuration>
<property>
<name>tez.lib.uris</name>
<value>/tez/tez-0.7.0</value>
<name>tez.lib.uris</name>
<value>hdfs://t1:9000/tez/tez-0.8.2.tar.gz</value>
</property>
</configuration>
 
3 修改 hadoop-2.6.0/etc/hadoop/hadoop-env.sh 
 
export TEZ_HOME= /usr/local/opt/tez-0.7.0
          for jar in `ls $TEZ_HOME |grep jar`; do
export HADOOP_CLASSPATH=$HADOOP_CLASSPATH:$TEZ_HOME/$jar
 done
           for jar in `ls $TEZ_HOME/lib`; do
export HADOOP_CLASSPATH=$HADOOP_CLASSPATH:$TEZ_HOME/lib/$jar
 done
 
 

以上完成了tez的基本配置,接下來有 2 中方法使我們的任務運行在tez上,一種修改

 mapreduce-site.xml 設置 yarn  改為 yarn-tez

第二種,修改 hive 直接運行在 tez 上

 

第三種  hive set tez

 
———————————————————— hive on tez (單個 job 運行 Tez) ————————————————————
1 將編譯好的 tez(編譯成功的包會放在tez-dist/target )所有jar 包放入 hive下。
     find . -name "*jar" -print | cp -a `xargs` tezlib/ 
上面命令得到 tez 所有jar 包。
2  hive on tez 的使用方式 配置好以后 進入 hive
  1. hive (default)>set hive.execution.engine=tez;
  2. set hive.execution.engine=mr 或 退出 hive 即可
   3 如果 hive set tez 后運行異常可以啟用調試模式啟動hive (linux 下進入 hive 啟動模式)
 
              hive -hiveconf hive.root.logger=DEBUG,console 
—————————————————— Hive on tez 性能測試——————————————————
性能測試:
select a.sex ,b.age , c.* from a join b on a.sex = b.sex join c on a.id ;
 
3表 各1萬 / 169kb  
Hive on MapReduce
39分鍾 = =!
 

 

hive on tez
25分鍾  (未發揮最佳性能,因為數據量大量的 IO 都是拉取。並無多 MR)
set hive.execution.engine=tez;

 

 

實驗 a 164M b 164M c 1.7G d 164M, e 164M
————————————————   hive on MR 3 分 9 秒  ————————————————

————————————————  hive on tez 22.5 秒  ————————————————

 

———————————————————— hive on tez (所有 job 運行 Tez) ————————————————————

Tez部署完畢后,下載hive0.14.0的二進制文件,解壓即可。然后在hive的conf目錄下新建hive-site.xml進行常規的配置,如果要是此hive運行在tez上,可以在配置文件中加上:

<property>

    <name>mapreduce.framework.name</name>

    <value>yarn-tez</value>

  </property>

當然這個配置也能加在mapsite.xml里,建議加在需要hive-site.xml以不影響集群其他hive。

     然后打開命令行,首先執行set hive.execution.engine=tez; 這里說下這個配置的含義,

 

Setting execution engine to mr and framework name to yarn = Hive compiles to MR and runs on MR.

Setting execution engine to mr and framework name to yarn-tez = Hive compiles to MR and runs on Tez.

Setting execution engine to tez = Hive compiles to Tez and runs on Tez.

 

 

 

 

 


免責聲明!

本站轉載的文章為個人學習借鑒使用,本站對版權不負任何法律責任。如果侵犯了您的隱私權益,請聯系本站郵箱yoyou2525@163.com刪除。



 
粵ICP備18138465號   © 2018-2025 CODEPRJ.COM