Hive的Transform的實現



Hive 的 TRANSFORM 關鍵字提供了在 SQL 中調用自寫腳本的功能。適合實現 Hive 中沒有的 功能又不想寫 UDF 的情況,腳本一般都是python寫的。

Json 數據: {"movie":"1193","rate":"5","timeStamp":"978300760","uid":"1"}

需求:把json的字段timeStamp轉換為日期編號。

1、先加載 rating.json 文件到 hive 的一個原始表 rate_json

create table rate_json(line string) row format delimited;
load data local inpath '/home/j.json' into table rate_json;

 

2、創建 rate 這張表用來存儲解析 json 出來的字段:

create table rate(movie int, rate int, unixtime int, userid int) row format delimited fields
terminated by '\t';

 

  解析 json,得到結果之后存入 rate 表: 

insert into table rate select 
get_json_object(line,'$.movie') as movie,
get_json_object(line,'$.rate') as rate,
get_json_object(line,'$.timeStamp') as unixtime,
get_json_object(line,'$.uid') as userid
from rate_json;

 

  使用 transform+python 的方式去轉換 unixtime 為 weekday

  先編輯一個 python 腳本文件

 1 import sys
 2 import datetime
 3 for line in sys.stdin:
 4     #獲取每一行的內容並去掉頭尾的空格
 5     line = line.strip()
 6     #根據換行符截取對應的字段
 7     movie,rate,timeinfo,userid = line.split('\t')
 8     #將timeinfo轉成時間格式
 9     weekday = datetime.datetime.fromtimestamp(float(timeinfo)).isoweekday()
10     #重新拼接拼接新的內容並加入換行符
11     print '\t'.join([movie, rate, str(weekday),userid])

 

3,創建最后的用來存儲調用 python 腳本解析出來的數據的表:lastjsontable

  

create table lastjsontable(movie int, rate int, weekday int, userid int) row format delimited
fields terminated by '\t';

 

   保存文件 然后,將文件加入 hive 的 classpath:

hive>add file /home/datechange.py;
hive> insert into table lastjsontable select transform(movie,rate,unixtime,userid)
using 'python datechange.py' as(movie,rate,weekday,userid) from rate;

 

4,最后查詢看數據是否正確

 

select distinct(weekday) from lastjsontable;

 


免責聲明!

本站轉載的文章為個人學習借鑒使用,本站對版權不負任何法律責任。如果侵犯了您的隱私權益,請聯系本站郵箱yoyou2525@163.com刪除。



 
粵ICP備18138465號   © 2018-2025 CODEPRJ.COM