sparksql使用collect_list自定義排序的實現方式

本文轉載自查看原文 2021-05-21 11:03 2814 spark/ Spark

原始數據如下：
+---+-----+----+
|id |name |type|
+---+-----+----+
|1 |name1|p   |
|2 |name2|p   |
|3 |name3|p   |
|1 |x1   |q   |
|2 |x2   |q   |
|3 |x3   |q   |
+---+-----+----+
目標數據如下：
+----+---------------------+
|type|value_list           |
+----+---------------------+
|p   |[name3, name2, name1]|
|q   |[x3, x2, x1]         |
+----+---------------------+

spark-shell
val df=Seq((1,"name1","p"),(2,"name2","p"),(3,"name3","p"),(1,"x1","q"),(2,"x2","q"),(3,"x3","q")).toDF("id","name","type")
df.show(false)
1.使用開窗函數

df.createOrReplaceTempView("test")
spark.sql("select type,max(c) as c1 from (select type,concat_ws('&',collect_list(trim(name)) over(partition by type order by id desc)) as c from test) as x group by type ")
因為使用開窗函數本身會使用比較多的資源，
這種方式在大數據量下性能會比較慢，所以嘗試下面的操作。
2.使用struct和sort_array(array,asc?)的方式來進行，效率高些:
val df3=spark.sql("select type, concat_ws('&',sort_array(collect_list(struct(id,name)),false).name) as c from test group by type ")
df3.show(false)
3.udf的方式
import org.apache.spark.sql.functions._
import org.apache.spark.sql._
val sortUdf = udf((rows: Seq[Row]) => {
rows.map { case Row(id:Int, value:String) => (id, value) }
.sortBy { case (id, value) => -id } //id if asc
.map { case (id, value) => value }
})

val grouped = df.groupBy(col("type")).agg(collect_list(struct("id", "name")) as "id_name")
val r1 = grouped.select(col("type"), sortUdf(col("id_name")).alias("value_list"))
r1.show(false)

免責聲明！

本站轉載的文章為個人學習借鑒使用，本站對版權不負任何法律責任。如果侵犯了您的隱私權益，請聯系本站郵箱yoyou2525@163.com刪除。

猜您在找 Java實現List自定義排序 hive：數據庫“行專列”操作---使用collect_set/collect_list/collect_all & row_number()over(partition by 分組字段 [order by 排序字段]) List自定義排序 007.hive組內拼接排序collect_list、sort_array Hive 集合函數 collect_set() collect_list() Hive筆記之collect_list/collect_set（列轉行） Hive系統函數之collect_list和collect_set sparksql的自定義函數 SparkSQL自定義函數 SparkSQL 如何自定義函數