spark 先groupby 再从每个group里面选top n

本文转载自查看原文 2020-07-30 09:37 889 spark

  import spark.implicits._

  val simpleData = Seq(("James","Sales","NY",90000,34,10000),
    ("Michael","Sales","NY",86000,56,20000),
    ("Robert","Sales","CA",81000,30,23000),
    ("Maria","Finance","CA",90000,24,23000),
    ("Raman","Finance","CA",99000,40,24000),
    ("Scott","Finance","NY",83000,36,19000),
    ("Jen","Finance","NY",79000,53,15000),
    ("Jeff","Marketing","CA",80000,25,18000),
    ("Kumar","Marketing","NY",91000,50,21000)
  )
  val df = simpleData.toDF("employee_name","department","state","salary","age","bonus")
  df.show()

import org.apache.spark.sql.functions._
import org.apache.spark.sql.expressions.Window


// Window definition
val w = Window.partitionBy($"department").orderBy(desc("bonus"))

// Filter
var df_1 = df.withColumn("rank", rank.over(w)).where($"rank" <= 2)

df_1.show()

免责声明！

本站转载的文章为个人学习借鉴使用，本站对版权不负任何法律责任。如果侵犯了您的隐私权益，请联系本站邮箱yoyou2525@163.com删除。

猜您在找 pandas 取 groupby 后每个分组的前 N 行 Spark如何解决常见的Top N问题 postgres select TOP X in group 查询每个组的前几名 MySQL：如何查询出每个分组中的 top n 条记录？ spark 按照key 分组然后统计每个key对应的最大、最小、平均值思路——使用groupby，或者reduceby Spark 两种方法计算分组取Top N Spark算子 - groupBy redis中获取每个数据类型top-n的bigkeys信息 Spark scala groupBy后求和 hive top n