Spark2 DataSet 創建新行之flatMap

本文轉載自查看原文 2016-11-28 19:05 4532 2.0--Spark

val dfList = List(("Hadoop", "Java,SQL,Hive,HBase,MySQL"), ("Spark", "Scala,SQL,DataSet,MLlib,GraphX"))
dfList: List[(String, String)] = List((Hadoop,Java,SQL,Hive,HBase,MySQL), (Spark,Scala,SQL,DataSet,MLlib,GraphX))

case class Book(title: String, words: String)

val df=dfList.map{p=>Book(p._1,p._2)}.toDS()
df: org.apache.spark.sql.Dataset[Book] = [title: string, words: string]

df.show
+------+--------------------+
| title|               words|
+------+--------------------+
|Hadoop|Java,SQL,Hive,HBa...|
| Spark|Scala,SQL,DataSet...|
+------+--------------------+

df.flatMap(_.words.split(",")).show
+-------+
|  value|
+-------+
|   Java|
|    SQL|
|   Hive|
|  HBase|
|  MySQL|
|  Scala|
|    SQL|
|DataSet|
|  MLlib|
| GraphX|
+-------+

免責聲明！

本站轉載的文章為個人學習借鑒使用，本站對版權不負任何法律責任。如果侵犯了您的隱私權益，請聯系本站郵箱yoyou2525@163.com刪除。

猜您在找 Spark2 Dataset之視圖與SQL Spark2 Dataset聚合操作 Spark2 Dataset去重、差集、交集 Spark2 Dataset持久化存儲級別StorageLevel Spark2 Dataset之collect_set與collect_list Spark2 Dataset多維度統計cube與rollup Spark2 Dataset DataFrame空值null,NaN判斷和處理 Spark2 Dataset行列操作和執行計划 Spark 根據 JSON數據創建Dataset Spark新特性（DataFrame/DataSet、Structured Streaming和Spark Session）