Flink SQL 系列 | 5 個 TableEnvironment 我該用哪個？

本文轉載自查看原文 2019-10-11 16:01 291

本文為 Flink SQL 系列文章的第二篇，前面對 Flink 1.9 Table 新架構及 Planner 的使用進行了詳細說明，本文詳細講解 5 個 TableEnvironment 及其適用場景，並介紹 Flink 社區對 TableEnvironment 的未來規划。主要內容如下：

TableEnvironment 簡介
5 個 TableEnvironment 梳理
如何使用 TableEnvironment
社區未來規划

1. TableEnvironment 簡介

TableEnvironment 是用來創建 Table & SQL 程序的上下文執行環境，也是 Table & SQL 程序的入口，Table & SQL 程序的所有功能都是圍繞 TableEnvironment 這個核心類展開的。TableEnvironment 的主要職能包括：對接外部系統，表及元數據的注冊和檢索，執行SQL語句，提供更詳細的配置選項。

在 Flink 1.8 中，一共有 7 個 TableEnvironment ，在最新的 Flink 1.9 中，社區進行了重構和優化，只保留了 5 個TableEnvironment 。本文詳細講解 5 個 TableEnvironment 及其適用場景，並介紹 Flink 社區對 TableEnvironment 的未來規划。

2. 5 個 TableEnvironment 梳理

Flink 1.9 中保留了 5 個 TableEnvironment，在實現上是 5 個面向用戶的接口，在接口底層進行了不同的實現。5 個接口包括一個 TableEnvironment 接口，兩個 BatchTableEnvironment 接口，兩個 StreamTableEnvironment 接口，5 個接口文件完整路徑如下：

org/apache/flink/table/api/TableEnvironment.java
org/apache/flink/table/api/java/BatchTableEnvironment.java
org/apache/flink/table/api/scala/BatchTableEnvironment.scala
org/apache/flink/table/api/java/StreamTableEnvironment.java
org/apache/flink/table/api/scala/StreamTableEnvironment.scala

結合文件的路徑，梳理這 5 個接口，我們會發現 TableEnvironment 是頂級接口，是所有 TableEnvironment 的基類，BatchTableEnvironment 和 StreamTableEnvironment 都提供了 Java 實現和 Scala 實現，分別有兩個接口。

5 個 TableEnvironment

其中，TableEnvironment 作為統一的接口，其統一性體現在兩個方面，一是對於所有基於JVM的語言(即 Scala API 和 Java API 之間沒有區別)是統一的；二是對於 unbounded data （無界數據，即流數據）和 bounded data （有界數據，即批數據）的處理是統一的。TableEnvironment 提供的是一個純 Table 生態的上下文環境，適用於整個作業都使用 Table API & SQL 編寫程序的場景。TableEnvironment 目前還不支持注冊 UDTF 和 UDAF，用戶有注冊 UDTF 和 UDAF 的需求時，可以選擇使用其他 TableEnvironment。

兩個 StreamTableEnvironment 分別用於 Java 的流計算和 Scala 的流計算場景，流計算的對象分別是 Java 的 DataStream 和 Scala 的 DataStream。相比 TableEnvironment，StreamTableEnvironment 提供了 DataStream 和 Table 之間相互轉換的接口，如果用戶的程序除了使用 Table API & SQL 編寫外，還需要使用到 DataStream API，則需要使用 StreamTableEnvironment。

兩個 BatchTableEnvironment 分別用於 Java 的批處理場景和 Scala 的批處理場景，批處理的對象分別是 Java 的 DataSet 和 Scala 的 DataSet。相比 TableEnvironment，BatchTableEnvironment 提供了 DataSet 和 Table 之間相互轉換的接口，如果用戶的程序除了使用 Table API & SQL 編寫外，還需要使用到 DataSet API，則需要使用 BatchTableEnvironment。

從這五個 TableEnvironment 支持的作業類型 ( Stream 作業和 Batch 作業)，支持的 API 類型（DataStream API 和 DataSet API)，以及對 UDTF/UDAF 的支持這 5 個方面進行對比，各個TableEnvironment 支持的功能可以歸納如下：

TableEnvironment 支持功能對比

可能大家會疑惑為什么在 API 需要區分 Java 和 Scala 的兩個 StreamTableEnvironment（或BatchTableEnvironment ），使用的 DataStream也分為 Java DataStream 和 Scala DataStream。

原因主要是 TableEnvironment 的 registerTableFunction方法（用於注冊UDTF）和 registerAggregateFunction 方法（用戶注冊UDAF）需要抽取泛型，而現有的 Java 泛型抽取和 Scala 的泛型抽取機制是不一樣的，Java 的抽取是通過反射機制實現，而 Scala 是通過 Scala macro 實現。此外，由於抽取泛型機制的不一致，作為統一入口的 TableEnvironment 現階段也不支持注冊 UDTF 和 UDAF。針對這個問題，社區已經在計划引入一套新的類型抽取機制來統一 Java 和 Scala 的類型抽取，實現 Java API 和 Scala API 的統一。

5 個 TableEnvironment 具體實現

結合 Flink planner 和 Blink planner，進一步梳理 TableEnvironment 的組織關系，我們可以注意到一些有趣的細節：

實現流批統一的 Blink planner 中由於沒有了 DataSet 的概念，已經不再使用 BatchTableEnvironment，只會使用 TableEnvironment 和 StreamTableEnvironment，而 Flink planner（即 Old planner）則支持 5 個 TableEnvironment。
BatchTableEnvironment 的實現都放到了 Old planner (flink-table-palnner模塊) 中，這個模塊在社區的未來規划中是會被逐步刪除的。

3. 如何使用 TableEnvironment

根據用戶使用的 planner 和作業的類型，可以把各個 TableEnvironment 的應用場景分為 4 類,下面結合代碼來說明在不同的場景下如何使用 TableEnvironment 。

場景一：

用戶使用 Old planner，進行流計算的 Table 程序（使用 Table API 或 SQL 進行開發的程序）的開發。這種場景下，用戶可以使用 StreamTableEnvironment 或 TableEnvironment ，兩者的區別是 StreamTableEnvironment 額外提供了與 DataStream API 交互的接口。示例代碼如下：

// **********************
// FLINK STREAMING QUERY USING JAVA
// **********************
import org.apache.flink.streaming.api.environment.StreamExecutionEnvironment;
import org.apache.flink.table.api.EnvironmentSettings;
import org.apache.flink.table.api.java.StreamTableEnvironment;
EnvironmentSettings fsSettings = EnvironmentSettings.newInstance().useOldPlanner().inStreamingMode().build();
StreamExecutionEnvironment fsEnv = StreamExecutionEnvironment.getExecutionEnvironment();
StreamTableEnvironment fsTableEnv = StreamTableEnvironment.create(fsEnv, fsSettings);
// or TableEnvironment fsTableEnv = TableEnvironment.create(fsSettings);
// **********************
// FLINK STREAMING QUERY USING SCALA
// **********************
import org.apache.flink.streaming.api.scala.StreamExecutionEnvironment
import org.apache.flink.table.api.EnvironmentSettings
import org.apache.flink.table.api.scala.StreamTableEnvironment
val fsSettings = EnvironmentSettings.newInstance().useOldPlanner().inStreamingMode().build()
val fsEnv = StreamExecutionEnvironment.getExecutionEnvironment
val fsTableEnv = StreamTableEnvironment.create(fsEnv, fsSettings)
// or val fsTableEnv = TableEnvironment.create(fsSettings)

場景二：

用戶使用 Old planner，進行批處理的 Table 程序的開發。這種場景下，用戶只能使用 BatchTableEnvironment ，因為在使用 Old planner 時，批處理程序操作的數據是 DataSet，只有 BatchTableEnvironment 提供了面向DataSet 的接口實現。示例代碼如下：

// ******************
// FLINK BATCH QUERY USING JAVA
// ******************
import org.apache.flink.api.java.ExecutionEnvironment;
import org.apache.flink.table.api.java.BatchTableEnvironment;
ExecutionEnvironment fbEnv = ExecutionEnvironment.getExecutionEnvironment();
BatchTableEnvironment fbTableEnv = BatchTableEnvironment.create(fbEnv);
// ******************
// FLINK BATCH QUERY USING SCALA
// ******************
import org.apache.flink.api.scala.ExecutionEnvironment
import org.apache.flink.table.api.scala.BatchTableEnvironment
val fbEnv = ExecutionEnvironment.getExecutionEnvironment
val fbTableEnv = BatchTableEnvironment.create(fbEnv)

場景三：

用戶使用 Blink planner，進行流計算的 Table 程序的開發。這種場景下，用戶可以使用 StreamTableEnvironment 或 TableEnvironment ，兩者的區別是 StreamTableEnvironment 額外提供與 DataStream API 交互的接口。用戶在 EnvironmentSettings 中聲明使用 Blink planner ，將執行模式設置為 StreamingMode 即可。示例代碼如下：

// **********************
// BLINK STREAMING QUERY USING JAVA
// **********************
import org.apache.flink.streaming.api.environment.StreamExecutionEnvironment;
import org.apache.flink.table.api.EnvironmentSettings;
import org.apache.flink.table.api.java.StreamTableEnvironment;
StreamExecutionEnvironment bsEnv = StreamExecutionEnvironment.getExecutionEnvironment();
EnvironmentSettings bsSettings = EnvironmentSettings.newInstance().useBlinkPlanner().inStreamingMode().build();
StreamTableEnvironment bsTableEnv = StreamTableEnvironment.create(bsEnv, bsSettings);
// or TableEnvironment bsTableEnv = TableEnvironment.create(bsSettings);
// **********************
// BLINK STREAMING QUERY USING SCALA
// **********************
import org.apache.flink.streaming.api.scala.StreamExecutionEnvironment
import org.apache.flink.table.api.EnvironmentSettings
import org.apache.flink.table.api.scala.StreamTableEnvironment
val bsEnv = StreamExecutionEnvironment.getExecutionEnvironment
val bsSettings = EnvironmentSettings.newInstance().useBlinkPlanner().inStreamingMode().build()
val bsTableEnv = StreamTableEnvironment.create(bsEnv, bsSettings)
// or val bsTableEnv = TableEnvironment.create(bsSettings)

場景四：

用戶使用 Blink planner，進行批處理的 Table 程序的開發。這種場景下，用戶只能使用 TableEnvironment ，因為在使用 Blink planner 時，批處理程序操作的數據已經是 bounded DataStream，所以不能使用 BatchTableEnvironment 。用戶在 EnvironmentSettings 中聲明使用 Blink planner ，將執行模式設置為 BatchMode 即可。值得注意的是，TableEnvironment 接口的具體實現中已經支持了 StreamingMode 和 BatchMode 兩種模式，而 StreamTableEnvironment 接口的具體實現中目前暫不支持 BatchMode 的配置，所以這種場景不能使用 StreamTableEnvironment。示例代碼如下：

// ******************
// BLINK BATCH QUERY USING JAVA
// ******************
import org.apache.flink.table.api.EnvironmentSettings;
import org.apache.flink.table.api.TableEnvironment;
EnvironmentSettings bbSettings = EnvironmentSettings.newInstance().useBlinkPlanner().inBatchMode().build();
TableEnvironment bbTableEnv = TableEnvironment.create(bbSettings);
// ******************
// BLINK BATCH QUERY USING SCALA
// ******************
import org.apache.flink.table.api.{EnvironmentSettings, TableEnvironment}
val bbSettings = EnvironmentSettings.newInstance().useBlinkPlanner().inBatchMode().build()
val bbTableEnv = TableEnvironment.create(bbSettings)

4. 社區未來規划

目前，社區正在推進 DataStream 的批處理能力，以實現流批技術棧的統一，屆時 DataSet API 會退出歷史的舞台，兩個 BatchTableEnvironment 也將退出歷史的舞台。同時社區也在努力推動 Java 和 Scala TableEnvironment 的統一。可以預見的是，Flink TableEnvironment 的未來架構會更加簡潔。TableEnvironment 會是 Flink 推薦使用的入口類，同時能支持 Java API 和 Scala API，還能同時支持流計算作業和批處理作業。只有當需要與 DataStream 做轉換時，才需要用到 StreamTableEnvironment。

本文作者：徐榜江（雪盡）

原文鏈接

本文為雲棲社區原創內容，未經允許不得轉載。

免責聲明！

本站轉載的文章為個人學習借鑒使用，本站對版權不負任何法律責任。如果侵犯了您的隱私權益，請聯系本站郵箱yoyou2525@163.com刪除。

猜您在找 flink系列-8、Flink Table API & Flink Sql API Flink系列之1.10版流式SQL應用 flink sql SQL表名，應該用復數還是單數 flink系列-9、flink的狀態與容錯 Flink系列之Time和WaterMark 前端們，gulp該用起來了，簡單的demo入門——gulp系列（一） flink系列-1、flink介紹，反壓原理 Flink Sql Client初探 Flink SQL CDC 詳解