【大数据】PySpark 使用 FileSystem 操作 HDFS

本文转载自查看原文 2021-12-26 21:47 962 Pyspark/ 每日一技

需求：spark 可以直接使用 textFile 读取 HDFS，但是不能判断 hdfs 文件是否存在，不过 pyspark 可以调用 java 程序，因此可以调用 FileSystem来实现：

# coding=utf-8

from pyspark import SparkContext

sc = SparkContext(appName="check_hdfs_exists")
jvm = sc._jvm
log4jLogger = jvm.org.apache.log4j
logger = log4jLogger.LogManager.getLogger(__name__)

config = jvm.org.apache.hadoop.conf.Configuration()
file_system = jvm.org.apache.hadoop.fs.File.System.get(config)

path = jvm.org.apache.hadoop.fs.Path("hdfs://hacluster/xxxxx")
path_is_exists = file_system.exists(path)

免责声明！

本站转载的文章为个人学习借鉴使用，本站对版权不负任何法律责任。如果侵犯了您的隐私权益，请联系本站邮箱yoyou2525@163.com删除。

猜您在找 大数据系列2：Hdfs的读写操作大数据基础---PySpark 大数据篇：HDFS 大数据学习之四——HDFS 使用FileSystem类操作HDFS文件大数据（1）---大数据及HDFS简述网易大数据之数据存储：HDFS 大数据---HDFS写入数据的过程大数据之--------hadoop存储(HDFS) 大数据系列之Flume+HDFS