Spark：java api读取hdfs目录下多个文件

本文转载自查看原文 2018-10-19 15:57 8013 BigData-Hadoop/ Hadoop+Spark

需求：

由于一个大文件，在spark中加载性能比较差。于是把一个大文件拆分为多个小文件后上传到hdfs，然而在spark2.2下如何加载某个目录下多个文件呢?

public class SparkJob {
    public static void main(String[] args) {
        String filePath = args[0];
        // initialize spark session
        String appName = "Streaming-MRO-Load-Multiple-CSV-Files-Test";
        SparkSession sparkSession = SparkHelper.getInstance().getAndConfigureSparkSession(appName);

        // reader multiple csv files.
        try {
            Dataset<Row> rows = sparkSession.read().option("delimiter", "|").option("header", false)
                    .csv(filePath).toDF(getNCellSchema());
            rows.show(10);
        } catch (Exception ex) {
            ex.printStackTrace();
        }

        try {
            Dataset<String> rows = sparkSession.read().textFile(filePath);
            rows.show(10);
        } catch (Exception ex) {
            ex.printStackTrace();
        }

        SparkHelper.getInstance().dispose();
    }

    private static Seq<String> getNCellSchema() {
        List<String> ncellColumns = "m_id,m_eid,m_int_id,.....";

        List<String> columns = new ArrayList<String>();
        for (String column : ncellColumns) {
            columns.add(column);
        }

        Seq<String> columnsSet = JavaConversions.asScalaBuffer(columns);

        return columnsSet;
    }
}

测试结果：

免责声明！

本站转载的文章为个人学习借鉴使用，本站对版权不负任何法律责任。如果侵犯了您的隐私权益，请联系本站邮箱yoyou2525@163.com删除。

猜您在找 Java 读取目录下的全部文件和文件夹 Java 读取某个目录下所有文件、文件夹 java 实现读取某个目录下指定类型的文件 java项目中读取src目录下的文件 java读取WEB-INF目录下文件 java读取存在src目录下和存在同级目录下的配置文件 Spark读取HDFS中的Zip文件 Java读取指定目录下的所有文件（子目录里的文件也可递归得到） Android：读取assets目录下文件（一） Python读取一目录下的所有文件