Python+Spark2.0+hadoop学习笔记——pyspark基础

本文转载自查看原文 2020-03-31 10:47 1206 大数据技术

在历经千辛万苦后，终于把所有的东西都配置好了。

下面开始介绍pyspark的一些基础内容，以字数统计为例。

1）在本地运行pyspark程序

读取本地文件

textFile=sc.textFile("file:/usr/local/spark/README.md")

textFile.count()

读取HDFS文件

textFile=sc.textFile('hdfs://master:9000/user/*********/wordcount/input/LICENSE.txt")

textFile.count()

2）在Hadoop YARN运行pyspark

HADOOP_CONF_DIR=/usr/local/hadoop/etc/hadoop pyspark --master yarn --deploy-more client

textFile=sc.textFile('hdfs://master:9000/user/*********/wordcount/input/LICENSE.txt")

textFile.count()

3）构建Spark Standalone Cluster运行环境

cp /usr/local/spark/conf/spark-env.sh.template /usr/local/spark/conf/spark-env.sh

sudo gedit /usr/local/spark/conf/spark

然后进行下面的设置

export SPARK_MASTER_IP=master

export SPARK_WORKER_CORES=1

export SPARK_WORKER_MEMORY=512m

export SPARK_WORKER_INSTANCES=4

然后连接每个计算机，之后启动Spark Standalone Cluster

/usr/local/spark/sbin/start-all.sh

pyspark --master spark://master:7077 --num-executors 1 --total-executor-cores 3 --executor 512m

读取本地文件

textFile=sc.textFile("file:/usr/local/spark/README.md")

textFile.count()

读取HDFS文件

textFile=sc.textFile('hdfs://master:9000/user/*********/wordcount/input/LICENSE.txt")

textFile.count()

本站转载的文章为个人学习借鉴使用，本站对版权不负任何法律责任。如果侵犯了您的隐私权益，请联系本站邮箱yoyou2525@163.com删除。

猜您在找 Python+Spark2.0+hadoop学习笔记——Spark ML Pipeline机器学习流程 [Hadoop] Hadoop学习笔记之Hadoop基础 python连接spark（pyspark） PySpark和SparkSQL基础：如何利用Python编程执行Spark（附代码） Spark (Python版) 零基础学习笔记（一）—— 快速入门 Spark学习笔记（一）——基础概述 spark 2.0 中 pyspark 对接 Ipython Hadoop/Spark入门学习笔记(完结) pyspark学习笔记 pyspark学习笔记