Python+Spark2.0+hadoop學習筆記——pyspark基礎

本文轉載自查看原文 2020-03-31 10:47 1206 大數據技術

在歷經千辛萬苦后，終於把所有的東西都配置好了。

下面開始介紹pyspark的一些基礎內容，以字數統計為例。

1）在本地運行pyspark程序

讀取本地文件

textFile=sc.textFile("file:/usr/local/spark/README.md")

textFile.count()

讀取HDFS文件

textFile=sc.textFile('hdfs://master:9000/user/*********/wordcount/input/LICENSE.txt")

textFile.count()

2）在Hadoop YARN運行pyspark

HADOOP_CONF_DIR=/usr/local/hadoop/etc/hadoop pyspark --master yarn --deploy-more client

textFile=sc.textFile('hdfs://master:9000/user/*********/wordcount/input/LICENSE.txt")

textFile.count()

3）構建Spark Standalone Cluster運行環境

cp /usr/local/spark/conf/spark-env.sh.template /usr/local/spark/conf/spark-env.sh

sudo gedit /usr/local/spark/conf/spark

然后進行下面的設置

export SPARK_MASTER_IP=master

export SPARK_WORKER_CORES=1

export SPARK_WORKER_MEMORY=512m

export SPARK_WORKER_INSTANCES=4

然后連接每個計算機，之后啟動Spark Standalone Cluster

/usr/local/spark/sbin/start-all.sh

pyspark --master spark://master:7077 --num-executors 1 --total-executor-cores 3 --executor 512m

讀取本地文件

textFile=sc.textFile("file:/usr/local/spark/README.md")

textFile.count()

讀取HDFS文件

textFile=sc.textFile('hdfs://master:9000/user/*********/wordcount/input/LICENSE.txt")

textFile.count()

本站轉載的文章為個人學習借鑒使用，本站對版權不負任何法律責任。如果侵犯了您的隱私權益，請聯系本站郵箱yoyou2525@163.com刪除。

猜您在找 Python+Spark2.0+hadoop學習筆記——Spark ML Pipeline機器學習流程 [Hadoop] Hadoop學習筆記之Hadoop基礎 python連接spark（pyspark） PySpark和SparkSQL基礎：如何利用Python編程執行Spark（附代碼） Spark (Python版) 零基礎學習筆記（一）—— 快速入門 Spark學習筆記（一）——基礎概述 spark 2.0 中 pyspark 對接 Ipython Hadoop/Spark入門學習筆記(完結) pyspark學習筆記 pyspark學習筆記