如何在Jupyter里以不同的运行模式使用Pyspark

本文转载自查看原文 2018-04-28 15:10 2076 pyspark spark jupyter

假设你的环境已经安装好了以下东西,如何详细的安装它们不在本文的讨论范围之内
具体的可疑参考三分钟搞定jupyter和pyspark整合

这里多说一句,spark1.几的版本以下的只支持python2.几的支持python2和3.具体是spark2.几,笔者没有详细调查.

如何以不同的模式运行pyspark

我们都知道,spark是分为local,standalone,yarn-client,yarn-cluster等运行模式的.既然想用jupyter,自然是想要交互式的,那么如何以不同的模式来交互呢?

笔者总结如下:

import findspark
findspark.init()
from pyspark import SparkContext
sc = SparkContext("local", "First App")

2.standalone
需要传入地址和端口

import findspark
findspark.init()
from pyspark import SparkContext
sc = SparkContext("spark://192.168.5.129:7077", "First App")

3.yarn-client

import findspark
findspark.init()
from pyspark import SparkContext
sc = SparkContext("yarn-client", "First App")

3.yarn-cluster
cluster模式一般都是开发完成后,直接用来执行用的,不适用于交互模式,笔者也没有尝试过.在此就不介绍了.

其实SparkContext这个类,每个位置可以传的参数,是和shell命令行对应的,注意到了这一点,看看文档就知道每个参数可以接受什么样的值了.具体内容可以看spark官方文档.

本站转载的文章为个人学习借鉴使用，本站对版权不负任何法律责任。如果侵犯了您的隐私权益，请联系本站邮箱yoyou2525@163.com删除。

猜您在找 如何在Windows上的Jupyter Notebook中安装和运行PySpark 在 window 上安装 pyspark 并使用（集成 jupyter notebook）如何在VSCode下使用Jupyter 如何在Jupyter Lab中运行.py文件？ PySpark 安装教程使用 Jupyter 作编辑器如何在Docker容器里运行Docker pyspark 中启动 jupyter notebook jupyter notebook + pyspark 环境搭建 CDH 集群机器上部署 Jupyter notebook 使用 Pyspark 读取 Hive 数据库 pyspark启动与简单使用----本地模式（local）----shell