Linux下远程连接Jupyter+pyspark部署教程
作者:RayCchou 发布时间:2021-03-31 18:35:59
博主最近试在服务器上进行spark编程,因此,在开始编程作业之前,要先搭建一个便利的编程环境,这样才能做到舒心地开发。本文主要有以下内容:
1、python多版本管理利器-pythonbrew
2、Jupyter notebooks 安装与使用以及远程连接方法
3、Jupyter连接pyspark,实现web端sprak开发
一、python多版本管理利器-pythonbrew
在利用python进行编程开发的时候,很多时候我们需要多个Python版本进行测试,博主之前一直在Python2.x和3.x之间徘徊挣扎,两者纠缠不清的关系真是令博主心累了一万年。直至遇到了pythonbrew,它在博主心中泛起的涟漪,久久不能逝去。说到pythonbrew,它是一个python的多版本管理器,可以在多个 Python之间迅速切换,也可以在指定的 Python 版本下测试python程序,更重要的是它还整合了 Virtualenv。所以,当你的电脑里装了多个python版本,并需要经常切换测试时,pythonbrew就非常适合你。
1.安装配置pythonbrew
sudo easy_install pythonbrew(easy_install安装)
pip install pythonbrew(pip安装)
2.添加配置环境到~/.bashrc(或~/.bash_profile)
[[ -s "$HOME/.pythonbrew/etc/bashrc" ]] && source"$HOME/.pythonbrew/etc/bashrc"
然后执行:source ~/.bashrc(或~/.bash_profile)
3.查看系统可以安装的python版本
[ray@hadoop01 ~]$ pythonbrew list -k
# Pythons
Python-1.5.2
Python-1.6.1
Python-2.0.1
Python-2.1.3
Python-2.2.3
Python-2.3.7
Python-2.4.6
Python-2.5.6
Python-2.6.9
Python-2.7.10
Python-3.0.1
Python-3.1.5
Python-3.2.5
Python-3.3.5
Python-3.4.3
4.安装python
(ps:需要使用curl安装python,所以需要先安装curl)
[ray@hadoop01 ~]$ pythonbrew install 3.2.3(版本号)
5.清理安装后的版本的源码和安装包
[ray@hadoop01 ~]$ pythonbrew cleanup
6.选择一个python版本使用,ps:只在当前终端有效
[ray@hadoop01 ~]$ pythonbrew use 2.7.10(版本号)
7.查看当前pythonbrew下的python版本有哪些(后面有*号表示正在使用)
[ray@hadoop01 ~]$pythonbrew list
Python-2.6.7 (*)
Python-3.2.3
8.选择python3.4.3版本作为系统默认版本使用,会把该版本的路径添加到PATH中
[ray@hadoop01 ~]$ pythonbrew switch 3.4.3
9.取消pythonbrew选择的版本
[ray@hadoop01 ~]$ pythonbrew off
二、Jupyter notebooks 安装与使用以及远程连接方法
作为一只数据分析狮,利用python进行数据分析编程要的就是优雅和细致。如果还能随时随地利用任何终端进行数据分析,那不仅是高逼格,更是乐翻天了。而Jupyter notebook便是能帮助我们在web端做开发编程的利器。本节将介绍如果安装使用jupyter,以及如何远程连接到服务器端的Jupyter notebook。
1.安装Jupyter
[ray@hadoop01 ~]$ pip install jupyter
2.Jupyter Notebook远程服务器配置
1)首先要生成密码,打开python终端。
In [1]: from IPython.lib import passwd
In [2]: passwd()
Enter password:
Verify password:
Out[2]: 'sha1:0e422dfccef2:84cfbcb
b3ef95872fb8e23be3999c123f862d856'
2)接下来生成秘钥:
[ray@hadoop01 ~]$ openssl req -x509 -nodes -days 365 -newkey rsa:1024 -keyout mycert.pem -out mycert.pem
注意:这里会要求你需要一些个人信息,如:国家、省份、名字等。执行完命令后,会生成一个mycert.pem文件。记下这个文件的路径。
3)创建一个服务器配置
[ray@hadoop01 ~]$ ipython profile create nbserver
编辑文件jupyter_notebook_config.py,在~/.jupyter/文件夹里
c.NotebookApp.password = u'sha1:。。。。。。。。。。。' c.NotebookApp.certfile = u'/root/.jupyter/mycert.pem' c.NotebookApp.ip = '*'
c.NotebookApp.port = 9999
4)最后启动服务器:
[ray@hadoop01 ~]$ipython notebook --profile=nbserver
三、Jupyter连接pyspark,实现web端sprak开发
在进行这步操作之前,必须先安装好Jupyter、spark。
1.设置环境变量
将一下代码添加到~/.bash_profile(或者~/.bashrc)
export SPARK_HOME=~/spark-1.5.0-bin-hadoop2.6
export PATH=$SPARK_HOME/bin:$PATH
export PYTHONPATH=$SPARK_HOME/python/:$PYTHONPATH
export PYTHONPATH=$SPARK_HOME/python/lib/py4j-0.8.2.1-src.zip:$PYTHONPATH
注意:
1).SPARK_HOME的地址是你sprak的安装目录,另外在最后一行代码中,py4j-0.8.2.1-src.zip可能会因版本不同而不同,请进入对应地址确认好该文件的名字。
2).如果要使用python3进行作业,则需要在.bash_profile中添加 export PYSPARK_PYTHON=python3
2.启动pyspark-jupyter
IPYTHON_OPTS="notebook"$SPARK_HOME/bin/pyspark
至此,所以配置全部完成。
来源:https://blog.csdn.net/RayCchou/article/details/51273117
猜你喜欢
- 最近在使用Python的过程中,发现网上很少提到在使用post方式时,怎么传一个数组作为参数的示例,此处根据自己的实践经验,给出相关示例:单
- python3字符串操作 x = 'abc' y = 'defgh' print(x + y)
- django中有自带的分页模块Paginator,想Paginator提供对象的列表,就可以提供每一页上对象的方法。这里的话不讲解Pagin
- Haar特征哈尔特征使用检测窗口中指定位置的相邻矩形,计算每一个矩形的像素和并取其差值。然后用这些差值来对图像的子区域进行分类。haar特征
- 方法1: 代码如下:truncate table TableName 删除表中的所有的数据的同时,将自动增长清零。 如果有外键参考这个表,这
- Python 代码库之Tuple如何append元素tuple不像array给我们提供了append函数,我们可以通过下面的方式添加t=[1
- 如下所示:# -*-coding: utf-8 -*-import pandas as pd#读取csv文件df=pd.read_csv(&
- 一、PsutilPython当中的Psutil模块是个跨平台库,它能够轻松获取系统运行的进程和系统利用率,包括CPU、内存、磁盘、网络等信息
- 今天想说的是内容和容器的关系,顺便把之前设计中碰到的问题和大家一起探讨下。我们从软件的设置说起。(这里以QQ的设置举例)一个软件的设置(常称
- 本文实例讲述了Python实现的圆形绘制。分享给大家供大家参考,具体如下:# -*- coding:utf-8 -*-#! python3i
- 设计是简单的如果你知道要放的东西该放到哪。曾经在某个电子杂志里看到一篇关于如何在平面设计中偷懒的文章,引发了我的一些思考,在平面设计中有这么
- 算法优缺点:优点:容易实现缺点:可能收敛到局部最小值,在大规模数据集上收敛较慢使用数据类型:数值型数据算法思想k-means算法实际上就是通
- python文件特定行插入和替换实例详解python提供了read,write,但和很多语言类似似乎没有提供insert。当然真要提供的话,
- 使用场景对手机号码进行地域分析,需要查询归属地;问题描述针对数据集比较大的情况,通过脚本来处理,使用多线程的方法来加快查询速度pool =
- 下表列出 SQL Server 查询分析器提供的所有键盘快捷方式。活动 快捷方式 书签:清除所有书签。 CTRL-SHIFT-F2
- 前言由于python3.10之后版本不在支持libressl使用ssl,需要使用openssl安装来解决编译安装python时候遇到的ssl
- docx2txt的Github地址docx2txt是基于python的从docx文件中提取文本和图片的库。代码是从python-docx中获
- pandas中的DataFrame中可以根据某个属性的同一值进行聚合分组,可以选单个属性,也可以选多个属性:代码示例:import pand
- 本文实例讲述了Python及Django框架生成二维码的方法。分享给大家供大家参考,具体如下:一、包的安装和简单使用1.1 用Python来
- 本文实例讲述了Python列表元素常见操作。分享给大家供大家参考,具体如下:列表类似于java中的数组,用方括号表示,逗号分隔其中的元素#赋