windows下pycharm搭建spark环境并成功运行附源码

作者：贴进你的心聆听你的世界 | 2022-01-05 14:59

这篇文章主要介绍了windows下pycharm搭建spark环境并成功运行附源码,本文分步骤给大家介绍的非常详细，对大家的学习或工作具有一定的参考借鉴价值，需要的朋友可以参考下

windows下spark的安装和运行建议看到这篇文章(描述非常详细)

Spark在Win10下的环境搭建

一、创建项目和.py文件

在这里插入图片描述

二、在pycharm中添加spark环境

在这里插入图片描述

若是左侧的python中没有，可点击‘'+‘'号进行添加

在这里插入图片描述

配置spark环境：总共3个（SPARK_HOME、HADOOP_HOME、PYTHONPATH）

在这里插入图片描述

（注：SPARK_HOME和HADOOP_HOME已在系统的环境变量添加，故这里不再添加）

在编写代码时，建议添加如下代码，保证程序能够运行成功：

import os
import sys
import findspark  # 一定要在最前面导入

'''初始化spark环境'''
findspark.init()
# Path for spark source folder
os.environ['SPARK_HOME'] = "G:\Spark\Install\spark-2.4.3-bin-hadoop2.7"
# Append pyspark to Python Path
sys.path.append("G:\Spark\Install\spark-2.4.3-bin-hadoop2.7\python")

'''示例'''
from pyspark import SparkContext,SparkConf
from pyspark.sql import SparkSession
from pyspark.sql import Row

# SparkContext是spark功能的主要入口
sc = SparkContext("local", "app")
RawSalesDataRDD = sc.textFile("G:\\Spark\\作业\\taxi.csv")
print(RawSalesDataRDD.take(5))
salesRDD = RawSalesDataRDD.map(lambda line: line.split(","))
print(salesRDD.take(5))
taxi_Rows = salesRDD.map(lambda p:
                         Row(
                             id=p[0],
                             lat=p[1],
                             lon=p[2],
                             time=p[3]
                        ))

sqlContext = SparkSession.builder.getOrCreate()
taxi_df = sqlContext.createDataFrame(taxi_Rows)
print(taxi_Rows.take(5))

print('查看dataframe的字段名称和前5行数据：')
taxi_df.printSchema()
taxi_df.show(5)

'''使用SQL语句  操作表数据'''
# #创建临时表taxi_table
taxi_df.registerTempTable("taxi_table")

# 查询编号为 5 的出租车的 GPS 数据的前 10 行
taxi_df.filter("id='5'").show(10)
taxi_df.where("id='5'").show(10)
sqlContext.sql("select * from taxi_table where id='5'").show(10)

代码运行结果：

在这里插入图片描述

到此这篇关于windows下pycharm搭建spark环境并成功运行附源码的文章就介绍到这了,更多相关pycharm搭建spark环境内容请搜索以前的文章或继续浏览下面的相关文章希望大家以后多多支持！

推荐阅读

程序员
如何从其他Mac向AppStore提交应用程序？

如何解决《如何从其他Mac向AppStore提交应用程序？》经验，为你挑选了1个好方法。 ... [详细]
程序员
Selectorator.js - 页面上所有隐藏元素的选择器

如何解决《Selectorator.js-页面上所有隐藏元素的选择器》经验，为你挑选了0个好方法。 ... [详细]
程序员
如何访问Angularjs的v1.5组件中的属性？

如何解决《如何访问Angularjs的v1.5组件中的属性？》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何让IntelliJ警告Optional.get()的不安全用法

如何解决《如何让IntelliJ警告Optional.get()的不安全用法》经验，为你挑选了0个好方法。 ... [详细]
程序员
ms sql表在级别更改超过1时添加行,以便start_level和end_level中的每一行都有1的差异

如何解决《mssql表在级别更改超过1时添加行,以便start_level和end_level中的每一行都有1的差异》经验，为你挑选了0个好方法。 ... [详细]
程序员
测试内核模块

如何解决《测试内核模块》经验，为你挑选了1个好方法。 ... [详细]
程序员
中断JSON对象并添加到表中

如何解决《中断JSON对象并添加到表中》经验，为你挑选了1个好方法。 ... [详细]
程序员
Java - Apache POI - 读/写.xlsx文件 - 文件被破坏并变空

如何解决《Java-ApachePOI-读/写.xlsx文件-文件被破坏并变空》经验，为你挑选了0个好方法。 ... [详细]
程序员
Windows图元文件的尺寸是否有限制？

如何解决《Windows图元文件的尺寸是否有限制？》经验，为你挑选了1个好方法。 ... [详细]
程序员
SAPUI5限制页面可见性

如何解决《SAPUI5限制页面可见性》经验，为你挑选了0个好方法。 ... [详细]
程序员
检查字符串是否仅包含字母,数字和下划线

如何解决《检查字符串是否仅包含字母,数字和下划线》经验，为你挑选了2个好方法。 ... [详细]
程序员
TypeError:ufunc'add'不包含循环

如何解决《TypeError:ufunc'add'不包含循环》经验，为你挑选了1个好方法。 ... [详细]
程序员
Nunit:为特定测试用例添加类别

如何解决《Nunit:为特定测试用例添加类别》经验，为你挑选了1个好方法。 ... [详细]
程序员
使用fprintf输出__LINE__时出现分段错误

如何解决《使用fprintf输出__LINE__时出现分段错误》经验，为你挑选了1个好方法。 ... [详细]
程序员
Sass Gulp腐败了

如何解决《SassGulp腐败了》经验，为你挑选了0个好方法。 ... [详细]
程序员
Docker容器内的码头工人

如何解决《Docker容器内的码头工人》经验，为你挑选了1个好方法。 ... [详细]
程序员
应用程序本地化显示密钥而不是iOS中的值

如何解决《应用程序本地化显示密钥而不是iOS中的值》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何使用django自动创建uuid列

如何解决《如何使用django自动创建uuid列》经验，为你挑选了1个好方法。 ... [详细]
程序员
代理InputStream的方法

如何解决《代理InputStream的方法》经验，为你挑选了0个好方法。 ... [详细]
程序员
如何在yii2中从web运行控制台命令

如何解决《如何在yii2中从web运行控制台命令》经验，为你挑选了1个好方法。 ... [详细]

贴进你的心聆听你的世界

这个屌丝很懒，什么也没留下！

关注作者

Tags | 热门标签

RankList | 热门文章

windows下pycharm搭建spark环境并成功运行 附源码

一、创建项目和.py文件

二、在pycharm中添加spark环境

windows下pycharm搭建spark环境并成功运行附源码