python开发sparkSQL应用

2023-01-31 06:39

短信预约 -IT技能 免费直播动态提醒

准备条件：

部署hadoop集群
部署spark集群
安装python（本人安装的是anaconda3,python是3.6）

配置环境环境变量：

vi .bashrc  #添加如下内容
export SPARK_HOME=/opt/spark/current
export PYTHONPATH=$SPARK_HOME/python/:$SPARK_HOME/python/lib/py4j-0.10.4-class="lazy" data-src.zip

ps：spark里面会自带一个pyspark模块，但是本人官方下载的 spark2.1中的pyspark 与 python3.6 不兼容，存在bug，如果看官用的也是 python3的话，建议到githup下载最新的 pyspark 替换掉$SPARK_HOME/python目录下面的pyspark。

开启打怪升级：

1.启动hadoop集群和spark集群

wKiom1jCVlixB8kQAAGFqgUZuCI747.png-wh_50

wKioL1jCVlmivTckAAJOWt1bsw4843.png-wh_50

2.将数据传到hadoop文件系统上，people.json是官方提供的案例数据，salary.json是本人自己新建的数据

hadoop fs -mkdir -p /user/hadoop/examples/class="lazy" data-src/main/resources/
hadoop fs -put people.json /user/hadoop/examples/class="lazy" data-src/main/resources/
hadoop fs -put salary.json /user/hadoop/examples/class="lazy" data-src/main/resources/

wKioL1jCVW2BmKrnAADD5olPo3M605.png-wh_50

3.编写python SparkSQL程序

# -*- coding: utf-8 -*-
"""
Created on Wed Feb 22 15:07:44 2017
练习SparkSQL
@author: wanghuan
"""
from pyspark.sql import SparkSession

spark = SparkSession.builder.master("spark://cent0s7Master:7077").appName("Python Spark SQL basic example").config("spark.some.config.option", "some-value") 
.getOrCreate()
#ssc=SparkContext("local[2]","sparksqltest")
peopleDF = spark.read.json("examples/class="lazy" data-src/main/resources/people.json")
salaryDF = spark.read.json("examples/class="lazy" data-src/main/resources/salary.json")
#peopleDF.printSchema()

# Creates a temporary view using the DataFrame
peopleDF.createOrReplaceTempView("people")
salaryDF.createOrReplaceTempView("salary")
# SQL statements can be run by using the sql methods provided by spark
teenagerNamesDF = spark.sql("SELECT a.name,a.age,b.salary FROM people a,salary b where a.name=b.name and a.age <30 and b.salary>5000")
teenagerNamesDF.show()

4.运行SparkSQL 应用

wKioL1jCWASTDnHIAAD6heGNgnw930.png-wh_50