1. Spark的安装及介绍

*以下内容由《Spark快速大数据分析》整理所得。

读书笔记的第一部分是记录如何安装Spark？同时，简单介绍下Spark。

一、Spark安装

二、Spark介绍

一、Spark安装

如果是在个人电脑上学习Spark，建议先建个虚拟机，教程可参考1. 安装虚拟机，Hadoop和Hive。

在下载Spark之前得确认之前安装的Hadoop版本是什么？

# 查看hadoop版本(这里我是2.7.7)hadoop version

然后，去官网下载兼容现有hadoop版本的spark并解压安装包：

cd~

tar -xf spark-3.0.0-bin-hadoop2.7.tgz

cd spark-3.0.0-bin-hadoop2.7

ls

现在，安装好了就可以试运行下Python或Scala版本的Spark shell了：

# 打开Python版本的Spark shell

cd spark-3.0.0-bin-hadoop2.7

bin/pyspark

# 打开Scala版本的Spark setshell

bin/spark-shell

二、Spark介绍

“Spark是一个用来实现快速而通用的集群计算的平台。”，它一个主要特点是能够在内存中进行计算，因而更快。

1. Spark的核心组件有两个：驱动器程序(driver program)和执行器(executor)。

驱动器程序：shell启动时已自动创建一个SparkContext对象(也称sc变量)去访问Spark。有了SparkContext，就可以用它创建RDD(弹性分布式数据集resilient distributed dataset，不能看作是存放着特定数据的数据集，而是看作如何计算数据的指令列表)。
执行器：驱动器程序一般要管理多个执行器节点，不同节点会执行不同的工作，在集群上实现并行数据分析。

例如Python的行数统计

$bin/pyspark

>>>lines = sc.textFile("README.md") # 使用sc创建一个名为lines的RDD

>>>lines.count() # 执行器统计RDD中元素的个数

108

2. 运行Python脚本：使用Spark自带的bin/spark-submit脚本帮我们引入Python程序的Spark依赖（相当于为Spark的PythonAPI配置好的运行环境）

bin/spark-submit my_python_script.py

3. 在python中初始化Spark:

from pyspark import SparkConf, SparkContext


# 创建一个SparkConf对象来配置你的应用

conf = SparkConf().setMaster("local").setAppName("My App")


# 基于这个SparkConf创建一个SparkContext对象

sc = SparkContext(conf = conf)

1. Spark的安装及介绍的更多相关文章

Spark安装与介绍
1. Scala的安装注意点:版本匹配的问题, Spark 1.6.2 -- Scala2.10 Spark 2.0.0 -- Scala2.11 https://www.scala-lang.or ...
Cloudera Manager （centos）安装详细介绍
文章全部来自:Cloudera Manager (centos)安装详细介绍http://www.aboutyun.com/thread-9190-1-1.html(出处: about云开发) 这里已 ...
mac下Spark的安装与使用
每次接触一个新的知识之前我都抱有恐惧之心,因为总认为自己没有接触到的知识都很高大上,比如上篇介绍到的Hadoop的安装与使用与本篇要介绍的Spark,其实在自己真正琢磨以后才发现本以为高大上的知识其实 ...
neo4j 图数据库安装及介绍
neo4j 图数据库安装及介绍一.neo4j图数据库介绍图数据库,顾名思义就是利用了"图的数据结构来作为数据存储逻辑体现的一种数据库",所以要想学好图数据库当然需要了解一些关于 ...
Sikuli图形脚本测试工具安装及介绍（适合小白的测试神器）
sikuli简单安装以及介绍附图: 一.简单介绍 SikuliX官方网站:https://launchpad.net/sikuli/(官方的最新版本是SikuliX1.1.0更新于2015-10-06 ...
Spark standlone安装与配置
spark的安装简单,去官网下载与集群hadoop版本相一致的文件即可. 解压后,主要需要修改spark-evn.sh文件. 以spark standlone为例,配置dn1,nn2为master,使 ...
python Scrapy安装和介绍
python Scrapy安装和介绍 Windows7下安装1.执行easy_install Scrapy Centos6.5下安装 1.库文件安装yum install libxslt-devel ...
Spark standalone安装（最小化集群部署）
Spark standalone安装-最小化集群部署(Spark官方建议使用Standalone模式) 集群规划: 主机 IP ...
Visual Studio 2017正式版离线安装及介绍
Visual Studio 2017 RTM正式版离线安装及介绍. 首先至官网下载:https://www.visualstudio.com/zh-hans/downloads/ VS 2017 正式 ...

随机推荐

day58 Pyhton 框架Django 01
内容回顾 python基础网路编程并发编程数据库前端 osi7层 tcp/ip 5层模型应用层表示层 ...
day27 Pyhton 面向对象02 组合
# 组合 # 什么是组合 : 一个类对象的属性是另外一个类的对象 class Person: def __init__(self,name,sex,hp,mp,ad): self.name = nam ...
Convert to Ones CodeForces（超水题）
题目大意:给你几个数,这些数里面只有0或1,你有两种操作:1.把一段区域内的所有数前后交换位置.2.把一段区域内所有数取反.(区域可大可小,可以是所有数也 ...
centos8平台使用mpstat监控cpu
一,mpstat的用途 mpstat是 Multiprocessor Statistics的缩写,是实时cpu监控工具. 在多CPU系统里,其不但能查看所有CPU的平均状况信息,而且能够查看特定CPU ...
MySQL死锁系列-线上死锁问题排查思路
前言 MySQL 死锁异常是我们经常会遇到的线上异常类别,一旦线上业务日间复杂,各种业务操作之间往往会产生锁冲突,有些会导致死锁异常.这种死锁异常一般要在特定时间特定数据和特定业务操作才会复现,并且分 ...
Docker学习笔记之-在虚拟机VM上安装CentOS 7.8
虚拟机VM版本:VMware Workstation Pro 16 中文虚拟机软件专业版到官网下载即可,或者也可以通过下边链接下载下载地址: http://www.epinv.com/post/1 ...
JS XMLHttpRequest请求
前言我们知道jq的请求非常简短好用,但是其实js原生的请求也不差,并且不用插件更能说明自己本身的技术已经很强了,别人看自己代码一脸懵逼的时候,这时就可以一一解释这些代码的用处,更能让别人敬佩! JS ...
[Vue音乐项目] 第一节环境搭建
1.Node安装登录官网,下载最新版本并安装: 在我的电脑内,执行以下操作:右键->属性->高级->环境变量->系统变量->path 查看是否有node的安装路径,没有 ...
dns配置文件的方式
1./etc/resolve.conf /etc/resolv.conf它是DNS客户机配置文件,用于设置DNS服务器的IP地址及DNS域名,还包含了主机的域名搜索顺序.该文件是由域名解析器(res ...
JavaWeb 图书管理系统
查看更多系统:系统大全,课程设计.毕业设计,请点击这里查看 01 系统简述图书管理系统就是利用计算机,结合互联网对图书进行结构化.自动化管理的一种软件,来提高对图书的管理效率. 02 系统特点集成 ...

1. Spark的安装及介绍

1. Spark的安装及介绍的更多相关文章

随机推荐

热门专题