[Spark] Hello Spark

这里只使用Spark的Python操作和接口，其他语言应为不熟悉，所以先不写在这里。

Spark 部署

可以直接从官方网站下载 pre-build 版本，可以直接在电脑上运行，离线安装也是可以的，比如说针对Python 2.7的link。

解压：

tar zxvf spark-2.1.0-bin-hadoop2.7.tgz

解压之后，其目录为如下：

$ ls

LICENSE		README.md	conf		jars		sbin

NOTICE		RELEASE		data		licenses	yarn

R		bin		examples	python

其中的几个目录可以先认识一下：

bin : 这个目录中包含用来和Spark交互的可执行文件。
README.md : 是一个Spark 的说明文件。
examples : 包含一些可以查看和运行的例子程序，对学习Spark的API很有帮助。

Spark 的 Python Shell

在Spark的目录下，执行：

./bin/pyspark

即可载入Python Shell，成功之后的界面如下：

到这就代表Spark完成了部署，可以使用 Control + D 退出 SparkShell。

第一段小程序

在解释器中执行下面的一段程序试试：

>>> lines = sc.textFile("README.md")

>>> pythonLines = lines.filter(lambda line: "Python" in line)

上面两行代码分别为：

通过 SparkContext 对象 sc ，从README.md文件创建一个文本文件类型的 RDD。
从名为 lines 的RDD中 筛选出 包含字符串"Python"的行，组成新的RDD。

下面解释 RDD 和 SparkContext 这两个名词：

SparkContext : 从上层来看，每个Spark应用都有一个驱动程序来发起集群上的各种并行操作。驱动程序包含应用的main函数，并且定义了集群上的分布式数据集，还对这些分布式数据集应用了相关操作。在这个例子中，实际的驱动程序就是SparkShell本身，你只需要输入想要运行的操作就可以了。shell启动的时候已经自动创建了一个SparkContext对象，名字为sc。
RDD : 在Spark中，我们通过对分布式数据集的操作来表达我们的计算意图，这样的数据集被称为弹性分布式数据集(Resilient Distributed Dataset)，简称RDD。

然后可以用执行 .first() 和 .count() 两个方法来查看：

[Spark] Hello Spark的更多相关文章

Spark Shell & Spark submit
Spark 的 shell 是一个强大的交互式数据分析工具. 1. 搭建Spark 2. 两个目录下面有可执行文件: bin 包含spark-shell 和 spark-submit sbin 包含 ...
【转】科普Spark，Spark是什么，如何使用Spark
本博文是转自如下链接,为了方便自己查阅学习和他人交流.感谢原博主的提供! http://www.aboutyun.com/thread-6849-1-1.html http://www.aboutyu ...
Spark:使用Spark Shell的两个示例
Spark:使用Spark Shell的两个示例 Python 行数统计 ** 注意: **使用的是Hadoop的HDFS作为持久层,需要先配置Hadoop 命令行代码 # pyspark >& ...
大数据技术之_19_Spark学习_01_Spark 基础解析 + Spark 概述 + Spark 集群安装 + 执行 Spark 程序
第1章 Spark 概述1.1 什么是 Spark1.2 Spark 特点1.3 Spark 的用户和用途第2章 Spark 集群安装2.1 集群角色2.2 机器准备2.3 下载 Spark 安装包2 ...
[Spark][Python]spark 从 avro 文件获取 Dataframe 的例子
[Spark][Python]spark 从 avro 文件获取 Dataframe 的例子从如下地址获取文件: https://github.com/databricks/spark-avro/r ...
[Spark][Python]Spark 访问 mysql , 生成 dataframe 的例子：
[Spark][Python]Spark 访问 mysql , 生成 dataframe 的例子: mydf001=sqlContext.read.format("jdbc").o ...
Spark记录-Spark性能优化解决方案
Spark性能优化的10大问题及其解决方案问题1:reduce task数目不合适解决方式:需根据实际情况调节默认配置,调整方式是修改参数spark.default.parallelism.通常,r ...
Spark记录-spark编程介绍
Spark核心编程 Spark 核心是整个项目的基础.它提供了分布式任务调度,调度和基本的 I/O 功能.Spark 使用一种称为RDD(弹性分布式数据集)一个专门的基础数据结构,是整个机器分区数据的 ...
Spark记录-spark介绍
Apache Spark是一个集群计算设计的快速计算.它是建立在Hadoop MapReduce之上,它扩展了 MapReduce 模式,有效地使用更多类型的计算,其中包括交互式查询和流处理.这是一个 ...
Spark 以及 spark streaming 核心原理及实践
收录待用,修改转载已取得腾讯云授权作者 | 蒋专蒋专,现CDG事业群社交与效果广告部微信广告中心业务逻辑组员工,负责广告系统后台开发,2012年上海同济大学软件学院本科毕业,曾在百度凤巢工作三年, ...

随机推荐

C# 关键字【转】
C#中的关键字关键字是对编译器具有特殊意义的预定义保留标识符.它们不能在程序中用作标识符,除非它们有一个 @ 前缀.例如,@if 是有效的标识符,但 if 不是,因为 if 是关键字. 下面是列 ...
学习笔记---C/C++语法
一.char *s char s[] 区别 char *s中的s是指针,而指针是指向一块内存区域,它指向的内存区域的大小可以随时改变,而且当指针指向常量字符串时,它的内容是不可以被修改的,否则在运行时 ...
oracle正则表达式的用法
<SPAN style="FONT-SIZE: 18px">Oracle 正则表达式函数-REGEXP_SUBSTR 使用例子 .5个参数第一个是输入的字符串第二个 ...
WP8.1 状态栏隐藏
StatusBar statusbar = StatusBar.GetForCurrentView(); await statusbar.HideAsync();
Tyrion中文文档（含示例源码）
Tyrion是一个基于Python实现的支持多个WEB框架的Form表单验证组件,其完美的支持Tornado.Django.Flask.Bottle Web框架.Tyrion主要有两大重要动能: 表单 ...
linux基础
用户管理: id:可以查看当前用户 whoami:查看当前的用户 who:看当前已经登录的用户 w:也可以看添加用户:useradd name 添加用户组: useradd -g groupnam ...
web 安全的前期准备哦
学习web安全需要的软件和基础基础会在以后发出来软件在网上都可以下首先你要有一款虚拟机软件虚拟系统通过生成现有操作系统的全新虚拟镜像,它具有真实windows系统完全一样 ...
夺命雷公狗----Git---5---分支
git分支的概念相当于是添加一个属于自己的分支,别人是看不到的,等你写完自己的程序到时候在合并到团队的分支上即可.... 我们可以查看自己git里面有什么分支,如下所示: git branch 在这里 ...
CSS中隐藏内容的3种方法及属性值
CSS中隐藏内容的3种方法及属性值 (2011-02-11 13:33:59) 在制作网页时,隐藏内容也是一种比较常用的手法,它的作用一般有:隐藏文本/图片.隐藏链接.隐藏超出范围的内容.隐藏弹出 ...
C++之检测文件结尾
当使用文件作为输入流时,为了确保适时的结束文件读取操作,程序要靠检查文件尾来判断该何时停止读取.常用的检查文件尾方法有两种: 两种方式均已将 fin 与文件关联,即均已声明 fin 输入流,并已调用 ...