spark的wordcount

在开发环境下实现第一个程序wordcount

1、下载和配置scala，注意不要下载2.13，在spark-core明确支持scala2.13前，使用2.12或者2.11比较好。

https://www.scala-lang.org/download/

2、windows环境下的scala配置，可选

3、开发工具IDEA环境设置，全局环境添加scala的sdk，注意scala的源码要手动下载和添加

4、在IDEA中新建MAVEN项目，添加scala框架支持

5、在MAVEN工程添加spark-core依赖，注意根据自己需要选择对应的版本，版本不对很可能会出现运行期异常。

    <dependencies>

        <dependency>

            <groupId>org.apache.spark</groupId>

            <artifactId>spark-core_2.12</artifactId>

            <version>2.4.4</version>

        </dependency>

    </dependencies>

6、wordcount代码

在项目根目录（与src平级）中新建一个input目录，里面放入需要统计词频的文本文件

package com.home.spark

import org.apache.spark.rdd.RDD

import org.apache.spark.{SparkConf, SparkContext}

object WordCount {

  def main(args: Array[String]): Unit = {

    //获取环境

    val conf: SparkConf = new SparkConf().setMaster("local[*]").setAppName("SparkWordCount")

    //获取上下文

    val sc: SparkContext = new SparkContext(conf)

    //读取每一行

    val lines: RDD[String] = sc.textFile("input")

    //扁平化，将每行数据拆分成单个词（自定义业务逻辑）

    val words: RDD[String] = lines.flatMap(_.split(" "))

    //结构转换，对每个词获得初始词频

    val wordToOne: RDD[(String, Int)] = words.map((_,1))

    //词频计数

    val wordToSum: RDD[(String, Int)] = wordToOne.reduceByKey(_+_)

    //按词频数量降序排序

    val wordToSorted: RDD[(String, Int)] = wordToSum.sortBy(_._2,false)

    //数据输出

    val result: Array[(String, Int)] = wordToSorted.collect()

    //打印

    result.foreach(println)

    //关闭上下文

    sc.stop()

  }

}

spark的wordcount的更多相关文章

[转] 用SBT编译Spark的WordCount程序
问题导读: 1.什么是sbt? 2.sbt项目环境如何建立? 3.如何使用sbt编译打包scala? [sbt介绍 sbt是一个代码编译工具,是scala界的mvn,可以编译scala,java等,需 ...
Spark 实现wordcount
配置完spark之后,使用spark实现wordcount,这一部分完全参考<深入理解Spark:核心思想与源码分析> 依然使用hadoop wordcountTest的那几个txt文件 ...
用SBT编译Spark的WordCount程序
问题导读: 1.什么是sbt? 2.sbt项目环境如何建立? 3.如何使用sbt编译打包scala? sbt介绍 sbt是一个代码编译工具,是scala界的mvn,可以编译scala,java等,需要 ...
编写Spark的WordCount程序并提交到集群运行[含scala和java两个版本]
编写Spark的WordCount程序并提交到集群运行[含scala和java两个版本] 1. 开发环境 Jdk 1.7.0_72 Maven 3.2.1 Scala 2.10.6 Spark 1.6 ...
spark 例子wordcount topk
spark 例子wordcount topk 例子描述: [单词计算wordcount ] [词频排序topk] 单词计算在代码方便很简单,基本大体就三个步骤拆分字符串以需要进行记数的单位为K,自 ...
1.spark的wordcount解析
一.Eclipse(scala IDE)开发local和cluster (一). 配置开发环境要在本地安装好java和scala. 由于spark1.6需要scala 2.10.X版本的.推荐 2 ...
.Net for Spark 实现 WordCount 应用及调试入坑详解
.Net for Spark 实现WordCount应用及调试入坑详解 1. 概述 iNeuOS云端操作系统现在具备物联网.视图业务建模.机器学习的功能,但是缺少一个计算平台产品.最近在调研使用 ...
Spark版wordcount，并根据词频进行排序
import org.apache.spark.{SparkConf, SparkContext}/** * Created by loushsh on 2017/10/9. */object Wor ...
Spark开发wordcount程序
1.java版本(spark-2.1.0) package chavin.king; import org.apache.spark.api.java.JavaSparkContext; import ...
在IDEA中编写Spark的WordCount程序
1:spark shell仅在测试和验证我们的程序时使用的较多,在生产环境中,通常会在IDE中编制程序,然后打成jar包,然后提交到集群,最常用的是创建一个Maven项目,利用Maven来管理jar包 ...

随机推荐

Java操作数据库——在JDBC里使用事务
Java操作数据库——在JDBC里使用事务摘要:本文主要学习了如何在JDBC里使用事务. 使用Connection的事务控制方法当JDBC程序向数据库获得一个Connection对象时,默认情况下 ...
Typescript使用字符串联合类型代替枚举类型
TypeScript宗旨我觉得Typescript的宗旨是任何一个 TypeScript 程序,在手动删去类型部分,将后缀改成 .js 后,都应能够正常运行.Typescript是javascri ...
XPath匹配标签使用text()判断获取结果失败/为空的问题及解决方法
XPath当匹配标签判断text()判断内容失败的问题及解决问题复现在爬取网站的时候我使用XPath去抓取网页上的内容,XPath表达式来精准获取需要的标签内容. 当我对如下一段html代码编写X ...
使用docker-compose部署springboot项目
由于是单机测试,没有测试多主机的跨网络分布式请求. 项目是前后分离的,所以使用nginx作为前端服务器,后端是springboot则直接基于java8环境的容器上跑,cache用的redis,mysq ...
scp跨服务器拷贝，后台运行
[转载]原文:https://blog.csdn.net/u013091013/article/details/68941250 通常情况下,我门在同一台服务器拷贝数据最常用的命令便是cp,如果要在不 ...
AcWing 37. 树的子结构
题目描述地址https://www.acwing.com/problem/content/35/输入两棵二叉树A,B,判断B是不是A的子结构. 我们规定空树不是任何树的子结构. 样例树A: / ...
numpy中多维数组的绝对索引
这涉及到吧多维数组映射为一维数组. 对于3维数组,有公式: def MAP(x,y,z): return y_s * z_s * x + z_s * y + z 此公式可以推广到N维测试代码:(两个 ...
SQLite安装及使用教程
SQLite是一款轻型的嵌入式关系数据库,轻量级,效率高,操作起来也特别方便我们今天来讲解一下SQLite的安装和一些基本操作 SQLite下载如果是64位机,下载下面的两个解压就好在dos界面 ...
《细说PHP》第四版样章第23章自定义PHP接口规范 7
23.5 创建RESTful规范 WebAPI框架虽然我们现在可以自己实现API了,也了解了RESTful API的设计原则,但让自己实现的API符合RESTful API规范,对很多刚接触API ...
【vim编辑器】文本编辑器vim
在Linux系统中一切皆文件.配置一个服务就是在修改其配置文件的参数一.Vim编辑器 vim是我们在Linux系统中常用的文件编辑命令,也可以使用其简写vi.其边际模式有三种:命令模式,输入模式,行 ...

spark的wordcount

spark的wordcount的更多相关文章

随机推荐

热门专题