Ubuntu 14.10 下使用IDEA开发Spark应用

1 环境准备

　　1.1 下载IDEA，可在官网下载

　　1.2 IDEA与Eclipse有点不同，IDEA中的New Projects相当于Eclipse中的workspace，New Module才是新建工程

2 建立Spark程序

　　2.1 首先新建项目，New Projects，名字随便取：Create New Project -> Scala -> SBT -> 创建名为SparkExample的project

　　2.2 创建Module，New Module，名字随便取：New Module-> Scala -> Scala，创建名为FirstApp

　　2.3 设置FirstApp 的Project Structure

　　　　2.3.1 增加源码目录，目录结构自己设置

　　　　2.3.2 增加Jar包，File -> Project Structure -> Libraries -> + -> java -> 选择

　　　　　　spark-assembly-1.0.0-hadoop2.2.0.jar

　　　　　　scala-library.jar

　　2.4 编写代码，在源码包下新建Object，这里找了三个Demo

import org.apache.spark._

import scala.math.random

/**

 * Created by hadoop on 15-3-21.

 */

object SparkPi {

  def main (args: Array[String]) {

    val conf = new SparkConf().setAppName("Spark Pi")

    val spark = new SparkContext(conf)

    val slices = if(args.length > 0) args(0).toInt else 2

    val n = 100000 * slices

    val count = spark.parallelize(1 to n,slices).map{ i =>

      val x = random * 2 - 1

      val y = random * 2 - 1

      if(x*x + y*y < 1) 1 else 0

    }.reduce(_+_)

    println("Pi is roughly " + 4.0 * count / n)

    spark.stop()

  }

}

import org.apache.spark.{SparkContext,SparkConf}

import org.apache.spark.SparkContext._

/**

 * Created by hadoop on 15-3-21.

 */

object WordCount1 {

  def main (args: Array[String]) {

    if(args.length == 0){

      System.err.println("Usage: WordCount1 <file1>")

      System.exit(1)

    }

    val conf = new SparkConf().setAppName("WordCount1")

    val sc = new SparkContext(conf)

    sc.textFile(args(0)).flatMap(_.split(" ")).map(x => (x,1)).reduceByKey(_+_).take(10).foreach(println)

    sc.stop()

  }

}

import org.apache.spark.{SparkContext, SparkConf}

import org.apache.spark.SparkContext._

/**

 * Created by hadoop on 15-3-21.

 */

object WordCount2 {

  def main(args: Array[String]) {

    if (args.length == 0) {

      System.err.println("Usage: WordCount2 <file1>")

      System.exit(1)

    }

    val conf = new SparkConf().setAppName("WordCount2")

    val sc = new SparkContext(conf)

    sc.textFile(args(0)).flatMap(_.split(" ")).map(x => (x,1)).reduceByKey(_+_).map(x =>

      (x._2,x._1)).sortByKey(false).map(x => (x._2,x._1)).take(10).foreach(println)

    sc.stop()

  }

}

　　2.5 生成Jar包

　　生成程序包之前要先建立一个artifacts，File -> Project Structure -> Artifacts -> + -> Jars -> From moudles with dependencies，然后随便选一个class作为主class。

　　按OK后，对artifacts进行配置，修改Name为FirstApp，删除Output Layout中FirstApp.jar中的几个依赖包，只剩FirstApp项目本身。

　　按OK后， Build -> Build Artifacts -> FirstApp -> rebuild进行打包，经过编译后，程序包放置在out/artifacts/FirstApp目录下，文件名为FirstApp.jar。

3 测试Jar包，下图摘自http://blog.csdn.net/book_mmicky/article/details/25714545，需要修改Jar包名称，HDFS路径

参考：http://www.aboutyun.com/thread-8404-1-1.html

　　　http://blog.csdn.net/book_mmicky/article/details/25714545

　　　http://blog.csdn.net/david_xtd/article/details/19081341

Ubuntu 14.10 下使用IDEA开发Spark应用的更多相关文章

Ubuntu 14.04 下使用IDEA开发Spark应用入门
网上有很多教程,有用sbt ,也有不用sbt的,看的头大,搞了半天,终于运行成功一个例子,如下: 1.官网下载http://www.jetbrains.com/idea/download/ Inter ...
Ubuntu 14.10下基于Nginx搭建mp4/flv流媒体服务器(可随意拖动)并支持RTMP/HLS协议(含转码工具)
Ubuntu 14.10下基于Nginx搭建mp4/flv流媒体服务器(可随意拖动)并支持RTMP/HLS协议(含转码工具) 最近因为项目关系,收朋友之托,想制作秀场网站,但是因为之前一直没有涉及到这 ...
Ubuntu 14.10 下安装Ganglia监控集群
关于 Ganglia 软件,Ganglia是一个跨平台可扩展的,高性能计算系统下的分布式监控系统,如集群和网格.它是基于分层设计,它使用广泛的技术,如XML数据代表,便携数据传输,RRDtool用于数 ...
Ubuntu 14.10 下安装java反编译工具 jd-gui
系统环境,Ubuntu 14.10 ,64位 1 下载JD-GUI,网址http://221.3.153.126/1Q2W3E4R5T6Y7U8I9O0P1Z2X3C4V5B/jd.benow.ca/ ...
Ubuntu 14.10 下ZooKeeper+Hadoop2.6.0+HBase1.0.0 的HA机群高可用配置
1 硬件环境 Ubuntu 14.10 64位 2 软件环境 openjdk-7-jdk hadoop 2.6.0 zookeeper-3.4.6 hbase-1.0.0 3 机群规划 3.1 zoo ...
Ubuntu 14.10 下Hive配置
1 系统环境 Ubuntu 14.10 JDK-7 Hadoop 2.6.0 2 安装步骤 2.1 下载Hive 我第一次安装的时候,下载的是Hive-1.2.1,配置好之后,总是报错 [ERROR] ...
Ubuntu 14.10 下DokuWiki安装
环境说明: Ubuntu 14.10 64位 1 下载DokuWiki:http://download.dokuwiki.org/ 2 解压到 /var/www/html下面 3 如果没有安装Apac ...
Ubuntu 14.10 下Server版本中文乱码问题
在安装Ubuntu server 14.10 时候选择了中文版,但是装好系统发现,里面的中文有乱码,解决办法打开 /etc/default/locale sudo nano /etc/default ...
Ubuntu 14.10 下awk命令详解
简介 awk是一个强大的文本分析工具,相对于grep的查找,sed的编辑,awk在其对数据分析并生成报告时,显得尤为强大.简单来说awk就是把文件逐行的读入,以空格为默认分隔符将每行切片,切开的部分再 ...

随机推荐

一个简单的 openssl 示例
////生成一个私钥////$key=openssl_pkey_new();openssl_pkey_export($key,$out);//等于下面写入的内容////将私钥写入一个文件////ope ...
C++学习（十五）（C语言部分）之数组二
数组大纲多维数组二维数组重点 (三位以上基本不会用到) 都是用来存数据一个班有20个人可以用一维数组存20个人的年龄 int age[20]; 一个年级10个班每个班20人 int age ...
SVN三种合并类型
https://blog.csdn.net/zht666/article/details/36178117 转自:http://wenku.baidu.com/link?url=pnALYESJnX0 ...
JAVA静态代码块的作用
一般情况下,如果有些代码必须在项目启动的时候就执行的时候,需要使用静态代码块,这种代码是主动执行的;需要在项目启动的时候就初始化,在不创建对象的情况下,其他程序来调用的时候,需要使用静态方法,这种 ...
事务 — Redis 设计与实现
非事务状态下的命令以单个命令为单位执行,前一个命令和后一个命令的客户端不一定是同一个: 事务状态则是以一个事务为单位,执行事务队列中的所有命令:除非当前事务执行完毕,否则服务器不会中断事务,也不会执行 ...
node api 之：process - 进程
process 对象是一个全局变量,它提供当前 Node.js 进程的有关信息,以及控制当前 Node.js 进程. 因为是全局变量,所以无需使用 require().
kibana 启动关闭和进程查找
启动kibana : nohup ./kibana & 查看启动日志 : tail -f nohup kibana 使用 ps -ef|grep kibana 是查不到进程的,主要原因大概 ...
VC++6 调用teststand api的方法
参考example中的vs2010的例子,创建MFC工程打开project->setting ,c/c++ tab cat 选 Proprocessor ->Additional in ...
tomcat中catalina是什么
catalina 就是Tomcat服务器使用的 Apache实现的servlet容器的名字. Tomcat的核心分为3个部分: (1)Web容器---处理静态页面: (2)catalina --- ...
minicom的安装及配置
1. sudo apt-get install minicom 2. 配置 (1). sudo minicom –s (2). (3). 按“A”配置设备,再按回车保存.按”F”,把留空改为NO.回车 ...

Ubuntu 14.10 下使用IDEA开发Spark应用

Ubuntu 14.10 下使用IDEA开发Spark应用的更多相关文章

随机推荐

热门专题