windows 本地构建hadoop-spark运行环境（hadoop-2.6, spark2.0）

下载hadoop

http://hadoop.apache.org/releases.html --> http://mirrors.tuna.tsinghua.edu.cn/apache/hadoop/common/hadoop-2.6.5/hadoop-2.6.5.tar.gz
安装hadoop，配置HADOOP_HOME，把${HADOOP_HOME}/bin放到path

下载spark

http://spark.apache.org/downloads.html --> https://d3kbcqa49mib13.cloudfront.net/spark-2.0.2-bin-hadoop2.6.tgz 注意与hadoop版本匹配
安装，配置SPARK_HOME，把${SPARK_HOME}/bin放到path

在运行spark程序时，会报找不到 winutils.exe

下载 https://github.com/srccodes/hadoop-common-2.2.0-bin.git 放到${HADOOP_HOME}/bin下

运行时设置本地运行即可
spark样例：

LocalSparkContext.scala

import org.apache.spark.{SparkConf, SparkContext}

import org.scalatest._

trait LocalSparkContext extends BeforeAndAfterAll {

self: Suite =>

@transient var sc: SparkContext = _

override def beforeAll() {

val conf = new SparkConf()

.setMaster("local[2]")

.setAppName("test")

sc = new SparkContext(conf)

}

override def afterAll() {

if (sc != null) {

sc.stop()

}

}

}

SparkWCSuit.scala

import org.apache.spark.rdd.RDD

import org.apache.spark.sql.{Row, SQLContext}

import org.apache.spark.util.LongAccumulator

import org.scalatest.FunSuite

import tool.LocalSparkContext

import algos.{MergedPCtr, PCtrUtils}

class SparkWCSuit extends FunSuite with LocalSparkContext {

//rdd wordCount

test("test rdd wc") {

sc.setLogLevel("ERROR")

val rdd = sc.makeRDD(Seq("a", "b", "b"))

val res = rdd.map((_, 1)).reduceByKey(_ + _).collect().sorted

assert(res === Array(("a", 1), ("b", 2)))

}

}

build.sbt

name := "doc_rank"

version := "1.0"

scalaVersion := "2.10.5"

libraryDependencies += "org.apache.spark" % "spark-core_2.10" % "2.0.2"

libraryDependencies += "org.apache.spark" % "spark-mllib_2.10" % "2.0.2"

libraryDependencies += "commons-cli" % "commons-cli" % "1.2"

libraryDependencies ++= Seq(

"org.scalanlp" %% "breeze" % "0.11.2",

"org.scalanlp" %% "breeze-natives" % "0.11.2",

"org.scalanlp" %% "breeze-viz" % "0.11.2"

)

libraryDependencies ++= Seq(

"org.apache.hadoop" % "hadoop-core" % "2.6.0-mr1-cdh5.4.4",

"org.apache.hbase" % "hbase-client" % "1.0.0-cdh5.4.4",

"org.apache.hbase" % "hbase-common" % "1.0.0-cdh5.4.4",

"org.apache.hbase" % "hbase-server" % "1.0.0-cdh5.4.4",

"org.apache.hbase" % "hbase-protocol" % "1.0.0-cdh5.4.4"

)

resolvers += "Akka Repository" at "http://repo.akka.io/releases/";

resolvers += "cloudera-repo-releases" at "https://repository.cloudera.com/artifactory/repo/";

resolvers ++= Seq(

"Sonatype Snapshots" at "https://oss.sonatype.org/content/repositories/snapshots/";,

"Sonatype Releases" at "https://oss.sonatype.org/content/repositories/releases/";

)

hadoop样例

目录结构：

src/

├── main

│   ├── java

│   │   ├── io

│   │   │   └── longwind

│   │   │       └── mapreduce

│   │   │           ├── main

│   │   │           │   └── Main.java

│   │   │           ├── mapreduce

│   │   │           │   └── InfoidUniquer.java

│   │   │           └── utils

│   │   │               ├── Constant.java

│   │   │               └── HadoopUtils.java

│   │   └── org

│   │       └── apache

│   │           └── hadoop

│   │               ├── io

│   │               │   └── nativeio

│   │               │       └── NativeIO.java

│   │               └── mapred

│   │                   ├── ClientCache.java

│   │                   ├── ClientServiceDelegate.java

│   │                   ├── NotRunningJob.java

│   │                   ├── ResourceMgrDelegate.java

│   │                   ├── YarnClientProtocolProvider.java

│   │                   └── YARNRunner.java

│   └── resources

│       └── log4j.properties

└── test

    ├── java

    │   └── test

    └── resources

        └── log4j.properties

pom.xml中关键依赖

<dependency>

<groupId>org.apache.hadoop</groupId>

<artifactId>hadoop-common</artifactId>

<version>2.6.0-cdh5.4.4</version>

</dependency>

<dependency>

<groupId>org.apache.hadoop</groupId>

<artifactId>hadoop-mapreduce-client-core</artifactId>

<version>2.6.0-cdh5.4.4</version>

</dependency>

<dependency>

<groupId>org.apache.hadoop</groupId>

<artifactId>hadoop-mapreduce-client-common</artifactId>

<version>2.6.0-cdh5.4.4</version>

</dependency>

代码方面：

上面目录结构显示的org.apache.hadoop.* 那些是从hadoop源码包里拷出来的，注意是2.6.0-cdh5.4.4版本的

程序运行起来报错access0，如果是NativeIO.java 那应该是权限问题，需要手动修改NativeIO.java 中的

public static boolean access(String path, AccessRight desiredAccess)throws IOException {

    return true;//修改后

    //return access0(path, desiredAccess.accessRight());//修改前

}

这样，就能在windows本地，轻松进行hadoop, spark开发调试了，顺便吐槽一下mrunit不是很给力，问题一般是版本，包冲突，权限。

参考：

平野大荒 http://www.cnblogs.com/tq03/p/5101916.html --windows上的mapreduce运行环境
在前进的路上 http://blog.csdn.net/congcong68/article/details/42043093 -- access0 问题解决
xuweimdm http://blog.csdn.net/u011513853/article/details/52865076 -- spark在windows上

windows 本地构建hadoop-spark运行环境（hadoop-2.6, spark2.0）的更多相关文章

Spark简单介绍，Windows下安装Scala+Hadoop+Spark运行环境，集成到IDEA中
一.前言近几年大数据是异常的火爆,今天小编以java开发的身份来会会大数据,提高一下自己的层面! 大数据技术也是有很多: Hadoop Spark Flink 小编也只知道这些了,由于Hadoop, ...
[phvia/dkc] Docker Compose 快速构建(LNMP+Node)运行环境
快速构建(LNMP+Node)运行环境. dkc 在此作为 docker-compose 的缩写,你可以理解为 alias dkc=docker-compose 准备安装 docker 选择1) 从 ...
【原创干货】大数据Hadoop/Spark开发环境搭建
已经自学了好几个月的大数据了,第一个月里自己通过看书.看视频.网上查资料也把hadoop(1.x.2.x).spark单机.伪分布式.集群都部署了一遍,但经历短暂的兴奋后,还是觉得不得门而入. 只有深 ...
Hadoop之运行环境搭建
一.虚拟机环境准备 1.克隆虚拟机 2.修改克隆虚拟机静态IP 3.修改主机名 4.关闭防火墙 5.创建hadoop用户 6.配置hadoop用户具有root权限 7.在/opt 目录下创建文件夹 1 ...
【Spark笔记】Windows10 本地搭建单机版Spark开发环境
0x00 环境及软件 1.系统环境 OS:Windows10_x64 专业版 2.所需软件或工具 JDK1.8.0_131 spark-2.3.0-bin-hadoop2.7.tgz hadoop-2 ...
Amazon EMR（Elastic MapReduce）：亚马逊Hadoop托管服务运行架构&Hadoop云服务之战：微软vs.亚马逊
http://s3tools.org/s3cmd Amazon Elastic MapReduce (Amazon EMR)简介 Amazon Elastic MapReduce (Amazon EM ...
Windows下单机安装Spark开发环境
机器:windows 10 64位. 因Spark支持java.python等语言,所以尝试安装了两种语言环境下的spark开发环境. 1.Java下Spark开发环境搭建 1.1.jdk安装安装o ...
Apache Spark源码走读之12 -- Hive on Spark运行环境搭建
欢迎转载,转载请注明出处,徽沪一郎. 楔子 Hive是基于Hadoop的开源数据仓库工具,提供了类似于SQL的HiveQL语言,使得上层的数据分析人员不用知道太多MapReduce的知识就能对存储于H ...
Hive on Spark运行环境搭建
Hive是基于Hadoop的开源数据仓库工具,提供了类似于SQL的HiveQL语言,使得上层的数据分析人员不用知道太多MapReduce的知识就能对存储于Hdfs中的海量数据进行分析.由于这一特性而收 ...

随机推荐

springmvc注解
简介: handler method 参数绑定常用的注解,我们根据他们处理的Request的不同内容部分分为四类:(主要讲解常用类型) A.处理requet uri 部分(这里指uri templat ...
oop 第三次作业文件读写
oop第三次作业 GitHub 对于迟交我感到很抱歉 031602510 体会这次的用到了之前的文件读写,传参定义函数有返回值,使代码更加简洁.面向对象的程序设计,在面对函数多元的情况下,编程更加 ...
【Beta】阶段第三次Daily Scrum Meeting
每日任务 ·1.本次会议为第三次 Meeting 会议 ·2.本次会议在周三上午9:40召开,会议时间为10分钟一.今日站立式会议照片二.每个人的工作(有work item的ID) 三.工作中遇到 ...
1st_homework_SE--四则运算题目生成器
0x00 Code 查询源代码及README请点此 0x01 需求分析实现一个自动生成小学四则运算题目的命令行程序. 0x02 功能设计主要功能为: 接受用户输入以便知道要出多少道题目python ...
201521123032 《Java程序设计》第13周学习总结
1. 本周学习总结以你喜欢的方式(思维导图.OneNote或其他)归纳总结多网络相关内容. 2. 书面作业 1. 网络基础 1.1 比较ping www.baidu.com与ping cec.jmu ...
headfirst设计模式（3）—装饰者模式
序好久没写设计模式了,自从写了两篇之后,就放弃治疗了,主要还是工作太忙了啊(借口,都是借口),过完年以后一直填坑,填了好几个月,总算是稳定下来了,可以打打酱油了. 为什么又重新开始写设计模式呢?学习 ...
接口测试入门（5）----新框架重构，使用轻量级的HTTP开发库 Unirest
之前的第一套框架在使用过程中发现存在以下问题: 一. 框架1缺点: 1.登陆的账号每个人写的不一样,一旦用户在测试环境被修改,则导致用例失败 2.每次读取访问网址,需要在同一个java文件下切换测试 ...
session get和load方法对比
get测试代码如下: public class Test { public static void main(String[] args) { // TODO Auto-generated metho ...
Mybatis源码解析-DynamicSqlSource和RawSqlSource的区别
XMLLanguageDriver是ibatis的默认解析sql节点帮助类,其中的方法其会调用生成DynamicSqlSource和RawSqlSource这两个帮助类,本文将对此作下简单的简析应用 ...
Routing in ASP.NET Core
.NET-Core Series Server in ASP.NET-Core DI in ASP.NET-Core Routing in ASP.NET-Core Error Handling in ...

windows 本地构建hadoop-spark运行环境（hadoop-2.6, spark2.0）

windows 本地构建hadoop-spark运行环境（hadoop-2.6, spark2.0）的更多相关文章

随机推荐

热门专题