【原创干货】大数据Hadoop/Spark开发环境搭建

码以致用 2024-09-01 15:58:19 原文

　　已经自学了好几个月的大数据了，第一个月里自己通过看书、看视频、网上查资料也把hadoop（1.x、2.x）、spark单机、伪分布式、集群都部署了一遍，但经历短暂的兴奋后，还是觉得不得门而入。

　　只有深入大数据开发才能逐步掌握大数据。而首先要搭开发环境，对于一个像我这样之前只做过plsql开发的人来说，确实走了很多弯路。一开始目标设得很高，直接下源代码编译成jar包进行使用，后来发现其实没什么必要，受到一些非技术因素尤其是天朝特色社会主义网络的影响，sbt基本无法使用，直接下官方编译好的版本就行了。

注：我在搭建开发环境的过程中，在网上查阅了无数资料，也在《hadoop权威指南》等书里找过，但几乎找不到满意的，要不就是过程本身就有问题，要不就是提供的方法在天朝无法实践，还有就是写得过于简略或过于深奥。严重影响了搭建进度。看到本文的朋友们有福了，除去下载软件的时间，基本一个小时之内可以全部搞定。大道至简，很多东西要是不说清楚，写一万句废话也是没用的。

IDE:eclipse-Scala-Ide
hadoop:hadoop-2.6.2
spark:spark-1.2.0

一、hadoop开发环境

第一种方法：

直接用hadoop eclipse插件，再进行简单的配置就可以了。

第二种方法：

直接导入hadoop的jar包，可使用maven工程实现自动导入，也可手动导入

手动导入：

hdfs和mapred:

C:\Software\hadoop\hadoop-2.6.2\share\hadoop\common\

C:\Software\hadoop\hadoop-2.6.2\share\hadoop\common\lib\

C:\Software\hadoop\hadoop-2.6.2\share\hadoop\hdfs\

hive:

C:\Software\hadoop\apache-hive-2.1.0-bin\lib\

hbase:

E:\Hadoop\hbase-0.94.2-security\hbase-0.94.2-security.jar

E:\Hadoop\hbase-0.94.2-security\hbase-0.94.2-security-tests.jar

E:\Hadoop\hbase-0.94.2-security\lib\

其实不用导入那么多包，以后用maven来自动导入。

导入后，选中这些jar包，Build Path->Add to Build Path

二、spark开发环境

下载scala-ide。位数需要与本地jdk版本位数一致，直接解压即可作为eclipse使用

新建scala project

在工程名处右击点Properties->Java Builder Path->Libraries->Add External JARs->添加编译后spark assembly包（可以直接从官网下载编译后的版本里找出来）

有很多时候需要配置Run Configurations，重点关注Main和Arguments两项里的内容。如果没有部署spark，可以直接在VM arguments里添加-Dspark.master=local，或者直接在代码里添加conf.setMaster("local")

so easy！

【原创干货】大数据Hadoop/Spark开发环境搭建的更多相关文章

大数据 -- Hadoop集群环境搭建
首先我们来认识一下HDFS, HDFS(Hadoop Distributed File System )Hadoop分布式文件系统.它其实是将一个大文件分成若干块保存在不同服务器的多个节点中.通过联网 ...
搭建大数据hadoop完全分布式环境遇到的坑
搭建大数据hadoop完全分布式环境,遇到很多问题,这里记录一部分,以备以后查看. 1.在安装配置完hadoop以后,需要格式化namenode,输入指令:hadoop namenode -forma ...
HBase、Hive、MapReduce、Hadoop、Spark 开发环境搭建后的一些步骤（export导出jar包方式或 Ant 方式）
步骤一若是,不会HBase开发环境搭建的博文们,见我下面的这篇博客. HBase 开发环境搭建(Eclipse\MyEclipse + Maven) 步骤一里的,需要补充的.如下: 在项目名,右键, ...
我搭建大数据Hadoop完全分布式环境遇到的坑---hadoop： command not found
搭建大数据hadoop环境,遇到很多问题,这里记录一部分,以备以后查看. [遇到问题].在安装配置完hadoop以后,需要格式化namenode,输入指令:hadoop namenode -forma ...
Spark编译及spark开发环境搭建
最近需要将生产环境的spark1.3版本升级到spark1.6(尽管spark2.0已经发布一段时间了,稳定可靠起见,还是选择了spark1.6),同时需要基于spark开发一些中间件,因此需要搭建一 ...
Spark开发环境搭建和作业提交
Spark高可用集群搭建在所有节点上下载或上传spark文件,解压缩安装,建立软连接配置所有节点spark安装目录下的spark-evn.sh文件配置slaves 配置spark-default ...
《OD大数据实战》Hive环境搭建
一.搭建hadoop环境 <OD大数据实战>hadoop伪分布式环境搭建二.Hive环境搭建 1. 准备安装文件下载地址: http://archive.cloudera.com/cd ...
Hadoop项目开发环境搭建（Eclipse\MyEclipse + Maven）
写在前面的话可详细参考,一定得去看 HBase 开发环境搭建(Eclipse\MyEclipse + Maven) Zookeeper项目开发环境搭建(Eclipse\MyEclipse + Mav ...
Hadoop Eclipse开发环境搭建
This document is from my evernote, when I was still at baidu, I have a complete hadoop developme ...

随机推荐

Redis底层函数详解
Redis底层函数详解 serverCron 函数它负责管理服务器的资源,并维持服务器的正常运行.在执行 serverCron 函数的过程中会调用相关的子函数,如 trackOperationsPe ...
git push错误,如何回滚
--> git push Counting objects: 81, done.Delta compression using up to 4 threads.Compressing objec ...
DL 调参经验
2019-10-20 11:45:54 数据侧 1.在数据集很大的情况下,不要立马跑全量数据.可以现在小数据集上进行测试,估算一下运行时间. 2.数据shuffle和augmentation,训练之前 ...
[最短路,floyd] Codeforces 1204C Anna, Svyatoslav and Maps
题目:http://codeforces.com/contest/1204/problem/C C. Anna, Svyatoslav and Maps time limit per test 2 s ...
Hive数据倾斜的原因及主要解决方法
数据倾斜产生的原因数据倾斜的原因很大部分是join倾斜和聚合倾斜两大类 Hive倾斜之group by聚合倾斜原因: 分组的维度过少,每个维度的值过多,导致处理某值的reduce耗时很久: 对一些 ...
Jocke的IOT之路--raspberrypi更换国内镜像
一.编辑sources.list文件 sudo nano /etc/apt/sources.list 使用#将文件内容全部注释调,更改位 deb http://mirrors.tuna.tsinghu ...
浅尝Go语言GC
大家好,我是小栈君,因为个人和工作的缘故,所以拖更了一点时间,但是关于拖更的内容小栈君会在后续的时间中补回来,还希望大家继续支持和关注小栈君.当然,在国内疫情稍微减缓的情况下,小栈君在这里也多说两句, ...
五大经典卷积神经网络介绍：LeNet / AlexNet / GoogLeNet / VGGNet/ ResNet
欢迎大家关注我们的网站和系列教程:http://www.tensorflownews.com/,学习更多的机器学习.深度学习的知识! LeNet / AlexNet / GoogLeNet / VGG ...
Array.forEach原理，仿造一个类似功能
Array.forEach原理,仿造一个类似功能 array.forEach // 设一个arr数组 let arr = [12,45,78,165,68,124]; let sum = 0; // ...
使用SpringCloud将单体迁移至微服务
使用SpringBoot构建单体项目有一段时间了,准备对一个老项目重构时引入SpringCloud微服务,以此奠定后台服务能够应对未知的业务需求. 现在SOA架构下的服务管理面临很多挑战,比如面临一个 ...