实验环境

Hadoop版本：CDH 5.3.6

*本实验项目所需软件均可在百度网盘链接：http://pan.baidu.com/s/1dFeNR6h 密码：1zx4中获取。

安装 Hadoop

上传hadoop文件到/usr/local目录下

rz

解压

tar -zxvf hadoop-2.5.0-cdh5.3.6.tar.gz

删除tar包

rm -rf hadoop-2.5.0-cdh5.3.6.tar.gz

重命名
mv hadoop-2.5.0-cdh5.3.6 hadoop

设置环境变量

vi ~/.bashrc

export HADOOP_HOME=/usr/local/hadoop

export PATH=$HADOOP_HOME/bin:$HADOOP_HOME/sbin

生效设置

source ~/.bashrc

测试

hadoop

hadoop version

yarn

yarn version

创建/usr/local/data目录

配置文件

修改core-site.xml文件

cd /hadoop/etc/hadoop

ls

vi core-sie.xml

<property>

  <name>fs.default.name</name>

  <value>hdfs://sparkproject1:9000</value>

</property>

修改hdfs-site.xml

<property>

  <name>dfs.name.dir</name>

  <value>/usr/local/data/namenode</value>

</property>

<property>

  <name>dfs.data.dir</name>

  <value>/usr/local/data/datanode</value>

</property>

<property>

  <name>dfs.tmp.dir</name>

  <value>/usr/local/data/tmp</value>

</property>

<property>

  <name>dfs.replication</name>

  <value>2</value>

</property>

修改mapred-site.xml

cp mapred-site.xml.template mapred-site.xml

vi mapred-site.xml

<property>

  <name>mapreduce.framework.name</name>

  <value>yarn</value>

</property>

修改yarn-site.xml

<property>

  <name>yarn.resourcemanager.hostname</name>

  <value>sparkproject1</value>

</property>

<property>

  <name>yarn.nodemanager.aux-services</name>

  <value>mapreduce_shuffle</value>

</property>

修改slaves

sparkproject2

sparkproject3

sparkproject1是主节点，sparkproject2和sparkproject3是从节点

在另外两台虚拟机上搭建hadoop

在sparkproject1上使用scp命令将配置好的文件传输到另外两个虚拟机上

cd /usr/local

scp -r hadoop root@sparkproject2:/usr/local

scp -r hadoop root@sparkproject3:/usr/local

scp ~/.bashrc root@sparkproject2:~/

scp ~/.bashrc root@sparkproject3:~/

在sparkproject2和sparkproject3上分别执行

source ~/.bashrc

在sparkproject2和sparkproject3的/usr/local目录下创建data目录

cd /usr/local

mkdir data

启动hdfs集群

格式化namenode
在sparkproject1上执行

hdfs namenode –format

启动集群

start-dfs.sh

查看是否启动成功

在浏览器中输入sparkproject1:50070查看状态

上传测试文件

vi hello.txt

Hello world !

hdfs dfs -put hell.txt /hello.txt

在网页端查看上传的文件

启动yarn集群

start-yarn.sh

使用jps检查各节点启动状态，sparkproject1上启动ResourceManager，sparkproject2和sparkproject3节点上启动NodeManager

在浏览器中输入sparkproject1：8088查看

至此，hadoop集群搭建完成，下一步将安装Hive。

更多文章：Spark大型电商项目实战：http://blog.csdn.net/u012318074/article/category/6744423

3.环境搭建-Hadoop（CDH）集群搭建的更多相关文章

超快速使用docker在本地搭建hadoop分布式集群
超快速使用docker在本地搭建hadoop分布式集群超快速使用docker在本地搭建hadoop分布式集群学习hadoop集群环境搭建是hadoop入门的必经之路.搭建分布式集群通常有两个办法: ...
Hadoop分布式集群搭建hadoop2.6+Ubuntu16.04
前段时间搭建Hadoop分布式集群,踩了不少坑,网上很多资料都写得不够详细,对于新手来说搭建起来会遇到很多问题.以下是自己根据搭建Hadoop分布式集群的经验希望给新手一些帮助.当然,建议先把HDFS ...
Hadoop分布式集群搭建
layout: "post" title: "Hadoop分布式集群搭建" date: "2017-08-17 10:23" catalog ...
使用Docker在本地搭建Hadoop分布式集群
学习Hadoop集群环境搭建是Hadoop入门必经之路.搭建分布式集群通常有两个办法: 要么找多台机器来部署(常常找不到机器) 或者在本地开多个虚拟机(开销很大,对宿主机器性能要求高,光是安装多个虚拟 ...
Hadoop+HBase 集群搭建
Hadoop+HBase 集群搭建 1. 环境准备说明:本次集群搭建使用系统版本Centos 7.5 ,软件版本 V3.1.1. 1.1 配置说明本次集群搭建共三台机器,具体说明下: 主机名 IP ...
分布式计算（一）Ubuntu搭建Hadoop分布式集群
最近准备接触分布式计算,学习分布式计算的技术栈和架构知识.目前的分布式计算方式大致分为两种:离线计算和实时计算.在大数据全家桶中,离线计算的优秀工具当属Hadoop和Spark,而实时计算的杰出代表非 ...
hadoop+spark集群搭建入门
忽略元数据末尾回到原数据开始处 Hadoop+spark集群搭建说明: 本文档主要讲述hadoop+spark的集群搭建,linux环境是centos,本文档集群搭建使用两个节点作为集群环境:一个 ...
hadoop ha集群搭建
集群配置: jdk1.8.0_161 hadoop-2.6.1 zookeeper-3.4.8 linux系统环境:Centos6.5 3台主机:master.slave01.slave02 Hado ...
使用docker搭建hadoop分布式集群
使用docker搭建部署hadoop分布式集群在网上找了非常长时间都没有找到使用docker搭建hadoop分布式集群的文档,没办法,仅仅能自己写一个了. 一:环境准备: 1:首先要有一个Cento ...
CDH集群搭建视频教程百度云网盘下载
CDH集群搭建视频教程百度云网盘下载链接: http://pan.baidu.com/s/1i5DVBlb 密码:2mny

随机推荐

JAVA-基础(二） java.lang
1.String类提供了许多从String对象中截取字符的方法 1.1 char charAt(int where) 1.2 void getChars(int sourceStart, int so ...
luogu4001 [BJOI2006]狼抓兔子
裸dinic就跑过去了,哪用得着平面图最小割=最短路-- #include <iostream> #include <cstring> #include <cstdio& ...
用PHP写的一个简单的分页类 2.0版
<?php /* 分页类用于实现对多条数据分页显示 version:2.0 //基于1.0 数据库查询用mysqli实现 author:Knight E-Mail:S.Knight.Work@ ...
linux内核代码注释赵炯第三章引导启动程序
linux内核代码注释第三章引导启动程序 boot目录中的三个汇编代码文件 bootsect.s和setup.s采用近似intel的汇编语法,需要8086汇编器连接器as86和ld86 head ...
EM算法简易推导
EM算法推导网上和书上有关于EM算法的推导,都比较复杂,不便于记忆,这里给出一个更加简短的推导,用于备忘. 在不包含隐变量的情况下,我们求最大似然的时候只需要进行求导使导函数等于0,求出参数即可.但 ...
[python学习篇][廖雪峰][1]高级特性--创建生成器方法2 yield
def fib(max): n, a, b = 0, 0, 1 while n < max: print b a, b = b, a + b n = n + 1 将print b 改成yield ...
Jeddict目前的使用现状
一.为什么使用jeddict 工具:提升生产力的工具:创建并部署一个CRUD服务系统,只需要5-10分钟规范:生成的代码,都是稳定可执行代码(前端自动使用selenium框架测试,后端使用Arqui ...
deque 类
题外: 'A' +1='B' 1.deque被称为双端队列,它也是一种顺序容器.可通过迭代器存取元素 ,也可以通过下标顺序存取元素 for(i=0;i<d1.size();i++) { cou ...
hibernate缓存详解
hibernate中提供了两级缓存,一级缓存是Session级别的缓存,它属于事务范围的缓存,该级缓存由hibernate管理,应用程序无需干预:二级缓存是SessionFactory级别的缓存,该级 ...
计算机、程序和java概述
1.1 计算机.程序和java概述计算机包括硬件(hardware)软件(software)两部分.硬件包括计算机中看得见的物理部分,软件提供看不见的指令,指令控制硬件并且使得硬件完成特定的任务.一台 ...

3.环境搭建-Hadoop（CDH）集群搭建

目录