Hadoop

HDFS、Yarn、MapReduce

Hadoop集群环境搭建

完全分布式环境，伪分布式将其中的多台服务器改为一台，并将配置文件中的相关内容更改即可

1、安装Linux系统模型机

关闭防火墙：

CentOS:

systemctl stop firewalld

systemctl disable firewalld.service

Ubuntu:

ufw disable

修改环境变量：

vim /etc/profile.d/my_env.sh

配置JDK环境变量：vim /etc/profile.d/my_env.sh

#JAVA_HOME

export JAVA_HOME=/opt/module/jdk1.8.0_212

export PATH=$PATH:$JAVA_HOME/bin

配置Hadoop环境变量

#HADOOP_HOME

export HADOOP_HOME=/opt/module/hadoop-3.1.3

export PATH=$PATH:$HADOOP_HOME/bin

export PATH=$PATH:$HADOOP_HOME/sbin

更新环境变量：

source /etc/profile

设置host映射：Linux系统、Windows系统

修改静态IP地址：虚拟机、Linux系统和Windows系统

 CentOS:

 vim /etc/sysconfig/network-scripts/ifcfg-ens33

2、复制Linux系统

修改复制后的各个系统的静态IP地址和主机名

3、密钥免密登录

生成密钥：

ssh-keygen -t rsa

分发密钥：

ssh-copy-id 服务器地址

4、配置完全分布式环境

修改配置文件：core-site.xml、hdfs-site.xml、yarn-site.xml、mapred-site.xml 、workers

core-site.xml文件：

<?xml version="1.0" encoding="UTF-8"?>

<?xml-stylesheet type="text/xsl" href="configuration.xsl"?>

<configuration>

 <!-- 指定 NameNode 的地址 -->

     <property>

     <name>fs.defaultFS</name>

     <value>hdfs://hadoop102:8020</value>

     </property>

     <!-- 指定 hadoop 数据的存储目录 -->

     <property>

     <name>hadoop.tmp.dir</name>

     <value>/opt/module/hadoop-3.1.3/data</value>

     </property>

     <!-- 配置 HDFS 网页登录使用的静态用户为 an -->

     <property>

     <name>hadoop.http.staticuser.user</name>

     <value>an</value>

     </property>

    <!--如果需要用到 spark 的话，需要在 core-site.xml 中加入如下：【否则会出错】-->

    <property>

    <name>hadoop.proxyuser.root.hosts</name>

    <value>*</value>

    </property>

    <property>

    <name>hadoop.proxyuser.root.groups</name>

    <value>*</value>

    </property>

</configuration>

hdfs-site.xml文件：

<?xml version="1.0" encoding="UTF-8"?>

<?xml-stylesheet type="text/xsl" href="configuration.xsl"?>

<configuration>

    <property>

    <name>dfs.replication</name>

    <value>3</value>

    <!--默认为3，搭建伪分布式时只有一个节点、改为1即可-->

    </property>

    <!-- nn web 端访问地址-->

    <property>

     <name>dfs.namenode.http-address</name>

     <value>hadoop102:9870</value>

     </property>

    <!-- 2nn web 端访问地址-->

     <property>

     <name>dfs.namenode.secondary.http-address</name>

     <value>hadoop104:9868</value>

     </property>

</configuration>

yarn-site.xml文件：

<?xml version="1.0" encoding="UTF-8"?>

<?xml-stylesheet type="text/xsl" href="configuration.xsl"?>

<configuration>

 <!-- 指定 MR 走 shuffle -->

     <property>

     <name>yarn.nodemanager.aux-services</name>

     <value>mapreduce_shuffle</value>

     </property>

     <!-- 指定 ResourceManager 的地址-->

     <property>

     <name>yarn.resourcemanager.hostname</name>

     <value>hadoop103</value>

     </property>

     <!-- 环境变量的继承 -->

     <property>

     <name>yarn.nodemanager.env-whitelist</name>

    <value>JAVA_HOME,HADOOP_COMMON_HOME,HADOOP_HDFS_HOME,HADOOP_CONF_DIR,CLASSPATH_PREPEND_DISTCACHE,HADOOP_YARN_HOME,HADOOP_MAP

    RED_HOME</value>

     </property>

    <!-- 开启日志聚集功能 -->

    <property>

     <name>yarn.log-aggregation-enable</name>

     <value>true</value>

    </property>

    <!-- 设置日志聚集服务器地址 -->

    <property>

     <name>yarn.log.server.url</name>

     <value>http://hadoop102:19888/jobhistory/logs</value>

    </property>

    <!-- 设置日志保留时间为 7 天 -->

    <property>

     <name>yarn.log-aggregation.retain-seconds</name>

     <value>604800</value>

    </property>

</configuration>

mapred-site.xml文件：

<?xml version="1.0" encoding="UTF-8"?>

<?xml-stylesheet type="text/xsl" href="configuration.xsl"?>

<configuration>

    <!-- 指定 MapReduce 程序运行在 Yarn 上 -->

     <property>

     <name>mapreduce.framework.name</name>

     <value>yarn</value>

     </property>

     <!-- 历史服务器端地址 -->

    <property>

     <name>mapreduce.jobhistory.address</name>

     <value>hadoop102:10020</value>

    </property>

    <!-- 历史服务器 web 端地址 -->

    <property>

     <name>mapreduce.jobhistory.webapp.address</name>

     <value>hadoop102:19888</value>

    </property>

</configuration>

分发到各个Linux服务器

5、启动集群

格式化：hdfs namenode -format

启动和关闭HDFS： start-dfs.sh  stop-dfs.sh

启动和关闭Yarn： strat-yarn.sh  stop-yarn.sh

统一启动和关闭：start-all.sh stop-all.sh

启动历史服务器：mapred --daemon start historyserver

启动和关闭脚本：

#!/bin/bash

if [ $# -lt 1 ]

then

 echo "No Args Input..."

 exit ;

fi

case $1 in

"start")

 echo " =================== 启动 hadoop 集群 ==================="

 echo " --------------- 启动 hdfs ---------------"

 ssh hadoop102 "/opt/module/hadoop-3.1.3/sbin/start-dfs.sh"

 echo " --------------- 启动 yarn ---------------"

 ssh hadoop103 "/opt/module/hadoop-3.1.3/sbin/start-yarn.sh"

 echo " --------------- 启动 historyserver ---------------"

 ssh hadoop102 "/opt/module/hadoop-3.1.3/bin/mapred --daemon start

historyserver"

;;

"stop")

 echo " =================== 关闭 hadoop 集群 ==================="

 echo " --------------- 关闭 historyserver ---------------"

 ssh hadoop102 "/opt/module/hadoop-3.1.3/bin/mapred --daemon stop

historyserver"

 echo " --------------- 关闭 yarn ---------------"

 ssh hadoop103 "/opt/module/hadoop-3.1.3/sbin/stop-yarn.sh"

 echo " --------------- 关闭 hdfs ---------------"

 ssh hadoop102 "/opt/module/hadoop-3.1.3/sbin/stop-dfs.sh"

;;

*)

 echo "Input Args Error..."

;;

esac

6、常用端口号

查看 JobHistory hadoop102:19888:jobhistory

Hadoop环境的搭建的更多相关文章

Ubuntu下hadoop环境的搭建（伪分布模式）
Ubuntu下hadoop环境的搭建(伪分布模式) 一.必要资源的下载 1.Java jdk(jdk-8u25-linux-x64.tar.gz)的下载具体链接为: http://www.oracl ...
Hadoop学习---Eclipse中hadoop环境的搭建
在eclipse中建立hadoop环境的支持 1.需要下载安装eclipse 2.需要hadoop-eclipse-plugin-2.6.0.jar插件,插件的终极解决方案是https://githu ...
Linux上安装Hadoop集群(CentOS7+hadoop-2.8.0)--------hadoop环境的搭建
Linux上安装Hadoop集群(CentOS7+hadoop-2.8.0)------https://blog.csdn.net/pucao_cug/article/details/71698903 ...
hadoop集群搭建--CentOS部署Hadoop服务
在了解了Hadoop的相关知识后,接下来就是Hadoop环境的搭建,搭建Hadoop环境是正式学习大数据的开始,接下来就开始搭建环境!我们用到环境为:VMware 12+CentOS6.4 hadoo ...
【转】RHadoop实践系列之一:Hadoop环境搭建
RHadoop实践系列之一:Hadoop环境搭建 RHadoop实践系列文章,包含了R语言与Hadoop结合进行海量数据分析.Hadoop主要用来存储海量数据,R语言完成MapReduce 算法,用来 ...
【Hadoop环境搭建】Centos6.8搭建hadoop伪分布模式
阅读目录 ~/.ssh/authorized_keys 把公钥加到用于认证的公钥文件中,authorized_keys是用于认证的公钥文件方式2: (未测试,应该可用) 基于空口令创建新的SSH密钥 ...
hadoop集群环境的搭建
hadoop集群环境的搭建今天终于把hadoop集群环境给搭建起来了,能够运行单词统计的示例程序了. 集群信息如下: 主机名 Hadoop角色 Hadoop jps命令结果 Hadoop用户 Had ...
hadoop环境搭建之关于NAT模式静态IP的设置 ---VMware12+CentOs7
很久没有更新了,主要是没有时间,今天挤出时间验证了一下,果然还是有些问题的,不过已经解决了,就发上来吧. PS:小豆腐看仔细了哦~ 关于hadoop环境搭建,从单机模式,到伪分布式,再到完全分布式,我 ...
虚拟机搭建hadoop环境
这里简单用三台虚拟机,搭建了一个两个数据节点的hadoop机群,仅供新人学习.零零碎碎,花了大概一天时间,总算完成了. 环境 Linux版本:CentOS 6.5 VMware虚拟机 jdk1.6.0 ...
大数据学习系列之一 ----- Hadoop环境搭建(单机)
一.环境选择 1,服务器选择阿里云服务器:入门型(按量付费) 操作系统:linux CentOS 6.8 Cpu:1核内存:1G 硬盘:40G ip:39.108.77.250 2,配置选择 JD ...

随机推荐

bind使用场景之一
.NET WebAPI 跨域问题(has been blocked by CORS policy:No Access-Control-Allow-Ogigin header is present on the requested resource)
一.什么是跨域 1. 跨域解释跨域指的是浏览器不能执行其他网站的脚本.它是由浏览器的同源策略造成的,是浏览器施加的安全限制. 同源指的是:域名,协议,端口均相同. 2. 什么情况下会导致跨域 2.1 ...
P26_wxss - 样式导入
样式导入什么是样式导入使用 WXSS 提供的 @import 语法,可以导入外联的样式表. @import 的语法格式 @import 后跟需要导入的外联样式表的相对路径,用 ; 表示语句结束.示 ...
P24_wxss - wxss与css的关系
WXSS 模板样式什么是 WXSS WXSS (WeiXin Style Sheets)是一套样式语言,用于美化 WXML 的组件样式,类似于网页开发中的 CSS. WXSS 和 CSS 的关系 W ...
源码下载teb
git clone https://github.com/rst-tu-dortmund/teb_local_planner.git git checkout <ros版本分支> git ...
基于Python的OpenGL 04 之变换
1. 概述本文基于Python语言,描述OpenGL的变换前置知识可参考: 基于Python的OpenGL 03 之纹理 - 当时明月在曾照彩云归 - 博客园 (cnblogs.com) 笔者这里 ...
PostgreSQL cache lookup failed for type XXXX 错误
一.错误信息执行 pg_dump 命令备份,提示 cache lookup failed for type- 错误. 二.错误分析根据上面日志中的提示信息,可以确定 222222 这个 ID 号, ...
AD域安装后无法打开网络适配器，提示无法访问指定设备,路径或文件,你可能没有。。。
虚拟机安装win 2016,配置网络,安装VM tools,激活,重启. 修改计算机名,重启,安装AD域,DNS,重启然后准备修改DNS指向的时候发现无法打开更改适配器选项. 打开服务器管理器,点击 ...
swiper滑动异常
遇到这样的情况,一共5张slide,但是从第三个起再往右划就不动了.后来发现是已经初始化swiper后又追加了slide.(大概意思是这样.太久的程序了,也不想仔细捋了) 暂且用到的办法: 先定义好: ...
nginx反向代理hyperf
location / { #反向代理到本地9501端口 proxy_pass http://127.0.0.1:9501; proxy_redirect off; p ...

Hadoop环境的搭建