Rhel6-hadoop分布式部署配置文档

理论基础：

Hadoop　　分布式文件系统架构

HDFS　　负责大数据存储

MapReduce　　负责大数据计算

namenode master守护进程

datanode slaves上负责存储的进程

secondarynamenode master上提供周期检查和清理任务的进程

jobtracker master上负责调度datanode上工作的进程

tasktracker slaves上负责计算的进程

Hadoop 主从节点分解:

主节点包括名称节点、从属名称节点和jobtracker守护进程(即所谓的主守护进程)以及管理集群所用的实用程序和浏览器。从节点包括tasktracker和数据节点(从属守护进程)。两种设置的不同之处在于,主节点包括提供Hadoop集群管理和协调的守护进程,而从节点包括实现Hadoop文件系统(HDFS)存储功能和MapReduce功能(数据处理功能)的守护进程。

每个守护进程在Hadoop框架中的作用。namenode是Hadoop中的主服务器,它管理文件系统名称空间和对集群中存储的文件的访问。还有一个secondary namenode,它不是namenode的冗余守护进程,而是提供周期检查点和清理任务。在每个Hadoop集群中可以找到一个namenode和一个secondarynamenode。

datanode管理连接到节点的存储(一个集群中可以有多个节点)。每个存储数据的节点运行一个datanode守护进程。

每个集群有一个jobtracker,它负责调度datanode上的工作。每个
datanode有一个tasktracker,它们执行实际工作。jobtracker和tasktracker
采用主-从形式,jobtracker跨datanode分发工作,而tasktracker执行任务。jobtracker还检查请求的工作,如果一个datanode由于某种原因失败,jobtracker
会重新调度以前的任务。

配置：

系统环境: rhel6 x86_64 iptables and selinux disabled

主机: 192.168.122.112 server12.example.com Master 192.168.122.234 server34.example.com Slave

192.168.122.20 server20.example.com Slave

注：所有主机间时间需同步，并实现无密码认证

所需的包: hadoop-1.1.2.tar.gz

相关网址：http://hadoop.apache.org/

#在所有节点上安装jdk

[root@server12 ~]# sh jdk-6u32-linux-x64.bin

[root@server12 ~]# tar zxf hadoop-1.1.2.tar.gz -C /usr/local/

[root@server12 ~]# mv jdk1.6.0_32/ /usr/local/hadoop-1.1.2/jdk

[root@server12 ~]# vim /etc/profile

export JAVA_HOME=/usr/local/hadoop-1.1.2/jdk

export CLASSPATH=.:$JAVA_HOME/lib:$JAVA_HOME/jre/lib

export PATH=$PATH:$JAVA_HOME/bin

[root@server12 ~]# source /etc/profile

生产环境中建议建立一个普通用户来实施以下操作,本文档直接用root用户执行

Standalone Operation

以下步骤在server12上实施：

[root@server12 hadoop-1.1.2]# mkdir dir1

[root@server12 hadoop-1.1.2]# cp conf/* dir1/

[root@server12 hadoop-1.1.2]# bin/hadoop jar hadoop-examples-1.1.2.jar grep dir1/ dir2/ 'dfs[a-z.]+'

[root@server12 hadoop-1.1.2]# cat dir2/*

1 dfs.server.namenode.

1 dfsadmin

注：出现类似如上输出说明成功

Pseudo-Distributed
Operation(伪分布式)

以下步骤在server12上实施：

[root@server12
~]# cd /usr/local/hadoop-1.1.2/conf/

[root@server12
conf]# vim core-site.xml

<name>fs.default.name</name>

<value>hdfs://192.168.122.112:9000</value>
#指定
namenode

</property>

</configuration>

[root@server12
conf]# vim hdfs-site.xml

<name>dfs.replication</name> #指定文件保存的副本数

</property>

</configuration>

[root@server12
conf]# vim mapred-site.xml

<name>mapred.job.tracker</name> #指定
jobtracker

</property>

</configuration>

[root@server12
conf]# vim hadoop-env.sh

export JAVA_HOME=/usr/local/hadoop-1.1.2/jdk
(此JAVA_HOME路径跟安装jdk时候指定的JAVA_HOME一致)

#建立ssh无密码登录

[root@server12
conf]# ssh-keygen （一路回车即可）

[root@server12
conf]# ssh-copy-id localhost

[root@server12
conf]# cd /usr/local/hadoop-1.1.2/

[root@server12
hadoop-1.1.2]# bin/hadoop namenode -format

/************************************************************

STARTUP_MSG:
Starting NameNode

STARTUP_MSG:
host = server12.example.com/192.168.122.112

STARTUP_MSG:
args = [-format]

STARTUP_MSG:
version = 1.1.2

STARTUP_MSG:
build =
https://svn.apache.org/repos/asf/hadoop/common/branches/branch-1.1 -r
1440782; compiled by 'hortonfo' on Thu Jan 31 02:03:24 UTC 2013

************************************************************/

13/12/01
15:49:39 INFO util.GSet: VM type = 64-bit

13/12/01
15:49:39 INFO util.GSet: 2% max memory = 19.33375 MB

13/12/01
15:49:39 INFO util.GSet: capacity = 2^21 = 2097152 entries

13/12/01
15:49:39 INFO util.GSet: recommended=2097152, actual=2097152

13/12/01
15:49:39 INFO namenode.FSNamesystem: fsOwner=root

13/12/01
15:49:39 INFO namenode.FSNamesystem: supergroup=supergroup

13/12/01
15:49:39 INFO namenode.FSNamesystem: isPermissionEnabled=true

13/12/01
15:49:39 INFO namenode.FSNamesystem: dfs.block.invalidate.limit=100

13/12/01
15:49:39 INFO namenode.FSNamesystem: isAccessTokenEnabled=false
accessKeyUpdateInterval=0 min(s), accessTokenLifetime=0 min(s)

13/12/01
15:49:39 INFO namenode.NameNode: Caching file names occuring more
than 10 times

13/12/01
15:49:40 INFO common.Storage: Image file of size 110 saved in 0
seconds.

13/12/01
15:49:40 INFO namenode.FSEditLog: closing edit log: position=4,
editlog=/tmp/hadoop-root/dfs/name/current/edits

13/12/01
15:49:40 INFO namenode.FSEditLog: close success: truncate to 4,
editlog=/tmp/hadoop-root/dfs/name/current/edits

13/12/01
15:49:40 INFO common.Storage: Storage directory
/tmp/hadoop-root/dfs/name has been successfully formatted.

13/12/01
15:49:40 INFO namenode.NameNode: SHUTDOWN_MSG:

/************************************************************

SHUTDOWN_MSG:
Shutting down NameNode at server12.example.com/192.168.122.112

************************************************************/

注：出现类似如上输出为正常

[root@server12
hadoop-1.1.2]# bin/start-all.sh

[root@server12
hadoop-1.1.2]# jps

2065
NameNode

2164
DataNode

2346
JobTracker

2262
SecondaryNameNode

2448
TaskTracker

个进程说明启动成功.

和可分别看到如下页面：

测试:

[root@server12 hadoop-1.1.2]# mkdir input

[root@server12 hadoop-1.1.2]# cp conf/* input/

[root@server12 hadoop-1.1.2]# bin/hadoop fs -mkdir dir1

[root@server12 hadoop-1.1.2]# bin/hadoop fs -ls

Found 1 items

drwxr-xr-x - root supergroup 0 2013-12-01 15:57 /user/root/dir1

[root@server12
hadoop-1.1.2]# bin/hadoop fs -put input/* dir1

[root@server12
hadoop-1.1.2]# bin/hadoop fs -ls dir1 （列出分布式文件系统dir1中的内容）

[root@server12
hadoop-1.1.2]# bin/hadoop jar hadoop-examples-1.1.2.jar grep dir1
dir2 'dfs[a-z.]+'

[root@server12
hadoop-1.1.2]# bin/hadoop fs -cat dir2/*

cat:
ouput/_logs: Is a directory

1 dfs.server.namenode.

1 dfsadmin

[root@server12
hadoop-1.1.2]# bin/hadoop fs -get dir2 output
(将分布式文件系统中的文件导出到本地的output文件夹中)

[root@server12
hadoop-1.1.2]# cat output/*

cat:
ouput/_logs: Is a directory

1 dfs.server.namenode.

1 dfsadmin

Fully-Distributed
Operation(分布式)

以下步骤在server12上实施：

[root@server12
~]# cd /usr/local/hadoop-1.1.2/conf/

[root@server12
conf]# vim core-site.xml

<name>fs.default.name</name>

<value>hdfs://192.168.122.112:9000</value>
#指定
namenode

</property>

</configuration>

[root@server12
conf]# vim hdfs-site.xml

<name>dfs.replication</name> #指定文件保存的副本数

</property>

</configuration>

[root@server12
conf]# vim mapred-site.xml

<name>mapred.job.tracker</name> #指定
jobtracker

</property>

</configuration>

[root@server12
conf]# vim hadoop-env.sh

export JAVA_HOME=/usr/local/hadoop-1.1.2/jdk
(此JAVA_HOME路径跟安装jdk时候指定的JAVA_HOME一致)

[root@server12
conf]# vim masters

192.168.122.112
#指定master节点的IP

[root@server12
conf]# vim slaves

192.168.122.234
#指定slave节点的IP

192.168.122.20

[root@server12
conf]# scp -r /usr/local/hadoop-1.1.2/
root@192.168.122.234:/usr/local/

[root@server12
conf]# scp -r /usr/local/hadoop-1.1.2/
root@192.168.122.20:/usr/local/

[root@server12
conf]# scp /etc/profile root@192.168.122.234:/etc/

[root@server12
conf]# scp /etc/profile root@192.168.122.20:/etc/

以下步骤在server34和server20上实施：

[root@server34
~]# source /etc/profile

#建立ssh无密码登录

[root@server12
conf]# ssh-keygen （一路回车即可）

[root@server12
conf]# ssh-copy-id 192.168.122.234

[root@server12
conf]# ssh-copy-id 192.168.122.20

[root@server12
conf]# cd /usr/local/hadoop-1.1.2/

[root@server12
hadoop-1.1.2]# bin/hadoop namenode -format

13/12/01
17:10:42 INFO namenode.NameNode: STARTUP_MSG:

/************************************************************

STARTUP_MSG:
Starting NameNode

STARTUP_MSG:
host = server12.example.com/192.168.122.112

STARTUP_MSG:
args = [-format]

STARTUP_MSG:
version = 1.1.2

STARTUP_MSG:
build =
https://svn.apache.org/repos/asf/hadoop/common/branches/branch-1.1 -r
1440782; compiled by 'hortonfo' on Thu Jan 31 02:03:24 UTC 2013

********13/12/01
17:10:45 INFO util.GSet: VM type = 64-bit

13/12/01
17:10:45 INFO util.GSet: 2% max memory = 19.33375 MB

13/12/01
17:10:45 INFO util.GSet: capacity = 2^21 = 2097152 entries

13/12/01
17:10:45 INFO util.GSet: recommended=2097152, actual=2097152

13/12/01
17:10:45 INFO namenode.FSNamesystem: fsOwner=root

13/12/01
17:10:45 INFO namenode.FSNamesystem: supergroup=supergroup

13/12/01
17:10:45 INFO namenode.FSNamesystem: isPermissionEnabled=true

13/12/01
17:10:45 INFO namenode.FSNamesystem: dfs.block.invalidate.limit=100

13/12/01
17:10:45 INFO namenode.FSNamesystem: isAccessTokenEnabled=false
accessKeyUpdateInterval=0 min(s), accessTokenLifetime=0 min(s)

13/12/01
17:10:45 INFO namenode.NameNode: Caching file names occuring more
than 10 times

13/12/01
17:10:46 INFO common.Storage: Image file of size 110 saved in 0
seconds.

13/12/01
17:10:46 INFO namenode.FSEditLog: closing edit log: position=4,
editlog=/tmp/hadoop-root/dfs/name/current/edits

13/12/01
17:10:46 INFO namenode.FSEditLog: close success: truncate to 4,
editlog=/tmp/hadoop-root/dfs/name/current/edits

13/12/01
17:10:46 INFO common.Storage: Storage directory
/tmp/hadoop-root/dfs/name has been successfully formatted.

13/12/01
17:10:46 INFO namenode.NameNode: SHUTDOWN_MSG:

/************************************************************

SHUTDOWN_MSG:
Shutting down NameNode at server12.example.com/192.168.122.112

************************************************************/
****************************************************/

注：出现类似如上输出为正常

[root@server12
hadoop-1.1.2]# bin/start-all.sh

[root@server12
hadoop-1.1.2]# jps

5385
NameNode

5526
SecondaryNameNode

5612
JobTracker

个进程说明启动成功.

[root@server34
~]# jps

1942
TaskTracker

1873
DataNode

个进程说明启动成功.

和192.168.122.112：50030可分别看到如下页面：

测试：仿照伪分布式的测试方式即可

Hadoop
在线添加节点:

1.
在新增节点上安装jdk,并创建相同的hadoop用户,uid等保持一致

2.
在conf/slaves文件中添加新增节点的ip

3.
同步master上hadoop所有数据到新增节点上,路径保持一致

4.
在新增节点上启动服务:

#
bin/hadoop-daemon.sh start datanode

#
bin/hadoop-daemon.sh start tasktracker

5.
均衡数据:

#
bin/start-balancer.sh

1)如果不执行均衡,那么cluster会把新的数据都存放在新的datanode上,这样会降低mapred的工作效率

2)设置平衡阈值,默认是10%,值越低各节点越平衡,但消耗时间也更长

#
bin/start-balancer.sh -threshold 5

Hadoop
在线删除
datanode
节点:

1.
在master上修改conf/mapred-site.xml

<name>dfs.hosts.exclude</name>

<value>/home/hadoop/hadoop-1.0.4/conf/datanode-excludes</value>

</property>

2.
创建datanode-excludes文件,并添加需要删除的主机,一行一个

192.168.122.77

3.
在master上在线刷新节点

#
bin/hadoop dfsadmin -refreshNodes

此操作会在后台迁移数据,等此节点的状态显示为Decommissioned,就可以安全关闭了。

4.
你可以通过以下命令查看
datanode 状态

#
bin/hadoop dfsadmin -report

在做数据迁移时,此节点不要参与
tasktracker,否则会出现异常。

Hadoop
在线删除
tasktracker
节点:

1.
在master上修改conf/mapred-site.xml

<name>mapred.hosts.exclude</name>

<value>/home/hadoop/hadoop-1.0.4/conf/tasktracker-excludes</value>

</property>

2.
创建tasktracker-excludes文件,并添加需要删除的主机名,一行一个

192.168.122.77

3.
在master上在线刷新节点

#
bin/hadoop mradmin -refreshNodes

4.
登录
jobtracker
的网络接口,进行查看。

Rhel6-hadoop分布式部署配置文档的更多相关文章

【G】开源的分布式部署解决方案文档 - 手动安装
G.系列导航 [G]开源的分布式部署解决方案 - 导航序言因各种原因,决定先写使用文档.也证明下项目没有太监.至于安装过程复杂,是因为还没有做一键安装,这个现阶段确实没精力. 项目进度 (点击图片 ...
【G】开源的分布式部署解决方案文档 - 使用手册
G.系列导航 [G]开源的分布式部署解决方案 - 导航已知问题导航没有联动因为权限只是做了基础的登录校验,考虑到后面导航要跟权限关联上暂时是写死的. 只有部分界面使用了Vue.js 因为刚开始没 ...
【G】开源的分布式部署解决方案文档 - Web Deploy
G.系列导航 [G]开源的分布式部署解决方案 - 导航微软官方部署方式右键项目->发布这个大家应该再熟悉不过,在部署前有个预览界面可以看本次更新到底更新哪些文件. 既然它可以预览部署结果, ...
【G】开源的分布式部署解决方案文档 - 部署Console & 控制负载均衡 & 跳转持续集成控制台
G.系列导航 [G]开源的分布式部署解决方案 - 导航设置项目部署流程项目类型:选择Console,这个跟功能无关,只是做项目分类,后面会有后续功能宿主:选择Console 部署方式:选择原始, ...
_00024 尼娜抹微笑伊拉克_云计算ClouderaManager以及CHD5.1.0群集部署安装文档V1.0
笔者博文:妳那伊抹微笑 itdog8 地址链接 : http://www.itdog8.com(个人链接) 博客地址:http://blog.csdn.net/u012185296 博文标题:_000 ...
Apache Hadoop 集群安装文档
简介: Apache Hadoop 集群安装文档软件:jdk-8u111-linux-x64.rpm.hadoop-2.8.0.tar.gz http://www.apache.org/dyn/cl ...
Hibernate配置文档详解
Hibernate配置文档有框架总部署文档hibernate.cfg.xml 和映射类的配置文档 ***.hbm.xml hibernate.cfg.xml(文件位置直接放在src源文件夹即可) (在 ...
Hadoop分布式部署——要点
这里只记录几个要点,比较容易出问题的地方. 1.各服务器必须有相同的用户(便于使用相同的用户ssh登录)2.ssh互通,配置无密码登录ssh-keygen -t rsa,将id_rsa.pub的内容相 ...
Kerberos主从配置文档
Kerberos主从配置文档 1. Kerberos主从同步机制在Master上通过以下命令同步数据: kdb5_util dump /var/kerberos/krb5kdc/slave_db ...

随机推荐

html页面的绝对路径和相对路径
在用springmvc架构开发网站的过程中,离不开开发前台html页面,html经常需要使用本地相关的资源,如:图片,js,css等,一般情况下,我们可以通过使用相对路径的方式来对这些资源进行指向和访 ...
html5移动端制作知识点总结
一.测试工具:1.Chrome 2.Opera Mobile二.分辨率:一般现代手机最小320px,最大640px.三.全屏流体设计: 1.腾讯新闻:http://xw.qq.com/ 2.途牛旅游: ...
转：CPU与内存的那些事
下面是网上看到的一些关于内存和CPU方面的一些很不错的文章. 整理如下: 转: CPU的等待有多久? 原文标题:What Your Computer Does While You Wait 原文地址: ...
转载 - LINUX下查看CPU使用率的命令
几个常用的命令,一些不错的解释 http://blog.csdn.net/wengpingbo/article/details/6302058 1.top 使用权限:所有使用者使用方式:top [- ...
SQL Server常见基础操作
1. 常见针对表的操作(增删改查) --1. Create Table USE [MVC_000] CREATE TABLE T_TableName ( ID ,) PRIMARY KEY, Name ...
JavaScript高阶函数的应用
定义高阶函数是指至少满足下列条件之一的函数: 函数可以作为参数被传递: 函数可以作为返回值输出. JavaScript语言中的函数显然满足高阶函数的条件,在实际开发中,无论是将函数当作参数传递,还是 ...
python 暴力破解密码脚本
python 暴力破解密码脚本以下,仅为个人测试代码,环境也是测试环境,暴力破解原理都是一样的, 假设要暴力破解登陆网站www.a.com 用户 testUser的密码, 首先,该网站登陆的验证要支 ...
eclipse 新建 maven 项目步骤（初级入门新手）
安装 maven(百度) 和在eclipse 中svn(上一篇) 修改 maven 本地仓库 eclipse 属性 maven--> installations-->添加新的自定义安装的 ...
sqlserver计算表使用大小sql
) create table #spt_space ( ) null, [rows] int null, ) null, ) null, ) null, ) null ) set nocount on ...
ASP.NET页面与IIS底层交互和工作原理详解
转载自:http://www.cnblogs.com/lidabo/archive/2012/03/13/2393200.html 第一回: 引言我查阅过不少Asp.Net的书籍,发现大多数作者都是 ...

Rhel6-hadoop分布式部署配置文档

Rhel6-hadoop分布式部署配置文档的更多相关文章

随机推荐

热门专题