[转载]hadoop SecondNamenode详解

SecondNamenode名字看起来很象是对第二个Namenode，要么与Namenode一样同时对外提供服务，要么相当于Namenode的HA。
真正的了解了SecondNamenode以后，才发现事实并不是这样的。
下面这段是Hadoop对SecondNamenode的准确定义：

* The Secondary Namenode is a helper to the primary Namenode.
* The Secondary is responsible for supporting periodic checkpoints
* of the HDFS metadata. The current design allows only one Secondary
* Namenode per HDFs cluster.
*
* The Secondary Namenode is a daemon that periodically wakes
* up (determined by the schedule specified in the configuration),
* triggers a periodic checkpoint and then goes back to sleep.
* The Secondary Namenode uses the ClientProtocol to talk to the
* primary Namenode.

SecondNamenode是对主Namenode的一个补充，它会周期的执行对HDFS元数据的检查点。
当前的设计仅仅允许每个HDFS只有单个SecondNamenode结点。
SecondNamenode是有一个后台的进程，会定期的被唤醒（唤醒的周期依赖相关配置）执行检查点任务，然后继续休眠。
它使用ClientProtocol协议与主Namenode通信。

1，检查点到底是做什么用的呢？
先抛开SecondNamenode不说，先介绍下Namenode中与检查点相关的两个文件，以及他们之间的关系。
fsimage文件与edits文件是Namenode结点上的核心文件。
Namenode中仅仅存储目录树信息，而关于BLOCK的位置信息则是从各个Datanode上传到Namenode上的。
Namenode的目录树信息就是物理的存储在fsimage这个文件中的，当Namenode启动的时候会首先读取fsimage这个文件，将目录树信息装载到内存中。
而edits存储的是日志信息，在Namenode启动后所有对目录结构的增加，删除，修改等操作都会记录到edits文件中，并不会同步的记录在fsimage中。
而当Namenode结点关闭的时候，也不会将fsimage与edits文件进行合并，这个合并的过程实际上是发生在Namenode启动的过程中。
也就是说，当Namenode启动的时候，首先装载fsimage文件，然后在应用edits文件，最后还会将最新的目录树信息更新到新的fsimage文件中，然后启用新的edits文件。
整个流程是没有问题的，但是有个小瑕疵，就是如果Namenode在启动后发生的改变过多，会导致edits文件变得非常大，大得程度与Namenode的更新频率有关系。
那么在下一次Namenode启动的过程中，读取了fsimage文件后，会应用这个无比大的edits文件，导致启动时间变长，并且不可能控，可能需要启动几个小时也说不定。

Namenode的edits文件过大的问题，也就是SecondeNamenode要解决的主要问题。
SecondNamenode会按照一定规则被唤醒，然后进行fsimage文件与edits文件的合并，防止edits文件过大，导致Namenode启动时间过长。

2，检查点被唤醒的条件？
以前的文章里面曾经写过相关内容，这里在回顾一下。
控制检查点的参数有两个，分别是：
fs.checkpoint.period：单位秒，默认值3600，检查点的间隔时间，当距离上次检查点执行超过该时间后启动检查点
fs.checkpoint.size：单位字节，默认值67108864，当edits文件超过该大小后，启动检查点
上面两个条件是或的关系，主要满足启动一个条件，检查点即被唤醒

3，检查点执行的过程？
a，初始化检查点
b，通知Namenode启用新的edits文件
c，从Namenode下载fsimage和edits文件
d，调用loadFSImage装载fsimage
e，调用loadFSEdits应用edits日志
f，保存合并后的目录树信息到新的image文件中
g，将新产生的image上传到Namenode中，替换原来的image文件
h，结束检查点

4，SecondNamenode最好于Namenode部署到不同的服务器
应该在merge的过程中，SecondNamenode对内存的需求与Namenode是相同的，所以对于那些大型的生产系统中，如果将两者部署到同台服务器上，在内存上会出现瓶颈。
所以最好将他们分别部署到不同的服务器。
修改hadoop配置文件的master文件。

5，关于SecondNamenode的思考
其实检查点的执行过程最好在Namenode结点搞定，也就说能有个任务定期的将Namenode的内存结果刷新到fsimage中，而不是仅仅在Namenode启动的时候才进行一次合并。
如果可以实现定期的对Namenode执行检查点，那么SecondNamenode完全没有存在的必要了。
或者在SecondNamenode方面实现增量的刷新，每次不需要将fsimage整个装载到内存中，而仅仅将增量刷新就OK了。
不过这样会让系统变得复杂一些，可以参考oracle中的检查点的处理，还是有些复杂的。
简单就是美？！！

FYI：在masters文件中配置second namenode后，日志报java.net.BindException: Cannot assign requested address异常，而且second namenode启动失败，反复测试发现是hdfs-site.xml中的dfs.secondary.http.address没有更改IP，更改成masters中配置的IP后集群启动正常。

dfs.secondary.http.address
second_namenode:50090

The secondary namenode http server address and port.
If the port is 0 then the server will start on a free port.

转载自http://blog.chinaunix.net/uid-20577907-id-3524135.html

[转载]hadoop SecondNamenode详解的更多相关文章

hadoop SecondNamenode 详解
SecondNamenode名字看起来很象是对第二个Namenode,要么与Namenode一样同时对外提供服务,要么相当于Namenode的HA. 真正的了解了SecondNamenode以后,才发 ...
hadoop SecondNamenode详解
SecondNamenode名字看起来很象是对第二个Namenode,要么与Namenode一样同时对外提供服务,要么相当于Namenode的HA. 真正的了解了SecondNamenode以后,才发 ...
Hadoop Pipeline详解[摘抄]
最近使用公司内部的一个框架写map reduce发现没有封装hadoop streaming这些东西,查了下pipeline相关的东西 Hadoop Pipeline详解 20. Aug / had ...
Hadoop Streaming详解
一: Hadoop Streaming详解 1.Streaming的作用 Hadoop Streaming框架,最大的好处是,让任何语言编写的map, reduce程序能够在hadoop集群上运行:m ...
hadoop框架详解
Hadoop框架详解 Hadoop项目主要包括以下四个模块 ◆ Hadoop Common: 为其他Hadoop模块提供基础设施 ◆ Hadoop HDFS: 一个高可靠.高吞吐量的分布式文件系统 ◆ ...
[转载]Linux 命令详解:./configure、make、make install 命令
[转载]Linux 命令详解:./configure.make.make install 命令来源:https://www.cnblogs.com/tinywan/p/7230039.html 这些 ...
Python API 操作Hadoop hdfs详解
1:安装由于是windows环境(linux其实也一样),只要有pip或者setup_install安装起来都是很方便的 >pip install hdfs 2:Client——创建集群连接 ...
Hadoop基本命令详解
调用文件系统(FS)Shell命令应使用bin/hadoop fs <args>的形式.所有的的FS shell命令使用URI路径作为参数.URI路径详解点击这里. 1.cat 说明:将路 ...
[转载] 多图详解Spring框架的设计理念与设计模式
转载自http://developer.51cto.com/art/201006/205212_all.htm Spring作为现在最优秀的框架之一,已被广泛的使用,51CTO也曾经针对Spring框 ...

随机推荐

bzoj2002
这道题学习了一种简洁的解决一些数据结构题的方法——分块法这道题方法很多,但分块写起来只有1kb左右,非常的简洁(但不是非常的高效)首先很容易思考到一种暴力的做法,从后往前推,很容易搞出每个点会弹几次弹 ...
iOS动态管理AutoLayout的约束NSLayoutConstraint
除了使用Storyboard之外,也可以使用使用代码的方式,动态的向指定的UIView,添加约束. 例如有两个UILabel:someLabel,otherLabel 首先用代码实例化,两个控件 se ...
Ethernet & IEEE 802.3 802.X 802.1ag-MEP
ISO/IEC 7498标准,它定义了网络互联的7层框架,也就是开放式系统互连参考模型(OSI模型). 交换机好比是邻近的街道,而路由器则是街道的交汇点. (交换机第二层,即数据链路层,也有四层,七层 ...
佛山Uber优步司机奖励政策（1月18日~1月24日）
滴快车单单2.5倍,注册地址:http://www.udache.com/ 如何注册Uber司机(全国版最新最详细注册流程)/月入2万/不用抢单:http://www.cnblogs.com/mfry ...
disconf实践(一)
公司目前的应用基本采用分布式部署,通过F5进行集群管理.分布式应用带来的好处是,随着流量的增加,可以快速扩展应用节点,分摊压力.分布式也会带来一定的挑战,譬如配置文件管理.如果某个配置要修改,那么所有 ...
JS：九宫格抽奖转盘实例
工作需要,所以做了个抽奖转盘的插件,当然这里只做最简单的演示.可以用于取代一些flash抽奖程序. 机制说明: 1.通过定义lottery-unit来控制节点的个数及索引: 2.通过设置lottery ...
The Boost C++ Libraries
" ...one of the most highly regarded and expertly designed C++ library projects in the world.&q ...
JavaCodeTra 猴子选猴王约瑟夫循环
之前用的是循环链表,java刚学,不知道怎么用链表.用个小算法吧代码: import java.util.Scanner; /** * */ /** * @author john * @约瑟夫循环/ ...
[AngularJS + Webpack] Uglifying your JavaScript
Angular requires some careful consideration when uglifying your code because of how angular's depend ...
Android bitmap图片处理
一.View转换为Bitmap 在Android中所有的控件都是View的直接子类或者间接子类,通过它们可以组成丰富的UI界面.在窗口显示的时候Android会把这些控件都加载到内存中 ...

[转载]hadoop SecondNamenode详解

[转载]hadoop SecondNamenode详解的更多相关文章

随机推荐

热门专题