大数据小白系列—

这里是大数据小白系列，这是本系列的第二篇，介绍一下HDFS中SecondaryNameNode、单点失败（SPOF）、以及高可用（HA）等概念。

上一篇我们说到了大数据、分布式存储，以及HDFS中的一些基本概念，为了能更好的理解后续介绍的内容，这里先补充介绍一下NameNode到底是怎么存储元数据的。

首先，在启动的时候，将磁盘中的元数据文件读取到内存，后续所有变化将被直接写入内存，同时被写入一个叫Edit Log的磁盘文件。（如果你熟悉关系型数据库，这个Edit Log有点像Oracle Redo Log，这是题外话）。

Q: 为什么不把这些变化直接写到磁盘上的元数据中，使磁盘上的元数据保持最新呢？Edit Log是不是多此一举？

A: 这个主要是基于性能考虑，由于对Edit Log的写是“顺序写”（追加），对元数据的写是“随机写”，两者在磁盘上表现出来的性能有相当大的差异。有兴趣的同学可以搜索学习一下磁盘相关原理哦。

上面这个方案，带来了一些明显的副作用。

NameNode长期运行，不停地向Edit Log追加内容，导致它变得巨大无比。
NameNode在重启时，需要使用Edit Log更新元数据文件，当Edit Log太大时，这一步骤就会耗费很长的时间。

为了消除这些副作用，HDFS中引入了另外一个角色，SecondaryNameNode。

它定期（比如每小时）从NameNode上抓取Edit Log，使用它更新元数据文件，并把最新的元数据文件写回到NameNode。

说完了SecondaryNameNode的职责之后，大家应该明白，它并不是一个“备用NameNode”，其实这是典型的命名不当，它应该被命名成“Checkpoint NameNode”才比较恰当。

接下来我们来说说HDFS中的单点失败问题（SPOF, Single Point Of Failure），即，当NameNode掉线之后，整个HDFS集群就变得不可用了。为解决这个问题，Hadoop 2.0中真正引入了一个“备用NameNode”。

对元数据的修改首先发生在NameNode，并被写入某个“共享位置”，备用NameNode将从该位置获取Edit Log。
DataNode节点们同时向两台NameNode汇报状态。

由于这两点，两台NameNode上的元数据将一直保持同步。这将保证当NameNode掉线后，用户可以立即切换到备用NameNode，系统将保持可用。

由于备用NameNode比较空闲（不用处理用户请求），系统又给它安排了另外一份工作——定期使用Edit Log更新元数据文件，也就是说它接手了SecondaryNameNode的工作。

所以，在HA环境中，我们就不再需要SecondaryNameNode了。

今天就到这里，下一篇准备介绍JournalNode、NameNode选举等概念，Cheers！

公众号“程序员杂书馆”，专注大数据，欢迎关注，每位关注者将获赠《Spark快速大数据分析》纸质书一本！

大数据小白系列——HDFS(2)的更多相关文章

大数据小白系列——HDFS(4)
这里是大数据小白系列,这是本系列的第四篇,来看一个真实世界Hadoop集群的规模,以及我们为什么需要Hadoop Federation. 首先,我们先要来个直观的印象,这是你以为的Hadoop集群: ...
大数据小白系列——HDFS(3)
这里是大数据小白系列,这是本系列的第三篇,介绍HDFS中NameNode选举,JournalNode等概念. 上一期我们说到了为解决NameNode(下称NN)单点失败问题,HDFS中使用了双NN的机 ...
大数据小白系列——HDFS(1)
[注1:结尾有大福利!] [注2:想写一个大数据小白系列,介绍大数据生态系统中的主要成员,理解其原理,明白其用途,万一有用呢,对不对.] 大数据是什么?抛开那些高大上但笼统的说法,其实大数据说的是两件 ...
大数据小白系列——MR(1)
一部编程发展史就是一部程序员偷懒史,MapReduce(下称MR)同样是程序员们用来偷懒的工具. 来了一份大数据,我们写了一个程序准备分析它,需要怎么做? 老式的处理方法不行,数据量太大时,所需的时间 ...
大数据小白系列 —— MapReduce流程的深入说明
上一期我们介绍了MR的基本流程与概念,本期稍微深入了解一下这个流程,尤其是比较重要但相对较少被提及的Shuffling过程. Mapping 上期我们说过,每一个mapper进程接收并处理一块数据,这 ...
大数据学习系列之四 ----- Hadoop+Hive环境搭建图文详解(单机)
引言在大数据学习系列之一 ----- Hadoop环境搭建(单机) 成功的搭建了Hadoop的环境,在大数据学习系列之二 ----- HBase环境搭建(单机)成功搭建了HBase的环境以及相关使用 ...
大数据学习系列之五 ----- Hive整合HBase图文详解
引言在上一篇大数据学习系列之四 ----- Hadoop+Hive环境搭建图文详解(单机) 和之前的大数据学习系列之二 ----- HBase环境搭建(单机) 中成功搭建了Hive和HBase的环 ...
大数据学习系列之六 ----- Hadoop+Spark环境搭建
引言在上一篇中大数据学习系列之五 ----- Hive整合HBase图文详解 : http://www.panchengming.com/2017/12/18/pancm62/ 中使用Hive整合 ...
大数据学习系列之七 ----- Hadoop+Spark+Zookeeper+HBase+Hive集群搭建图文详解
引言在之前的大数据学习系列中,搭建了Hadoop+Spark+HBase+Hive 环境以及一些测试.其实要说的话,我开始学习大数据的时候,搭建的就是集群,并不是单机模式和伪分布式.至于为什么先写单 ...

随机推荐

Guideline 5.2.1 - Legal - Intellectual Property 解决方案
最近在上架公司公司项目的时候遇到这个问题什么5.2.1 然后去了解发现最近不少人都遇到了这个问题.先说一下我上架的APP是一个医疗的APP然后说需要什么医疗资质,估计是账号的公司资质不够吧.后面和苹 ...
index_select ，clamp，detach
1.torch.clamp(input,min,max,out=None)-> Tensor 将input中的元素限制在[min,max]范围内并返回一个Tensor 2.index_selec ...
tp3.2 事务
public function exchangeTransfer($user_id, $type, $money, $config, $other_id = 0) { $r['code'] = ERR ...
WireShark Wifi认证数据包分析(论文ｉｄｅａ)
1.使用 wireShark捕获802.11数据帧结构分成三种,管理帧.控制帧.数据帧. 使用的过滤语法: 过滤MAC 地址: Waln.bssid eq=8c:23:0c:44:21:0f 过滤特定 ...
medir设置
setting中 MEDIA_URL="/media/"MEDIA_ROOT=os.path.join(BASE_DIR, "app01","medi ...
Nginx详解七：Nginx基础篇之Nginx官方模块
Nginx官方模块 --with-http_stub_status_module:Nginx的客户端状态,用于监控连接的信息,配置语法如下:配置语法:stub_status;默认状态:-配置方法:se ...
Allegro PCB Design GXL (legacy) 将指定的层导出为DXF
Allegro PCB Design GXL (legacy) version 16.6-2015 1.菜单:Display > Color/Visibility... 2.打开Color Di ...
easyUI-layout布局
https://www.cnblogs.com/kexb/p/3685913.html <!DOCTYPE html><html><head> <meta c ...
AI-CBV写法
AI-CBV写法 CBV固定样式 #url.py from django.conf.urls import url from django.contrib import admin from app0 ...
oracle 12c ORA-01017：invalid username/password; logon denied
Oracle 12C 中,想通过操作系统认证登录Oracle 数据库,有一些要注意的地方.不然就会遇到 ORA-01017:invalid username/password; logon denie ...

大数据小白系列——HDFS(2)

大数据小白系列——HDFS(2)的更多相关文章

随机推荐

热门专题