HDFS读写过程

HDFS的读写过程：

读过程：

Client收到用户的读请求——client拿着path向namenode请求文件或者block的datanode列表——client从返回的datanode列表中选择一个离自己最近的datanode，并且向他请求数据——datanode接到请求返回block的数据

读过程：

DFSInputStream对象中包含文件开始部分的数据块所在的DataNode地址，首先它会链接包含文件第一个块最近的DataNode。随后，在数据流中重复调用read函数，知道这个块全部读完位置，当最后一个块读取完毕时，DFSInputStream会关闭连接，并查找存储下一个数据块客户端最近的DataNode。客户端按照DFSInputSttream打开和DataNode连接返回的数据流的顺序读取该块，它会调用NameNode来检索下一组块所在的DataNode的位置信息。

写过程：client接到用户的写请求——client接收到数据，分割成一个个block——client请求namenode，并说明写入的数据大小和备份数——namenode返回给client需要的datanode列表——client写入第一个datanode，以packet的形式写入，一个packet一般为64k；第一个datanode写入第二个datanode，依次类推；每写入一个datanode都会返回ack信息，第一个datanode返回所有的ack信息；当datanode持久化数据后向namenode汇报已经完成——client接收到ack，检查所有datanode都写入正常，发送请求给namenode要求关闭文件——namenode关闭文件。

写过程：DFSOutputStream将文件分割成包，然后放入一个内部队列。DataStreamer会将这些小的文件包放入数据流中。

副本写过程：假设副本系数为3，当本地临时文件累积到一个数据块的大小（累积量超过一个数据块的大小），客户端会从NameNode获取一个Datanode列表用于存放副本，然后客户端开始向第一个Datanode传输数据，第一个Datanode一小部分一小部分（4kb）接收数据，将每一部分写入本地仓库，并同时传输到该部分到列表中第二个Datanode节点，第二个Datanode也是这样所以，Datanode采取流水线复制，从前一个节点接收数据，并在同时转发给下一个节点。

HDFS读写过程的更多相关文章

Hadoop学习总结之二：HDFS读写过程解析
一.文件的打开 1.1.客户端 HDFS打开一个文件,需要在客户端调用DistributedFileSystem.open(Path f, int bufferSize),其实现为: public F ...
Hadoop源码分析(1)：HDFS读写过程解析
一.文件的打开 1.1.客户端 HDFS打开一个文件,需要在客户端调用DistributedFileSystem.open(Path f, int bufferSize),其实现为: public F ...
HDFS 文件读写过程
HDFS 文件读写过程 HDFS 文件读取剖析客户端通过调用FileSystem对象的open()来读取希望打开的文件.对于HDFS来说,这个对象是分布式文件系统的一个实例. Distributed ...
Hadoop之HDFS文件读写过程
一.HDFS读过程 1.1 HDFS API 读文件 Configuration conf = new Configuration(); FileSystem fs = FileSystem.get( ...
HDFS读写数据块--${dfs.data.dir}选择策略
最近工作需要,看了HDFS读写数据块这部分.不过可能跟网上大部分帖子不一样,本文主要写了${dfs.data.dir}的选择策略,也就是block在DataNode上的放置策略.我主要是从我们工作需要 ...
Hadoop -- HDFS 读写数据
一.HDFS读写文件过程 1.读取文件过程 1) 初始化FileSystem,然后客户端(client)用FileSystem的open()函数打开文件 2) FileSyst ...
HBase 文件读写过程描述
HBase 数据读写过程描述我们熟悉的在 Hadoop 使用的文件格式有许多种,例如: Avro:用于 HDFS 数据序序列化与 Parquet:常见于 Hive 数据文件保存在 HDFS中 HFi ...
【转】HDFS读写流程
概述开始之前先看看其基本属性,HDFS(Hadoop Distributed File System)是GFS的开源实现. 特点如下: 能够运行在廉价机器上,硬件出错常态,需要具备高容错性流式数据访问 ...
HBase的简单介绍，寻址过程，读写过程
HBase是列族数据库,主要由,表,行键,列族,列标识,值,时间戳组成, 表其中HBase 主要底层存储依赖与hdfs,可以在HDFS中看到每个表名都作为一个独立的目录结构 ...

随机推荐

JFreeChart绘制折线图实例
JFreeChart是JAVA平台上的一个开放的第三方图表绘制类库.只要下载JFreeChart的类库,导入项目即可使用.下面是一个绘制折线图的实例.各处注释都已经写的比较清晰了. package c ...
知识点干货—多线程同步【6】之synchronized
"明日复明日,明日何其多. 我生待明日,万事成蹉跎. 世人若被明日累,春去秋来老将至. 朝看水东流,暮看日西坠. 百年明日能几何?请君听我明日歌. 明日复明日,明日何其多! 日日待明日,万世 ...
查询操作 -- Django从入门到精通系列教程
该系列教程系个人原创,并完整发布在个人官网刘江的博客和教程所有转载本文者,需在顶部显著位置注明原作者及www.liujiangblog.com官网地址. Python及Django学习QQ群:453 ...
Python CRM项目四
实现Django Admin的多对多的复选框效果效果:左边显示的是未选中的字段,右边显示的是已选中的字段,两边点击的标签可以互相更换首先在king_admin.py中增加filter_horizo ...
JAVA配置&注解方式搭建简单的SpringMVC前后台交互系统
前面两篇文章介绍了基于XML方式搭建SpringMVC前后台交互系统的方法,博文链接如下: http://www.cnblogs.com/hunterCecil/p/8252060.html htt ...
Power shell 重启IIS
最近根据项目需要写了一段power shell的代码 ,主要功能是批量重启IIS 具体的 Power shell 服务如下: write-output 'Restarting IIS servers ...
CSS中的选择器之类选择器和id选择器
1.css中的选择器: 1.类选择器,又叫class选择器 2.id选择器 3.html元素选择器(又叫标签选择器) 4.通配符选择器 5.伪类选择器 6.组合选择器(多元素选择器,子元素选择器,后代 ...
ABP官方文档翻译 9.2 Entity Framework Core
Entity Framework Core 介绍 DbContext 配置在Startup类中在模块PreInitialize方法中仓储默认仓储自定义仓储应用程序特定基础仓储类自定义仓储 ...
让44.1版本的sketch打开更高版本的sketch文件
我们都知道,sketch的有效license与版本挂钩.最近设计师又更新了sketch版本,导致她生成的源文件我都无法打开. 毕竟我不是使用sketch进行UI设计,仅用它来查看设计稿参数,再花99美 ...
Linux普通用户使用sudo权限启停apache服务
sudo的工作过程如下: 1,用户执行sudo时,系统会主动寻找/etc/sudoers文件,判断该用户是否有执行sudo的权限 2,确认用户具有可执行sudo的权限后,让用户输入密码确认 3,若密码 ...

HDFS读写过程

HDFS读写过程的更多相关文章

随机推荐

热门专题