一:大数据应用

1.Cloudera

  cloudera公司是Hadoop三大发行商之一,其版本为CDH版本,现在最新的版本是CDH5。

  网站:http://archive.cloudera.com/cdh5/

  

  现在官网上的最新的版本:

  

2.大数据的三大基础

  Java

  SQL

  Linux

3.大数据的特性

  大量的数据:PB级别

  多样的数据类型

  快速的数据流转

  价值

  

二:学习的框架

1.官网:

  hadoop.apache.org

  目前学习的系列是Hadoop2.x,在2006年发布,几个重要的版本,2.2.0 ,2.5.0, 2.7.0

  现在已经有了新的版本Hadoop3.0

  

2.特性

  Hadoop是一个可靠性,可扩展,的分布式计算框架(The Apache™ Hadoop® project develops open-source software for reliable, scalable, distributed computing.)。

  

  A) 可靠性

    存储方面:

      HDFS存储策略,副本数为3个

      以块进行,检验块损坏,生成校验码,并将两次的校验码进行比较来判断。

    计算方面:

      如果计算中出现问题,会使用副本数继续计算。

  B) 可扩展性

    可以在原有的基础上任意添加多台机器。

  C) 低成本(另外补充)

    磁盘的成本低一些。

3.四个核心模块

  

  Hadoop Common:支持模块的工具类

  HDFS:分布式文件系统

  Hadoop YARN:任务调度和集群资源(内存,CPU)管理框架

  Hadoop MapReduce:一个基于YARN的并行处理大数据集的框架

4.Hadoop之父

  doug cutting

5.Hadoop的起源

  apache Lucene:全文检索工具包

  Apache Nutch:web搜索引擎

  Google三大论文:MapReduce,GFS,BigTable

二:HDFS分布式文件系统

1.文件系统

  建立在无数的硬件上。

  设计理念:一次写入,多次读取

  主从架构

    namenode

    datanode

  存储的是文件,文件属性

    名称,位置,副本数,拥有者,权限,存储的块

  存储形式:块(block,默认是128M)

    假设一个文件是250M,则需要两个块存储,第一个块128M,第二个块122M(一个文件小于一个数据块的大小,不需要占用整个数据块的空间的).

    多个文件不能放到一个块中的。

  文件的与元数据

    文件的属性。

    给到namenode进行存储。

  真正存储的是datanode。

2.框架

  

3.HDFS读写流程(都有一个就近原则)(大概)

  读取

    客户端先去namenode,知道文件的存储位置。

    再去找datanode。

    当读取到好几个文件的时候,这个时候设计到就近原则,同一个机架上读取文件肯定比读取其他机架上的数据快。

    读取块。

  写入文件

    首先客户端找namenode,知道文件将要被分到哪个位置

    然后再找到对应的datanode

    然后去datanode写入。

    写副本时,应该需要写一个到别的机架。

4.HDFS服务功能

  Namenode:是主节点,存储文件的元数据

  Datanode:在本地文件系统存储文件数据,以及数据块的校验和。

  Secondary Namenode:监控HDFS状态的辅助后台程序,每隔一段时间获取HDFS元数据的快照。

三:Hadoop YARN框架

1.框架

  

2.资源管理和调度框架

  主从架构

    Resourcemanager:管理整个集群的资源

    NodeManager:资源所在

  每个应用都有一个应用管理者:ApplicationMaster

  container

    使得应用不会被干扰,是资源的抽象,分装了每个任务需要的资源。

  

3.yarn的运行机制

  当一个应用在yarn上运行,Resourcemanager首先会找一个nodemanager,给这个应用分配一个应用管理者(ApplicationMaster),使得应用管理者可以在nodemanager上运行。

  然后管理者会计算出需要的资源,然后管理者根据计算出的资源向Resourcemanager申请资源

  然后Resourcemanager给应用一个container,让应用在container中运行,

  然后应用管理者进行监控和容错。

4.YARN服务功能

  

四:MapReduce框架

1.两个阶段

  Map:并行输入数据

  Reduce:对结果进行汇总

2.特点

  适合离线批量计算

  数据量大

  启动开销大,每个mapreduce任务都会开一个Java虚拟机。

  

3.

  

004 Hadoop2.x基础知识的更多相关文章

  1. .NET面试题系列[1] - .NET框架基础知识(1)

    很明显,CLS是CTS的一个子集,而且是最小的子集. - 张子阳 .NET框架基础知识(1) 参考资料: http://www.tracefact.net/CLR-and-Framework/DotN ...

  2. RabbitMQ基础知识

    RabbitMQ基础知识 一.背景 RabbitMQ是一个由erlang开发的AMQP(Advanced Message Queue )的开源实现.AMQP 的出现其实也是应了广大人民群众的需求,虽然 ...

  3. Java基础知识(壹)

    写在前面的话 这篇博客,是很早之前自己的学习Java基础知识的,所记录的内容,仅仅是当时学习的一个总结随笔.现在分享出来,希望能帮助大家,如有不足的,希望大家支出. 后续会继续分享基础知识手记.希望能 ...

  4. selenium自动化基础知识

    什么是自动化测试? 自动化测试分为:功能自动化和性能自动化 功能自动化即使用计算机通过编码的方式来替代手工测试,完成一些重复性比较高的测试,解放测试人员的测试压力.同时,如果系统有不份模块更改后,只要 ...

  5. [SQL] SQL 基础知识梳理(一)- 数据库与 SQL

    SQL 基础知识梳理(一)- 数据库与 SQL [博主]反骨仔 [原文地址]http://www.cnblogs.com/liqingwen/p/5902856.html 目录 What's 数据库 ...

  6. [SQL] SQL 基础知识梳理(二) - 查询基础

    SQL 基础知识梳理(二) - 查询基础 [博主]反骨仔 [原文]http://www.cnblogs.com/liqingwen/p/5904824.html 序 这是<SQL 基础知识梳理( ...

  7. [SQL] SQL 基础知识梳理(三) - 聚合和排序

    SQL 基础知识梳理(三) - 聚合和排序 [博主]反骨仔 [原文]http://www.cnblogs.com/liqingwen/p/5926689.html 序 这是<SQL 基础知识梳理 ...

  8. [SQL] SQL 基础知识梳理(四) - 数据更新

    SQL 基础知识梳理(四) - 数据更新 [博主]反骨仔 [原文]http://www.cnblogs.com/liqingwen/p/5929786.html 序 这是<SQL 基础知识梳理( ...

  9. [SQL] SQL 基础知识梳理(五) - 复杂查询

    SQL 基础知识梳理(五) - 复杂查询 [博主]反骨仔 [原文]http://www.cnblogs.com/liqingwen/p/5939796.html 序 这是<SQL 基础知识梳理( ...

随机推荐

  1. 2015/11/7用Python写游戏,pygame入门(7):碰撞检测

    我们已经完成了飞机大战的大部分东西,但是游戏还是没有办法正式开玩,因为子弹并不能打掉飞机.只有完成了这一个工作,游戏才算基本成型. 今天的内容就非常简单了,就是做到这个碰撞检测,以及控制好子弹和飞机的 ...

  2. Java获取精确到秒的时间戳

    1.时间戳简介: 时间戳的定义:通常是一个字符序列,唯一地标识某一刻的时间.数字时间戳技术是数字签名技术一种变种的应用.是指格林威治时间1970年01月01日00时00分00秒(北京时间1970年01 ...

  3. bzoj 1044 [HAOI2008]木棍分割(二分+贪心,DP+优化)

    [题目链接] http://www.lydsy.com/JudgeOnline/problem.php?id=1044 [题意] n根木棍拼到一起,最多可以切m刀,问切成后最大段的最小值及其方案数. ...

  4. python 面试题3

    注:本面试题来源于网络. 1.python下多线程的限制以及多进程中传递参数的方式 python多线程有个全局解释器锁(global interpreter lock),这个锁的意思是任一时间只能有一 ...

  5. Task多线程进行多进程

    using System; using System.Collections.Generic; using System.Diagnostics; using System.IO; using Sys ...

  6. 十一、springboot之web开发之Filter

    我们常常在项目中会使用filters用于录调用日志.排除有XSS威胁的字符.执行权限验证等等.Spring Boot自动添加了OrderedCharacterEncodingFilter和Hidden ...

  7. 【h5标签转小程序标签】小程序使用wxParse解析html教程

    一.先下载所需文件,下载地址:https://pan.baidu.com/s/1umZO9uI24zUTRd7VqaWbAg  ,下载完毕后会得到一个wxParse文件夹,后面会用到: 二.先拷贝cs ...

  8. 【本地服务器】用nodejs搭建最简单、轻量化的http server

    1. 引言 前端程序猿主要关注的是页面,你可能根本就用不到.net,java,php等后台语言. 但是你制作出来的网页总要运行.总要测试吧?——那就免不了用到http server.我先前都是用vis ...

  9. mac idea内存溢出

    VM options: -mx2048m -XX:MaxPermSize=2048m -Drebel.spring_plugin=true -Drebel.hibernate_plugin=true

  10. CxGrid 表格列内容居中

    首先每一列 Cxgrid 都不知道要当成什么来出来,所以每一列都有个properties 让你来设置,告诉cxgrid 这列的内容是什么,然后根据你给出的内容 再来决定用什么居中方式: 就是说 官方再 ...