大数据笔记（一）——Hadoop的起源与背景知识

一.大数据的5个特征（IBM提出）：

　　Volume（大量）

　　Velocity（高速）

　　Variety（多样）

　　Value（价值）

　　Varacity（真实性）

二.OLTP与OLAP

　1.OLTP：联机事务处理过程，也称面向交易的处理过程，是对用户操作快速响应的方式之一。OLTP是传统的关系型数据库的主要应用，主要是基本的、日常的事务处理，例如银行交易：

　　　　开启事务——>从转出账号中扣钱——>往转入账号中加钱——>提交事务

　2.OLAP：联机分析处理过程，是数据仓库系统的主要应用，支持复杂的分析操作，侧重决策支持，并且提供直观易懂的查询结果。例如商品推荐：

　　　　抽取（读取）历史订单——>分析历史订单，找到最受欢迎的商品——>展示结果

　3.OLTP和OLAP的区别：

	OLTP	OLAP
用户	操作人员	决策人员，高级管理人员
功能	日常操作处理	分析决策
DB设计	面向应用	面向主题
数据	当前的，最新的细节的，二维的分立的	历史的，聚集的，多位的，集成的，统一的
存取	读/写数十条记录	读上百万条记录
工作单位	简单的事务	复杂的事务
DB大小	100MB-GB	100GB-TB

三.数据仓库

　　为企业所有级别的决策制定过程，提供所有类型数据支持的战略集合。

四.Google的基本思想

　　Hadoop的思想来源：Google

1.Google的低成本之道

不使用超级计算机，不使用存储（淘宝的去i，去e，去o之路）
大量使用普通的pc服务器，提供有冗余的集群服务
全世界多个数据中心
运营商向Google倒付费

2.Google的三篇论文（Hadoop的思想来源）

GFS（Google File System:Google的文件系统）

倒排索引

　　把文件ID对应到关键词的映射转换为关键词到文件ID的映射，每个关键词都对应着一系列的文件，这些文件中都出现这个关键词。

Page Rank(排名先后)
BigTable(大表)：Google设计的分布式数据存储系统，用来处理海量数据的一种非关系型数据库。

　　常见的NoSQL数据库（Key-value值）：

HBase:基于HDFS，面向列的:region
Redis:基于内存、支持持久化：rdb和aof
MongoDB:面向文档，Json型

大数据笔记（一）——Hadoop的起源与背景知识的更多相关文章

大数据时代之hadoop(五)：hadoop 分布式计算框架（MapReduce）
大数据时代之hadoop(一):hadoop安装大数据时代之hadoop(二):hadoop脚本解析大数据时代之hadoop(三):hadoop数据流(生命周期) 大数据时代之hadoop(四): ...
大数据测试之初识Hadoop
大数据测试之初识Hadoop POPTEST老李认为测试开发工程师是面向测试的开发,也就是说,写代码就是为完成测试任务服务的,写自动化测试(性能自动化,功能自动化,安全自动化,接口自动化等等)的cas ...
一篇了解大数据架构及Hadoop生态圈
一篇了解大数据架构及Hadoop生态圈阅读建议,有一定基础的阅读顺序为1,2,3,4节,没有基础的阅读顺序为2,3,4,1节. 第一节集群规划大数据集群规划(以CDH集群为例),参考链接: ht ...
大数据笔记01：大数据之Hadoop简介
1. 背景随着大数据时代来临,人们发现数据越来越多.但是如何对大数据进行存储与分析呢? 单机PC存储和分析数据存在很多瓶颈,包括存储容量.读写速率.计算效率等等,这些单机PC无法满足要求. 2. ...
从Hadoop Summit 2016看大数据行业与Hadoop的发展
前言: 好吧我承认已经有四年多没有更新博客了.... 在这四年中发生了很多事情,换了工作,换了工作的方向.在工作的第一年的时候接触机器学习,从那之后的一年非常狂热的学习机器学习的相关技术,也写了一些自 ...
ASP.NET + SqlSever 大数据解决方案 PK HADOOP
半个月前看到博客园有人说.NET不行那篇文章,我只想说你们有时间去抱怨不如多写些实在的东西. 1.SQLSERVER优点和缺点? 优点:支持索引.事务.安全性以及容错性高缺点:数据量达到100万以 ...
大数据 --> Spark与Hadoop对比
Spark与Hadoop对比什么是Spark Spark是UC Berkeley AMP lab所开源的类Hadoop MapReduce的通用的并行计算框架,Spark基于map reduce算法 ...
白话大数据 | Spark和Hadoop到底谁更厉害？
要想搞清楚spark跟Hadoop到底谁更厉害,首先得明白spark到底是什么鬼. 经过之前的介绍大家应该非常了解什么是Hadoop了(不了解的点击这里:白话大数据 | hadoop究竟是什么鬼),简 ...
大数据计算框架Hadoop, Spark和MPI
转自:https://www.cnblogs.com/reed/p/7730338.html 今天做题,其中一道是请简要描述一下Hadoop, Spark, MPI三种计算框架的特点以及分别适用于什 ...

随机推荐

P1182 数列分段`Section II` 二分
https://www.luogu.org/problemnew/show/P1182 做了这个题才知道二分的强大这个题可以假设我们有n个果子 m个容器要能把果子全装进去那么容器最小可以是多小 ...
【Linux 架构】Linux内核架构
(1)System Call Interface(SCI)------系统调用接口(2)Process Management(PM)-------进程管理模块(3)Memory Management( ...
Docker网络大揭秘(单机)
docker网络官网 https://docs.docker.com/network/ Docker容器和服务如此强大的原因之一是您可以将它们连接在一起,或将它们连接到非Docker工作负载.Dock ...
Spring框架学习总结
一.Spring概述 1.什么是Spring? Spring是一个优秀轻量级的框架,是Java中使用最多的框架,Spring框架具有轻量.控制反转.面向切面.容器.框架.MVC的特点. 2.Sprin ...
Django使用Celery进行异步任务
Celery Celery是一个功能完备即插即用的异步任务队列系统.它适用于异步处理问题,当发送邮件.或者文件上传, 图像处理等等一些比较耗时的操作,我们可将其异步执行,这样用户不需要等待很久,提高用 ...
Springboot+CAS单点登录
一:安装CAS 下载cas:https://github.com/apereo/cas 1.1 将cas并打成war包.放入一个干净的tomcat中,启动tomcat测试: http://localh ...
js实现完整轮播
1.封装一个简单的动画函数 function animate(obj,target,callback){ clearInterval(obj.timer);//清除定时器防止定时器重复添加 obj.t ...
LazyMan的深入解析和实现
一.题目介绍以下是我copy自网上的面试题原文: 实现一个LazyMan,可以按照以下方式调用: LazyMan("Hank")输出: Hi! This is Hank! L ...
flask-migrate的使用
先安装flask-migrate:pip install flask-migrate 然后见代码: 输入命令生成migrates文件夹然后可以看到项目下生成文件夹: 然后输入命令: 看到: 总之,模 ...
前端之CSS：CSS补充
css样式之补充... css常用的一些属性: 1.去掉下划线 :text-decoration:none ;2.加上下划线: text-decoration: underline; 3.调整文本和图 ...

大数据笔记（一）——Hadoop的起源与背景知识

大数据笔记（一）——Hadoop的起源与背景知识的更多相关文章

随机推荐

热门专题