hbase数据模型以及编码压缩（转）

原文链接：hbase源码系列（四）数据模型-表定义和列族定义的具体含义

hbase是一个KeyValue型的数据库，在《hbase实战》描述它的逻辑模型【行键，列族，列限定符，时间版本】，物理模型是基于列族的。但实际情况是啥？还是上点代码吧。

　　　　 HTableDescriptor tableDesc = new HTableDescriptor("test");

        //日志flush的时候是同步写，还是异步写

        tableDesc.setDurability(Durability.SYNC_WAL);

        //MemStore大小

        tableDesc.setMemStoreFlushSize(256*1024*1024);

        HColumnDescriptor colDesc = new HColumnDescriptor("f");

        //块缓存，保存着每个HFile数据块的startKey

        colDesc.setBlockCacheEnabled(true);

        //块的大小，默认值是65536

        //加载到内存当中的数据块越小，随机查找性能更好,越大，连续读性能更好

        colDesc.setBlocksize(64*1024);

        //bloom过滤器，有ROW和ROWCOL，ROWCOL除了过滤ROW还要过滤列族

        colDesc.setBloomFilterType(BloomType.ROW);

        //写的时候缓存bloom

        colDesc.setCacheBloomsOnWrite(true);

        //写的时候缓存索引

        colDesc.setCacheIndexesOnWrite(true);
　　　　　//存储的时候使用压缩算法
  　　　 colDesc.setCompressionType(Algorithm.SNAPPY);

        //进行compaction的时候使用压缩算法

        colDesc.setCompactionCompressionType(Algorithm.SNAPPY);

        //压缩内存和存储的数据，区别于Snappy

        colDesc.setDataBlockEncoding(DataBlockEncoding.PREFIX);

        //写入硬盘的时候是否进行编码

        colDesc.setEncodeOnDisk(true);

        //关闭的时候，是否剔除缓存的块

        colDesc.setEvictBlocksOnClose(true);

        //是否保存那些已经删除掉的kv

        colDesc.setKeepDeletedCells(false);

        //让数据块缓存在LRU缓存里面有更高的优先级

        colDesc.setInMemory(true);

        //最大最小版本

        colDesc.setMaxVersions(3);

        colDesc.setMinVersions(1);

        //集群间复制的时候，如果被设置成REPLICATION_SCOPE_LOCAL就不能被复制了

        colDesc.setScope(HConstants.REPLICATION_SCOPE_GLOBAL);

        //生存时间

        colDesc.setTimeToLive(18000);

        tableDesc.addFamily(colDesc);

　　在上面列出来表定义和列族定义的所有参数，含义也标上去了，我们经常需要设置的可能就是下面的这些。

　　　　 //bloom过滤器，过滤加速
        colDesc.setBloomFilterType(BloomType.ROW);

        //压缩内存和存储中的数据，内存紧张的时候设置

        colDesc.setDataBlockEncoding(DataBlockEncoding.PREFIX);
　　　　 //让数据块缓存在LRU缓存里面有更高的优先级

        colDesc.setInMemory(true);

        //最大版本，没必要的话，就设置成1个

        colDesc.setMaxVersions(1);

        //集群间复制的时候，如果被设置成REPLICATION_SCOPE_LOCAL就不能被复制了

        colDesc.setScope(HConstants.REPLICATION_SCOPE_GLOBAL);
　　　　　//存储的时候使用压缩算法，这个基本是必备的，hbase的存储大得惊人
  　　　 colDesc.setCompressionType(Algorithm.SNAPPY);
        //进行compaction的时候使用压缩算法
        colDesc.setCompactionCompressionType(Algorithm.SNAPPY);

　　hbase的表在hdfs上面的是这么存储的，/hbase-root/tableName/regionName/familyName /HFile, 在tableName这一级目录会有一个名.tabledesc的文件，在region这一级目录有一个名为.regioninfo的文件，都是明文的。

　　了解完表和列族的定义之后，我们看看KeyValue是怎么存储的吧，引用一下代码，可能大家一看就都懂了。

　　@Override

    public void write(Cell cell) throws IOException {

      checkFlushed();

      // Row rowkey，起始位置，长度

      write(cell.getRowArray(), cell.getRowOffset(), cell.getRowLength());

      // Column family 列族，起始位置，长度

      write(cell.getFamilyArray(), cell.getFamilyOffset(), cell.getFamilyLength());

      // Qualifier 列名，起始位置，长度

      write(cell.getQualifierArray(), cell.getQualifierOffset(), cell.getQualifierLength());

      // Version 时间戳

      this.out.write(Bytes.toBytes(cell.getTimestamp()));

      // Type Put或者Delete

      this.out.write(cell.getTypeByte());

      // Value 值，起始位置，长度

      write(cell.getValueArray(), cell.getValueOffset(), cell.getValueLength());

    }

　　好吧，列存储的话存储的时候每个列都会重复前面的rowkey、列族这些信息，在列很多的情况下，rowkey和列族越长，消耗的内存和列族都会很大，所以它们都要尽量的短。

　　可以考虑用colDesc.setDataBlockEncoding(DataBlockEncoding.PREFIX_TREE)来压缩一下内存中的大小，这个后面后面会讲到。

hbase数据模型以及编码压缩（转）的更多相关文章

HBase 数据模型（Data Model）
HBase Data Model--HBase 数据模型(翻译) 在HBase中,数据是存储在有行有列的表格中.这是与关系型数据库重复的术语,并不是有用的类比.相反,HBase可以被认为是一个多维度的 ...
HBase 数据模型
在HBase中,数据是存储在有行有列的表格中.这是与关系型数据库重复的术语,并不是有用的类比.相反,HBase可以被认为是一个多维度的映射. HBase数据模型术语 Table(表格) 一个HBase ...
HBase数据压缩算法编码探索
摘要: 本文主要介绍了hbase对数据压缩,编码的支持,以及云hbase在社区基础上对数据压缩率和访问速度上了进行的改进. 前言你可曾遇到这种需求,只有几百qps的冷数据缓存,却因为存储水位要浪费几 ...
Hbase总结（一）-hbase命令,hbase安装,与Hive的区别,与传统数据库的区别,Hbase数据模型
Hbase总结(一)-hbase命令下面我们看看HBase Shell的一些基本操作命令,我列出了几个常用的HBase Shell命令,如下: 名称命令表达式创建表 create '表名称', ...
HBase数据模型
上次我们讲过了<HBase简介>,点击阅读有助于更好地理解本文.本文讲述的是HBase数据模型. 1.ROW KEY 决定一行数据按照字典顺序排序的.Row key只能存储64k的字节数据 ...
HBase数据模型(2)
HBase数据模型(1) HBase数据模型(2) 1.0 HBase的版本version,是一个用长整型表示的.由Rowkey.Column(列族和列).Version组合在一起称为HBase中的一 ...
HBase数据模型(1)
HBase数据模型(1) HBase数据模型(2) 1.0 HBase的特性 Table HBase以表(Table)的方式组织数据,数据存储在表中. Row/Column 行(Row)和列(Colu ...
3.Hbase数据模型
3.1.Hbase数据模型: 概念视图: 物理视图 Hbase数据在存储系统中是以列族来体现的[Column Family],任何时候可以随意的添加一列到已经存在的列族中空的单元格在表中不做存储也不 ...
从零自学Hadoop(20)：HBase数据模型相关操作上
阅读目录序介绍命名空间表系列索引本文版权归mephisto和博客园共有,欢迎转载,但须保留此段声明,并给出原文链接,谢谢合作. 文章是哥(mephisto)写的,SourceLink 序 ...

随机推荐

poj1970 The Game(DFS)
题目链接 http://poj.org/problem?id=1970 思路题目的意思是判断五子棋棋局是否有胜者,有的话输出胜者的棋子类型,并且输出五个棋子中最左上的棋子坐标:没有胜者输出0. 这道 ...
CentOS源码安装搭建LNMP全过程(包括nginx，mysql，php，svn)
服务器环境为:CentOS6.5 64位目标:搭建LNMP(Linux + Nginx + MySQL + PHP +SVN),其中svn是用来代替ftp,方便开发中调试同步代码相关目录:所有软件 ...
thinkphp每次跳转时都会显示笑脸的修改
Success和error方法都有对应的模板,并且是可以设置的,默认的设置是两个方法对应的模板都是://默认错误跳转对应的模板文件'TMPL_ACTION_ERROR' => THINK_PAT ...
SQL_异化
select a.pk_accasoa from bd_accasoa a; --下级科目原来主键: 0001Z0100000000001A2 --执行该语句后下级科目异化了(替换的意思) , '@@ ...
liniux Crontab 的重启和设置
重启crontab,service cron restart 05 01 * * * /usr/local/php/bin/php FILE 10,30,50 * * * * /usr/local/p ...
[leetcode greedy]134. Gas Station
There are N gas stations along a circular route, where the amount of gas at station i is gas[i]. You ...
IO编程
1.文件读写 >>>f = open('/Users/michael/test.txt', 'r') >>> f.read() 'Hello, world!' &g ...
[LOJ2541][PKUWC2018]猎人杀(容斥+分治+FFT)
https://blog.csdn.net/Maxwei_wzj/article/details/80714129 n个二项式相乘可以用分治+FFT的方法,使用空间回收可以只开log个数组. #inc ...
PAT(Basic Level)--个位数统计
输入一个不超过1000位的整数,计算每个数字出现的次数. 一道十分简单的题目,最开始以为Java的String没有计算长度的方法,还想了半天,而且还用HashMap做了一次,代码特别长,看了别人的代码 ...
bzoj 4033
树形DP,dp[i][j]表示i子树中,选了j个白点,i子树中所有边的贡献. /************************************************************ ...

hbase数据模型以及编码压缩（转）

原文链接：hbase源码系列（四）数据模型-表定义和列族定义的具体含义

hbase数据模型以及编码压缩（转）的更多相关文章

随机推荐

热门专题