前言：《读者来信》是HBase老店开设的一个问答专栏，旨在能为更多的小伙伴解决工作中常遇到的HBase相关的问题。老店会尽力帮大家解决这些问题或帮你发出求救贴，老店希望这会是一个互帮互助的小平台。有问题请直接在老店后台留言，有好的解决方案也请不要吝啬，诚挚欢迎大家能在留言区积极探讨解决方案，大胆发表自己的看法，也许你今天帮别人解决的问题，就是你明天可能遇到的答案。

来信人：刘*刚

小猿提问

在重启HBase集群的过程中，RS节点全部启动成功了，但是HMaser一直启动不起来，错误日志如下：

unexpected error, closing socket connection and attempting reconnect

java.io.IOException: Packet len4745468 is out of range!

	at org.apache.zookeeper.ClientCnxnSocket.readLength(ClientCnxnSocket.java:112)

	at org.apache.zookeeper.ClientCnxnSocketNIO.doIO(ClientCnxnSocketNIO.java:79)

	at org.apache.zookeeper.ClientCnxnSocketNIO.doTransport(ClientCnxnSocketNIO.java:366)

	at org.apache.zookeeper.ClientCnxn$SendThread.run(ClientCnxn.java:1081)

2020-04-02 22:31:08,673 ERROR [hadoop01:16000.activeMasterManager] zookeeper.RecoverableZooKeeper: ZooKeeper getChildren failed after 4 attempts

2020-04-02 22:31:08,674 FATAL [hadoop01:16000.activeMasterManager] master.HMaster: Failed to become active master

org.apache.zookeeper.KeeperException$ConnectionLossException: KeeperErrorCode = ConnectionLoss for /hbase/region-in-transition

	at org.apache.zookeeper.KeeperException.create(KeeperException.java:99)

	at org.apache.zookeeper.KeeperException.create(KeeperException.java:51)

	at org.apache.zookeeper.ZooKeeper.getChildren(ZooKeeper.java:1472)

	at org.apache.hadoop.hbase.zookeeper.RecoverableZooKeeper.getChildren(RecoverableZooKeeper.java:295)

	at org.apache.hadoop.hbase.zookeeper.ZKUtil.listChildrenNoWatch(ZKUtil.java:513)

	at org.apache.hadoop.hbase.master.AssignmentManager.processDeadServersAndRegionsInTransition(AssignmentManager.java:519)

	at org.apache.hadoop.hbase.master.AssignmentManager.joinCluster(AssignmentManager.java:494)

	at org.apache.hadoop.hbase.master.HMaster.finishActiveMasterInitialization(HMaster.java:748)

	at org.apache.hadoop.hbase.master.HMaster.access$500(HMaster.java:184)

	at org.apache.hadoop.hbase.master.HMaster$1.run(HMaster.java:1729)

	at java.lang.Thread.run(Thread.java:748)

小猿分析

HBase 版本：Apache 1.2.1
集群规模：120000+ region

看错误日志，好像只看到了ZK的身影，日志关键词是[ZooKeeper.getChildren|Packet|out of range|ConnectionLoss for /hbase/region-in-transition]。

我们知道，HBase Master 重启时要做很多初始化工作，要与ZK数据节点进行一些交互工作，如元数据或节点状态的注册、修改、获取等等。看这些关键词大概好像明白是怎么回事：ZooKeeper在getChildren（region-in-transition）的时候超出了Packet的range，导致连接丢失了，Failed to become active master。

那什么是Packet呢？小猿问了问度娘，度娘回答说：

在 ZooKeeper 中，Packet 是一个最小的通信协议单元，即数据包。Pakcet 用于进行客户端与服务端之间的网络传输，任何需要传输的对象都需要包装成一个 Packet 对象。

那就是读取zk节点数据包长度有限制咯，这个时候我们肯定是先去网上找下zk有没有相关的参数可以调一下。结果还真的有：jute.maxbuffer，感觉自己很幸运。套用官网的话解释一下这个参数：

(Java system property: jute.maxbuffer)

This option can only be set as a Java system property. There is no zookeeper prefix on it. It specifies the maximum size of the data that can be stored in a znode. The default is 0xfffff, or just under 1M. If this option is changed, the system property must be set on all servers and clients otherwise problems will arise. This is really a sanity check. ZooKeeper is designed to store data on the order of kilobytes in size.

翻译一下：

（Java系统属性：jute.maxbuffer）

此选项只能设置为Java系统属性。上面没有Zookeeper前缀。它指定可以存储在znode中的数据的最大大小。默认值为0xfffff，或不到1M。如果更改此选项，则必须在所有服务器和客户端上设置系统属性，否则会出现问题。这确实是一个健全性检查。ZooKeeper旨在存储大小为千字节的数据。

也有另一种说法：

需要注意的是，该参数并不是在 Server 和 Client 端同时设置才会生效。实际情况是，在客户端设置后，Zookeeper 将控制从 Server 端读取数据的大小（outgoingBuffer）；而在服务端设置后，则是控制从 Client 端写入数据的大小（incomingBuffer）

小猿解答

当然也不只/region-in-transition节点会有这样的问题，/unssigned 等节点也可能会有一样的问题。解决方案总结如下：

方案一：清理zk节点历史上存在的垃圾数据

该方案旨在将zk节点的数据大小降下来，是否可以降到红线以下。

方案二：调大参数jute.maxbuffer

# 设置 Client 端

$ vim $ZOOKEEPER_HOME/bin/zkCli.sh

  # 增加 -Djute.maxbuffer=<buffer_size> 参数

  "$JAVA" "-Dzookeeper.log.dir=${ZOO_LOG_DIR}" "-Dzookeeper.root.logger=${ZOO_LOG4J_PROP}"  "-Djute.maxbuffer=1073741824"  \

       -cp "$CLASSPATH" $CLIENT_JVMFLAGS $JVMFLAGS \

       org.apache.zookeeper.ZooKeeperMain "$@"

# 设置 Server 端

$ vim $ZOOKEEPER_HOME/conf/zoo.cfg

  # 增加 jute.maxbuffer=<buffer_size> 参数

  jute.maxbuffer=1073741824

调大该参数可能有风险，上面也提到zk旨在存储大小为千字节的数据。

方案三：使用层次结构（来自社区评论区）

该方案是通过区域ID的前缀将·/hbase/region-in-transition 目录分片。例如，区域1234567890abcdef将位于/hbase/region-in-transition/1234/1234567890abcdef中。因此，我们必须进行遍历才能获得完整列表。

参考文献

转载请注明出处！欢迎关注本人微信公众号【HBase工作笔记】

读者来信 | 如果你家HBase集群Region太多请点进来看看，这个问题你可能会遇到的更多相关文章

读者来信-5 | 如果你家HBase集群Region太多请点进来看看，这个问题你可能会遇到
前言:<读者来信>是HBase老店开设的一个问答专栏,旨在能为更多的小伙伴解决工作中常遇到的HBase相关的问题.老店会尽力帮大家解决这些问题或帮你发出求救贴,老店希望这会是一个互帮互助的 ...
读者来信 | 刚搭完HBase集群，Phoenix一启动，HBase就全崩了，是什么原因?（已解决）
前言:之前有朋友加好友与我探讨一些问题,我觉得这些问题倒挺有价值的:于是就想在本公众号开设一个问答专栏,方便技术交流与分享,专栏名就定为:<读者来信>.如遇到本人能力有限难以解决的问题,我 ...
hbase集群region数量和大小的影响
1.Region数量的影响通常较少的region数量可使群集运行的更加平稳,官方指出每个RegionServer大约100个regions的时候效果最好,理由如下: 1)Hbase的一个特性MSLA ...
hbase集群安装与部署
1.相关环境 centos7 hadoop2.6.5 zookeeper3.4.9 jdk1.8 hbase1.2.4 本篇文章仅涉及hbase集群的搭建,关于hadoop与zookeeper的相关部 ...
Hbase集群搭建及所有配置调优参数整理及API代码运行
最近为了方便开发,在自己的虚拟机上搭建了三节点的Hadoop集群与Hbase集群,hadoop集群的搭建与zookeeper集群这里就不再详细说明,原来的笔记中记录过.这里将hbase配置参数进行相应 ...
dfs.datanode.max.xcievers参数导致hbase集群报错
2013/08/09 转发自http://bkeep.blog.163.com/blog/static/123414290201272644422987/ [案例]dfs.datanode.max.x ...
hbase集群常用维护命令
一. zk集群 1. 查看当前服务的角色 leader/follower echo stat|nc 127.0.0.1 2181 2. 启动ZK服务: sh bin/zkServer.sh star ...
HBase集群安装
1.HBase的机群搭建过程(在原来的hadoop0上的HBase伪分布基础上进行搭建)1.1 集群结构,主节点(hmaster)是hadoop0,从节点(region server)是hadoop1 ...
Hbase集群监控
Hbase集群监控 Hbase Jmx监控监控每个regionServer的总请求数,readRequestsCount,writeRequestCount,region分裂,region合并,St ...

随机推荐

Ansible-基本概述
为什么要自动化运维纯手动软件安装部署方式我们以 10 台机器部署 Nginx 为例.部署步骤如下: 1.通过 ssh 登录一台机器: 2.yum install -y nginx 或者获取安装包 ...
JavaScript，ajax与springboot之间的传参方式
Springboot:@PostMapping("/mDelTest")public String mDelTest (@RequestBody List<String> ...
2，Java中的数据结构
1,字符串(String) ···String为特殊的引用类型,不可变. ···常用实例方法: 获取子串:substring(start, end); 获取索引:indexOf(cha ...
Python - loguru日志库，高效输出控制台日志和日志记录
一.安装loguru loguru的PyPI地址为:https://pypi.org/project/loguru/ GitHub仓库地址为:https://github.com/Delgan/log ...
JAVA生成EXCEL模板
JAVA生成excel模板,支持1.必填字段前加红色 * 2.定义可选值下拉列表 valList3.定义名称并通过名称设置可选值 refName(名称在sheet2,sheet2自动隐藏)4.支持设 ...
flask 模型之间的关系操作注意点
在创建模型时使用 # 关联表与表添加以下参数 lazy='dynamic' 在两个表之间使用关联字段可以再次进行操作,筛选,分页具体操作请看 https://www.bilibili.com/ ...
spark打包详解
spark打包还是比较复杂的,特别的其中有关R语言的模块.在本章,我就将其中遇到的所有问题为大家一一讲解,为大家提供一点经验. 这里的打包命令是直接从官网中找的,这里我们最后得到的是tgz格式的包.打 ...
深度学习与人类语言处理-语音识别(part2)
上节回顾深度学习与人类语言处理-语音识别(part1),这节课我们将学习如何将seq2seq模型用在语音识别 LAS 那我们来看看LAS的Encoder,Attend,Decoder分别是什么 Lis ...
Struts UI标签的使用
先来看一下日期控件 html5标签中其实已经有日期的类型,用<input type="date">便可调用. struts里面也自带了日期控件,其使用步骤为: 1. 导 ...
Spyder——科学的Python开发环境
刚开始接触Python的时候,网上找到的资料基本上上来就是介绍Python语言,很少有对开发环境进行讲解的,但如果在学习的过程中不断练习,这样效率会更高,所以特意将一个Python的开发环境Spyde ...

读者来信 | 如果你家HBase集群Region太多请点进来看看，这个问题你可能会遇到