Elasticsearch实战-磁盘IO被打满

背景

事情是这样的。一天下午4点42分左右。业务反馈我开发的服务在测试环境出现问题，返回资源数据是0。查日志发现是ES访问超时。相当于数据库挂了。持续了20多分钟自己恢复。
咨询了ES团队，最终得到下面的答复：

当前集群现状:
1）当前集群数据IO最高的索引为XXX，数据量很小(100mb)
2)但是读写都很大(读>1000QPS,写>1000QPS) ，使用的是线下环境的机器
3)索引分了10个片，4个副本问题
分析:
1)线下环境的机器之前了解到测试环境硬盘性能本来就很差,这个需要业务SRE一块来确定
2)查询的时候，会一次性查询10个片，这样可能会查10台机器的数据，很容易出现木桶效应，造成集群的性能下降
3)写入的时候，虽然是做了10个分片，看起来能加大写能力，但是机器数少，导致结果是每台机器分布了5个分片，等效于只做了2个分片，完全没有扩大写的能力
建议:
1)升级硬件，换成SSD
2)分片改成2个，这样读能力比以前肯定有提升，写能力等价
3)数据量很小，建议直接换成Redis

我自己做了调查。测试环境ES有十台VM（非本地ESB磁盘）作为服务器。其中一台IO被打满。其他机器负载、IO都很低。对于这个问题，ES团队给出的答复是：

ES的服务负载均衡、发现机制是自己写的，一般不会出现问题，
Client仅仅对官方的客户端做了简单的封装，
当然最好是可以对官方的客户端进行改造，
但是我们现在的人力明显不行，只能继续沿用老的客户端使用；
我们预计在10月份左右会出一个自研的客户端，
会尽量避免出现一台机器导致部分查询出现问题，
但是也避免不了，
ES内部的服务发现机制，我们改变不了，除非改ES

调查

1.需要换成本地磁盘，测试环境也是我们的正式环境。是否能直接替换成物理机？多少台合适？怎么可以平滑替换？

没有必要换成物理机。因为ES内存最多能用32G。内存多出来的是浪费用不上，有物理机也是隔成VM来用。

原来10台VM是足够的，只需要同等数量替换。

有机器替换功能。替换时原理是先申请机器部署。然后点击机器替换。会一台台的将分片赶到新机器上。一台下完自动下线老机器。

2.我们测试环境有10台服务器，10个分片，4个副本，写/读QPS大概是7：6。究竟几个分片几个索引更合理？

因为每个分片和副本是同步写。写比例大，副本多会对性能有很大影响。分片替换需要重建索引，很难平滑。所以只将副本数减少为一个分片1个。

3.程序方面有没有可以优化的？

在ES上层增加tair缓存。在进行数据更新操作时是单个数据读取。采用tair有更好的事务性，并减少了对ES的压力。ES只处理复杂查询请求。

Elasticsearch实战-磁盘IO被打满的更多相关文章

ElasticSearch实战系列十: ElasticSearch冷热分离架构
前言本文主要介绍ElasticSearch冷热分离架构以及实现. 冷热分离架构介绍冷热分离是目前ES非常火的一个架构,它充分的利用的集群机器的优劣来实现资源的调度分配.ES集群的索引写入及查询速度 ...
【好书摘要】性能优化中CPU、内存、磁盘IO、网络性能的依赖
系统优化是一项复杂.繁琐.长期的工作,优化前需要监测.采集.测试.评估,优化后也需要测试.采集.评估.监测,而且是一个长期和持续的过程,不是说现在优化了,测试了,以后就可以一劳永逸了,也不是说书本上 ...
Linux按照CPU、内存、磁盘IO、网络性能监测
系统优化是一项复杂.繁琐.长期的工作,优化前需要监测.采集.测试.评估,优化后也需要测试.采集.评估.监测,而且是一个长期和持续的过程,不是说现在优化了,测试了,以后就可以一劳永逸了,也不是说书 ...
inux按照CPU、内存、磁盘IO、网络性能监测
http://my.oschina.net/chape/blog/159640 系统优化是一项复杂.繁琐.长期的工作,优化前需要监测.采集.测试.评估,优化后也需要测试.采集.评估.监测,而且是一个长 ...
ES CPU和磁盘IO升高
问题 ES监控出现偶尔的波动,CPU和磁盘IO升高有时候在凌晨,业务请求比较低,也没有慢查询,GC也比较正常,没有出现Full GC ES内部的merge segment会占用CPU和磁盘资源,怀疑 ...
linux性能优化cpu 磁盘IO MEM
系统优化是一项复杂.繁琐.长期的工作,优化前需要监测.采集.测试.评估,优化后也需要测试.采集.评估.监测,而且是一个长期和持续的过程,不是说现在优化了,测试了,以后就可以一劳永逸了,也不是说书本上 ...
性能优化中CPU、内存、磁盘IO、网络性能的依赖(转)
关于系统性能优化,推荐一篇不错的博客! 系统优化是一项复杂.繁琐.长期的工作,优化前需要监测.采集.测试.评估,优化后也需要测试.采集.评估.监测,而且是一个长期和持续的过程,不是说现在优化了,测试 ...
Linux按照CPU、内存、磁盘IO、网络性能监测【转载】
本文转载地址:https://my.oschina.net/chape/blog/159640 系统优化是一项复杂.繁琐.长期的工作,优化前需要监测.采集.测试.评估,优化后也需要测试.采集.评估.监 ...
磁盘 IO 和网络 IO 该如何评估、监控、性能定位和优化？
生产中经常遇到一些IO延时长导致的系统吞吐量下降.响应时间慢等问题,例如交换机故障.网线老化导致的丢包重传:存储阵列条带宽度不足.缓存不足.QoS限制.RAID级别设置不当等引起的IO延时. 一.评估 ...

随机推荐

P2766 最长不下降子序列问题网络流
link:https://www.luogu.org/problemnew/show/P2766 题意给定正整数序列x1,...,xn . (1)计算其最长不下降子序列的长度s. (2)计算从给定的 ...
2019 Multi-University Training Contest 3
B.Blow up the city solved by F0_0H 210min 题意给一个DAG,每次询问给定u,v,求使得u或v不能与中心点联通的关键点个数做法按照拓扑序建树新加节点的父 ...
菜鸟系列Fabric——Fabric 动态添加组织（7）
Fabric 网络动态添加组织 1.环境准备如果存在fabric网络环境可不执行,若不存在可以安装下列进行准备下载fabric-sample,fabric https://github.com/h ...
Java日志框架SLF4J和log4j以及logback的联系和区别
1.SLF4J(Simple logging Facade for Java) 意思为简单日志门面,它是把不同的日志系统的实现进行了具体的抽象化,只提供了统一的日志使用接口,使用时只需要按照其提供的接 ...
脚本代码混淆-Python篇-pyminifier（1）
前言最近研究了一下脚本语言的混淆方法,比如 python,javascript等.脚本语言属于动态语言,代码大多无法直接编译成二进制机器码,发行脚本基本上相当于暴露源码,这对于一些商业应用是无法接受 ...
5.1、顺序队列（java实现）
1.实现代码 public class SeqQueue { private final int MaxSize = 8; private int rear; //队尾指针 private int f ...
laravel模板布局
在实际的开发中,我们会遇到许多重复页面的部分,这些页面的重复会让我们的代码看起来非常冗余所以我们要进行页面的布局规划.思路:将页面中的公有部分取出来作为单独的页面,其他继承公共模板在公共模板的基础 ...
使用java程序作为celery的工作节点
celery是python实现的分布式调度框架,有时候想用celery去调用java服务,正好有一个celery-java的库可以使用,能达到这个效果,记录一下: 先添加依赖: <depende ...
python django+bootstrap4+mysql智慧交通系统构建
之前,我做了一个实训的项目,但是一直没有展示如何做的,现在就让我讲解一下如何用django+bootstrap4+mysql实现这个智慧交通系统.这里用到的是网页的bootstrap4框架和mysql ...
Elastic Stack 笔记（八）Elasticsearch5.6 Java API
博客地址:http://www.moonxy.com 一.前言 Elasticsearch 底层依赖于 Lucene 库,而 Lucene 库完全是 Java 编写的,前面的文章都是发送的 RESTf ...