RAC节点两边存储名字不一致导致的故障及相关延伸
起因:一个客户的实际故障,该故障非常典型,其他客户类似的环境也非常多,所以很值得梳理并记录下来。
环境:Oracle 11.2.0.4 RAC(2 nodes)+ RHEL 6.6
共享存储:EMC powerpath 做的多路径绑定
分别登陆到两个节点,查看设备名称:
[oracle@node1 ~]$ ls -l /dev/emcpower*
crw-r--r-- 1 root root 10, 56 Feb 2 09:52 /dev/emcpower
brw-rw---- 1 grid asmadmin 120, 0 Feb 2 16:56 /dev/emcpowera
brw-rw---- 1 grid asmadmin 120, 16 Feb 2 16:56 /dev/emcpowerb
brw-rw---- 1 grid asmadmin 120, 32 Feb 2 16:56 /dev/emcpowerc
brw-rw---- 1 grid asmadmin 120, 48 Feb 2 16:56 /dev/emcpowerd
brw-rw---- 1 grid asmadmin 120, 64 Feb 2 16:56 /dev/emcpowere
brw-rw---- 1 grid asmadmin 120, 80 Feb 2 16:56 /dev/emcpowerf
brw-rw---- 1 grid asmadmin 120, 96 Feb 2 16:56 /dev/emcpowerg
brw-rw---- 1 grid asmadmin 120, 112 Feb 2 16:56 /dev/emcpowerh
brw-rw---- 1 grid asmadmin 120, 128 Feb 2 09:52 /dev/emcpoweri
[oracle@node2 ~]$ ls -l /dev/emcpower*
crw-rw---- 1 root root 10, 56 Jan 31 16:16 /dev/emcpower
brw-rw---- 1 grid asmadmin 120, 0 Feb 2 17:06 /dev/emcpowera
brw-rw---- 1 grid asmadmin 120, 16 Feb 2 17:07 /dev/emcpowerb
brw-rw---- 1 grid asmadmin 120, 32 Feb 2 17:07 /dev/emcpowerc
brw-rw---- 1 grid asmadmin 120, 48 Feb 2 17:06 /dev/emcpowerd
brw-rw---- 1 grid asmadmin 120, 64 Feb 2 17:06 /dev/emcpowere
brw-rw---- 1 grid asmadmin 120, 80 Feb 2 17:06 /dev/emcpowerf
brw-rw---- 1 grid asmadmin 120, 96 Feb 2 17:06 /dev/emcpowerg
brw-rw---- 1 grid asmadmin 120, 112 Feb 2 12:19 /dev/emcpowerh
brw-rw---- 1 grid asmadmin 120, 128 Feb 2 17:06 /dev/emcpoweri
我们知道,这些都是powerpath多路径聚合之后的名字。
常见误区总结
对于一个这样的生产环境,存在以下几个普遍的误区:
常见误区一:
很多初学者对此存有误解,直接参照网上普及的RAC安装教学类视频,甚至还将这样的盘udev绑定成/dev/asm-disk* 这样的盘。
这样的做法完全是画蛇添足,实际上我们只需要确认这些多路径聚合之后盘的权限是正确的即可。
常见误区二:
在Linux系统中,关于盘的权限设定,很多人不清楚实施的规范究竟是怎样,比如看到有人习惯在/etc/rc.local中设定权限,有人习惯udev绑定权限,之后还有人说哪种方法都可以,给初学者造成了很大的困扰。而实际上具体选择如何赋予权限还和Linux操作系统的具体版本有关系。
这在Linux早期版本(RHEL6.2或更早),甚至只需要在 /etc/rc.local下写入一行chown的权限修改即可,可参考早期的文章:
而在之后的RHEL版本中,这样不再可行,如果还在/etc/rc.local添加设定权限,udev还是会定时刷新权限为之前默认的。所以正确的做法是使用udev绑定权限。具体方法可参考早期文章:
常见误区三:
这也是本文要描述的真实故障:背景信息详见文章开头部分,客户需求是从ASM磁盘组中剔除一块盘/dev/emcpoweri用作它用,剔除完毕后,客户第二天在格式化磁盘/dev/emcpoweri时,误以为两边节点的/dev/emcpoeri 对应的底层设备肯定是一样的,就直接到另一个节点去格式化/dev/emcpoweri,结果实际发现二者并不一样(通过kfed read查看磁盘头也可以验证),更糟的是被损坏的DATA磁盘组还是选择的外部冗余模式,相当于硬生生的格式化了一块ASM的数据盘用作它用,且没有任何冗余备份,从而酿成悲剧。
这个案例反映出来的误区就是:在两个节点查看多路径聚合后的共享磁盘的设备名称,得到的结果完全一致,很多初学者就想当然认为两边的名称对应的底层设备也一致。
而实际上RAC节点两边存储名字对应的真实磁盘很可能是不一致的,部分环境有要求一致的需求,那是需要要求存储工程师做相应的操作才可以。
说到各个节点对盘符识别的一致性,还需要延伸一下ASM的基础知识:对于Oracle提供的ASM,其实并不需要硬性要求两边共享磁盘设备的名字完全对应。因为作为ASM磁盘后,盘头是有记录信息的,Oracle通过盘头的信息判断是否是同一块盘。这点也可以在两个节点分别使用kfed read /dev/emcpoweri aun=0 blkn=0|more来查看盘头的信息验证。
PS:早期版本(Oracle 10g RAC)之所以要求ocr和voting disk对应的磁盘名称在两边一致是因为那个时候OCR和voting disk还不能放在ASM中。对于高标准的施工,出于为了方便后期的磁盘管理工作考虑,还是建议让各个节点对盘符识别保持一致性的,比如一般Linux使用自己的multipath软件,可以根据将每个盘唯一的scsi_id取alias绑定,这样就实现了各节点的盘符识别一致性。
RAC节点两边存储名字不一致导致的故障及相关延伸的更多相关文章
- 『NiFi 节点本地流与集群流不一致导致集群加入失败』问题解决
一.概述 在某些极端情况下,某些 NiFi 节点信息会由于用户强行 disconnect from cluster ,而出现 local flow 与 cluster 的 flow 不同步的问题. 此 ...
- distcp导致个别datanode节点数据存储严重不均衡分析
hadoop2.4生产集群已经执行一段时间了.因为大量的hadoop1.0上面的应用不断迁移过来.刚開始事hdfs这边还没有出现多少问题.随着时间的推移,近期发现个别的datanode节点上面的磁盘空 ...
- rac库grid目录权限(6751)导致数据库宕机案例 此方法仅用于紧急救助
问题: 我的rac环境不小心通过chown命令改变了/u01目录及其子目录的权限,导致rac节点2数据库宕掉,sqlplus下打开数据库报错如下: [oracle@node2 ~]$ sqlplus ...
- oracle 11g rac for linux add node (oracle 11g rac 节点添加)
说明: Adding Oracle RAC to Nodes with Oracle Clusterware Installed步骤来自ORACLE 官方文档: https://docs.oracle ...
- Mysql数据库表排序规则不一致导致联表查询,索引不起作用问题
Mysql数据库表排序规则不一致导致联表查询,索引不起作用问题 表更描述: 将mysql数据库中的worktask表添加ishaspic字段. 具体操作:(1)数据库worktask表新添是否有图片字 ...
- Greenplum hostname和address不一致导致配置文件无法加载
最近又遇到了几个坑,逐一记录分析下. 1.主机名hostname和address不一致 在又一次部署压测环境交由测试组进行压测时,同事修改了pg_hba.conf文件重新加载配置文件时报错.(找不到l ...
- Treat wchar_t as built-in type不一致导致的链接错误
今天用VS2013新建了一个工程,生成时出现很多怪异的链接错误,比如: error LNK2019: unresolved external symbol "__declspec(dllim ...
- thrift 版本不一致导致 @Override 报错
thrift 版本不一致导致 @Override 报错 学习了:http://blog.csdn.net/antony1776/article/details/78920888 版本不一致导致的: 在 ...
- MySQL字符集不一致导致性能下降25%,你敢信?
故事是这样的: 我在对MySQL进行性能测试时,发现CPU使用率接近100%,其中80%us, 16%sys,3%wa,iostat发现磁盘iops2000以下,avgqu-sz不超过3,%util最 ...
随机推荐
- 如何用Safari联调Hybrid APP
随着Hybrid APP的流行,对其调试变得必不可少.使用Xcode我们能看到的仅仅是WebView,要想进一步查看里面的a标签.button和其他元素,Xcode是心有余而力不足.但是不用担心,Sa ...
- python3 第十九章 - 写一个10进制转任意进制的函数
我们先回忆下之前所学的进制转换的知识(详见:第十章),10进制转其它进制的方法是: 整数部分,除基取余,逆序排列 小数部分,乘基取整,顺序排列 负数,按绝对值处理 好,假设我们需要转化的数都是正整数, ...
- Long转Date/页面自定义标签
运行时发现异常:org.apache.jasper.JasperException: javax.el.ELException: java.lang.IllegalArgumentException: ...
- JAVA中使用log4j及slf4j进行日志输出的方法详解
JAVA中输出日志比较常用的是log4j,这里讲下log4j的配置和使用方法,以及slf4j的使用方法. 一.下载log4j的架包,并导入项目中,如下: 二.创建log4j.properties配置 ...
- 【高并发简单解决方案】redis队列缓存 + mysql 批量入库 + php离线整合
需求背景:有个调用统计日志存储和统计需求,要求存储到mysql中:存储数据高峰能达到日均千万,瓶颈在于直接入库并发太高,可能会把mysql干垮. 问题分析 思考:应用网站架构的衍化过程中,应用最新的框 ...
- MS SQL 事物日志传送能否跨数据库版本吗?
SQL SERVER的事物日志传送(log shipping)功能,相信很多人都使用过或正在应用,这是MS SQL提供的一个非常强大的功能,一般需要一个主数据库服务器(primary/producti ...
- android imageview按钮按下动画效果
private ImageView today_eat: today_eat = (ImageView) view.findViewById(R.id.today_eat); today_eat.se ...
- redis数据类型-列表类型
列表类型 列表类型(list)可以存储一个有序的字符串列表,常用的操作是向列表两端添加元素,或者获得列表的某一个片段. 列表类型内部是使用双向链表(double linked list)实现的,所以向 ...
- Global对象
1.Global对象是不需要创建实例就可以直接调用方法或属性的对象.有点类是于java中的工具类 2.关于汉字的网络传递 网络访问的过程中在传递数据的时候,传递的本质都是0101,如果你要传送字符的话 ...
- 第一章 C++基本认识
1.使用visual studio时让程序暂停,在return前加上这个: char response; std::cin >> response; 2.c++程序开发流程 3.变量名的命 ...