处理某客户p570硬盘故障所思
p570,硬盘故障。
机器有两个vg,rootvg和datavg,rootvg未做镜像,datavg已做镜像。系统errpt和HMC报硬盘有问题,查看错误代码可能是硬盘有坏道(坏块),在尽量保全用户数据的前提下,要解决此问题。
先是想到把datavg的镜像解除,把空出来的hdisk2分配到rootvg给有故障的盘做mirror。在经过很长一段时间的同步之后,查看rootvg里面的Lv状态时可以看到除了hd1即/home还是stale状态外,其它LV都已经是syncd状态。然后为保险起见把整个/home分区都tar到datavg的一个分区里面,因为耗时比较久同时也可能是因为有坏道,所以此操作进行了很久而且IO等待很高,而且执行df
-g,iostat,vmstat等命令都等待了很久,完全就是卡住了,于是决定等第二天继续处理。
第二天早上查看此机器的状态,lsvg -l
rootvg发现除了/home之外也有很多分区也变成了stale状态,同时lsvg查看到有故障的hdisk0已经是missing状态,完全已经不可操作了。又一次尝试把/home下面的一些文件和文件夹tar到datavg里面,准备把/home分区重建一下。尝试使用rmlv,rmfs都失败,提示只有最后的一块好的盘系统无法保证vg完整而拒绝rmlv,rmfs。给rootvg
unmirror成功,但是在给/home分区rmlvcopy的时候一样提示失败。同时使用lspv
-M命令查看到hdisk1上只有两个LP是stale的状态,而查看hdisk0时看到正好对应的两个LP是好的,于是想着把hdisk0上这两块好的LP直接迁移到hdisk1上去,使用mirgratelp命令,但是在迁移过程中卡死,ctrl+c中止掉,后面就发现/home的LV的PVs变成了3,非常奇怪的问题。再尝试把hdisk0直接从rootvg中reduce掉,执行reducevg提示上面一样的错误,想换盘都不行了。后面实在无法了,准备尝试重启一下机器看。
重启后,在HMC里面看到,该分区的启动报错误代码0552,重新选一块hdisk启动依然报0552。于是只能从网络引导分区,引导进去之后已经看不到原来的hdisk0这块硬盘,importvg都不行,提示VGDA信息有问题。同时用于管理这几台小机的HMC也挂掉了,不能用了,图形界面始终无法显示出来,重启HMC之后故障依旧,只能把这个分区挂到另外一台HMC上使用。最后尝试各种方法都无法恢复系统本身,于是只能选择重装AIX。
这个案例告诉我们重要数据一定要做备份。案例中rootvg没镜像,小机也没连磁带机,也从来没有用mksysb做过系统的备份。虽然这是个开发测试机,但是oracle的数据居然是直接放在/home下面,不说用裸设备,至少要分另外一块硬盘的一个单独的LV出来用作oracle的数据分区。硬件故障是不可避免的,而用户没做备份这就有点说不过去了,所以对硬件不要太依赖,重要的数据一定要做备份。
处理某客户p570硬盘故障所思的更多相关文章
- vsftp客户连接常见故障现象
ftp客户连接常见故障现象现象0:> ftp: connect :连接被拒绝原因: 服务没启动解决: # chkconfig vsftpd on<Enter> 现象1:500 OOP ...
- DELL EqualLogic PS存储硬盘故障数据恢复成功案例分享
DELL EqualLogic PS4000采用虚拟ISCSI SAN阵列,为远程或分支办公室.部门和中小企业存储部署带来企业级功能.智能化.自动化和可靠性.以简化的管理.快速的部署及合理的价格满足了 ...
- EVA 4400存储硬盘故障数据恢复方案和数据恢复过程
EVA系列存储是一款以虚拟化存储为实现目的的HP中高端存储设备,平时数据会不断的迁移,加上任务通常较为繁重,所以磁盘的负载相对是较重的,也是很容易出现故障的.EVA是依靠大量磁盘的冗余空间,以及故障后 ...
- rsync 实现文件同步 (重要数据通过rsyncr把数据同步到不同的两台服务器上,这样可以防止服务器的硬盘故障导致数据丢失) 客户端同步时如果要排某个目录
rsync是unix系统下的数据镜像 备份工具,一般linux系统都 自带: # rpm -qa|grep rsync rsync-3.0.9-17.el7.x86_64 服务器端:10.100.0. ...
- Centos6.5硬盘故障修复
以企业Centos6.5Linux为案例来修复系统,步骤如下: (1)远程备份本地其他重要数据,出现只读文件系统,需要先备份其他重要数据基于rsync|scp远程备份,其中/data为源目录,/dat ...
- 分布式存储ceph——(5)ceph osd故障硬盘更换
正常状态:
- Ceph添加、删除osd及故障硬盘更换
添加或删除osd均在ceph部署节点的cent用户下的ceph目录进行. 1. 添加osd 当前ceph集群中有如下osd,现在准备新添加osd: (1)选择一个osd节点,添加好新的硬盘: (2)显 ...
- 分布式存储ceph--osd故障硬盘更换(6)
正常状态:
- Ceph osd故障硬盘更换
正常状态: 故障状态: 实施更换步骤: (1)关闭ceph集群数据迁移: osd硬盘故障,状态变为down.在经过mod osd down out interval 设定的时间间隔后,ceph将其标记 ...
随机推荐
- MongoDB count distinct group by JavaAPI查询
import java.net.UnknownHostException; import com.mongodb.BasicDBList; import com.mongodb.BasicDBObje ...
- Android 仿 窗帘效果 和 登录界面拖动效果 (Scroller类的应用) 附 2个DEMO及源代码
在android学习中,动作交互是软件中重要的一部分.当中的Scroller就是提供了拖动效果的类,在网上.比方说一些Launcher实现滑屏都能够通过这个类去实现.以下要说的就是上次Scroller ...
- 数据可视化之Processing【1】
说Processing之前得先说一下数据可视化. 数据可视化--顾名思义.是关于数据之视觉表现形式的研究,将数据用其它方式表现出来,使之更直观, 更清晰,更easy分析和处理.常见的表达方式如word ...
- codevs1052
题目地址:http://codevs.cn/problem/1053/ 分析: 模拟 代码: var s:string; a:array['a'..'z'] of longint; i,j,t,n:l ...
- Most common words
To find the most common words, we can apply the DSU pattern; most_common takes a histogram and retur ...
- C语言基础-第三章
C语句和数据输入/输出(函数) 1.printf();输出函数 2.getch();输入函数 3.scanf();格式输入 4.puts();字符串输出 5.gets();字符串输入
- JavaScript总结(2)
<!--脚本部分-->06 <script type="text/javascript">07 date_object=new Date();08 what ...
- CF402E Strictly Positive Matrix(矩阵,强联通分量)
题意 给定一个 n∗n 的矩阵 A,每个元素都非负判断是否存在一个整数 k 使得 A^k 的所有元素 >0 n≤2000(矩阵中[i][i]保证为1) 题解 考虑矩阵$A*A$的意义 ,设得到的 ...
- shell应用之批量添加用户实例
这里要实现功能介绍 读取一个用户列表文件 给列表中的用户添加随机密码需要包含大小写字符和数字 保存对应的用户和密码文件 这些用户属于同个用户组 1.列表文件 [root@mail ~]# cat li ...
- P1872 回文串计数(回文树)
题目描述 小a虽然是一名理科生,但他常常称自己是一名真正的文科生.不知为何,他对于背诵总有一种莫名其妙的热爱,这也促使他走向了以记忆量大而闻名的生物竞赛.然而,他很快发现这并不能满足他热爱背诵的心,但 ...