p570,硬盘故障。



机器有两个vg,rootvg和datavg,rootvg未做镜像,datavg已做镜像。系统errpt和HMC报硬盘有问题,查看错误代码可能是硬盘有坏道(坏块),在尽量保全用户数据的前提下,要解决此问题。

先是想到把datavg的镜像解除,把空出来的hdisk2分配到rootvg给有故障的盘做mirror。在经过很长一段时间的同步之后,查看rootvg里面的Lv状态时可以看到除了hd1即/home还是stale状态外,其它LV都已经是syncd状态。然后为保险起见把整个/home分区都tar到datavg的一个分区里面,因为耗时比较久同时也可能是因为有坏道,所以此操作进行了很久而且IO等待很高,而且执行df
-g,iostat,vmstat等命令都等待了很久,完全就是卡住了,于是决定等第二天继续处理。



第二天早上查看此机器的状态,lsvg -l
rootvg发现除了/home之外也有很多分区也变成了stale状态,同时lsvg查看到有故障的hdisk0已经是missing状态,完全已经不可操作了。又一次尝试把/home下面的一些文件和文件夹tar到datavg里面,准备把/home分区重建一下。尝试使用rmlv,rmfs都失败,提示只有最后的一块好的盘系统无法保证vg完整而拒绝rmlv,rmfs。给rootvg
unmirror成功,但是在给/home分区rmlvcopy的时候一样提示失败。同时使用lspv
-M命令查看到hdisk1上只有两个LP是stale的状态,而查看hdisk0时看到正好对应的两个LP是好的,于是想着把hdisk0上这两块好的LP直接迁移到hdisk1上去,使用mirgratelp命令,但是在迁移过程中卡死,ctrl+c中止掉,后面就发现/home的LV的PVs变成了3,非常奇怪的问题。再尝试把hdisk0直接从rootvg中reduce掉,执行reducevg提示上面一样的错误,想换盘都不行了。后面实在无法了,准备尝试重启一下机器看。

重启后,在HMC里面看到,该分区的启动报错误代码0552,重新选一块hdisk启动依然报0552。于是只能从网络引导分区,引导进去之后已经看不到原来的hdisk0这块硬盘,importvg都不行,提示VGDA信息有问题。同时用于管理这几台小机的HMC也挂掉了,不能用了,图形界面始终无法显示出来,重启HMC之后故障依旧,只能把这个分区挂到另外一台HMC上使用。最后尝试各种方法都无法恢复系统本身,于是只能选择重装AIX。

这个案例告诉我们重要数据一定要做备份。案例中rootvg没镜像,小机也没连磁带机,也从来没有用mksysb做过系统的备份。虽然这是个开发测试机,但是oracle的数据居然是直接放在/home下面,不说用裸设备,至少要分另外一块硬盘的一个单独的LV出来用作oracle的数据分区。硬件故障是不可避免的,而用户没做备份这就有点说不过去了,所以对硬件不要太依赖,重要的数据一定要做备份。

处理某客户p570硬盘故障所思的更多相关文章

  1. vsftp客户连接常见故障现象

    ftp客户连接常见故障现象现象0:> ftp: connect :连接被拒绝原因: 服务没启动解决: # chkconfig vsftpd on<Enter> 现象1:500 OOP ...

  2. DELL EqualLogic PS存储硬盘故障数据恢复成功案例分享

    DELL EqualLogic PS4000采用虚拟ISCSI SAN阵列,为远程或分支办公室.部门和中小企业存储部署带来企业级功能.智能化.自动化和可靠性.以简化的管理.快速的部署及合理的价格满足了 ...

  3. EVA 4400存储硬盘故障数据恢复方案和数据恢复过程

    EVA系列存储是一款以虚拟化存储为实现目的的HP中高端存储设备,平时数据会不断的迁移,加上任务通常较为繁重,所以磁盘的负载相对是较重的,也是很容易出现故障的.EVA是依靠大量磁盘的冗余空间,以及故障后 ...

  4. rsync 实现文件同步 (重要数据通过rsyncr把数据同步到不同的两台服务器上,这样可以防止服务器的硬盘故障导致数据丢失) 客户端同步时如果要排某个目录

    rsync是unix系统下的数据镜像 备份工具,一般linux系统都 自带: # rpm -qa|grep rsync rsync-3.0.9-17.el7.x86_64 服务器端:10.100.0. ...

  5. Centos6.5硬盘故障修复

    以企业Centos6.5Linux为案例来修复系统,步骤如下: (1)远程备份本地其他重要数据,出现只读文件系统,需要先备份其他重要数据基于rsync|scp远程备份,其中/data为源目录,/dat ...

  6. 分布式存储ceph——(5)ceph osd故障硬盘更换

    正常状态:

  7. Ceph添加、删除osd及故障硬盘更换

    添加或删除osd均在ceph部署节点的cent用户下的ceph目录进行. 1. 添加osd 当前ceph集群中有如下osd,现在准备新添加osd: (1)选择一个osd节点,添加好新的硬盘: (2)显 ...

  8. 分布式存储ceph--osd故障硬盘更换(6)

    正常状态:

  9. Ceph osd故障硬盘更换

    正常状态: 故障状态: 实施更换步骤: (1)关闭ceph集群数据迁移: osd硬盘故障,状态变为down.在经过mod osd down out interval 设定的时间间隔后,ceph将其标记 ...

随机推荐

  1. node tail 日志服务

    var http = require('http'), ,spawn = require('child_process').spawn function onRequest(req, res) { v ...

  2. angularjs 表单校验

    <!DOCTYPE HTML> <html ng-app="myApp"> <head> <meta http-equiv="C ...

  3. 使用Java操作Redis(二)

    上篇文章中我们可以看到,通过自己动手编码来操作Redis是相当繁琐的,实际上我们在重复制造轮子.Redis网站上列举出了一些方便操作Redis的常用工具. 可供Java选择的比较多,这里介绍一下Jed ...

  4. SQLServer中同义词Synonym的用法

    以前一直认为SqlServer中的同义词(Synonym)没有什么用处,所以也一直没有去查它的语法格式.今天碰到一个问题,用Synonym来解决再好不过了.问题是这样子的,我的系统中用到了多个数据库, ...

  5. GoldenGate 反向切换步骤

    1 事先配置好反向复制链路: 2 停止源端的应用程序; 3 确认源端Capture已捕获所有的Redo信息: GGSCI>info all GGSCI>info ext_app 4 确认源 ...

  6. vue实现文字上下滚动

    实现文字的上下滚动使用positon的relative的top属性,通过动态改变top来实现相关内容的更换,通过transion来实现相关的动画效果, 相关的dom内容 <template> ...

  7. [译] 我最终是怎么玩转了 Vue 的作用域插槽

    原文链接:https://juejin.im/post/5c8856e6e51d456b30397f31#comment 原文地址:How I finally got my head around S ...

  8. Vue和vue-template-compiler版本之间的问题

    今天把远程仓库拉下项目,运行'npm run dev'时,报错 Module build failed: Error: Cannot find module 'vue-template-compile ...

  9. JavaScript 回车键绑定登录 事件 常用键位码(keyCode)

    1.回车键绑定登录事件 $(document).keydown(function (e) { if ((e.keyCode || e.which) == 13) { //document.queryS ...

  10. hbase启动报错

    前一段时间vmware上的ubuntu的hbase用不了了,而hadoop能正常的操作,非常的奇怪. 错误信息好像是connect fail, RPC什么的,看来跟网路有关. 想起以前曾经解决过hba ...