不明原因频繁死机的处理全过程

发表于:2007-06-08来源:作者:点击数: 标签:
2003年1月14日上午, 2号机报宕机,任务已被1号机接管。远程对2号机检查时,发现能ping通其boot地址x.x.x.4,但无法登录。在重启动两次无效后,开始怀疑该".4"地址是另外主机冒用所至,而非2号机。遂扫描该局 网络 ,初步判定不是2号机;后远程登录到该局某P

2003年1月14日上午,

2号机报宕机,任务已被1号机接管。远程对2号机检查时,发现能ping通其boot地址x.x.x.4,但无法登录。在重启动两次无效后,开始怀疑该".4"地址是另外主机冒用所至,而非2号机。遂扫描该局网络,初步判定不是2号机;后远程登录到该局某PC机,再对该".4"进行检查,发现该地址果然是被一台PC机冒用。

在将其地址更改后,再重启动2号机,仍旧不能连接,且无法ping通,遂请当地局网管协助,检查机器液晶板及显示输出,发现有人将恢复用的启动备份磁带放入磁带机,导致系统在启动时进行准备恢复状态,将其取出后,再重启动,顺利进入系统boot地址。但在启动HA时无法将ORACLE2文件系统加载,在停止无效的情况下,再启动2号机,手动加载文件系统失败,这时判断文件系统可能出现损坏,遂进行文件系统检查并修复受损的超级块,后顺利启动HA,双机正常运行。

2003年1月16日晚上

接报2号机又宕机,远程调试无法成功,连夜赶赴现场检查。因第二天有国家总局领导前来参观,任务紧急。为顺利糊过第二天的参观,暂时将2号机搁置未用,由1号机承担全部资源及任务。次日,在现场监视处于单机状态的1、2号机运行状况,同时进行诊断和日志分析。按errpt记录的时间先后发现如下错误:
1. SCSI0 报错
2. HDISK0 报错
3. HDISK1 报错
4. LVM、LVDD报错
5. JFS  报错
6. ROOTVG 不可访问
7. 部分文件系统不可访问
8. 大部分命令无法执行
9. 丧失ROOT权限,无法关机
10. 系统死机,如果此时运行着HA,则任务将被接管,但资源组无法释放

在死机后,将2号机重启,进行诊断,却未查出任何错误,系统完好。启动时进入维护模式也未查出任何故障。但不久后上面的错误现象又开始出现。无法判断出错的真正原因。临时决定所有任务继续由1号机执行,2号机进入观察期,并在观察期内配置crontab每10分钟记录一次系统各部件状态以便诊断。

2003年1月17日

因屡次发现errpt错误记录在重启动后丢失,于是手抄错误,

以下是我在重启动之前抄下的所有报过的错误:
0EC00096 P U SYSPFS STORAGE SUBSYSTEM FAILURE
C60BB505 P S SYSPROC SOFTWARE PROGRAM ABNORMALLY TERMINATED
0BA49C99 T H scsi1           SCSI BUS ERROR
D2A1B43E P U SYSPFS FILE SYSTEM CORRUPTION
613E5F38 P H LVDD           I/0 ERROR DETECTED BY LVM
3CFF4028 U H hdisk1 UNDETERMINED ERROR
CAD234BE U H LVDD           QUORUM LOST, VOLUME GROUP CLOSING
35BFC499 P H hdisk1 DISK OPERATION ERROR
F7DDA124 U H LVDD           PHYSICAL VOLUME DECLARED MISSING
0BA49C99 T H scsi0           SCSI BUS ERROR
41BF2110 U H LVDD           MIRROR WRITE CACHE WRITE FAILED
0BA49C99 T H scsi0           SCSI BUS ERROR
CD546B25 I O SYSPFS FILE SYSTEM RECOVERY REQUIRED
T H hidsk1 DISK OPERATION ERROR
F2936FC5 I S errdemon CANNOT EXPAND LOG FILE TO REQUESTED SIZE

根据该错误日志,初步判断做了镜像的内置硬盘或SCSI0卡有故障,准备重新启动进行内置硬盘和SCSI0诊断,但多次重启动机器均无效,无法正常启动,每次的启动屏幕有如下不同的报错:

20ee000b 启动image已经丢失
21ee0001 SMS Error Log:U0.1-P1-Z1-A
21a00001 SMS Error Log:U0.1-P1-Z1-A

进入SMS菜单

显示current boot sequence:
1
2
3 None
4 None
5 None

Configure 1st Boot Device: 准备修改启动设备时,发现无法找到hdisk0/1
1 Diskette
2 Ethe.net (loc=U0.1-P1-I5/E1)
3 Ethernet (loc=U0.1-P1-I10/E1)
4 SCSI CD-ROM (loc=U0.1-P1-/Z1-A1)
5 SCSI Tape (loc=U0.1-P1-/Z2-A0)
6 SCSI Processor (loc=U0.1-P1-/Z2-A8)
7 SCSI Processor (loc=U0.1-P1-/Z2-A8)
8 Ethernet (loc=U0.1-P1/E1)
9 None

而我查了一下红皮书上与U0.1-P1/Z相关的设备也只有这几个:

Internal SCSI controller U0.1-P1/Z1 40-60
External SCSI controller  U0.1-P1/Z2 40-61
Tape drive U0.1-P1-Z1-A0 40-60-00-0,0
CD drive U0.1-P1-Z1-A1 40-60-00-1,0
Internal DASD 1 U0.1-P1-Z1-A4 40-60-00-4,0
Internal DASD 2 U0.1-P1-Z1-A8 40-60-00-8,0

也就是说,SCSI0上只挂了CD0、HDISK0、HDISK1。

后我使用安装CD启动,可以进入安装模式及维护模式,这基本可以证明SCSI0无故障,

后加载rootvg,报文件系统有错并修复,并显示hdisk0 和 hdisk1 都已经找到。
但再次从硬盘启动后又出现上面的错误。在LED板上停止于 0552。


在重启动之前查看日志显示:
--------------------------------------
17日8:00分,
lsvg -p rootvg
    hdisk0 active
hdisk1 active
17日8:30分,
lsvg -p rootvg
    hdisk0 missing   #已经丢失了
hdisk1 active

--------------------------------------
17日8:30分,已经有多个LV状态为staled

# lsvg -l rootvg
rootvg:
LV NAME             TYPE       LPs   PPs   PVs  LV STATE      MOUNT POINT
hd5                 boot       1     2     2    closed/syncd  N/A
hd6                 paging     128   256   2    open/syncd    N/A
hd8                 jfslog     1     2     2    open/staled    N/A
hd4                 jfs        20    40    2    open/syncd    /
hd2                 jfs        155   310   2    open/staled    /usr
hd9var              jfs        10    20    2    open/staled    /var
hd3                 jfs        81    162   2    open/syncd    /tmp
hd1                 jfs        22    44    2    open/staled    /home


判断硬盘有损坏,但不可能两块盘都一起坏呀,如果是SCSI卡坏的话,那么光盘也应该不能使用啊,但光盘启动还正常。真是见了鬼了。于是想找诊断盘,但死活找不到。又想从启动时的OK PROMPT进入对所有硬件检测,但IBM的OK符连个HELP都没有,也不知有什么命令可用,照着SUN的OK符命令试了一下,也只有很少的可用,手头上又没有诊断盘,不能断定到底是不是内置盘或SCSI卡的故障。真急死了!

2003年1月19日,

将处在观察期内的2号机的错误进行仔细分析并报IBM-800支持后,被告知以前此类案件只有HDISK报错,而像我这样即有HDISK报错又同时有SCSI报错的情况没见过。但同意将问题锁定在I/O柜中的SCSI0卡与SCSI内置硬盘上,并建议拆开I/O柜检查。

下午终于找到了诊断盘,在用诊断盘进行多次测试后,结果表明0号盘已坏,而1号盘根本就未能找到,于是当晚调货更换了两块内置硬盘。随后分别使用安装光盘及备份磁带多次启动进行安装或恢复,但均失败,都是在安装或恢复到3-5%的时候出错。问题依旧未解决。

2003年1月20日,

现在的问题是,两块新硬盘不可能也是坏的,而SCSI0卡也不可能是坏的,否则CD0应该无法使用。到底问题出在哪呢?那根SCSI线缆总不可能出问题吧。

签于原因无法在短期内查明,而1号机任务过重并出现不能及时响应的情况,当晚决定立即调换2号机的I/O柜,旧的I/O柜带回仔细研究。次日下午新I/O柜到达现场,更换后对2号机系统进行磁带恢复,并做多次系统及切换测试,未见异常。21日继续对其观察,一切正常。至此,2号机的频繁不明原因的死机问题暂告一段落。

谁能帮忙分析一下原来的那个I/O柜导致死机的真正原因呢?

 老农a 回复于:2003-01-27 12:17:06
我觉得就是那根SCSI线!(这种事情是有的,我遇到过类似的,因为这根线是分两段的,CD和HD不在一段)。

 baiyun 回复于:2003-01-27 13:55:25
哦? 但如果是线的故障,那光盘为什么还能用呢?难道这根线到了硬盘接口就不行了?。。。。。。

 老农a 回复于:2003-01-27 13:58:02
因为这根线是分两段的,CD和HD不在一段

 baiyun 回复于:2003-01-27 14:25:06
哦。。。。

看来这线还确实有可能是罪魁了,当时真应该把它揪下来看看。待我查它一查!多谢农哥!

 龙鸽 回复于:2003-01-27 15:02:04
查出原因,别忘了告诉大家,小弟也像知道!先谢了!

 冰人 回复于:2003-01-27 15:16:51
硬盘段scsi线,是否有terminator啊?

 baiyun 回复于:2003-01-27 15:54:51
当然有啦,这机子已经用了一年了呢

 viacocha 回复于:2003-01-28 10:41:20
项上老兄的说的IP地址被人用了的事情我也碰到一次,那段时间我的网一直怪怪,真的把那人搞出来。真不清那么贵的小型机怎么这么肉肉的呀

 yanbing 回复于:2003-01-28 10:50:03
感谢baiyun花心血将自己的查错排障过程写出来与大家分享,谢谢你的热情。。

祝你新春愉快!!!

 黯精灵 回复于:2003-01-28 12:24:05
他们最后给你换的是I/O backplane,  还是整个I/O柜??

如果是前者,那么那根SCSI cable 是不会被换掉的,也就是说和scsi cable无关。

如果是后者,那么就是cable的问题了。

 老农a 回复于:2003-01-28 12:30:57
[quote:07d85538f6="viacocha"]项上老兄的说的IP地址被人用了的事情我也碰到一次,那段时间我的网一直怪怪,真的把那人搞出来。真不清那么贵的小型机怎么这么肉肉的呀[/quote:07d85538f6]
这跟小型机有什么关系啊?
我要是用水来浇那还什么机器都没戏呢!

 老农a 回复于:2003-01-28 12:31:53
[quote:534b863530="黯精灵"]他们最后给你换的是I/O backplane,  还是整个I/O柜??

如果是前者,那么那根SCSI cable 是不会被换掉的,也就是说和scsi cable无关。

如果是后者,那么就是cable的问题了。[/quote:534b863530]
上面清清楚楚写着换的I/O DRAWER呀:)

 黯精灵 回复于:2003-01-28 12:47:03
可是根据IBM的习惯,I/O DRAWER 不能作为一个备件整个换掉的,仓库里应该没有这样的存货。

 老农a 回复于:2003-01-28 13:10:34
呵呵,代理可以自己换啊:)
而且这么一换,机器的SN也就换了,

 冰人 回复于:2003-01-28 13:46:47
[quote:570db39f91="黯精灵"]可是根据IBM的习惯,I/O DRAWER 不能作为一个备件整个换掉的,仓库里应该没有这样的存货。[/quote:570db39f91]

谁说一定是ibm换的呀 :wink:

 kkkggg21cn 回复于:2003-01-28 14:24:01
在想确定是CEC还是I/O抽屉坏的情况下,可不可以拿另一台机器的整个I/O抽屉与本机的CEC连到一起进行故障范围诊断,有什么需要注意的地方,像老家所说的S/N冲突什么的?

thanks a million

 炸鸡 回复于:2003-01-28 14:51:50
哇,好玩,拆个I/ODRAWER下来又装上去,试完还要拆下来装上去,后面一大堆线再加相当于一个女孩子的重量,真难为您了。

我儿子只会把积木拆散,怎么也装不回去。5555555

 kkkggg21cn 回复于:2003-01-28 15:02:38
不是我想啊,而是机器报错啊, 00003333, 我试过一两次好像没成功, 所以想讲教各位前辈的经验。目的就是不想惹这个拖着四条尾巴的女孩子,好沉啊!!!想到KFC休息一下吃块炸鸡。

 老农a 回复于:2003-01-28 15:09:34
不用拆装的,那些线3米够长的,直接转接过去即可。S/N没有冲突,只不过是系统里的S/N号是存在I/O抽屉的panel板的:)

 kkkggg21cn 回复于:2003-01-28 15:42:32
换句话说,就是可以把两台机器的CEC和I/O DRAWER混连,且可以正常运行,只是在AIX上看到的机器S/N号与面板上所印S/N号不一致,仅此而己。
农哥对吗?
thanks a million

 ibm6000 回复于:2003-01-28 23:04:31
我也遇到过ip的问题而导致ha非正常接管的。

 baiyun 回复于:2003-01-29 20:46:16
谢谢yanbing的祝福,谢谢农哥的指点,以及大家的关心。

也祝大家春节过得愉快,玩得开心! :)

换下的I/O柜已返回一级代理商检查,待过完年结果出来后我一定通报各位。

 feijin 回复于:2004-06-11 14:24:55
过了一年拉!
我前些天遇到.... 结果就是两块内置盘同时坏掉
换了两个立刻就好,后来又坏了一块.....(9G真的很脆弱阿)
后来买了新的18G 两块 暂时没问题

 bloodsun 回复于:2004-10-25 03:34:32
在7026-M80上我也碰到过.两套不同的平台分别出现两次了. 这种问题很鬼有时候硬盘会找不到,但有时候又找到了.
估计是SCSI0的线出了问题.
但由于是业务系统,我当时也是换的整个IO柜.带回去分析坏的IO柜发现又是好的. 这台机器后来搬来搬去,先后又出现过几次同样的问题.最后我索性把SCSI0线拉到机器外面来,除了问题我就关机,摸摸这个线再启动他就好了.

 fhbkyo 回复于:2005-04-01 11:58:20
不是非常清楚,不过出现这种情况最好升级一下微码

 aixnewer 回复于:2005-04-01 16:51:31
升级微码作用不是很大

 yanbing 回复于:2005-04-01 17:25:56
这种情况升级微码未必能够解决问题!

还有啊!倒回头来看看这些老帖子,真的有感悟哟!

路就是这么一步一步走过来的呀!

备注:vpd在io book里。。。

原文转自:http://www.ltesting.net