不明原因频繁死机的处理全过程
发表于:2007-06-08来源:作者:点击数:
标签:
2003年1月14日上午, 2号机报宕机,任务已被1号机接管。远程对2号机检查时,发现能ping通其boot地址x.x.x.4,但无法登录。在重启动两次无效后,开始怀疑该".4"地址是另外主机冒用所至,而非2号机。遂扫描该局 网络 ,初步判定不是2号机;后远程登录到该局某P
2003年1月14日上午,
2号机报宕机,任务已被1号机接管。远程对2号机检查时,发现能ping通其boot地址x.x.x.4,但无法登录。在重启动两次无效后,开始怀疑该".4"地址是另外主机冒用所至,而非2号机。遂扫描该局
网络,初步判定不是2号机;后远程登录到该局某PC机,再对该".4"进行检查,发现该地址果然是被一台PC机冒用。
在将其地址更改后,再重启动2号机,仍旧不能连接,且无法ping通,遂请当地局网管协助,检查机器液晶板及显示输出,发现有人将恢复用的启动备份磁带放入磁带机,导致系统在启动时进行准备恢复状态,将其取出后,再重启动,顺利进入系统boot地址。但在启动HA时无法将ORACLE2文件系统加载,在停止无效的情况下,再启动2号机,手动加载文件系统失败,这时判断文件系统可能出现损坏,遂进行文件系统检查并修复受损的超级块,后顺利启动HA,双机正常运行。
2003年1月16日晚上
接报2号机又宕机,远程调试无法成功,连夜赶赴现场检查。因第二天有国家总局领导前来参观,任务紧急。为顺利糊过第二天的参观,暂时将2号机搁置未用,由1号机承担全部资源及任务。次日,在现场监视处于单机状态的1、2号机运行状况,同时进行诊断和日志分析。按er
rpt记录的时间先后发现如下错误:
1. SCSI0 报错
2. HDISK0 报错
3. HDISK1 报错
4. LVM、LVDD报错
5. JFS 报错
6. ROOTVG 不可访问
7. 部分文件系统不可访问
8. 大部分命令无法执行
9. 丧失ROOT权限,无法关机
10. 系统死机,如果此时运行着HA,则任务将被接管,但资源组无法释放
在死机后,将2号机重启,进行诊断,却未查出任何错误,系统完好。启动时进入维护模式也未查出任何故障。但不久后上面的错误现象又开始出现。无法判断出错的真正原因。临时决定所有任务继续由1号机执行,2号机进入观察期,并在观察期内配置crontab每10分钟记录一次系统各部件状态以便诊断。
2003年1月17日
因屡次发现errpt错误记录在重启动后丢失,于是手抄错误,
以下是我在重启动之前抄下的所有报过的错误:
0EC00096 P U SYSPFS STORAGE SUBSYSTEM FAILURE
C60BB505 P S SYSPROC SOFTWARE PROGRAM ABNORMALLY TER
MINATED
0BA49C99 T H scsi1 SCSI BUS ERROR
D2A1B43E P U SYSPFS FILE SYSTEM COR
RUPTION
613E5F38 P H LVDD I/0 ERROR DETECTED BY LVM
3CFF4028 U H hdisk1 UNDETERMINED ERROR
CAD234BE U H LVDD QUORUM LOST, VOLUME GROUP CLOSING
35BFC499 P H hdisk1 DISK OPERATION ERROR
F7DDA124 U H LVDD PHYSICAL VOLUME DECLARED MISSING
0BA49C99 T H scsi0 SCSI BUS ERROR
41BF2110 U H LVDD MIRROR WRITE CACHE WRITE FAILED
0BA49C99 T H scsi0 SCSI BUS ERROR
CD546B25 I O SYSPFS FILE SYSTEM RECOVERY REQUIRED
T H hidsk1 DISK OPERATION ERROR
F2936FC5 I S errdemon CANNOT E
XPAND LOG FILE TO REQUESTED SIZE
根据该错误日志,初步判断做了镜像的内置硬盘或SCSI0卡有故障,准备重新启动进行内置硬盘和SCSI0诊断,但多次重启动机器均无效,无法正常启动,每次的启动屏幕有如下不同的报错:
20ee000b 启动image已经丢失
21ee0001 SMS Error Log:U0.1-P1-Z1-A
21a00001 SMS Error Log:U0.1-P1-Z1-A
进入SMS菜单
显示current boot sequence:
1
2
3 None
4 None
5 None
Configure 1st Boot Device: 准备修改启动设备时,发现无法找到hdisk0/1
1 Diskette
2 Ethe
.net (loc=U0.1-P1-I5/E1)
3 Ethernet (loc=U0.1-P1-I10/E1)
4 SCSI CD-ROM (loc=U0.1-P1-/Z1-A1)
5 SCSI Tape (loc=U0.1-P1-/Z2-A0)
6 SCSI Processor (loc=U0.1-P1-/Z2-A8)
7 SCSI Processor (loc=U0.1-P1-/Z2-A8)
8 Ethernet (loc=U0.1-P1/E1)
9 None
而我查了一下红皮书上与U0.1-P1/Z相关的设备也只有这几个:
Internal SCSI controller U0.1-P1/Z1 40-60
External SCSI controller U0.1-P1/Z2 40-61
Tape drive U0.1-P1-Z1-A0 40-60-00-0,0
CD drive U0.1-P1-Z1-A1 40-60-00-1,0
Internal DASD 1 U0.1-P1-Z1-A4 40-60-00-4,0
Internal DASD 2 U0.1-P1-Z1-A8 40-60-00-8,0
也就是说,SCSI0上只挂了CD0、HDISK0、HDISK1。
后我使用安装CD启动,可以进入安装模式及维护模式,这基本可以证明SCSI0无故障,
后加载rootvg,报文件系统有错并修复,并显示hdisk0 和 hdisk1 都已经找到。
但再次从硬盘启动后又出现上面的错误。在LED板上停止于 0552。
在重启动之前查看日志显示:
--------------------------------------
17日8:00分,
lsvg -p rootvg
hdisk0 active
hdisk1 active
17日8:30分,
lsvg -p rootvg
hdisk0 missing #已经丢失了
hdisk1 active
--------------------------------------
17日8:30分,已经有多个LV状态为staled
# lsvg -l rootvg
rootvg:
LV NAME TYPE LPs PPs PVs LV STATE MOUNT POINT
hd5 boot 1 2 2 closed/syncd N/A
hd6 paging 128 256 2 open/syncd N/A
hd8 jfslog 1 2 2 open/staled N/A
hd4 jfs 20 40 2 open/syncd /
hd2 jfs 155 310 2 open/staled /usr
hd9var jfs 10 20 2 open/staled /var
hd3 jfs 81 162 2 open/syncd /tmp
hd1 jfs 22 44 2 open/staled /home
判断硬盘有损坏,但不可能两块盘都一起坏呀,如果是SCSI卡坏的话,那么光盘也应该不能使用啊,但光盘启动还正常。真是见了鬼了。于是想找诊断盘,但死活找不到。又想从启动时的OK PROMPT进入对所有硬件检测,但IBM的OK符连个HELP都没有,也不知有什么命令可用,照着SUN的OK符命令试了一下,也只有很少的可用,手头上又没有诊断盘,不能断定到底是不是内置盘或SCSI卡的故障。真急死了!
2003年1月19日,
将处在观察期内的2号机的错误进行仔细分析并报IBM-800支持后,被告知以前此类案件只有HDISK报错,而像我这样即有HDISK报错又同时有SCSI报错的情况没见过。但同意将问题锁定在I/O柜中的SCSI0卡与SCSI内置硬盘上,并建议拆开I/O柜检查。
下午终于找到了诊断盘,在用诊断盘进行多次
测试后,结果表明0号盘已坏,而1号盘根本就未能找到,于是当晚调货更换了两块内置硬盘。随后分别使用安装光盘及备份磁带多次启动进行安装或恢复,但均失败,都是在安装或恢复到3-5%的时候出错。问题依旧未解决。
2003年1月20日,
现在的问题是,两块新硬盘不可能也是坏的,而SCSI0卡也不可能是坏的,否则CD0应该无法使用。到底问题出在哪呢?那根SCSI线缆总不可能出问题吧。
签于原因无法在短期内查明,而1号机任务过重并出现不能及时响应的情况,当晚决定立即调换2号机的I/O柜,旧的I/O柜带回仔细研究。次日下午新I/O柜到达现场,更换后对2号机系统进行磁带恢复,并做多次系统及切换测试,未见异常。21日继续对其观察,一切正常。至此,2号机的频繁不明原因的死机问题暂告一段落。
谁能帮忙分析一下原来的那个I/O柜导致死机的真正原因呢?
| 老农a 回复于:2003-01-27 12:17:06
|
我觉得就是那根SCSI线!(这种事情是有的,我遇到过类似的,因为这根线是分两段的,CD和HD不在一段)。
|
| baiyun 回复于:2003-01-27 13:55:25
|
哦? 但如果是线的故障,那光盘为什么还能用呢?难道这根线到了硬盘接口就不行了?。。。。。。
|
| 老农a 回复于:2003-01-27 13:58:02
|
因为这根线是分两段的,CD和HD不在一段
|
| baiyun 回复于:2003-01-27 14:25:06
|
哦。。。。
看来这线还确实有可能是罪魁了,当时真应该把它揪下来看看。待我查它一查!多谢农哥!
|
| 龙鸽 回复于:2003-01-27 15:02:04
|
查出原因,别忘了告诉大家,小弟也像知道!先谢了!
|
| 冰人 回复于:2003-01-27 15:16:51
|
硬盘段scsi线,是否有terminator啊?
|
| baiyun 回复于:2003-01-27 15:54:51
|
当然有啦,这机子已经用了一年了呢
|
| viacocha 回复于:2003-01-28 10:41:20
|
项上老兄的说的IP地址被人用了的事情我也碰到一次,那段时间我的网一直怪怪,真的把那人搞出来。真不清那么贵的小型机怎么这么肉肉的呀
|
| yanbing 回复于:2003-01-28 10:50:03
|
感谢baiyun花心血将自己的查错排障过程写出来与大家分享,谢谢你的热情。。
祝你新春愉快!!!
|
| 黯精灵 回复于:2003-01-28 12:24:05
|
他们最后给你换的是I/O backplane, 还是整个I/O柜??
如果是前者,那么那根SCSI cable 是不会被换掉的,也就是说和scsi cable无关。
如果是后者,那么就是cable的问题了。
|
| 老农a 回复于:2003-01-28 12:30:57
|
[quote:07d85538f6="viacocha"]项上老兄的说的IP地址被人用了的事情我也碰到一次,那段时间我的网一直怪怪,真的把那人搞出来。真不清那么贵的小型机怎么这么肉肉的呀[/quote:07d85538f6]
这跟小型机有什么关系啊?
我要是用水来浇那还什么机器都没戏呢!
|
| 老农a 回复于:2003-01-28 12:31:53
|
[quote:534b863530="黯精灵"]他们最后给你换的是I/O backplane, 还是整个I/O柜??
如果是前者,那么那根SCSI cable 是不会被换掉的,也就是说和scsi cable无关。
如果是后者,那么就是cable的问题了。[/quote:534b863530]
上面清清楚楚写着换的I/O DRAWER呀:)
|
| 黯精灵 回复于:2003-01-28 12:47:03
|
可是根据IBM的习惯,I/O DRAWER 不能作为一个备件整个换掉的,仓库里应该没有这样的存货。
|
| 老农a 回复于:2003-01-28 13:10:34
|
呵呵,代理可以自己换啊:)
而且这么一换,机器的SN也就换了,
|
| 冰人 回复于:2003-01-28 13:46:47
|
[quote:570db39f91="黯精灵"]可是根据IBM的习惯,I/O DRAWER 不能作为一个备件整个换掉的,仓库里应该没有这样的存货。[/quote:570db39f91]
谁说一定是ibm换的呀 :wink:
|
| kkkggg21cn 回复于:2003-01-28 14:24:01
|
在想确定是CEC还是I/O抽屉坏的情况下,可不可以拿另一台机器的整个I/O抽屉与本机的CEC连到一起进行故障范围诊断,有什么需要注意的地方,像老家所说的S/N冲突什么的?
thanks a million
|
| 炸鸡 回复于:2003-01-28 14:51:50
|
哇,好玩,拆个I/ODRAWER下来又装上去,试完还要拆下来装上去,后面一大堆线再加相当于一个女孩子的重量,真难为您了。
我儿子只会把积木拆散,怎么也装不回去。5555555
|
| kkkggg21cn 回复于:2003-01-28 15:02:38
|
不是我想啊,而是机器报错啊, 00003333, 我试过一两次好像没成功, 所以想讲教各位前辈的经验。目的就是不想惹这个拖着四条尾巴的女孩子,好沉啊!!!想到KFC休息一下吃块炸鸡。
|
| 老农a 回复于:2003-01-28 15:09:34
|
不用拆装的,那些线3米够长的,直接转接过去即可。S/N没有冲突,只不过是系统里的S/N号是存在I/O抽屉的panel板的:)
|
| kkkggg21cn 回复于:2003-01-28 15:42:32
|
换句话说,就是可以把两台机器的CEC和I/O DRAWER混连,且可以正常运行,只是在AIX上看到的机器S/N号与面板上所印S/N号不一致,仅此而己。
农哥对吗?
thanks a million
|
| ibm6000 回复于:2003-01-28 23:04:31
|
我也遇到过ip的问题而导致ha非正常接管的。
|
| baiyun 回复于:2003-01-29 20:46:16
|
谢谢yanbing的祝福,谢谢农哥的指点,以及大家的关心。
也祝大家春节过得愉快,玩得开心! :)
换下的I/O柜已返回一级代理商检查,待过完年结果出来后我一定通报各位。
|
| feijin 回复于:2004-06-11 14:24:55
|
过了一年拉!
我前些天遇到.... 结果就是两块内置盘同时坏掉
换了两个立刻就好,后来又坏了一块.....(9G真的很脆弱阿)
后来买了新的18G 两块 暂时没问题
|
| bloodsun 回复于:2004-10-25 03:34:32
|
在7026-M80上我也碰到过.两套不同的平台分别出现两次了. 这种问题很鬼有时候硬盘会找不到,但有时候又找到了.
估计是SCSI0的线出了问题.
但由于是业务系统,我当时也是换的整个IO柜.带回去分析坏的IO柜发现又是好的. 这台机器后来搬来搬去,先后又出现过几次同样的问题.最后我索性把SCSI0线拉到机器外面来,除了问题我就关机,摸摸这个线再启动他就好了.
|
| fhbkyo 回复于:2005-04-01 11:58:20
|
不是非常清楚,不过出现这种情况最好升级一下微码
|
| aixnewer 回复于:2005-04-01 16:51:31
|
升级微码作用不是很大
|
| yanbing 回复于:2005-04-01 17:25:56
|
这种情况升级微码未必能够解决问题!
还有啊!倒回头来看看这些老帖子,真的有感悟哟!
路就是这么一步一步走过来的呀!
备注:vpd在io book里。。。
|
原文转自:http://www.ltesting.net