AIX操作系统错误日志及日常维护

合集下载

AIX操作系统错误日志及日常维护

AIX操作系统错误日志及日常维护

A I X操作系统错误日志及日常维护一、系统故障记录(errorlog)errdemon 进程在系统启动时自动运行记录包括硬件软件及其他操作信息故障记录文件为/var/adm/ras/errlog 可备份下来或拷贝到别的机器上分析errpt 命令的使用(普通用户权限也可使用)#errpt |more 列出简短出错信息ERROR_ID TIMESTAMP T C RESOURCE_NAME ERROR_DESCRIPTION192ACror logging turned off038FTIMESTAMP: MMDDHHMMYY (月日时分年T 类型: P 永久; T 临时; U 未知永久性的错误应引起重视C 分类: H 硬件; S 软件; O 用户; U未知#errpt -d H 列出所有硬件出错信息#errpt -d S 列出所有软件出错信息#errpt -aj ERROR_ID 列出详细出错信息# errpt -aj 0502f666 <--- ERROR_ID用大小写均可,例:LABEL: SCSI_ERR1ID: 0502F666Date/Time: Jun 19 22:29:51Sequence Number: 95Node ID: host1Class: HType: PERMResource Name: scsi0Resource Class: adapterResource Type: hscsiLocation: 00-08VPD: <--- Virtal Product DataDevice Driver Level (00)Diagnostic Level (00)Displayable Message.........SCSIEC Level....................C25928FRU Number..................30F8834Manufacturer................IBM97FPart Number.................59F4566Serial Number (00002849)ROS Level and ID (24)Read/Write Register Ptr (0120)DescriptionADAPTER ERRORProbable CausesADAPTER HARDWARE CABLECABLE TERMINATOR DEVICEFailure CausesADAPTERCABLE LOOSE OR DEFECTIVERecommended ActionsPERFORM PROBLEM DETERMINATION PROCEDURESCHECK CABLE AND ITS CONNECTIONSDetail DataSENSE DATA0000 0000 0000 0000 0000 0000 0000 0000 0000 0000 0000 0000二、控制面板上的LED 代码.8 位代码通常系统故障灯会同时亮起某些机型还会同时显示故障设备位置代码.4 位代码通常是Exxx.3 位代码通常为0yyy 只看后3位.8 位和4位代码可查看系统服务手册 (Service Guide)3 位代码可查看系统诊断手册(Diagnostic Information for Multiple Bus System).闪动的 888, 系统崩溃硬件或软件原因造成按reset 键会显示更多内容888-102 一般为软件故障888-102-207 例外系统会产生一个dump888-102-xxx-0C9 系统正在做dump, 请等待888-102-xxx-0C0 系统dump完成可关电重启888-103 或 105硬件故障一般有 SRN 代码及位置代码三、其他用于收集系统信息的命令lsdev -C 系统设备信息#lsdev -Cc diskhdisk0 Available 00-06-00-2,0 4.5 GB 16 Bit SCSI Disk Drivehdisk1 Available 00-06-00-1,0 4.5 GB 16 Bit SCSI Disk Drivehdisk2 Defined 00-06-00-4,0 16 Bit SCSI Disk Drivelspv 查看物理卷信息#lspvhdisk0 0007821160af3d76 rootvghdisk1 000782117f571294 rootvghdisk2 0000000045c45bde datavglsvg 查看卷组信息#lsvg datavgVOLUME GROUP: datavg VG IDENTIFIER: 0000000055e2458bVG STATE: active PP SIZE: 4 megabyte(s)VG PERMISSION: read/write TOTAL PPs: 2169 (8676 megabytMAX LVs: 256 FREE PPs: 1 (4 megabytes)LVs: 3 USED PPs: 2168 (8672 megabytOPEN LVs: 2 QUORUM: 2TOTAL PVs: 1 VG DESCRIPTORS: 2STALE PVs: 0 STALE PPs: 0ACTIVE PVs: 1 AUTO ON: yesMAX PPs per PV: 2032 MAX PVs: 16#lsvg -l rootvgrootvg:LV NAME TYPE LPs PPs PVs LV STATE MOUNT POINThd5 boot 1 1 1 closed/syncd N/A...lv00 jfs 51 102 1 closed/stale /ibmcxxlv01 jfs 1 1 1 open/syncd /cics_regionslv02 jfs 4 4 1 open/syncd /var/mqmlslpp 查看文件组信息# lslpp -L |grep 23100020....100020.rte 4.3.2.7 C IBM PCI 10/100 Ethernet Adapt看某个文件组是否已安装如以太网卡驱动也用于查询补丁程序的版本lsattr 查看设备参数设置# lsattr -El ent2busio 0x7fffc00 Bus I/O address Falsebusintr 9 Bus interrupt level Falseintr_priority 3 Interrupt priority Falsetx_que_size 512 TRANSMIT queue size Truerx_que_size 256 RECEIVE queue size Truerxbuf_pool_size 384 RECEIVE buffer pool size Truemedia_speed 10_Half_Duplex Media Speed Trueuse_alt_addr no Enable ALTERNATE ETHERNET address Truealt_addr 0x000000000000 ALTERNATE ETHERNET address Trueip_gap 96 Inter-Packet Gap Truelscfg 查看VPD信息Virtual Product Data)# lscfg -vl ssa1DEVICE LOCATION DESCRIPTIONssa1 30-68 IBM SSA Enhanced RAID Adapter(14104500)Part Number.................097H0645FRU Number..................097H0645 <-- 备件号Serial Number...............C8217227EC Level....................0000F20825 Manufacturer................IBM053ROS Level and ID............7201 <-- 微码版本Loadable Microcode Level (04)Device Driver Level (00)Displayable Message.........SSA-ADAPTERDevice Specific.(Z0)........DRAM=032Device Specific.(Z1)........CACHE=0Device Specific.(Z2)........000000062955dab2Device Specific.(YL)........P2-I7 <-- 槽号不同的硬件设备有不同的VPD 所含的格式和信息都不一样通常备件号和微码版本最有参考价值注FRU(Field Replace Unit)才是真正的备件号。

AIX系统日志

AIX系统日志

AIX系统日志说明1、系统错误日志存放路径:/var/adm/ras/errlog说明:该日志记录了系统所检测到的软硬件故障和错误,尤其对系统的硬件故障有很大的参考价值,是AIX提供的最有价值的日志之一, errlog 文件用more或者其他文本的查看命令来打开我们看到的只是一对乱码,为了能够查看错误日志文件需要使用aix的errpt命令,如:errpt 列信息;errpt –a列详细信息,详细使用方法可以参考man,2、用户的登录日志存放路径:/var/adm/wtmp /var/adm/sulog说明:这些日志记录了用户登录和访问服务器的情况信息,具体的日志文件有wtmp、、sulog 等,它们记录的分别是不同的事件,wtmp记录的是历史的login和lognout信息,可以用last命令访问。

sulog记录的是用户用su命令转变为另一用户的信息。

who、last等这些命令可以查看wtmp和sulog的内容如:Last –f wtmp我们想查看最近10次登录的用户和他们的地址,可以用如下命令:last -103、用户的失败登录日志存放路径:/etc/security/failedlogin说明:这些日志记录了用户登录和访问服务器失败的情况信息,登录失败的情况单独记录在该日志中,可以用who命令来查看。

4、集群管理软件hacmp的日志存放路径:/tmp/hacmp.out说明:HACMP是IBM提供的确保系统运行可靠性的集群套件,HACMP在每次启动和关闭时都要经历一段时间以停止服务和转换文件系统,我们可以通过对HACMP。

OUT日志文件的跟踪实时的了解HACMP在启动和关闭时的信息,如出现启动失败则可以帮助我们定位错误。

可以使用tail进行跟踪,tail –f /tmp/hacmp.out5、系统启动错误日志存放路径:/var/adm/ras/bootlog说明:该日志可以跟踪系统在Boot过程中发生的问题,包括服务器液晶板上的代码信息都有记载。

AIX5.3+oracle10g日常维护手册

AIX5.3+oracle10g日常维护手册

AIX5.3+Oracle10g日常维护手册小型机维护步骤:1、首先查看小型机机房的温度、湿度、电气条件。

温度(摄氏℃)10 ℃-40℃湿度(%)8% -80%零地之间的电压小于1V2、查看小型机、磁盘阵列的指示灯。

主机故障灯面板上不能有数字显示,如果有的话,说明系统有故障。

告警灯为黄色表示有故障磁带机故障灯告警灯为黄色说明有故障或磁带机太脏,须清洗。

#/usr/lpp/diagnostics/bin/utape -cd rmt0 –n //清洗命令磁盘阵列故障灯告警灯为黄色表示有故障3、登录系统,查看小型机的错误日志硬件故障检测命令:# errpt -d H -T PERM若没有故障,则显示为空白,若有故障执行命令# errpt -a -d H -T PERM>/tmp/harderror.log保存,下载之后,将其报给集成商或者硬件厂家进行分析。

软件故障检测命令:# errpt -d S -T PERM若没有故障,则显示为空白,若有故障执行命令# errpt -a -d S -T PERM>/tmp/softerror.log保存,下载之后,将其报给集成商或者软件厂家进行分析。

4、有否发给root用户的错误报告(mail)观察所有未读消息,注意有关diagela的消息。

#mail如果有信息,则使用# Ctrl+d ; 存盘退出,存在/var/spool/Mail目录下,每个用户一个文件,将其下载,发给系统集成商或者硬件厂商5、查看文件系统的使用率%Used为文件系统的使用率。

所有文件系统的使用率不能大于70%,如果超过70%,则应该选择文件系统空间扩容或者删除该文件夹下某些无用数据#df –k //以KB为单位查看Filesystem 1024-blocks Free %Used Iused %Iused Mounted on/dev/hd4 24576 1452 95% 2599 22% //dev/hd2 614400 28068 96% 22967 15% /usr/dev/hd9var 8192 4540 45% 649 32% /var/dev/hd3 167936 157968 6% 89 1% /tmp/dev/hd1 16384 5332 68% 1402 35% /home 上表中,超过70%的/ 和/usr均需要增加容量,或者删除其中不需要的文件。

AIX维护大全分享(七)

AIX维护大全分享(七)

/usr/sbin/install_assist Smitty Installation Assistant
/usr/sys/inst.images/sys.bundles Software bundle files
alt_disk_install -c hdisk1 Clones a running rootvg onto hdisk1
第 28 楼:AIX Useful Commands
compress -c file.txt > file.Z Create a compressed file.
uuencode (infile) (extract-file-name) > (output file)
echo * Lists files, can be used if ls is corrupt/missing
chtz (timezone eg GMT0BST) Changes the timezone in /etc/environment file
like version number, when compiled.
lslpp -L all list all installed software
lslpp -L (program set name) Check if software installed
examples :-
uuencode maymap maymap > maymap.enc
uudecode maymap.enc
od -c /tmp Displays contents of the /tmp directory file
ls -i Lists files with their inode numbers

AIX系统日常维护管理

AIX系统日常维护管理
查看硬件情况
◦ 检查设备故障灯,一般为橙色并有 标志。 ◦ 有没有异常声响,如硬盘、风扇等。 ◦ 有没有破损的电缆等
系统健康检查
检查文件系统
◦ 查看有没有“满”的文件系统。文件系统满可导致系统 不能正常工作,尤其是AIX的基本文件系统。如/ (根文 件系统)满则会导致用户不能登录。
# df -k (查看AIX的基本文件系统)
系统健康检查
磁带机
◦ 磁带机应定期清洁,每使用30小时(8mm20GB为72小时) 或至少每月清洁一次,不要等故障灯亮起后再清洁。
◦ 不同类型的带机用要不同的清洗带,不要混用。
◦ 用" /usr/lpp/diagnostics/bin/utape -c -d rmt0 -n" 可 查看磁带机使用时数。
FRU Number..................30F8834
Manufacturer................IBM97F
Part Number.................59F4566
Serial Number...............00002849
ROS Level and ID............24
系统健康检查
处理方法2:增加文件系统大小
◦ # smitty chjfs ◦ 文件系统可以在任何时候加大,前提是卷组(VG)中有剩余空间。
检查文件系统的完整性
◦ # umount filesystem_name ◦ # fsck filesystem_name ◦ # fsck -y filesystem_name
◦ 核对主机名 ◦ #hostname
系统健康检查
#ifconfig -a
en0: flags=4e080863<UP,BROADCAST,NOTRAILERS,RUNNING,SIMPLEX,MULTICAST,GROUPRT,6 4BIT,PSEG>

AIX系统日志

AIX系统日志

1、系统错误日志存放路径:/var/adm/ras/errlog说明:该日志记录了系统所检测到的软硬件故障和错误,尤其对系统的硬件故障有很大的参考价值,是AIX提供的最有价值的日志之一,errlog 文件用more或者其他文本的查看命令来打开我们看到的只是一对乱码,为了能够查看错误日志文件需要使用aix的errpt命令,如:errpt 列信息;errpt –a列详细信息,详细使用方法可以参考man,2、用户的登录日志存放路径:/var/adm/wtmp /var/adm/sulog说明:这些日志记录了用户登录和访问服务器的情况信息,具体的日志文件有wtmp、、sulog 等,它们记录的分别是不同的事件,wtmp记录的是历史的login和lognout信息,可以用last 命令访问。

sulog记录的是用户用su命令转变为另一用户的信息。

who、last等这些命令可以查看wtmp和sulog的内容如:Last –f wtmp我们想查看最近10次登录的用户和他们的地址,可以用如下命令:last -103、用户的失败登录日志存放路径:/etc/security/failedlogin说明:这些日志记录了用户登录和访问服务器失败的情况信息,登录失败的情况单独记录在该日志中,可以用who命令来查看。

4、集群管理软件hacmp的日志存放路径:/tmp/hacmp.out说明:HACMP是IBM提供的确保系统运行可靠性的集群套件,HACMP在每次启动和关闭时都要经历一段时间以停止服务和转换文件系统,我们可以通过对HACMP。

OUT日志文件的跟踪实时的了解HACMP在启动和关闭时的信息,如出现启动失败则可以帮助我们定位错误。

可以使用tail进行跟踪,tail –f /tmp/hacmp.out5、系统启动错误日志存放路径:/var/adm/ras/bootlog说明:该日志可以跟踪系统在Boot过程中发生的问题,包括服务器液晶板上的代码信息都有记载。

AIX操作系统卷组故障维护

AIX操作系统卷组故障维护

AIX操作系统卷组故障维护AIX操作系统卷组故障维护故障描述:4.20日早晨,发现日报没有正常发送,登录数据库备机查看原因,查看系统的log命令:errpt |more没有发现什么异常,不过发现有如下错误:F3931284 0410055009 I H ent2 ETHERNET NETWORK RECOVERY MODEF3931284 0410055009 I H ent0 ETHERNET NETWORK RECOVERY MODE 173C787F 0410053709 I S topsvcs Possible malfunction on local adapter173C787F 0410053709 I S topsvcs Possible malfunction on local adapterEC0BCCD4 0410053709 T H ent2 ETHERNET DOWNEC0BCCD4 0410053709 T H ent0 ETHERNET DOWN这个时间正好是同事更换以太网交换机的时间查看数据库同步脚本log:# sh /home/oracle/sh/rmanres.sh[YOU HAVE NEW MAIL]0516-040 lqueryvg: Unable to read the specified physical volumedescriptor area.0516-932 /usr/sbin/syncvg: Unable to synchronize volume group backvg.[YOU HAVE NEW MAIL]restoring datafile 00058 to /u01/oracle/product/9.2.0/oradata/orcl/yy33.dbf restoring datafile 00059 to/u01/oracle/product/9.2.0/oradata/orcl/yy34.dbfreleased channel: ch1RMAN-00571:========================================= =============== ===RMAN-00569: =============== ERROR MESSAGE STACK FOLLOWS ======== =======RMAN-00571:========================================= =============== ===RMAN-03002: failure of restore command at 04/20/2009 12:06:25ORA-19501: read error on file "/u03/orabackup/rman/orcl_db_684391660_523_1", blo ckno 8192001 (blocksize=8192)ORA-27063: skgfospo: number of bytes read/written is incorrectIBM AIX RISC System/6000 Error: 12: Not enough spaceAdditional information: -1Additional information: 1048576ORA-19501: read error on file "/u03/orabackup/rman/orcl_db_684391660_523_1", blo ckno 8191873 (blocksize=8192)ORA-27063: skgfospo: number of bytes read/written is incorrectRecovery Manager complete.[YOU HAVE NEW MAIL]SQL*Plus: Release 9.2.0.1.0 - Production on Mon Apr 20 12:06:26 2009Copyright (c) 1982, 2002, Oracle Corporation. All rightsreserved.SP2-0640: Not connectedSP2-0640: Not connectedERROR:ORA-12500: TNS:listener failed to start a dedicated server processSP2-0640: Not connectedSP2-0640: Not connected系统日志:# ps -ef |moreUID PID PPID C STIME TTY TIME CMDroot 1 0 0 Dec 16 - 0:55 /etc/initroot 61572 78170 0 Dec 16 - 359:56 dtgreetroot 69798 1 0 Dec 16 - 0:00 /usr/lib/errdemonroot 73882 1 0 Dec 16 - 71:56 /usr/sbin/syncd 60root 90242 1 0 Dec 16 - 0:00 /usr/dt/bin/dtlogin -daemon root 102438 344388 0 13:18:46 pts/7 0:00 -kshroot 118898 102438 0 13:19:03 pts/7 0:00 ps -efroot 127086 1 0 Dec 16 - 0:00 /usr/ccs/bin/shlap64root 143514 106918 0 Dec 16 - 0:00 /usr/sbin/rsct/bin/IBM.ERrmdroot 155816 106918 0 Dec 16 - 2:24 /usr/sbin/rsct/bin/IBM.CSMAgentRMd root 159976 106918 0 Dec 16 - 3:08 /usr/sbin/rsct/bin/rmcd -a IBM.LPCom mands -r root 164070 352610 0 Dec 16 - 37:11 /usr/sbin/rsct/bin/hats_nimdaemon 168160 106918 0 Dec 16 - 0:00 /usr/sbin/rpc.statd -d 0 -t 50oracle 180262 1 0 Dec 16 - 0:02 ora_reco_rmandbroot 184400 106918 0 Dec 16 - 1:01 /usr/sbin/gsclvmdoracle 205000 1 0 11:26:43 - 0:00 ora_pmon_orclroot 233570 106918 0 Dec 16 - 7:56 /usr/sbin/rsct/bin/IBM.HostRMd oracle 237696 1 0 12:29:22 - 0:00 oracleorcl (LOCAL=NO)root 241712 352610 0 Dec 16 - 50:29 /usr/sbin/rsct/bin/hats_rs232_nim root 245830 106918 0 Dec 16 - 0:00 /usr/sbin/muxatmdroot 278610 352610 0 Dec 16 - 30:31 /usr/sbin/rsct/bin/hats_nimoracle 307362 1 0 Dec 16 - 0:06 ora_d000_rmandbroot 315394 106918 0 Dec 16 - 0:10 /usr/sbin/aixmibdroot 352384 106918 0 Dec 16 - 0:05 /usr/sbin/snmpmibdroot 372834 1 0 12:13:02 - 0:00 lsvg -ooracle 389264 1 0 11:26:43 - 0:00 ora_ckpt_orclroot 393248 1 0 12:11:24 - 0:00 lsvg -oroot 397368 1 0 12:21:43 - 0:00 lsvg -oroot 405556 1 0 12:15:51 - 0:00 lspvroot 417854 450810 0 12:06:28 - 0:00 lqueryvg -g 00c64e4b00004c0000000 11dbddadf95 -CXroot 426226 1 0 12:47:15 - 0:00 lsvg statvgoracle 434210 1 0 12:07:13 - 0:00 oracleorcl (LOCAL=NO)oracle 442388 1 0 11:26:43 - 0:00 ora_lgwr_orcloracle 446680 1 0 11:26:43 - 0:00 ora_dbw0_orclroot 450810 1 0 12:06:28 - 0:00 /usr/bin/ksh /usr/sbin/varyoffvg backvg root 61802 90242 0 Dec 16 - 8:20 /usr/lpp/X11/bin/X -D /usr/lib/X11//rgb -T -force :0 -auth /var/dt/A:0-ozyiiaroot 74076 106918 0 Dec 16 - 1:34 /usr/sbin/snmpdroot 78170 90242 0 Dec 16 - 0:00 dtlogin <:0> -daemonroot 86416 106918 0 Dec 16 - 0:02 /usr/sbin/syslogdroot 94582 106918 0 Dec 16 - 0:00 /usr/sbin/inetdroot 98768 106918 0 Dec 16 - 13:14 /usr/es/sbin/cluster/clcomd -droot 106918 1 0 Dec 16 - 0:00 /usr/sbin/srcmstrroot 115134 106918 0 Dec 16 - 0:00 /usr/sbin/portmaproot 119210 1 0 Dec 16 - 0:22 /usr/sbin/cronroot 131516 1 0 Dec 16 - 0:00 /usr/sbin/uprintfdroot 139680 1 0 Dec 16 lft0 0:00 /usr/sbin/getty /dev/consoleroot 143754 102438 0 13:19:03 pts/7 0:00 moreroot 151986 106918 0 Dec 16 - 0:00 /usr/sbin/rsct/bin/IBM.ServiceRMd root 156076 106918 0 Dec 16 - 0:00 /usr/sbin/rsct/bin/IBM.AuditRMd oracle 168230 1 0 11:26:43 - 0:00 ora_d000_orcloracle 172368 1 0 11:26:43 - 0:00 ora_arc0_orcloracle 287158 1 0 11:26:43 - 0:00 ora_smon_orcloracle 299364 1 0 11:26:43 - 0:00 ora_reco_orclroot 319924 1 0 11:51:24 - 0:00 lspv hdisk5root 332234 106918 0 Dec 16 - 5:53 hagsd grpsvcsoracle 336330 1 0 Dec 16 - 5:07 ora_dbw0_rmandbroot 344388 94582 0 13:18:45 - 0:00 telnetd -aroot 352610 106918 0 Dec 16 - 55:44 /usr/sbin/rsct/bin/hatsd -n 1 -o dead ManSwitchoracle 356856 1 0 Dec 16 - 11:53 ora_ckpt_rmandboracle 360852 1 0 Dec 16 - 5:24 ora_smon_rmandbroot 369086 106918 0 Dec 16 - 51:38 /usr/es/sbin/cluster/clstrmgrroot 389556 106918 0 Dec 16 - 11:02 /usr/es/sbin/cluster/clinfooracle 393484 1 0 Dec 16 - 4:17 ora_pmon_rmandboracle 418112 1 0 Dec 16 - 0:04 /home/oracle/product/9.2.0/bin/tnslsnr LI STENER -inherit root 422200 106918 0 Dec 16 - 0:08 haemd HACMP 1 Cluster SECNOS UPPORTroot 438682 106918 0 Dec 16 - 0:05 /usr/sbin/qdaemonroot 442776 106918 0 Dec 16 - 0:00 /usr/sbin/rpc.lockd -d 0 root 446934 106918 0 Dec 16 - 0:00 /usr/sbin/writesrvroot 451032 106918 0 Dec 16 - 0:00 /usr/sbin/biod 6root 471540 106918 0 Dec 16 - 0:21 sendmail: accepting connections oracle 479602 1 0 Dec 16 - 1:33 ora_lgwr_rmandb root 491900 106918 0 Dec 16 - 0:05 /usr/sbin/hostmibdoracle 495908 1 0 11:26:43 - 0:00 ora_arc1_orcl环境:两台小机,一个存储阵列,两台机器是hacmp的有三个卷组,dbvg, statvg, backvg主机卷组dbvg备机卷组:statvgbackvg两机都可以访问,用于备份的问题描述:现在备机只要是执行和卷组,pv相关的命令就挂在那,没有反应我通过进程信息,可以判断是卷组锁定了backvg,我执行过的操作,再备机上:chvg -u backvg ,已经3个小时了,还是没有结果,挂载那然后又在备机上执行exportvg backvg 又很长时间了,一个多小时,还是挂在那,请问如何解决这个问题,解锁backvg,我在主机varyonvg backvg时,提示:# varyonvg backvg0516-013 varyonvg: The volume group cannot be varied on because there are no good copies of the descriptor area.Command: failed stdout: yes stderr: noBefore command completion, additional instructions may appear below.0516-024 lqueryvg: Unable to open physical volume.Either PV was not configured or could not be opened. Run diagnostics.0516-024 lqueryvg: Unable to open physical volume.Either PV was not configured or could not be opened. Run diagnostics.0516-1140 importvg: Unable to read the volume group descriptor area on specified physical volume.问题产生的原因:因为backvg卷组是共享卷组(不是并发卷组),在每日的04:00-05:40这段时间是数据库用backvg备份,而在每次使用卷组的时候都要更改卷组的vgda,vgsa中的时间戳,而在这段时间里同事更换了交换机,导致两个小机的卷组的VGDA不一致从而会出现这个错误解决方法:首要目的:让备机释放掉对pv,卷组的管理进程,以达到我可以从新管理备机的卷组信息由于一些原因,我强行kill掉相关LVM命令,导致这些进程都被系统接管,根本无法再kil l掉,即使用kill -9,也是不可以我当时在想有两个方法可以解决此种情况1.有一些特殊的方法可以kill掉这些进程2.重新启动机器让其释放所有资源咨询了很多人,又google半天,也没有找到可以kill那些进程的方法最后决定重启机器因为我的环境是两台小机做了hacmp,为了避免出万一,决定23号凌晨去机房维护,出什么问题也好就近解决主要是担心网卡down了,远程连接不上当到了机房,就在外边的维护室(机房太冷了!!能不进去就不进去啊), 我的hacmp配置为有优先级的cascading模式,按优先级来接管资源。

aix系统日常维护

aix系统日常维护
当系统运行发现错误时,SRNs码(Service request numbers,服务请求码)会以xxx-xxx的形式显示在显示面板上,同时在AIX的errorlog中也会进行登记;当SSA磁盘柜出现故障时,在磁盘柜前面板的液晶显示屏上会显示相应的SRNs,同时黄色的显示灯会闪动,在AIX的errorlog中会登记相应错误信息,在出现问题后记录下代码,并告之IBM公司解决。
(1)系统故障记录
errdemon 进程在系统启动时自动运行,记录包括硬件、软件及其他操作信息,故障记录文件为/var/adm/ras/errlog,可备份下来或拷贝到别的机器上分析,使用errpt 命令(普通用户权限也可使用)。
#errpt |more 列出简短出错信息
#errpt -d H 列出所有硬件出错信息
1.系统用户的最大登录数maxlogin
maxlogin的具体大小可根据用户数设定,可以通过smitty chlicense命令修改,该参数记录在/etc/security/login.cfg文件中,修改在系统重新启动后生效。
2.系统用户的limits参数
这些参数位于/etc/security/limits文件中,可以把这些参数设为-1即无限制,可以用vi修改/etc/security/limits文件,所有修改在用户重新登录后生效。
(2)系统错误报告。
(3)检查是否有发给root用户的错误报告。
(4)检查hacmp.out,smit.log,boot.log。
(5)关键系统的文件使用率不大于80%。
(6)逻辑卷有否stale。
(7)内存交换区使用率是否超过70%。
(8)内存交换区的大小是否为物理内存的1.5倍。

AIX维护手册(详细版)

AIX维护手册(详细版)

日常简易维护与报修指南目录一、系统命令 (3)二、备份与恢复 (6)三、AIX安全 (10)四、错误日志查看 (12)五、Performance Tools (14)六、错误报告流程 (17)附录一硬件接线图 (19)附录二、IBM设备前后视图 (20)一、系统命令检查系统状态:➢系统整体: prtconf➢文件系统:df –k,df -g设备:lsdev –C 获取设备名称、状态、位置和描述。

例:查看硬盘: lsdev –Cc disk查看磁带机: lsdev –Cc tape查看适配卡: lsdev –Cc adapter处理器个数lsdev –C|grep proc系统配置lscfg –vp 获取所有已配置硬件设备的详细信息。

例:查看硬盘信息: lscfg –vl hdiskx x表示数字查看网卡信息: lscfg –vl entx x表示数字查看磁带机: lscfg –vl rmtx x表示数字查看硬件属性:lsattr –El 获取已配置设备的属性信息。

例:查看硬盘属性: lsattr –El hdiskx x表示数字查看网卡属性: lsattr –El entx x表示数字查看磁带机属性: lsattr –El rmtx x表示数字内存大小:lsattr –El mem0➢磁盘lspv➢交换分区lsps –a➢软件lslpp –l 文件包名字➢用户who关机命令:–shutdown一分钟后关机–shutdown +2二分钟后关机–shutdown –Fr关机重启(-r)关机命令调用/etc/rc.shutdown关闭程序可以在这个文件里加上你自己的脚本其它基本命令# passwdpasswd:—输入旧口令new passwd:—输入新口令re-enter new passwd:—重新输入新•mkdir/rm/mv/cd -用于创建目录/删除文件或目录/更改文件或目录名/进入某一目录•ls 显示目录中的内容(文件名)#ls –a 列出当前目录中的所有文件#ls –l 显示文件的详细信息•ps / kill 显示后台进程的有关信息或杀死后台进程#kill -9 253432•find 在一个/多个目录中查找符合条件的文件#find –name ‘t*’ -print•head/tail 显示文件头/尾声的内容#tail +200 filename•who/finger 列出系统注册/已登录的用户#who am I#finger user2光驱cdrom•加载cdrom•使用:mount -rv cdrfs /dev/cd0 /cdrom–或者创建一个CD-ROM文件系统并进行加载•smit cdrf s•mount /cdrom•卸载cdrom– unmount /cdrom二、备份与恢复rootvg备份—mksysb●只备份rootvg●只备份已挂接的文件系统●以备份格式创建可启动磁带●保存rootvg中的换页空间设备定义●保存逻辑卷策略●备份时应使活动的用户和应用减至最少注:mksysb创建操作系统备份,如果rootvg中有用户创建的文件系统,只要它已挂接,也被备份,用户创建的不含文件系统的逻辑卷内容及定义不备份。

AIX操作系统运行维护手册-Ver1.0

AIX操作系统运行维护手册-Ver1.0

AIX操作系统工作手册文件编号版 本0.1作成日2023年10月24日修订日发布日修 改 履 历序号版本修改日期章节号修改记录修改人批准人10.12023/10/23创建修游书目1引言 (5)1.1编写目的 (5)1.2适用范围 (5)1.3预期读者 (5)1.4文档说明 (5)2操作系统健康性检查 (6)2.1系统日志 (6)系统硬件错误日志检查 (6)系统全部错误日志检查 (7)系统错误日志Core_dump检查 (8)系统错误日志DELAYED_INT检查 (9)系统邮件日志内容检查 (9)系统邮件日志大小检查 (11)登录失败日志文件大小检查 (11)登录日志文件大小检查 (12)su日志文件大小检查 (13)异样终止的vi日志文件大小检查 (13)2.2系统性能 (14)系统CPU运用率检查 (14)查看占用CPU资源最多的进程 (17)系统内存运用率检查 (18)系统占用内存资源最多的进程 (20)系统磁盘繁忙程度检查 (22)2.3交换空间 (23)交换空间运用率检查 (23)2.4进程状态 (24)僵尸进程检查 (24)2.5网络状态 (24)网卡状态检查 (24)路由状态检查 (25)网络传输检查 (26)网络连接数量及状态检查 (30)主机解析检查 (32)2.6存储状态 (32)HBA卡状态检查 (32)2.7文件系统状态 (33)文件系统运用率检查 (33)文件系统挂载检查 (34)NFS文件系统挂载检查 (35)dump设备空间检查 (35)2.8逻辑卷状态 (36)Rootvg的剩余空间检查 (36)PV状态检查 (37)是否存在stale的pp检查 (37)2.9系统平安 (38)系统登录状况检查 (38)特权用户检查 (39)Su操作次数检查 (40)失败登录记录检查 (40)2.10双机状态 (41)双机心跳状态检查 (41)Hacmp.out日志检查 (42)Cluster.log日志检查 (42)双机节点状态检查 (43)2.11其它 (44)操作系统时间检查 (44)3操作系统异样快速排查规范 (44)3.1系统日志检查 (45)3.2CPU运用率检查 (45)3.3内存运用率检查 (45)3.4I/O运用率检查 (46)3.5网络检查 (46)3.6交换区检查 (47)3.7文件系统检查 (47)3.8双机检查 (48)1引言1.1编写目的为了保证项目组所运维系统的持续健康运行,降低操作系统的出错几率,并在出现问题时刚好且有效的进行排查、处理,故编写本手册。

AIX系统日常维护

AIX系统日常维护

AIX系统日常维护1.检查文件系统是否满检查方法:df –m 可以以兆为单位检查文件系统的使用率。

解决方法:如果文件系统的使用率达到90%以上,则需要扩大文件系统。

如果文件系统类型为jfs,使用命令smitty chjfs;如果文件系统类型为jfs2,使用命令smitty chjfs2。

检查周期:一周一次。

2.检查系统错误日志检查方法:使用errpt | more来检查系统生成的错误日志。

解决方法:如有错误生成,可使用errpt –aj 错误ID号,来查看错误的详细情况。

如果错误日志太长,可使用如下命令清除:errclear 0。

检查周期:一周一次。

3.检查系统合法/非法登陆情况检查方法:last命令可检查登陆信息。

如需查看root用户或从控制台终端的登陆和注销,可输入:last root console;如需查看系统两次重新引导间的时间,可输入:last reboot;如要显示所有在4月15日上午10:30仍登陆的用户,可输入:last –t 04151030;如只需显示列表中的十行,可输入:last –n 10。

检查周期:根据应用对安全性的要求决定检查周期。

4.检查系统是否有巨大的core文件生成检查方法:使用find / –name ‘core.*’–print来检查。

解决方法:对core文件,一般用rm命令直接删除。

检查周期:一月一次。

5.硬件检查检查方法:使用diag命令。

检查周期:一月一次。

6.系统性能检查a) CPU性能:使用vmstat,topas来检查。

b) 内存使用情况:也是使用topas,vmstat来检查。

c) 检查IO平衡使用情况:使用iostat来检查。

d) 内存交换页使用情况:使用lsps –a来检查。

机器性能优化主要从四个方面去考虑:CPU,内存,磁盘I/O,网络。

1,CPUsar命令可以使用sar命令来查看cpu的使用率。

ibm150:[/]#sar 1 5AIX ibm150 1 5 000AF70D4C00 01/24/0613:13:25 %usr %sys %wio %idle13:13:26 0 0 0 10013:13:27 0 0 0 10013:13:28 0 0 0 10013:13:29 0 0 0 10013:13:30 0 0 0 100Average 0 0 0 100%usr +%sys > 80%的时候CPU将是瓶颈ibm150:[/]#ps aux | head -4 查看前3位占用cpu的进程USER PID %CPU %MEM SZ RSS TTY STAT STIME TIME COMMANDroot 774 49.7 8.0 12 18052 - A 10:07:58 188:24 wait root 516 49.78.0 12 18052 - A 10:07:58 188:20 wait root 5688 0.1 0.0164 168 - A 10:09:13 0:21/usr/sbin/syncd 6%CPU表示进程使用cpu时间的百分比;%MEM表示进程使用实际内存的百分比ps –elf命令将查看进程的优先级别ibm150:[/]#ps -elfF S UID PID PPID C PRI NI ADDR SZ WCHAN STIME TTY TIME CMD200003 A root 1 0 0 60 20 28034 1876 10:08:23 0:00 /etc/init240401 A root 2968 4502 0 60 20 2c376 2176 *10:10:230:00 /usr/sbin/rsct/bin/IBM.ServiceRMd40001 A root 3192 1 0 60 20 3417a 1472 10:09:00 -0:00 /usr/dt/bin/dtlogin -daemon240001 A root 3730 4158 3 61 20 321b9 2568 10:10:19 -0:20 dtgreetPRI值越小,优先级越大。

AIX操作系统维护手册

AIX操作系统维护手册

AIX系统维护手册一:AIX系统日常管理1.文件系统是否满管理员需经常查看文件系统,以防止使用率过高导致的问题.方法: df –k 可以以K为单位检查文件系统的使用率。

(90%以上,需要调整)2.检查系统出错日志使用errpt |more来检查清除现有的log: Errclear 03.检查系统合法/非法登陆情况使用Last命令来检查来自登陆的地方。

4.检查系统是否有巨大的Core文件生成使用 find / -name core –print来检查。

对Core文件,一般直接删除就可以了。

5、系统进程管理ps命令是UNIX系统中最常见的命令,它主要显示系统中关于进程的统计和状态信息,如进程ID,I/O行为以及CPU利用率等。

利用ps命令提供的信息,可决定一个进程运行了多长时间,进程使用了多少CPU时间,以及进程是否受系统的惩罚。

还可用ps命令确定进程使用了多少内存,完成多少I/O,进程的优先级以及是谁创建了进程。

下面这几个命令组合对于管理RS/6000 AIX系统有帮助:(1)显示10个消耗CPU最多的进程:# ps aux |head -1 ;ps aux |sort -rn +2 |head –10(2)显示10个消耗存储空间最多的进程:# ps aux |head -1 ;ps aux |sort -rn +3 |head -10(3)按顺序显示系统中受罚的进程:#ps -eakl |head -1 ;ps -eakl |sort -rn +5(4)按优先级顺序显示系统中的进程:#ps -eakl |sort -n +6 |head(5)按处理时间为顺序显示系统中的前十个进程:#ps vx |head -1 ;ps vx |grep -v PID |sort -rn +3 |head –10(6)按实际内存使用的多少顺序显示系统中的前十个进程:#ps vx |head -1 ;ps vx |grep -v PID |sort -rn +6 |head –10(7)按换入页面的多少顺序显示系统中的前10个进程:#ps vx |head -1 ;ps vx |grep -v PID |sort -rn +4 |head -10二:AIX的系统备份和恢复备份和恢复是系统管理员经常要做的事情, 主要包括rootvg备份和用户数据备份.1. 操作系统和系统程序的备份:将一盘新磁带或无用磁带插入磁带机#tctl -f /dev/rmt0 rewind#smit mksysb在"备份设备或文件"中添入"/dev/rmt0"后回车.系统会运行很长时间, 等到屏幕显示OK后拿出磁带. 这时候, 系统备份完成. 注意: mksysb仅备份rootvg中已安装的文件系统.2. 用户数据备份·常用磁带机选项/dev/rmt0: 若选择/dev/rmt0, 在插入磁带和写完一次磁带时, 磁带机都将磁带反绕到头.因此, 下一次备份文件将覆盖本次备份./dev/rmt0.1: 若选择/dev/rmt0.1, 则插入磁带和写完一次磁带时, 磁带机均不反绕磁带.因此, 一盘磁带可以连续备份几个文件或文件系统.· #smit fs选择"备份文件系统"添入要备份的"文件系统名称"添入"/dev/rmt0.1"重复上述操作即可在同一盘磁带上备份多个文件系统.3. rootvg的恢复·启动机器进入维护模式参见安装手册, 当出现"Welcome to Base Operating System Installation and Maintanence"时,选3 "Start Maintenance Mode for System Recovery"·恢复系统继续选4 "Install from a System Backup"出现"Choose mksysb Device"画面, 选"/dev/rmt0"并插入磁带后回车.这时候, 系统自动恢复操作系统.4. 用户数据恢复#tctl -f /dev/rmt0 rewind#smit fs选择"恢复文件系统"添入"设备名称"和"目标目录"系统会自动找到相应目录恢复.三.日志清理问题:减小 /var/adm/wtmp 文件的大小?答案:文件 /var/adm/wtmp 的大小会在每次用户登录时增长, 但从不自动减小. wtmp 文件的内容会被命令 last 使用, 用于显示登录系统和重启机器的情况.该文件不能被删除, 但它的内容可用如下命令清除:# > /var/adm/wtmp四.HACMP类命令1.启动HACMP#smitty clstart2.关闭HACMP#smitty clstop3.查看HACMP的状态#smitty clstat4.查看HACMP的拓扑结构#/usr/sbin/cluster/utilities/cltopinfo。

Aix系统基本的日常维护

Aix系统基本的日常维护

Aix系统基本的日常维护1.文件系统监控:a) 文件系统是否满:使用df –k 可以以K为单位检查文件系统的使用率。

(90%以上,需要调整)要扩充空间,先用lsvg vgname查看是否有足够的free pps数目。

b) 用lsfs查看所有文件系统有无异常。

若vfs参数显示为???,即odm对某个文件系统的记录与超极块记录不同步。

解决方法:synclvodm lvname和syncvg -v vgname。

2.检查系统出错日志:a) errpt |more来大概检查。

主要查看C参数,H表示hardware问题;S表示software问题;U表示unknown 问题;O表示系统的正常operate,可不去管它。

b) errpt -a|more或errpt -aj errrID来详细检查。

c) 清除现有的log: Errclear 03.用户安全监控:a) /etc/security/failedlogin-->记录失败login的log。

用who命令读取此文件。

b) /var/adm/wtmp-->记录成功login的log。

用who命令读取此文件。

c) /var/adm/sulog-->记录su的log。

用more命令读取此文件。

d) 需要检查某个用户最后来自登陆的IP。

读取/etc/security/lastlog查看。

e) 使用who和w和finger和last命令查看用户login信息。

4.检查系统是否有巨大的Core文件生成:使用find / -name “core”–print来检查。

使用find / -name “core”-exec rm {} \; 来定期删除。

5.系统性能检查:a) CPU性能:使用Vmstat, topas来检查b) 内存使用情况:也是使用topas, vmstat来检查c) 检查IO平衡使用情况:使用iostat来检查d) 交换空间使用情况:使用lsps –a来检查6.邮件查看:定期检查Mail,特别是系统daemon发的错误和警告信息。

IBM AIX日常维护及故障处理汇总

IBM AIX日常维护及故障处理汇总

第一类、机房环境及物理检查一、机房内环境要求1. 温度与湿度:最佳工作温度:20-25摄氏度极限工作温度:10-40摄氏度湿度: 8-80%(在23摄氏度条件下)如果不是工作在最佳温度,请注意改善机房环境2. 同时机房要保证清洁.机房应保持清洁,若空气灰尘过多,很容易造成资源读写错误及磁盘机中磁盘或读写磁头毁损。

二、电源要求电压: 要求电压稳定, 尖峰电压会损坏设备电压范围: 220V +/- 10%, 即200-240V, 50-60Hz电源功率: 视机器类型和系统配置而定电源线 : 标准的零, 地, 火三相电, 其中零, 地电压不得超过3.0V.电源接驳: 用符合电流要求的空气开关或其他设备和主机电源线接驳,保证计算机系统的可靠工作应使用稳压电源和UPS,并建议配备发电机组;对于冗于电源的接入,建议采用两路单独输入.三、硬件检查]检查服务器、磁阵的安装、电源线、7133和主机接线符合要求。

服务器状态检查:1. 当服务器处于启动和正常工作状态时,其前面板上的液晶显示屏上应无信息显示。

2. 当液晶显示器上出现带数字和字母的信息时,说明有硬件告警。

可以通过查询相关机型的Service Guide查到相应告警原因,情况严重的,则要立即通知IBM技术专家进行问题排查。

7133状态检查:磁阵前面板上有7133机柜的状态灯(与电源灯并排)和各硬盘的状态灯(一排小灯,与各硬盘位置一一对应)。

1. 当机柜的状态灯出现橙黄色时,说明有硬件告警,此时要检查磁柜的电源、接线、硬盘等。

如果有硬件故障则立即进行更换和更正,如果查不出具体问题,则需要联系相关专家进一步诊断。

2. 当硬盘工作正常时,与各硬盘对应的硬盘灯会呈绿色,如无读写,则绿灯一直亮,如该硬盘有读写操作,则绿灯会不规则闪烁,当硬盘损坏时或SSA环路出现问题时,则硬盘状态灯将熄灭,或者呈闪烁状态:以1~3秒的频率有规律地、不停地闪烁第二类、系统日常维护流程2.1系统启动系统启动正常顺序如下:首先对外设(磁盘阵列、磁带库等)加电。

AIX常见故障报错及解决方案

AIX常见故障报错及解决方案

AIX 常见故障报错及解决方案大多数情况下,顺着报错顺藤摸瓜很快就能找出原因,但总有例外,有些报错信息或者日志恰恰让我们南辕北辙。

让我们看看这些案例最终是如何处理的……案例1:图省事,搞出来个大麻烦生产中心有几套VIOS环境,正常运行了1-2年,今日发现有2套进行健康性检查,发现执行命令就hang在哪里不动了,又是内存不够用了。

"0403-031 The forkfunction failed. There is not enough memory available."好奇怪,到底内存被谁用了,vios好端端的就这样了。

都这个样子,重启vios分区吧。

重启完,vios顺利登陆,执行健康性检查没啥问题,可是用nmon看了一下内存使用分配了4个G,使用1个多G,慢慢慢慢的就看到内存使用越来越大,不一会4个G就用完了,重启其他vios分区一个样子,连换页空间都用了。

顿时一头雾水。

到底发生了什么呢?生产中心有几套VIOS环境,正常运行了1-2年.突然出现这种问题,首先想到的是变更。

梳理了近期变更操作,近期新部署了PowerVC,VIOS进行了补丁升级。

VIOS2.1升级到VIOS2.2.3.首先,重启vios分区,在内存没有用完前赶紧检查那个进程使用的内存.排名第一的是vio_daemon,观察了一会发现内存一会就被他占用完了第二,元凶找到了,vio_daemon到底是干啥的,问问IBM800吧,IBM回复问我收集一下系统信息。

1.ioslevel2./etc/security/limits的输出反馈后,IBM告诉我,我遇到了bugvios版本和 /etc/security/limits stack = -1完全符合这个bug特征。

其实这个bug是可以避免的,我们大多数实施AIX的时候,很容易顺手把/etc/security/limits.都改成-1,在大多数情况下,没啥问题,但是就是在这个版本下就容易遇到这个问题。

aix_日常管理以及故障处理

aix_日常管理以及故障处理

aix_日常管理以及故障处理故障的处理RS6000 Admin & PD内容提要"日常管理"故障的处理"系统健康检查"查看硬件情况"检查设备故障灯,一般为橙色并有"有没有异常声响,如硬盘、风扇等。

"有没有破损的电缆等"查看系统故障信息"用errpt命令查看系统出错信息。

"用mail命令查看有否发给root用户的错误报告。

"查看其他的记录文件,如/tmp/hacmp.out。

"检查文件系统"查看有没有“满”的文件系统。

文件系统满可导致系统不能正常工作,尤其是AIX的基本文件系统。

如/ (根文件系统)满则会导致用户不能登录。

"系统健康检查# df -k (查看AIX的基本文件系统)Filesystem 1024-blocks Free %Used Iused %Iused Mounted on /dev/hd4 24576 1452 95%2599 22% //dev/hd2 614400 28068 96% 22967 15% /usr/dev/hd9var 8192 4540 45% 649 32% /var/dev/hd3 167936 157968 6% 89 1% /tmp/dev/hd1 16384 5332 68% 1402 35% /home除/usr文件系统,其他文件系统都不应太满,一般不超过80%。

处理方法1:删除垃圾文件# du -sk * |sort -rn |head查找出当前目录下占空间最大的子目录,逐层往下直到找出占空间最大的文件。

(要区分哪些目录是文件系统的mount point,哪些是文件系统的子目录)删除文件,释放空间。

有时删除文件后空间并不马上释放,这是由于你删除的文件正被某个程序打开。

只有当这个程序停止后空间才释放,有时甚至需要重起系统。

(零收费)AIX系统日常维护与故障的解决

(零收费)AIX系统日常维护与故障的解决

0104143100 T S SYSPROC
9DBCFDEE
0104143300 T O errdemon
192AC071
0104143000 T O errdemon
C60BB505
0104105800 P S SYSPROC
参数详解
标识‘’:错误归类 :硬件 :软件 :系统信息已经记录 :不能确定 标识‘’:错误类型 (并且为):显示系统遇到硬件问题并且无法自动修复 (并且为):系统硬件变为不可用并引起一系列错误系统 (并且为):显示系统遇到软件问题并且无法自动修复 (并且为):显示系统遇到软件问题并且已经自动修复
2CCF66F7
0105111300 T H bl0
2BFA76F6
0105111100 T S SYSPROC
9DBCFDEE
0105111300 T O errdemon
192AC071
0104174500 T O errdemon
2CCF66F7
0104143300 T H bl0
2BFA76F6
检查内存交换区( )使用率 使用率不要超过。 增加交换区,或增加内存。 观察内存大小的命令: –

系统管理日常健康检查与监控
网络检查 查看网卡状态 和 是否> 注:是指从这个网卡发出去错误包数目的统计
是指从这个网卡发出去的包个数的统计。 看它们是否>应该是指网络质量好坏。 查看是否通和是否有丢包。 路由表 查看路由表是否正确, 各路由器是否通。 核对主机名
系统管理日常健康检查与监控
检查文件系统 查看有没有“满”的文件系统。文件系统满可导致系统不能正常工作,
  1. 1、下载文档前请自行甄别文档内容的完整性,平台不提供额外的编辑、内容补充、找答案等附加服务。
  2. 2、"仅部分预览"的文档,不可在线预览部分如存在完整性等问题,可反馈申请退款(可完整预览的文档不适用该条件!)。
  3. 3、如文档侵犯您的权益,请联系客服反馈,我们会尽快为您处理(人工客服工作时间:9:00-18:30)。

AIX操作系统错误日志及日常维护
一、系统故障记录(errorlog)
errdemon 进程在系统启动时自动运行
记录包括硬件软件及其他操作信息
故障记录文件为/var/adm/ras/errlog 可备份下来或拷贝到别的机器上分析errpt 命令的使用(普通用户权限也可使用)
#errpt |more 列出简短出错信息
ERROR_ID TIMESTAMP T C RESOURCE_NAME ERROR_DESCRIPTION
192ACror logging turned off
038F
TIMESTAMP: MMDDHHMMYY (月日时分年
T 类型: P 永久; T 临时; U 未知永久性的错误应引起重视
C 分类: H 硬件; S 软件; O 用户; U未知
#errpt -d H 列出所有硬件出错信息
#errpt -d S 列出所有软件出错信息
#errpt -aj ERROR_ID 列出详细出错信息
# errpt -aj 0502f666 <--- ERROR_ID用大小写均可,例:
LABEL: SCSI_ERR1
ID: 0502F666
Date/Time: Jun 19 22:29:51
Sequence Number: 95
Node ID: host1
Class: H
Type: PERM
Resource Name: scsi0
Resource Class: adapter
Resource Type: hscsi
Location: 00-08
VPD: <--- Virtal Product Data
Device Driver Level (00)
Diagnostic Level (00)
Displayable Message.........SCSI
EC Level....................C25928
FRU Number..................30F8834 Manufacturer................IBM97F
Part Number.................59F4566
Serial Number (00002849)
ROS Level and ID (24)
Read/Write Register Ptr (0120)
Description
ADAPTER ERROR
Probable Causes
ADAPTER HARDWARE CABLE
CABLE TERMINATOR DEVICE
Failure Causes
ADAPTER
CABLE LOOSE OR DEFECTIVE
Recommended Actions
PERFORM PROBLEM DETERMINATION PROCEDURES
CHECK CABLE AND ITS CONNECTIONS
Detail Data
SENSE DATA
0000 0000 0000 0000 0000 0000 0000 0000 0000 0000 0000 0000
二、控制面板上的LED 代码
.8 位代码通常系统故障灯会同时亮起某些机型还会同时显示故障设备位置代码
.4 位代码通常是Exxx
.3 位代码通常为0yyy 只看后3位
.8 位和4位代码可查看系统服务手册 (Service Guide)
3 位代码可查看系统诊断手册(Diagnostic Information for Multiple Bus System)
.闪动的 888, 系统崩溃硬件或软件原因造成按reset 键会显示更多内容888-102 一般为软件故障888-102-207 例外
系统会产生一个dump
888-102-xxx-0C9 系统正在做dump, 请等待
888-102-xxx-0C0 系统dump完成可关电重启
888-103 或 105
硬件故障一般有 SRN 代码及位置代码
三、其他用于收集系统信息的命令
lsdev -C 系统设备信息
#lsdev -Cc disk
hdisk0 Available 00-06-00-2,0 4.5 GB 16 Bit SCSI Disk Drive
hdisk1 Available 00-06-00-1,0 4.5 GB 16 Bit SCSI Disk Drive
hdisk2 Defined 00-06-00-4,0 16 Bit SCSI Disk Drive
lspv 查看物理卷信息
#lspv
hdisk0 0007821160af3d76 rootvg
hdisk1 000782117f571294 rootvg
hdisk2 0000000045c45bde datavg
lsvg 查看卷组信息
#lsvg datavg
VOLUME GROUP: datavg VG IDENTIFIER: 0000000055e2458b
VG STATE: active PP SIZE: 4 megabyte(s)
VG PERMISSION: read/write TOTAL PPs: 2169 (8676 megabyt
MAX LVs: 256 FREE PPs: 1 (4 megabytes)
LVs: 3 USED PPs: 2168 (8672 megabyt
OPEN LVs: 2 QUORUM: 2
TOTAL PVs: 1 VG DESCRIPTORS: 2
STALE PVs: 0 STALE PPs: 0
ACTIVE PVs: 1 AUTO ON: yes
MAX PPs per PV: 2032 MAX PVs: 16
#lsvg -l rootvg
rootvg:
LV NAME TYPE LPs PPs PVs LV STATE MOUNT POINT
hd5 boot 1 1 1 closed/syncd N/A
...
lv00 jfs 51 102 1 closed/stale /ibmcxx
lv01 jfs 1 1 1 open/syncd /cics_regions
lv02 jfs 4 4 1 open/syncd /var/mqm
lslpp 查看文件组信息
# lslpp -L |grep 23100020
....
100020.rte 4.3.2.7 C IBM PCI 10/100 Ethernet Adapt
看某个文件组是否已安装如以太网卡驱动也用于查询补丁程序的版本
lsattr 查看设备参数设置
# lsattr -El ent2
busio 0x7fffc00 Bus I/O address False
busintr 9 Bus interrupt level False
intr_priority 3 Interrupt priority False
tx_que_size 512 TRANSMIT queue size True
rx_que_size 256 RECEIVE queue size True
rxbuf_pool_size 384 RECEIVE buffer pool size True
media_speed 10_Half_Duplex Media Speed True
use_alt_addr no Enable ALTERNATE ETHERNET address True
alt_addr 0x000000000000 ALTERNATE ETHERNET address True
ip_gap 96 Inter-Packet Gap True
lscfg 查看VPD信息Virtual Product Data)
# lscfg -vl ssa1
DEVICE LOCATION DESCRIPTION
ssa1 30-68 IBM SSA Enhanced RAID Adapter
(14104500)
Part Number.................097H0645
FRU Number..................097H0645 <-- 备件号
Serial Number...............C8217227
EC Level....................0000F20825 Manufacturer................IBM053
ROS Level and ID............7201 <-- 微码版本
Loadable Microcode Level (04)
Device Driver Level (00)
Displayable Message.........SSA-ADAPTER
Device Specific.(Z0)........DRAM=032
Device Specific.(Z1)........CACHE=0
Device Specific.(Z2)........000000062955dab2
Device Specific.(YL)........P2-I7 <-- 槽号
不同的硬件设备有不同的VPD 所含的格式和信息都不一样通常备件号和微码版本最有参考价值注FRU(Field Replace Unit)才是真正的备件号。

相关文档
最新文档