AIX操作系统错误日志及日常维护

合集下载

AIX系统日志

AIX系统日志

AIX系统日志说明1、系统错误日志存放路径:/var/adm/ras/errlog说明:该日志记录了系统所检测到的软硬件故障和错误,尤其对系统的硬件故障有很大的参考价值,是AIX提供的最有价值的日志之一, errlog 文件用more或者其他文本的查看命令来打开我们看到的只是一对乱码,为了能够查看错误日志文件需要使用aix的errpt命令,如:errpt 列信息;errpt –a列详细信息,详细使用方法可以参考man,2、用户的登录日志存放路径:/var/adm/wtmp /var/adm/sulog说明:这些日志记录了用户登录和访问服务器的情况信息,具体的日志文件有wtmp、、sulog 等,它们记录的分别是不同的事件,wtmp记录的是历史的login和lognout信息,可以用last命令访问。

sulog记录的是用户用su命令转变为另一用户的信息。

who、last等这些命令可以查看wtmp和sulog的内容如:Last –f wtmp我们想查看最近10次登录的用户和他们的地址,可以用如下命令:last -103、用户的失败登录日志存放路径:/etc/security/failedlogin说明:这些日志记录了用户登录和访问服务器失败的情况信息,登录失败的情况单独记录在该日志中,可以用who命令来查看。

4、集群管理软件hacmp的日志存放路径:/tmp/hacmp.out说明:HACMP是IBM提供的确保系统运行可靠性的集群套件,HACMP在每次启动和关闭时都要经历一段时间以停止服务和转换文件系统,我们可以通过对HACMP。

OUT日志文件的跟踪实时的了解HACMP在启动和关闭时的信息,如出现启动失败则可以帮助我们定位错误。

可以使用tail进行跟踪,tail –f /tmp/hacmp.out5、系统启动错误日志存放路径:/var/adm/ras/bootlog说明:该日志可以跟踪系统在Boot过程中发生的问题,包括服务器液晶板上的代码信息都有记载。

AIX系统日常维护管理

AIX系统日常维护管理
查看硬件情况
◦ 检查设备故障灯,一般为橙色并有 标志。 ◦ 有没有异常声响,如硬盘、风扇等。 ◦ 有没有破损的电缆等
系统健康检查
检查文件系统
◦ 查看有没有“满”的文件系统。文件系统满可导致系统 不能正常工作,尤其是AIX的基本文件系统。如/ (根文 件系统)满则会导致用户不能登录。
# df -k (查看AIX的基本文件系统)
系统健康检查
磁带机
◦ 磁带机应定期清洁,每使用30小时(8mm20GB为72小时) 或至少每月清洁一次,不要等故障灯亮起后再清洁。
◦ 不同类型的带机用要不同的清洗带,不要混用。
◦ 用" /usr/lpp/diagnostics/bin/utape -c -d rmt0 -n" 可 查看磁带机使用时数。
FRU Number..................30F8834
Manufacturer................IBM97F
Part Number.................59F4566
Serial Number...............00002849
ROS Level and ID............24
系统健康检查
处理方法2:增加文件系统大小
◦ # smitty chjfs ◦ 文件系统可以在任何时候加大,前提是卷组(VG)中有剩余空间。
检查文件系统的完整性
◦ # umount filesystem_name ◦ # fsck filesystem_name ◦ # fsck -y filesystem_name
◦ 核对主机名 ◦ #hostname
系统健康检查
#ifconfig -a
en0: flags=4e080863<UP,BROADCAST,NOTRAILERS,RUNNING,SIMPLEX,MULTICAST,GROUPRT,6 4BIT,PSEG>

AIX系统日志

AIX系统日志

1、系统错误日志存放路径:/var/adm/ras/errlog说明:该日志记录了系统所检测到的软硬件故障和错误,尤其对系统的硬件故障有很大的参考价值,是AIX提供的最有价值的日志之一,errlog 文件用more或者其他文本的查看命令来打开我们看到的只是一对乱码,为了能够查看错误日志文件需要使用aix的errpt命令,如:errpt 列信息;errpt –a列详细信息,详细使用方法可以参考man,2、用户的登录日志存放路径:/var/adm/wtmp /var/adm/sulog说明:这些日志记录了用户登录和访问服务器的情况信息,具体的日志文件有wtmp、、sulog 等,它们记录的分别是不同的事件,wtmp记录的是历史的login和lognout信息,可以用last 命令访问。

sulog记录的是用户用su命令转变为另一用户的信息。

who、last等这些命令可以查看wtmp和sulog的内容如:Last –f wtmp我们想查看最近10次登录的用户和他们的地址,可以用如下命令:last -103、用户的失败登录日志存放路径:/etc/security/failedlogin说明:这些日志记录了用户登录和访问服务器失败的情况信息,登录失败的情况单独记录在该日志中,可以用who命令来查看。

4、集群管理软件hacmp的日志存放路径:/tmp/hacmp.out说明:HACMP是IBM提供的确保系统运行可靠性的集群套件,HACMP在每次启动和关闭时都要经历一段时间以停止服务和转换文件系统,我们可以通过对HACMP。

OUT日志文件的跟踪实时的了解HACMP在启动和关闭时的信息,如出现启动失败则可以帮助我们定位错误。

可以使用tail进行跟踪,tail –f /tmp/hacmp.out5、系统启动错误日志存放路径:/var/adm/ras/bootlog说明:该日志可以跟踪系统在Boot过程中发生的问题,包括服务器液晶板上的代码信息都有记载。

AIX操作系统卷组故障维护

AIX操作系统卷组故障维护

AIX操作系统卷组故障维护AIX操作系统卷组故障维护故障描述:4.20日早晨,发现日报没有正常发送,登录数据库备机查看原因,查看系统的log命令:errpt |more没有发现什么异常,不过发现有如下错误:F3931284 0410055009 I H ent2 ETHERNET NETWORK RECOVERY MODEF3931284 0410055009 I H ent0 ETHERNET NETWORK RECOVERY MODE 173C787F 0410053709 I S topsvcs Possible malfunction on local adapter173C787F 0410053709 I S topsvcs Possible malfunction on local adapterEC0BCCD4 0410053709 T H ent2 ETHERNET DOWNEC0BCCD4 0410053709 T H ent0 ETHERNET DOWN这个时间正好是同事更换以太网交换机的时间查看数据库同步脚本log:# sh /home/oracle/sh/rmanres.sh[YOU HAVE NEW MAIL]0516-040 lqueryvg: Unable to read the specified physical volumedescriptor area.0516-932 /usr/sbin/syncvg: Unable to synchronize volume group backvg.[YOU HAVE NEW MAIL]restoring datafile 00058 to /u01/oracle/product/9.2.0/oradata/orcl/yy33.dbf restoring datafile 00059 to/u01/oracle/product/9.2.0/oradata/orcl/yy34.dbfreleased channel: ch1RMAN-00571:========================================= =============== ===RMAN-00569: =============== ERROR MESSAGE STACK FOLLOWS ======== =======RMAN-00571:========================================= =============== ===RMAN-03002: failure of restore command at 04/20/2009 12:06:25ORA-19501: read error on file "/u03/orabackup/rman/orcl_db_684391660_523_1", blo ckno 8192001 (blocksize=8192)ORA-27063: skgfospo: number of bytes read/written is incorrectIBM AIX RISC System/6000 Error: 12: Not enough spaceAdditional information: -1Additional information: 1048576ORA-19501: read error on file "/u03/orabackup/rman/orcl_db_684391660_523_1", blo ckno 8191873 (blocksize=8192)ORA-27063: skgfospo: number of bytes read/written is incorrectRecovery Manager complete.[YOU HAVE NEW MAIL]SQL*Plus: Release 9.2.0.1.0 - Production on Mon Apr 20 12:06:26 2009Copyright (c) 1982, 2002, Oracle Corporation. All rightsreserved.SP2-0640: Not connectedSP2-0640: Not connectedERROR:ORA-12500: TNS:listener failed to start a dedicated server processSP2-0640: Not connectedSP2-0640: Not connected系统日志:# ps -ef |moreUID PID PPID C STIME TTY TIME CMDroot 1 0 0 Dec 16 - 0:55 /etc/initroot 61572 78170 0 Dec 16 - 359:56 dtgreetroot 69798 1 0 Dec 16 - 0:00 /usr/lib/errdemonroot 73882 1 0 Dec 16 - 71:56 /usr/sbin/syncd 60root 90242 1 0 Dec 16 - 0:00 /usr/dt/bin/dtlogin -daemon root 102438 344388 0 13:18:46 pts/7 0:00 -kshroot 118898 102438 0 13:19:03 pts/7 0:00 ps -efroot 127086 1 0 Dec 16 - 0:00 /usr/ccs/bin/shlap64root 143514 106918 0 Dec 16 - 0:00 /usr/sbin/rsct/bin/IBM.ERrmdroot 155816 106918 0 Dec 16 - 2:24 /usr/sbin/rsct/bin/IBM.CSMAgentRMd root 159976 106918 0 Dec 16 - 3:08 /usr/sbin/rsct/bin/rmcd -a IBM.LPCom mands -r root 164070 352610 0 Dec 16 - 37:11 /usr/sbin/rsct/bin/hats_nimdaemon 168160 106918 0 Dec 16 - 0:00 /usr/sbin/rpc.statd -d 0 -t 50oracle 180262 1 0 Dec 16 - 0:02 ora_reco_rmandbroot 184400 106918 0 Dec 16 - 1:01 /usr/sbin/gsclvmdoracle 205000 1 0 11:26:43 - 0:00 ora_pmon_orclroot 233570 106918 0 Dec 16 - 7:56 /usr/sbin/rsct/bin/IBM.HostRMd oracle 237696 1 0 12:29:22 - 0:00 oracleorcl (LOCAL=NO)root 241712 352610 0 Dec 16 - 50:29 /usr/sbin/rsct/bin/hats_rs232_nim root 245830 106918 0 Dec 16 - 0:00 /usr/sbin/muxatmdroot 278610 352610 0 Dec 16 - 30:31 /usr/sbin/rsct/bin/hats_nimoracle 307362 1 0 Dec 16 - 0:06 ora_d000_rmandbroot 315394 106918 0 Dec 16 - 0:10 /usr/sbin/aixmibdroot 352384 106918 0 Dec 16 - 0:05 /usr/sbin/snmpmibdroot 372834 1 0 12:13:02 - 0:00 lsvg -ooracle 389264 1 0 11:26:43 - 0:00 ora_ckpt_orclroot 393248 1 0 12:11:24 - 0:00 lsvg -oroot 397368 1 0 12:21:43 - 0:00 lsvg -oroot 405556 1 0 12:15:51 - 0:00 lspvroot 417854 450810 0 12:06:28 - 0:00 lqueryvg -g 00c64e4b00004c0000000 11dbddadf95 -CXroot 426226 1 0 12:47:15 - 0:00 lsvg statvgoracle 434210 1 0 12:07:13 - 0:00 oracleorcl (LOCAL=NO)oracle 442388 1 0 11:26:43 - 0:00 ora_lgwr_orcloracle 446680 1 0 11:26:43 - 0:00 ora_dbw0_orclroot 450810 1 0 12:06:28 - 0:00 /usr/bin/ksh /usr/sbin/varyoffvg backvg root 61802 90242 0 Dec 16 - 8:20 /usr/lpp/X11/bin/X -D /usr/lib/X11//rgb -T -force :0 -auth /var/dt/A:0-ozyiiaroot 74076 106918 0 Dec 16 - 1:34 /usr/sbin/snmpdroot 78170 90242 0 Dec 16 - 0:00 dtlogin <:0> -daemonroot 86416 106918 0 Dec 16 - 0:02 /usr/sbin/syslogdroot 94582 106918 0 Dec 16 - 0:00 /usr/sbin/inetdroot 98768 106918 0 Dec 16 - 13:14 /usr/es/sbin/cluster/clcomd -droot 106918 1 0 Dec 16 - 0:00 /usr/sbin/srcmstrroot 115134 106918 0 Dec 16 - 0:00 /usr/sbin/portmaproot 119210 1 0 Dec 16 - 0:22 /usr/sbin/cronroot 131516 1 0 Dec 16 - 0:00 /usr/sbin/uprintfdroot 139680 1 0 Dec 16 lft0 0:00 /usr/sbin/getty /dev/consoleroot 143754 102438 0 13:19:03 pts/7 0:00 moreroot 151986 106918 0 Dec 16 - 0:00 /usr/sbin/rsct/bin/IBM.ServiceRMd root 156076 106918 0 Dec 16 - 0:00 /usr/sbin/rsct/bin/IBM.AuditRMd oracle 168230 1 0 11:26:43 - 0:00 ora_d000_orcloracle 172368 1 0 11:26:43 - 0:00 ora_arc0_orcloracle 287158 1 0 11:26:43 - 0:00 ora_smon_orcloracle 299364 1 0 11:26:43 - 0:00 ora_reco_orclroot 319924 1 0 11:51:24 - 0:00 lspv hdisk5root 332234 106918 0 Dec 16 - 5:53 hagsd grpsvcsoracle 336330 1 0 Dec 16 - 5:07 ora_dbw0_rmandbroot 344388 94582 0 13:18:45 - 0:00 telnetd -aroot 352610 106918 0 Dec 16 - 55:44 /usr/sbin/rsct/bin/hatsd -n 1 -o dead ManSwitchoracle 356856 1 0 Dec 16 - 11:53 ora_ckpt_rmandboracle 360852 1 0 Dec 16 - 5:24 ora_smon_rmandbroot 369086 106918 0 Dec 16 - 51:38 /usr/es/sbin/cluster/clstrmgrroot 389556 106918 0 Dec 16 - 11:02 /usr/es/sbin/cluster/clinfooracle 393484 1 0 Dec 16 - 4:17 ora_pmon_rmandboracle 418112 1 0 Dec 16 - 0:04 /home/oracle/product/9.2.0/bin/tnslsnr LI STENER -inherit root 422200 106918 0 Dec 16 - 0:08 haemd HACMP 1 Cluster SECNOS UPPORTroot 438682 106918 0 Dec 16 - 0:05 /usr/sbin/qdaemonroot 442776 106918 0 Dec 16 - 0:00 /usr/sbin/rpc.lockd -d 0 root 446934 106918 0 Dec 16 - 0:00 /usr/sbin/writesrvroot 451032 106918 0 Dec 16 - 0:00 /usr/sbin/biod 6root 471540 106918 0 Dec 16 - 0:21 sendmail: accepting connections oracle 479602 1 0 Dec 16 - 1:33 ora_lgwr_rmandb root 491900 106918 0 Dec 16 - 0:05 /usr/sbin/hostmibdoracle 495908 1 0 11:26:43 - 0:00 ora_arc1_orcl环境:两台小机,一个存储阵列,两台机器是hacmp的有三个卷组,dbvg, statvg, backvg主机卷组dbvg备机卷组:statvgbackvg两机都可以访问,用于备份的问题描述:现在备机只要是执行和卷组,pv相关的命令就挂在那,没有反应我通过进程信息,可以判断是卷组锁定了backvg,我执行过的操作,再备机上:chvg -u backvg ,已经3个小时了,还是没有结果,挂载那然后又在备机上执行exportvg backvg 又很长时间了,一个多小时,还是挂在那,请问如何解决这个问题,解锁backvg,我在主机varyonvg backvg时,提示:# varyonvg backvg0516-013 varyonvg: The volume group cannot be varied on because there are no good copies of the descriptor area.Command: failed stdout: yes stderr: noBefore command completion, additional instructions may appear below.0516-024 lqueryvg: Unable to open physical volume.Either PV was not configured or could not be opened. Run diagnostics.0516-024 lqueryvg: Unable to open physical volume.Either PV was not configured or could not be opened. Run diagnostics.0516-1140 importvg: Unable to read the volume group descriptor area on specified physical volume.问题产生的原因:因为backvg卷组是共享卷组(不是并发卷组),在每日的04:00-05:40这段时间是数据库用backvg备份,而在每次使用卷组的时候都要更改卷组的vgda,vgsa中的时间戳,而在这段时间里同事更换了交换机,导致两个小机的卷组的VGDA不一致从而会出现这个错误解决方法:首要目的:让备机释放掉对pv,卷组的管理进程,以达到我可以从新管理备机的卷组信息由于一些原因,我强行kill掉相关LVM命令,导致这些进程都被系统接管,根本无法再kil l掉,即使用kill -9,也是不可以我当时在想有两个方法可以解决此种情况1.有一些特殊的方法可以kill掉这些进程2.重新启动机器让其释放所有资源咨询了很多人,又google半天,也没有找到可以kill那些进程的方法最后决定重启机器因为我的环境是两台小机做了hacmp,为了避免出万一,决定23号凌晨去机房维护,出什么问题也好就近解决主要是担心网卡down了,远程连接不上当到了机房,就在外边的维护室(机房太冷了!!能不进去就不进去啊), 我的hacmp配置为有优先级的cascading模式,按优先级来接管资源。

如何解决AIX的文件系统故障网络服务器-电脑资料

如何解决AIX的文件系统故障网络服务器-电脑资料

如何解决AIX的文件系统故障网络服务器-电脑资料在进行文件系统维护和管理过程中,会碰到这样一些问题,例如无法安装文件系统或者无法拆卸文件系统,当文件系统的超级块被破坏,而无法正常使用文件系统,如何修复rootvg中的主要文件系统,下面就讨论如何解决一些常见的文件系统问题,。

一、恢复超级块错误在进行文件系统维护和管理过程中,会碰到这样一些问题,例如无法安装文件系统或者无法拆卸文件系统,当文件系统的超级块被破坏,而无法正常使用文件系统,如何修复rootvg中的主要文件系统,下面就讨论如何解决一些常见的文件系统问题。

一、恢复超级块错误有些用户在使用fsck或mount命令时,当见到下面的提示信息时,可能是文件系统的超级块出了问题:<PRE>fsck: Not an AIX3 file systemfsck: Not an AIXV3 file systemfsck: Not an AIX4 file systemfsck: Not an AIXV4 file systemfsck: Not a recognized file system typemount: invalid argument</PRE>例如,当用户安装一个/allenfs文件系统时,出现下面的错误提示:<PRE>#mount /allenfs</PRE>mount: 0506-324 Cannot mount /dev/lv1 on /allenfs: A system call received a parameter that is not valid.修复该文件系统时,出现下面错误提示,并异常终止:<PRE>#fsck /dev/lv1Not a recognized filesystem type. (TER<strong>MI</STRONG>NATED)</p><p> </PRE>要解决这个问题,只能用备份的超级块来恢复主超级块,我们都知道,在文件系统中,1号逻辑块是主超级块,31号逻辑块是备份超级块,因此就把31号逻辑块上的内容写到1号逻辑块上去。

AIX操作系统错误日志及日常维护

AIX操作系统错误日志及日常维护

AIX操作系统错误日志及日常维护一、系统故障记录(errorlog)errdemon 进程在系统启动时自动运行记录包括硬件软件及其他操作信息故障记录文件为/var/adm/ras/errlog 可备份下来或拷贝到别的机器上分析errpt 命令的使用(普通用户权限也可使用)#errpt |more 列出简短出错信息ERROR_ID TIMESTAMP T C RESOURCE_NAME ERROR_DESCRIPTION192ACror logging turned off038FTIMESTAMP: MMDDHHMMYY (月日时分年T 类型: P 永久; T 临时; U 未知永久性的错误应引起重视C 分类: H 硬件; S 软件; O 用户; U未知#errpt -d H 列出所有硬件出错信息#errpt -d S 列出所有软件出错信息#errpt -aj ERROR_ID 列出详细出错信息# errpt -aj 0502f666 <--- ERROR_ID用大小写均可,例:LABEL: SCSI_ERR1ID: 0502F666Date/Time: Jun 19 22:29:51Sequence Number: 95Node ID: host1Class: HType: PERMResource Name: scsi0Resource Class: adapterResource Type: hscsiLocation: 00-08VPD: <--- Virtal Product DataDevice Driver Level (00)Diagnostic Level (00)Displayable Message.........SCSIEC Level....................C25928FRU Number..................30F8834 Manufacturer................IBM97FPart Number.................59F4566Serial Number (00002849)ROS Level and ID (24)Read/Write Register Ptr (0120)DescriptionADAPTER ERRORProbable CausesADAPTER HARDWARE CABLECABLE TERMINATOR DEVICEFailure CausesADAPTERCABLE LOOSE OR DEFECTIVERecommended ActionsPERFORM PROBLEM DETERMINATION PROCEDURESCHECK CABLE AND ITS CONNECTIONSDetail DataSENSE DATA0000 0000 0000 0000 0000 0000 0000 0000 0000 0000 0000 0000二、控制面板上的LED 代码.8 位代码通常系统故障灯会同时亮起某些机型还会同时显示故障设备位置代码.4 位代码通常是Exxx.3 位代码通常为0yyy 只看后3位.8 位和4位代码可查看系统服务手册 (Service Guide)3 位代码可查看系统诊断手册(Diagnostic Information for Multiple Bus System).闪动的 888, 系统崩溃硬件或软件原因造成按reset 键会显示更多内容888-102 一般为软件故障888-102-207 例外系统会产生一个dump888-102-xxx-0C9 系统正在做dump, 请等待888-102-xxx-0C0 系统dump完成可关电重启888-103 或 105硬件故障一般有 SRN 代码及位置代码三、其他用于收集系统信息的命令lsdev -C 系统设备信息#lsdev -Cc diskhdisk0 Available 00-06-00-2,0 4.5 GB 16 Bit SCSI Disk Drivehdisk1 Available 00-06-00-1,0 4.5 GB 16 Bit SCSI Disk Drivehdisk2 Defined 00-06-00-4,0 16 Bit SCSI Disk Drivelspv 查看物理卷信息#lspvhdisk0 0007821160af3d76 rootvghdisk1 000782117f571294 rootvghdisk2 0000000045c45bde datavglsvg 查看卷组信息#lsvg datavgVOLUME GROUP: datavg VG IDENTIFIER: 0000000055e2458bVG STATE: active PP SIZE: 4 megabyte(s)VG PERMISSION: read/write TOTAL PPs: 2169 (8676 megabytMAX LVs: 256 FREE PPs: 1 (4 megabytes)LVs: 3 USED PPs: 2168 (8672 megabytOPEN LVs: 2 QUORUM: 2TOTAL PVs: 1 VG DESCRIPTORS: 2STALE PVs: 0 STALE PPs: 0ACTIVE PVs: 1 AUTO ON: yesMAX PPs per PV: 2032 MAX PVs: 16#lsvg -l rootvgrootvg:LV NAME TYPE LPs PPs PVs LV STATE MOUNT POINThd5 boot 1 1 1 closed/syncd N/A...lv00 jfs 51 102 1 closed/stale /ibmcxxlv01 jfs 1 1 1 open/syncd /cics_regionslv02 jfs 4 4 1 open/syncd /var/mqmlslpp 查看文件组信息# lslpp -L |grep 23100020....100020.rte 4.3.2.7 C IBM PCI 10/100 Ethernet Adapt看某个文件组是否已安装如以太网卡驱动也用于查询补丁程序的版本lsattr 查看设备参数设置# lsattr -El ent2busio 0x7fffc00 Bus I/O address Falsebusintr 9 Bus interrupt level Falseintr_priority 3 Interrupt priority Falsetx_que_size 512 TRANSMIT queue size Truerx_que_size 256 RECEIVE queue size Truerxbuf_pool_size 384 RECEIVE buffer pool size Truemedia_speed 10_Half_Duplex Media Speed Trueuse_alt_addr no Enable ALTERNATE ETHERNET address Truealt_addr 0x000000000000 ALTERNATE ETHERNET address Trueip_gap 96 Inter-Packet Gap Truelscfg 查看VPD信息Virtual Product Data)# lscfg -vl ssa1DEVICE LOCATION DESCRIPTIONssa1 30-68 IBM SSA Enhanced RAID Adapter(14104500)Part Number.................097H0645FRU Number..................097H0645 <-- 备件号Serial Number...............C8217227EC Level....................0000F20825 Manufacturer................IBM053ROS Level and ID............7201 <-- 微码版本Loadable Microcode Level (04)Device Driver Level (00)Displayable Message.........SSA-ADAPTERDevice Specific.(Z0)........DRAM=032Device Specific.(Z1)........CACHE=0Device Specific.(Z2)........000000062955dab2Device Specific.(YL)........P2-I7 <-- 槽号不同的硬件设备有不同的VPD 所含的格式和信息都不一样通常备件号和微码版本最有参考价值注FRU(Field Replace Unit)才是真正的备件号。

aix系统日常维护

aix系统日常维护
当系统运行发现错误时,SRNs码(Service request numbers,服务请求码)会以xxx-xxx的形式显示在显示面板上,同时在AIX的errorlog中也会进行登记;当SSA磁盘柜出现故障时,在磁盘柜前面板的液晶显示屏上会显示相应的SRNs,同时黄色的显示灯会闪动,在AIX的errorlog中会登记相应错误信息,在出现问题后记录下代码,并告之IBM公司解决。
(1)系统故障记录
errdemon 进程在系统启动时自动运行,记录包括硬件、软件及其他操作信息,故障记录文件为/var/adm/ras/errlog,可备份下来或拷贝到别的机器上分析,使用errpt 命令(普通用户权限也可使用)。
#errpt |more 列出简短出错信息
#errpt -d H 列出所有硬件出错信息
1.系统用户的最大登录数maxlogin
maxlogin的具体大小可根据用户数设定,可以通过smitty chlicense命令修改,该参数记录在/etc/security/login.cfg文件中,修改在系统重新启动后生效。
2.系统用户的limits参数
这些参数位于/etc/security/limits文件中,可以把这些参数设为-1即无限制,可以用vi修改/etc/security/limits文件,所有修改在用户重新登录后生效。
(2)系统错误报告。
(3)检查是否有发给root用户的错误报告。
(4)检查hacmp.out,smit.log,boot.log。
(5)关键系统的文件使用率不大于80%。
(6)逻辑卷有否stale。
(7)内存交换区使用率是否超过70%。
(8)内存交换区的大小是否为物理内存的1.5倍。

AIX维护手册(详细版)

AIX维护手册(详细版)

日常简易维护与报修指南目录一、系统命令 (3)二、备份与恢复 (6)三、AIX安全 (10)四、错误日志查看 (12)五、Performance Tools (14)六、错误报告流程 (17)附录一硬件接线图 (19)附录二、IBM设备前后视图 (20)一、系统命令检查系统状态:➢系统整体: prtconf➢文件系统:df –k,df -g设备:lsdev –C 获取设备名称、状态、位置和描述。

例:查看硬盘: lsdev –Cc disk查看磁带机: lsdev –Cc tape查看适配卡: lsdev –Cc adapter处理器个数lsdev –C|grep proc系统配置lscfg –vp 获取所有已配置硬件设备的详细信息。

例:查看硬盘信息: lscfg –vl hdiskx x表示数字查看网卡信息: lscfg –vl entx x表示数字查看磁带机: lscfg –vl rmtx x表示数字查看硬件属性:lsattr –El 获取已配置设备的属性信息。

例:查看硬盘属性: lsattr –El hdiskx x表示数字查看网卡属性: lsattr –El entx x表示数字查看磁带机属性: lsattr –El rmtx x表示数字内存大小:lsattr –El mem0➢磁盘lspv➢交换分区lsps –a➢软件lslpp –l 文件包名字➢用户who关机命令:–shutdown一分钟后关机–shutdown +2二分钟后关机–shutdown –Fr关机重启(-r)关机命令调用/etc/rc.shutdown关闭程序可以在这个文件里加上你自己的脚本其它基本命令# passwdpasswd:—输入旧口令new passwd:—输入新口令re-enter new passwd:—重新输入新•mkdir/rm/mv/cd -用于创建目录/删除文件或目录/更改文件或目录名/进入某一目录•ls 显示目录中的内容(文件名)#ls –a 列出当前目录中的所有文件#ls –l 显示文件的详细信息•ps / kill 显示后台进程的有关信息或杀死后台进程#kill -9 253432•find 在一个/多个目录中查找符合条件的文件#find –name ‘t*’ -print•head/tail 显示文件头/尾声的内容#tail +200 filename•who/finger 列出系统注册/已登录的用户#who am I#finger user2光驱cdrom•加载cdrom•使用:mount -rv cdrfs /dev/cd0 /cdrom–或者创建一个CD-ROM文件系统并进行加载•smit cdrf s•mount /cdrom•卸载cdrom– unmount /cdrom二、备份与恢复rootvg备份—mksysb●只备份rootvg●只备份已挂接的文件系统●以备份格式创建可启动磁带●保存rootvg中的换页空间设备定义●保存逻辑卷策略●备份时应使活动的用户和应用减至最少注:mksysb创建操作系统备份,如果rootvg中有用户创建的文件系统,只要它已挂接,也被备份,用户创建的不含文件系统的逻辑卷内容及定义不备份。

AIX操作系统运行维护手册-Ver11

AIX操作系统运行维护手册-Ver11

AIX操作系统工作手册修改履历目录1引言 (4)1.1编写目的 (4)1.2适用范围 (5)1.3预期读者 (5)1.4文档说明 (5)2操作系统健康性检查 (5)2.1系统日志 (6)2.1.1系统硬件错误日志检查 (6)2.1.2系统所有错误日志检查 (7)2.1.3系统错误日志Core_dump检查 (8)2.1.4系统错误日志DELAYED_INT检查 (8)2.1.5系统邮件日志内容检查 (9)2.1.6系统邮件日志大小检查 (10)2.1.7登录失败日志文件大小检查 (11)2.1.8登录日志文件大小检查 (11)2.1.9su日志文件大小检查 (12)2.1.10异常终止的vi日志文件大小检查 (13)2.2系统性能 (13)2.2.1系统CPU使用率检查 (13)2.2.2查看占用CPU资源最多的进程 (17)2.2.3系统内存使用率检查 (17)2.2.4系统占用内存资源最多的进程 (19)2.2.5系统磁盘繁忙程度检查 (21)2.3交换空间 (23)2.3.1交换空间使用率检查 (23)2.4进程状态 (23)2.4.1僵尸进程检查 (23)2.5网络状态 (24)2.5.1网卡状态检查 (24)2.5.2路由状态检查 (25)2.5.3网络传输检查 (26)2.5.4网络连接数量及状态检查 (29)2.5.5主机解析检查 (31)2.6存储状态 (31)2.6.1HBA卡状态检查 (31)2.7文件系统状态 (32)2.7.1文件系统使用率检查 (32)2.7.2文件系统挂载检查 (33)2.7.3NFS文件系统挂载检查 (34)2.7.4dump设备空间检查 (34)2.8逻辑卷状态 (35)2.8.1Rootvg的剩余空间检查 (35)2.8.2PV状态检查 (36)2.8.3是否存在stale的pp检查 (36)2.9系统安全 (37)2.9.1系统登录情况检查 (37)2.9.2特权用户检查 (38)2.9.3Su操作次数检查 (38)2.9.4失败登录记录检查 (39)2.10双机状态 (40)2.10.1双机心跳状态检查 (40)2.10.2Hacmp.out日志检查 (41)2.10.3Cluster.log日志检查 (41)2.10.4双机节点状态检查 (42)2.11其它 (42)2.11.1操作系统时间检查 (42)3操作系统异常快速排查规范 (43)3.1系统日志检查 (43)3.2CPU使用率检查 (44)3.3内存使用率检查 (44)3.4I/O使用率检查 (45)3.5网络检查 (45)3.6交换区检查 (46)3.7文件系统检查 (46)3.8双机检查 (47)1引言1.1 编写目的为了保证项目组所运维系统的持续健康运行,降低操作系统的出错几率,并在出现问题时及时且有效的进行排查、处理,故编写本手册。

AIX操作系统维护手册

AIX操作系统维护手册

AIX系统维护手册一:AIX系统日常管理1.文件系统是否满管理员需经常查看文件系统,以防止使用率过高导致的问题.方法: df –k 可以以K为单位检查文件系统的使用率。

(90%以上,需要调整)2.检查系统出错日志使用errpt |more来检查清除现有的log: Errclear 03.检查系统合法/非法登陆情况使用Last命令来检查来自登陆的地方。

4.检查系统是否有巨大的Core文件生成使用 find / -name core –print来检查。

对Core文件,一般直接删除就可以了。

5、系统进程管理ps命令是UNIX系统中最常见的命令,它主要显示系统中关于进程的统计和状态信息,如进程ID,I/O行为以及CPU利用率等。

利用ps命令提供的信息,可决定一个进程运行了多长时间,进程使用了多少CPU时间,以及进程是否受系统的惩罚。

还可用ps命令确定进程使用了多少内存,完成多少I/O,进程的优先级以及是谁创建了进程。

下面这几个命令组合对于管理RS/6000 AIX系统有帮助:(1)显示10个消耗CPU最多的进程:# ps aux |head -1 ;ps aux |sort -rn +2 |head –10(2)显示10个消耗存储空间最多的进程:# ps aux |head -1 ;ps aux |sort -rn +3 |head -10(3)按顺序显示系统中受罚的进程:#ps -eakl |head -1 ;ps -eakl |sort -rn +5(4)按优先级顺序显示系统中的进程:#ps -eakl |sort -n +6 |head(5)按处理时间为顺序显示系统中的前十个进程:#ps vx |head -1 ;ps vx |grep -v PID |sort -rn +3 |head –10(6)按实际内存使用的多少顺序显示系统中的前十个进程:#ps vx |head -1 ;ps vx |grep -v PID |sort -rn +6 |head –10(7)按换入页面的多少顺序显示系统中的前10个进程:#ps vx |head -1 ;ps vx |grep -v PID |sort -rn +4 |head -10二:AIX的系统备份和恢复备份和恢复是系统管理员经常要做的事情, 主要包括rootvg备份和用户数据备份.1. 操作系统和系统程序的备份:将一盘新磁带或无用磁带插入磁带机#tctl -f /dev/rmt0 rewind#smit mksysb在"备份设备或文件"中添入"/dev/rmt0"后回车.系统会运行很长时间, 等到屏幕显示OK后拿出磁带. 这时候, 系统备份完成. 注意: mksysb仅备份rootvg中已安装的文件系统.2. 用户数据备份·常用磁带机选项/dev/rmt0: 若选择/dev/rmt0, 在插入磁带和写完一次磁带时, 磁带机都将磁带反绕到头.因此, 下一次备份文件将覆盖本次备份./dev/rmt0.1: 若选择/dev/rmt0.1, 则插入磁带和写完一次磁带时, 磁带机均不反绕磁带.因此, 一盘磁带可以连续备份几个文件或文件系统.· #smit fs选择"备份文件系统"添入要备份的"文件系统名称"添入"/dev/rmt0.1"重复上述操作即可在同一盘磁带上备份多个文件系统.3. rootvg的恢复·启动机器进入维护模式参见安装手册, 当出现"Welcome to Base Operating System Installation and Maintanence"时,选3 "Start Maintenance Mode for System Recovery"·恢复系统继续选4 "Install from a System Backup"出现"Choose mksysb Device"画面, 选"/dev/rmt0"并插入磁带后回车.这时候, 系统自动恢复操作系统.4. 用户数据恢复#tctl -f /dev/rmt0 rewind#smit fs选择"恢复文件系统"添入"设备名称"和"目标目录"系统会自动找到相应目录恢复.三.日志清理问题:减小 /var/adm/wtmp 文件的大小?答案:文件 /var/adm/wtmp 的大小会在每次用户登录时增长, 但从不自动减小. wtmp 文件的内容会被命令 last 使用, 用于显示登录系统和重启机器的情况.该文件不能被删除, 但它的内容可用如下命令清除:# > /var/adm/wtmp四.HACMP类命令1.启动HACMP#smitty clstart2.关闭HACMP#smitty clstop3.查看HACMP的状态#smitty clstat4.查看HACMP的拓扑结构#/usr/sbin/cluster/utilities/cltopinfo。

Aix系统基本的日常维护

Aix系统基本的日常维护

Aix系统基本的日常维护1.文件系统监控:a) 文件系统是否满:使用df –k 可以以K为单位检查文件系统的使用率。

(90%以上,需要调整)要扩充空间,先用lsvg vgname查看是否有足够的free pps数目。

b) 用lsfs查看所有文件系统有无异常。

若vfs参数显示为???,即odm对某个文件系统的记录与超极块记录不同步。

解决方法:synclvodm lvname和syncvg -v vgname。

2.检查系统出错日志:a) errpt |more来大概检查。

主要查看C参数,H表示hardware问题;S表示software问题;U表示unknown 问题;O表示系统的正常operate,可不去管它。

b) errpt -a|more或errpt -aj errrID来详细检查。

c) 清除现有的log: Errclear 03.用户安全监控:a) /etc/security/failedlogin-->记录失败login的log。

用who命令读取此文件。

b) /var/adm/wtmp-->记录成功login的log。

用who命令读取此文件。

c) /var/adm/sulog-->记录su的log。

用more命令读取此文件。

d) 需要检查某个用户最后来自登陆的IP。

读取/etc/security/lastlog查看。

e) 使用who和w和finger和last命令查看用户login信息。

4.检查系统是否有巨大的Core文件生成:使用find / -name “core”–print来检查。

使用find / -name “core”-exec rm {} \; 来定期删除。

5.系统性能检查:a) CPU性能:使用Vmstat, topas来检查b) 内存使用情况:也是使用topas, vmstat来检查c) 检查IO平衡使用情况:使用iostat来检查d) 交换空间使用情况:使用lsps –a来检查6.邮件查看:定期检查Mail,特别是系统daemon发的错误和警告信息。

IBM AIX日常维护及故障处理汇总

IBM AIX日常维护及故障处理汇总

第一类、机房环境及物理检查一、机房内环境要求1. 温度与湿度:最佳工作温度:20-25摄氏度极限工作温度:10-40摄氏度湿度: 8-80%(在23摄氏度条件下)如果不是工作在最佳温度,请注意改善机房环境2. 同时机房要保证清洁.机房应保持清洁,若空气灰尘过多,很容易造成资源读写错误及磁盘机中磁盘或读写磁头毁损。

二、电源要求电压: 要求电压稳定, 尖峰电压会损坏设备电压范围: 220V +/- 10%, 即200-240V, 50-60Hz电源功率: 视机器类型和系统配置而定电源线 : 标准的零, 地, 火三相电, 其中零, 地电压不得超过3.0V.电源接驳: 用符合电流要求的空气开关或其他设备和主机电源线接驳,保证计算机系统的可靠工作应使用稳压电源和UPS,并建议配备发电机组;对于冗于电源的接入,建议采用两路单独输入.三、硬件检查]检查服务器、磁阵的安装、电源线、7133和主机接线符合要求。

服务器状态检查:1. 当服务器处于启动和正常工作状态时,其前面板上的液晶显示屏上应无信息显示。

2. 当液晶显示器上出现带数字和字母的信息时,说明有硬件告警。

可以通过查询相关机型的Service Guide查到相应告警原因,情况严重的,则要立即通知IBM技术专家进行问题排查。

7133状态检查:磁阵前面板上有7133机柜的状态灯(与电源灯并排)和各硬盘的状态灯(一排小灯,与各硬盘位置一一对应)。

1. 当机柜的状态灯出现橙黄色时,说明有硬件告警,此时要检查磁柜的电源、接线、硬盘等。

如果有硬件故障则立即进行更换和更正,如果查不出具体问题,则需要联系相关专家进一步诊断。

2. 当硬盘工作正常时,与各硬盘对应的硬盘灯会呈绿色,如无读写,则绿灯一直亮,如该硬盘有读写操作,则绿灯会不规则闪烁,当硬盘损坏时或SSA环路出现问题时,则硬盘状态灯将熄灭,或者呈闪烁状态:以1~3秒的频率有规律地、不停地闪烁第二类、系统日常维护流程2.1系统启动系统启动正常顺序如下:首先对外设(磁盘阵列、磁带库等)加电。

AIX常见故障报错及解决方案

AIX常见故障报错及解决方案

AIX 常见故障报错及解决方案大多数情况下,顺着报错顺藤摸瓜很快就能找出原因,但总有例外,有些报错信息或者日志恰恰让我们南辕北辙。

让我们看看这些案例最终是如何处理的……案例1:图省事,搞出来个大麻烦生产中心有几套VIOS环境,正常运行了1-2年,今日发现有2套进行健康性检查,发现执行命令就hang在哪里不动了,又是内存不够用了。

"0403-031 The forkfunction failed. There is not enough memory available."好奇怪,到底内存被谁用了,vios好端端的就这样了。

都这个样子,重启vios分区吧。

重启完,vios顺利登陆,执行健康性检查没啥问题,可是用nmon看了一下内存使用分配了4个G,使用1个多G,慢慢慢慢的就看到内存使用越来越大,不一会4个G就用完了,重启其他vios分区一个样子,连换页空间都用了。

顿时一头雾水。

到底发生了什么呢?生产中心有几套VIOS环境,正常运行了1-2年.突然出现这种问题,首先想到的是变更。

梳理了近期变更操作,近期新部署了PowerVC,VIOS进行了补丁升级。

VIOS2.1升级到VIOS2.2.3.首先,重启vios分区,在内存没有用完前赶紧检查那个进程使用的内存.排名第一的是vio_daemon,观察了一会发现内存一会就被他占用完了第二,元凶找到了,vio_daemon到底是干啥的,问问IBM800吧,IBM回复问我收集一下系统信息。

1.ioslevel2./etc/security/limits的输出反馈后,IBM告诉我,我遇到了bugvios版本和 /etc/security/limits stack = -1完全符合这个bug特征。

其实这个bug是可以避免的,我们大多数实施AIX的时候,很容易顺手把/etc/security/limits.都改成-1,在大多数情况下,没啥问题,但是就是在这个版本下就容易遇到这个问题。

aix_日常管理以及故障处理

aix_日常管理以及故障处理

aix_日常管理以及故障处理故障的处理RS6000 Admin & PD内容提要"日常管理"故障的处理"系统健康检查"查看硬件情况"检查设备故障灯,一般为橙色并有"有没有异常声响,如硬盘、风扇等。

"有没有破损的电缆等"查看系统故障信息"用errpt命令查看系统出错信息。

"用mail命令查看有否发给root用户的错误报告。

"查看其他的记录文件,如/tmp/hacmp.out。

"检查文件系统"查看有没有“满”的文件系统。

文件系统满可导致系统不能正常工作,尤其是AIX的基本文件系统。

如/ (根文件系统)满则会导致用户不能登录。

"系统健康检查# df -k (查看AIX的基本文件系统)Filesystem 1024-blocks Free %Used Iused %Iused Mounted on /dev/hd4 24576 1452 95%2599 22% //dev/hd2 614400 28068 96% 22967 15% /usr/dev/hd9var 8192 4540 45% 649 32% /var/dev/hd3 167936 157968 6% 89 1% /tmp/dev/hd1 16384 5332 68% 1402 35% /home除/usr文件系统,其他文件系统都不应太满,一般不超过80%。

处理方法1:删除垃圾文件# du -sk * |sort -rn |head查找出当前目录下占空间最大的子目录,逐层往下直到找出占空间最大的文件。

(要区分哪些目录是文件系统的mount point,哪些是文件系统的子目录)删除文件,释放空间。

有时删除文件后空间并不马上释放,这是由于你删除的文件正被某个程序打开。

只有当这个程序停止后空间才释放,有时甚至需要重起系统。

(零收费)AIX系统日常维护与故障的解决

(零收费)AIX系统日常维护与故障的解决

0104143100 T S SYSPROC
9DBCFDEE
0104143300 T O errdemon
192AC071
0104143000 T O errdemon
C60BB505
0104105800 P S SYSPROC
参数详解
标识‘’:错误归类 :硬件 :软件 :系统信息已经记录 :不能确定 标识‘’:错误类型 (并且为):显示系统遇到硬件问题并且无法自动修复 (并且为):系统硬件变为不可用并引起一系列错误系统 (并且为):显示系统遇到软件问题并且无法自动修复 (并且为):显示系统遇到软件问题并且已经自动修复
2CCF66F7
0105111300 T H bl0
2BFA76F6
0105111100 T S SYSPROC
9DBCFDEE
0105111300 T O errdemon
192AC071
0104174500 T O errdemon
2CCF66F7
0104143300 T H bl0
2BFA76F6
检查内存交换区( )使用率 使用率不要超过。 增加交换区,或增加内存。 观察内存大小的命令: –

系统管理日常健康检查与监控
网络检查 查看网卡状态 和 是否> 注:是指从这个网卡发出去错误包数目的统计
是指从这个网卡发出去的包个数的统计。 看它们是否>应该是指网络质量好坏。 查看是否通和是否有丢包。 路由表 查看路由表是否正确, 各路由器是否通。 核对主机名
系统管理日常健康检查与监控
检查文件系统 查看有没有“满”的文件系统。文件系统满可导致系统不能正常工作,

AIX系统维护手册

AIX系统维护手册

IBM AIX维护手册目录AIX系统维护手册 (1)1、系统配置 (3)2、AIX操作系统基本命令 (4)2.1、系统的进入和退出 (4)2.2、修改系统密码 (5)2.3、m k d i r、r m、m v和c d (5)2.4、列出文件l s (6)2.5、显示日期d a t e (7)2.6、查看登陆用户w h o (7)2.7、查看系统进程p s (7)2.8、终止进程k i l l (9)2.9、查找文件f i n d (9)2.10、查找指定字符g r e p (10)3、vi编辑器 (11)3.1、v i简介 (11)3.2、v i的进入与离开 (11)3.3、v i的文本输入模式 (11)3.4、v i基本编辑命令 (12)3.5、文件处理子命令 (14)4、硬件设备维护命令 (14)4.1、显示设备一般信息l s d e v (14)4.2、显示设备属性l s a t t r (15)4.3、显示整机信息l s c o n f (16)4.4、搜索可用的新硬件c f g m g r (18)4.5、删除硬件设备 (18)4.6、修改硬件设备属性 (18)4.7、磁盘更换 (18)4.7.1、查看rootvg中是否存在镜像 (18)4.7.2、确定rootvg中的磁盘 (19)4.7.3、确定需要更换哪块磁盘 (19)4.7.4、取消磁盘镜像 (20)4.7.5、把坏盘从rootvg中去掉 (20)4.7.6、把坏盘从系统中去掉 (20)4.7.7、更换新磁盘 (20)4.7.8、重新认新磁盘 (20)4.7.9、使新磁盘可用 (20)4.7.10、把新磁盘重新加入到rootvg卷组中 (21)4.7.11、为rootvg重做镜像 (21)4.7.12、重新设置磁盘引导区 (21)4.7.13、设置系统引导顺序 (21)5、用户管理 (21)5.1、增加用户 (21)5.2、修改用户密码 (22)5.3、修改用户信息 (22)5.4、删除用户 (22)6、网络管理 (22)6.1、查看网络状态和流量 (22)6.2、查看网卡接口状态 (24)6.3、启动网络服务 (25)6.4、配置本地主机名解释 (25)6.5、免密码远程登陆 (25)6.6、修改i p地址 (26)7、系统日常管理 (26)7.1、查看文件系统 (26)7.2、查看系统登陆记录 (27)7.3、检查系统c p u使用率 (27)7.4、查看I O使用情况 (29)7.5、查看交换空间 (30)7.6、管理交换空间 (31)7.7、查看系统安装的软件 (31)7.8、查看系统补丁及维护等级 (32)7.9、查看系统错误日志信息 (32)8、系统关机 (34)8.1、系统正常关机 (34)8.2、快速关机 (34)8.3、紧急情况关机 (34)8.4、重新启动系统 (34)9、双机维护命令 (35)9.1、启动H A C M P (35)9.2、关闭H A C M P (35)9.3、查看H A C M P状态 (36)1、系统信息本次项目中配备了2台IBM p5 561小型机,两台主机的配置如下:设备 小型机A硬件配置信息机型号 I B M p5561C P U4颗1.8G H z P O W E R5+P r o c e s s o r C P U,内存 16G B硬盘 2块146.8G B15,000转 U l t r a320S C S I硬盘光纤通道卡 2块4G B P C I-X光纤通道卡(H B A卡)异步卡 1块双口异步I E A-232P C I卡光驱 D V D光驱H A C M P H A C M P V5.4集群软件操作系统 A I X5L5.3设备 小型机B硬件配置信息机型号 I B M p5561C P U8颗1.8G H z P O W E R5+P r o c e s s o r C P U,内存 32G B硬盘 4块146.8G B15,000转 U l t r a320S C S I硬盘光纤通道卡 2块4G B P C I-X光纤通道卡(H B A卡)异步卡 1块双口异步I E A-232P C I卡光驱 D V D光驱H A C M P H A C M P V5.4集群软件操作系统 A I X5L5.3系统配置信息:系统信息主机名 S A P1S A P2操作系统 A I X5.3T L06S P03A I X5.3T L06S P03管理员 r o o t r o o t初始密码 r o o t r o o t内置磁盘 h d i s k0、h d i s k1h d i s k0、h d i s k1外置磁盘 h d i s k2~h d i s k13h d i s k2~h d i s k13卷组 d b v g、a p p v g d b v g、a p p v g网关网络接口 e n0e n0I P地址 10.10.10.1172.16.36.9网络掩码 255.255.255.0255.255.255.0网络接口 e n1e n2I P地址 172.16.36.710.10.10.2网络掩码 255.255.255.0255.255.255.0网络接口 e n2e n3I P地址 10.10.20.110.10.20.2网络掩码 255.255.255.0255.255.255.02、AIX操作系统基本命令2.1、系统的进入和退出登陆AIX系统可以通过telnet来登陆,首先需要配置一台PC,能够与以上所列出的任一网络地址连通。

AIX操作系统错误日志及日常维护

AIX操作系统错误日志及日常维护

A I X操作系统错误日志及日常维护一、系统故障记录(errorlog)errdemon 进程在系统启动时自动运行记录包括硬件软件及其他操作信息故障记录文件为/var/adm/ras/errlog 可备份下来或拷贝到别的机器上分析errpt 命令的使用(普通用户权限也可使用)#errpt |more 列出简短出错信息ERROR_ID TIMESTAMP T C RESOURCE_NAME ERROR_DESCRIPTION192ACror logging turned off038FTIMESTAMP: MMDDHHMMYY (月日时分年T 类型: P 永久; T 临时; U 未知永久性的错误应引起重视C 分类: H 硬件; S 软件; O 用户; U未知#errpt -d H 列出所有硬件出错信息#errpt -d S 列出所有软件出错信息#errpt -aj ERROR_ID 列出详细出错信息# errpt -aj 0502f666 <--- ERROR_ID用大小写均可,例:LABEL: SCSI_ERR1ID: 0502F666Date/Time: Jun 19 22:29:51Sequence Number: 95Node ID: host1Class: HType: PERMResource Name: scsi0Resource Class: adapterResource Type: hscsiLocation: 00-08VPD: <--- Virtal Product DataDevice Driver Level (00)Diagnostic Level (00)Displayable Message.........SCSIEC Level....................C25928FRU Number..................30F8834Manufacturer................IBM97FPart Number.................59F4566Serial Number (00002849)ROS Level and ID (24)Read/Write Register Ptr (0120)DescriptionADAPTER ERRORProbable CausesADAPTER HARDWARE CABLECABLE TERMINATOR DEVICEFailure CausesADAPTERCABLE LOOSE OR DEFECTIVERecommended ActionsPERFORM PROBLEM DETERMINATION PROCEDURESCHECK CABLE AND ITS CONNECTIONSDetail DataSENSE DATA0000 0000 0000 0000 0000 0000 0000 0000 0000 0000 0000 0000二、控制面板上的LED 代码.8 位代码通常系统故障灯会同时亮起某些机型还会同时显示故障设备位置代码.4 位代码通常是Exxx.3 位代码通常为0yyy 只看后3位.8 位和4位代码可查看系统服务手册 (Service Guide)3 位代码可查看系统诊断手册(Diagnostic Information for Multiple Bus System).闪动的 888, 系统崩溃硬件或软件原因造成按reset 键会显示更多内容888-102 一般为软件故障888-102-207 例外系统会产生一个dump888-102-xxx-0C9 系统正在做dump, 请等待888-102-xxx-0C0 系统dump完成可关电重启888-103 或 105硬件故障一般有 SRN 代码及位置代码三、其他用于收集系统信息的命令lsdev -C 系统设备信息#lsdev -Cc diskhdisk0 Available 00-06-00-2,0 4.5 GB 16 Bit SCSI Disk Drivehdisk1 Available 00-06-00-1,0 4.5 GB 16 Bit SCSI Disk Drivehdisk2 Defined 00-06-00-4,0 16 Bit SCSI Disk Drivelspv 查看物理卷信息#lspvhdisk0 0007821160af3d76 rootvghdisk1 000782117f571294 rootvghdisk2 0000000045c45bde datavglsvg 查看卷组信息#lsvg datavgVOLUME GROUP: datavg VG IDENTIFIER: 0000000055e2458bVG STATE: active PP SIZE: 4 megabyte(s)VG PERMISSION: read/write TOTAL PPs: 2169 (8676 megabytMAX LVs: 256 FREE PPs: 1 (4 megabytes)LVs: 3 USED PPs: 2168 (8672 megabytOPEN LVs: 2 QUORUM: 2TOTAL PVs: 1 VG DESCRIPTORS: 2STALE PVs: 0 STALE PPs: 0ACTIVE PVs: 1 AUTO ON: yesMAX PPs per PV: 2032 MAX PVs: 16#lsvg -l rootvgrootvg:LV NAME TYPE LPs PPs PVs LV STATE MOUNT POINThd5 boot 1 1 1 closed/syncd N/A...lv00 jfs 51 102 1 closed/stale /ibmcxxlv01 jfs 1 1 1 open/syncd /cics_regionslv02 jfs 4 4 1 open/syncd /var/mqmlslpp 查看文件组信息# lslpp -L |grep 23100020....100020.rte 4.3.2.7 C IBM PCI 10/100 Ethernet Adapt看某个文件组是否已安装如以太网卡驱动也用于查询补丁程序的版本lsattr 查看设备参数设置# lsattr -El ent2busio 0x7fffc00 Bus I/O address Falsebusintr 9 Bus interrupt level Falseintr_priority 3 Interrupt priority Falsetx_que_size 512 TRANSMIT queue size Truerx_que_size 256 RECEIVE queue size Truerxbuf_pool_size 384 RECEIVE buffer pool size Truemedia_speed 10_Half_Duplex Media Speed Trueuse_alt_addr no Enable ALTERNATE ETHERNET address Truealt_addr 0x000000000000 ALTERNATE ETHERNET address Trueip_gap 96 Inter-Packet Gap Truelscfg 查看VPD信息Virtual Product Data)# lscfg -vl ssa1DEVICE LOCATION DESCRIPTIONssa1 30-68 IBM SSA Enhanced RAID Adapter(14104500)Part Number.................097H0645FRU Number..................097H0645 <-- 备件号Serial Number...............C8217227EC Level....................0000F20825 Manufacturer................IBM053ROS Level and ID............7201 <-- 微码版本Loadable Microcode Level (04)Device Driver Level (00)Displayable Message.........SSA-ADAPTERDevice Specific.(Z0)........DRAM=032Device Specific.(Z1)........CACHE=0Device Specific.(Z2)........000000062955dab2Device Specific.(YL)........P2-I7 <-- 槽号不同的硬件设备有不同的VPD 所含的格式和信息都不一样通常备件号和微码版本最有参考价值注FRU(Field Replace Unit)才是真正的备件号。

  1. 1、下载文档前请自行甄别文档内容的完整性,平台不提供额外的编辑、内容补充、找答案等附加服务。
  2. 2、"仅部分预览"的文档,不可在线预览部分如存在完整性等问题,可反馈申请退款(可完整预览的文档不适用该条件!)。
  3. 3、如文档侵犯您的权益,请联系客服反馈,我们会尽快为您处理(人工客服工作时间:9:00-18:30)。

AIX操作系统错误日志及日常维护一、系统故障记录(errorlog)errdemon 进程在系统启动时自动运行记录包括硬件软件及其他操作信息故障记录文件为/var/adm/ras/errlog 可备份下来或拷贝到别的机器上分析errpt 命令的使用(普通用户权限也可使用)#errpt |more 列出简短出错信息ERROR_ID TIMESTAMP T C RESOURCE_NAME ERROR_DESCRIPTION192AC071 0723100300 T 0 errdemon Error logging turned off0E017ED1 0720131000 P H mem2 Memory failure9DBCFDEE 0701000000 T 0 errdemon Error logging turned on038F2580 0624131000 U H scdisk0 UNDETERMINED ERRORAA8AB241 0405130900 T O OPERATOR OPERATOR NOTIFICATION TIMESTAMP: MMDDHHMMYY (月日时分年T 类型: P 永久; T 临时; U 未知永久性的错误应引起重视C 分类: H 硬件; S 软件; O 用户; U未知#errpt -d H 列出所有硬件出错信息#errpt -d S 列出所有软件出错信息#errpt -aj ERROR_ID 列出详细出错信息# errpt -aj 0502f666 <--- ERROR_ID用大小写均可,例:LABEL: SCSI_ERR1ID: 0502F666Date/Time: Jun 19 22:29:51Sequence Number: 95Machine ID: 123456789012Node ID: host1Class: HType: PERMResource Name: scsi0Resource Class: adapterResource Type: hscsiLocation: 00-08VPD: <--- Virtal Product DataDevice Driver Level (00)Diagnostic Level (00)Displayable Message.........SCSIEC Level....................C25928FRU Number..................30F8834 Manufacturer................IBM97FPart Number.................59F4566Serial Number (00002849)ROS Level and ID (24)Read/Write Register Ptr (0120)DescriptionADAPTER ERRORProbable CausesADAPTER HARDWARE CABLECABLE TERMINATOR DEVICEFailure CausesADAPTERCABLE LOOSE OR DEFECTIVERecommended ActionsPERFORM PROBLEM DETERMINATION PROCEDURESCHECK CABLE AND ITS CONNECTIONSDetail DataSENSE DATA0000 0000 0000 0000 0000 0000 0000 0000 0000 0000 0000 0000二、控制面板上的LED 代码.8 位代码通常系统故障灯会同时亮起某些机型还会同时显示故障设备位置代码.4 位代码通常是Exxx.3 位代码通常为0yyy 只看后3位.8 位和4位代码可查看系统服务手册 (Service Guide)3 位代码可查看系统诊断手册(Diagnostic Information for Multiple Bus System).闪动的 888, 系统崩溃硬件或软件原因造成按reset 键会显示更多内容888-102 一般为软件故障888-102-207 例外系统会产生一个dump888-102-xxx-0C9 系统正在做dump, 请等待888-102-xxx-0C0 系统dump完成可关电重启888-103 或 105硬件故障一般有 SRN 代码及位置代码三、其他用于收集系统信息的命令lsdev -C 系统设备信息#lsdev -Cc diskhdisk0 Available 00-06-00-2,0 4.5 GB 16 Bit SCSI Disk Drivehdisk1 Available 00-06-00-1,0 4.5 GB 16 Bit SCSI Disk Drivehdisk2 Defined 00-06-00-4,0 16 Bit SCSI Disk Drivelspv 查看物理卷信息#lspvhdisk0 0007821160af3d76 rootvghdisk1 000782117f571294 rootvghdisk2 0000000045c45bde datavglsvg 查看卷组信息#lsvg datavgVOLUME GROUP: datavg VG IDENTIFIER: 0000000055e2458bVG STATE: active PP SIZE: 4 megabyte(s)VG PERMISSION: read/write TOTAL PPs: 2169 (8676 megabytMAX LVs: 256 FREE PPs: 1 (4 megabytes)LVs: 3 USED PPs: 2168 (8672 megabytOPEN LVs: 2 QUORUM: 2TOTAL PVs: 1 VG DESCRIPTORS: 2STALE PVs: 0 STALE PPs: 0ACTIVE PVs: 1 AUTO ON: yesMAX PPs per PV: 2032 MAX PVs: 16#lsvg -l rootvgrootvg:LV NAME TYPE LPs PPs PVs LV STATE MOUNT POINThd5 boot 1 1 1 closed/syncd N/A...lv00 jfs 51 102 1 closed/stale /ibmcxxlv01 jfs 1 1 1 open/syncd /cics_regionslv02 jfs 4 4 1 open/syncd /var/mqmlslpp 查看文件组信息# lslpp -L |grep 23100020....devices.pci.23100020.rte 4.3.2.7 C IBM PCI 10/100 Ethernet Adapt 看某个文件组是否已安装如以太网卡驱动也用于查询补丁程序的版本lsattr 查看设备参数设置# lsattr -El ent2busio 0x7fffc00 Bus I/O address Falsebusintr 9 Bus interrupt level Falseintr_priority 3 Interrupt priority Falsetx_que_size 512 TRANSMIT queue size Truerx_que_size 256 RECEIVE queue size Truerxbuf_pool_size 384 RECEIVE buffer pool size Truemedia_speed 10_Half_Duplex Media Speed Trueuse_alt_addr no Enable ALTERNATE ETHERNET address Truealt_addr 0x000000000000 ALTERNATE ETHERNET address Trueip_gap 96 Inter-Packet Gap Truelscfg 查看VPD信息Virtual Product Data)# lscfg -vl ssa1DEVICE LOCATION DESCRIPTIONssa1 30-68 IBM SSA Enhanced RAID Adapter(14104500)Part Number.................097H0645FRU Number..................097H0645 <-- 备件号Serial Number...............C8217227EC Level....................0000F20825 Manufacturer................IBM053ROS Level and ID............7201 <-- 微码版本Loadable Microcode Level (04)Device Driver Level (00)Displayable Message.........SSA-ADAPTERDevice Specific.(Z0)........DRAM=032Device Specific.(Z1)........CACHE=0Device Specific.(Z2)........000000062955dab2Device Specific.(YL)........P2-I7 <-- 槽号不同的硬件设备有不同的VPD 所含的格式和信息都不一样通常备件号和微码版本最有参考价值注FRU(Field Replace Unit)才是真正的备件号。

相关文档
最新文档