常用PC服务器阵列卡、硬盘健康监控 叶金荣
通常,我们使用的DELL/HP/IBM三家的机架式PC级服务器阵列卡是从LSI的卡OEM出来的,DELL和IBM两家的阵列卡原生程度较高,没有做太多封装,可以用原厂提供的阵列卡管理工具进行监控;而HP的阵列卡一般都做过封装了,因此需要使用自身特有的管理工具来监控。
本文以几种常用的阵列卡为例,展示其阵列卡及硬盘监控的方法。
DELL SAS 6/iR卡,全称LSI Logic SAS1068E,只支持RAID 0, RAID 1, RAID 1+0, 不支持RAID 5等高级RAID特性,不支持阵列卡电池。
DELL PERC PERC H700卡,全称LSI Logic MegaRAID SAS 2108,支持各种RAID级别及高级特性,可选配阵列卡电池。
DELL PERC H310 Mini卡,全称LSI Logic / Symbios Logic MegaRAID SAS 2008,支持常见RAID级别,不支持高级RAID特性,不支持阵列卡电池。
IBM ServeRAID M5014 SAS/SATA Controller卡,全称LSI Logic / Symbios Logic MegaRAID SAS 2108,支持各种RAID级别及高级特性,可选配阵列卡电池。
IBM ServeRAID-MR10i SAS/SATA Controller卡,全称LSI Logic / Symbios Logic MegaRAID SAS 1078,支持常见RAID级别,不支持高级RAID特性,可选配阵列卡电池,这个卡其实和DELL的PERC 6/i卡是一样的,都是基于LSI MegaRAID SAS 1078基础上OEM出来的。
上面是几种常见的阵列卡型号,更多的可以自行查看官方的技术手册。
下面我们要继续的是,这些阵列卡以及硬盘如何监控,阵列卡的管理也请查看官方技术手册,不在本文讨论范畴,或者查看作者的一个分享PPT:。
一般地,支持RAID 5的卡,我们称其为阵列卡,都可以使用LSI官方提供的MegaCli工具来管理,而不支持RAID 5的卡,我们称其为SAS卡,使用lsiutil工具来管理。HP的服务器使用其特有的hpacucli工具来管理。
1、MegaCli工具
a) MegaCli -adpallinfo -aall — 查看阵列卡信息
-a 参数指定阵列卡的编号,一般服务器上只会配一个阵列卡,因此我们通常指定为 -a0(阵列卡适配器编号,从0开始) 即可,主要关注下面几个信息:
状态值 | 对应含义 |
Product Name : PERC H710 Mini | 阵列卡名称 |
FW Package Build: 21.2.0-0007 | 阵列卡firmware版本号,版本如果太低,建议升级以提高稳定性及性能 |
BBU : Present | 是否有配BBU电池 |
b) MegaCli -cfgdsply -aall — 查看阵列配置
状态值 | 对应含义 |
Memory: 512MB | 阵列卡cache大小,2的N次方,如果不是,说明阵列卡有异常 |
Number of dedicated Hotspares: 0 | 阵列是否有专用/独享热备盘(如果有多个逻辑磁盘组/disk group,则可以指定一个硬盘用于全局热备,那么该disk group上的专用热备盘数量为0也不用担心),除了RAID 1/RAID 1+0一般不指定热备盘以外,其他几个阵列级别建议都要指定热备盘 |
State : Optimal | 阵列状态,如果不是 Optimal 就要关注了 |
Current Cache Policy: WriteBack, ReadAheadNone, Direct, Write Cache OK if Bad BBU | 阵列读写cache策略,建议写策略设置为FORCE WB,最起码是WB,预读策略可以关掉,意义不大,几乎没影响 |
Disk Cache Policy : Disabled | 硬盘cache策略,建议关闭,防止意外时数据丢失 |
Current Power Savings Policy: None | 节电策略,建议关闭 |
Media Error Count: 0 | 三个错误计数器,任何一个值大于100就要立刻引起关注,尤其要关注起增长速度。1T以上SATA盘,计数值不够精确,可能所有盘上该值都会大于0,一般重启就会重新清0,如果重启后还是大于0的话,赶紧报修吧。SAS盘的计数值则比较准确。 |
Other Error Count: 0 | |
Predictive Failure Count: 0 | |
Firmware state: Online, Spun Up | 查看硬盘状态,如果是unconfigured表示该硬盘未分配加入到阵列中;如果是 unconfigured(bad)表示该盘不但是未分配,而且还坏了,正是“出师未捷身先死”;如果是failed,表示该盘故障无法识别;如果是rebuilding,表示该盘正在重建数据 |
c) MegaCli -adpbbucmd -aall — 查看阵列卡电池信息
状态值 | 对应含义 |
Temperature: 39 C | 查看电池温度,如果相比上一次查看高出不少,就需要关注了,或者可以根据经验设置一个基线值 |
Battery State: Optimal | 电池状态,如果不是为Optimal,就需要关注了 |
Charger Status: Complete | 电池充放电状态 |
isSOHGood: Yes | 电池状态,如果不是为Yes,需要关注 |
Relative State of Charge: 93 % | 当前电量,当电量低于15%,或者电池坏掉时,默认都会将写策略从WB改成WT,除非设定为FORCE WB策略 |
Max Error = 0 % | 电池是否有错误信息 |
Next Learn time: Tue Oct 14 22:06:50 2014 | 电池充放电时间,注意这是美国时间。另外,新的阵列卡电池很多改成电容式的了,也就不需要重复充放电了 |
d) MegaCli -fwtermlog -dsply -aALL 查看阵列卡日志,关注里面的error/fail/warn等多个关键字
2、lsiutil工具
lsiutil有交互和非交互两种方式,作为监控,我们肯定选择非交互模式。想要使用交互模式的,可以根据非交互模式自行练习。
a) lsiutil -p 1 -a 20,12,0,0 — 查看硬盘计数器
Invalid DWord Count 2,563 — 任何一个值大于0,都需要引起关注
Running Disparity Error Count 2,366
Loss of DWord Synch Count 0
Phy Reset Problem Count 0
b) lsiutil -p 1 -a 21,1,0,0,0 — 查看逻辑卷状态
状态值 | 对应含义 |
Volume State: optimal, enabled | 逻辑卷健康状况 |
Volume draws from Hot Spare Pools: 0 | 是否有热备 |
Volume Size 139392 MB, 2 Members | 由几块硬盘组成 |
Primary is PhysDisk 1 (Bus 0 Target 9) | 物理硬盘1 |
Secondary is PhysDisk 0 (Bus 0 Target 3) | 物理硬盘0 |
c) lsiutil -p 1 -a 21,2,0,0,0 — 查看物理硬盘状态
状态值 | 对应含义 |
PhysDisk 0 is Bus 0 Target 3 | 编号 |
PhysDisk State: online | 状态 |
Error Count 13, Last Error: Command = 28h, Key = 3, ASC/ASCQ = 11h/00h | 错误计数器,大于0的话,就需要引起关注 |
3、hpacucli工具
hpacucli工具查看阵列、硬盘、电池信息,其实就只要一条指令:
hpacucli ctrl all show config detail — 查看阵列详细信息、配置
状态值 | 对应含义 |
Controller Status: OK | 阵列卡状态 |
Firmware Version: 1.18 | firmware版本,太低了建议升级,以提高稳定性及性能 |
Cache Board Present: True | 是否配备了cache模块 |
Cache Status: OK | cache模块状态 |
Cache Ratio: 100% Read / 0% Write | cache策略,此处只有读cache,不用于写cache,因为没有bbu电池,见下方结果 |
Drive Write Cache: Disabled | 关闭磁盘cache |
Total Cache Size: 256 MB | cache大小 |
Total Cache Memory Available: 208 MB | 实际可用cache大小,和理论cache大小不一样,说明cache模块可能有问题 |
No-Battery Write Cache: Disabled | 关闭FORCEWB策略 |
Battery/Capacitor Count: 0 | 阵列卡BBU电池数量为0,也就是没有BBU模块 |
Battery/Capacitor Status: Failed (Replace Batteries) | 阵列卡BBU电池状态,这里显示是错误状态,需要及时更换 |
Array: A | 第一个乌列阵列,编号从A开始,依次是A、B、C |
Status: OK | 物理阵列状态 |
Logical Drive: 1 | 第一个逻辑卷,编号从1开始 |
Fault Tolerance: RAID 5 | 第一个逻辑卷的阵列级别 |
Status: OK | 第一个逻辑卷状态 |
Caching: Enabled | 第一个逻辑卷是否启用了cache策略 |
physicaldrive 1I:1:1 | 第一块物理硬盘,编号从1开始 |
Status: OK | 第一块物理硬盘状态 |
Firmware Revision: HPDA | 第一块物理硬盘firmware,如果太低,也需要及时升级,HP的硬盘每个批次都有不同的firmware |
延伸阅读:
推荐系统
番茄花园win10纯净版 20h2 Ghost x64 系统下载 v2022.06
系统大小:4.92GB系统类型:Win10番茄花园win10纯净版 20h2 Ghost镜像 x64 ISO系统下载在系统方面技术积累雄厚深耕多年,是一款稳定流畅的系统,一直以来都以用户为中心,兼容各种硬件和软件,运行环境安全可靠稳定。
系统等级:进入下载 >Win10专业版系统下载 技术员联盟 ghost镜像 ISO v2022.07 下载
系统大小:4.48GB系统类型:Win10win10系统下载 技术员联盟 win10专业版 ghost镜像 ISO下载在系统方面技术积累雄厚深耕多年,打造了国内重装系统行业的番茄品牌,其系统口碑得到许多人认可,积累了广大的用户群体,win10是一款稳定流畅的系统,一直以来都以用户为中心,是由技术员联盟推出的win10国内镜像版,基于国内用户的习惯,做了系统性能的优化,采用了新的系统功能和硬件驱动,
系统等级:进入下载 >技术员联盟Win10纯净版系统下载 ghost镜像 ISO v2022.07 下载
系统大小:4.48GB系统类型:Win10技术员联盟在系统方面技术积累雄厚深耕多年,技术员联盟Win10纯净版系统下载 Windows11纯净版 GHOST ISO镜像系统,是由番茄团队推出的win10国内镜像版,基于国内用户的习惯,做了系统性能的优化,采用了新的系统功能和硬件驱动,可以更好的发挥系统的性能,优化了系统、驱动对硬件的加速,使得软件在windows10系统中运行得更加流畅,加固了系统安全策略
系统等级:进入下载 >微软Windows11下载 专业版 品牌机专用 Ghost系统 ISO镜像 X64位系统
系统大小:4.68GB系统类型:Win11技术员联盟打造了国内重装系统行业的系统之家品牌,微软Windows11下载 专业版 品牌机专用 Ghost系统 ISO镜像 X64位系统追求系统稳定性和强大的兼容,为广大用户提供最好用的系统,WINDOWS11系统在家用办公上跑分表现都是非常优秀,完美的兼容各种硬件和软件,运行环境安全可靠稳定。
系统等级:进入下载 >技术员联盟win7纯净版 ghost 官网镜像 x64位下载 v2022.07
系统大小:4.42GB系统类型:Win7技术员联盟win7纯净版 ghost 官网镜像 windows7纯净版 x64位下载在系统方面技术积累雄厚深耕多年,打造了国内重装系统行业的领头羊,其系统口碑得到许多人认可,积累了广大的用户群体,windows7是一款稳定流畅的系统,一直以来都以用户为中心,是由技术员联盟团队推出的windows7国内镜像版,基于国内用户的习惯,做了系统性能的优化,采用了新的系统功
系统等级:进入下载 >联想/戴尔品牌机专用系统 技术员联盟Win11专业版 完美激活 ghost ISO镜像 X64下载
系统大小:4.68GB系统类型:Win11技术员联盟打造了国内重装系统行业的系统之家品牌,联想 戴尔品牌机专用系统 技术员联盟Win11专业版 完美激活 ghost ISO镜像 X64下载,为广大用户提供最好用的系统,WINDOWS11系统在家用办公上跑分表现都是非常优秀,完美的兼容各种硬件和软件,运行环境安全可靠稳定。
系统等级:进入下载 >
相关文章
- 超级数据恢复软件解决移动硬盘提示未格式化的数据
- 天玑700和天玑1200区别是什么 天玑700和天玑1200对比介绍
- 告诉大家笔记本电脑快速充电是如何实现的?
- 彩喷常见故障处理方法
- 麒麟985和麒麟990哪款跑分高 麒麟985和麒麟990跑分对比
- 天玑900和骁龙768g哪个好?天玑900和骁龙768g哪个性能更强?
- 骁龙778g和骁龙845哪款处理器性能更强 骁龙778g和骁龙845对比
- 华为MateBook笔记本怎么新建分区?
- 打印机怎么取消正在排队打印的任务? 打印机删除打印任务的教程
- 华为watch3和gt2pro区别是什么 华为watch3和gt2pro对比介绍
- 苹果笔记本MacBookPro 的新手使用技巧
- 电脑硬件认识之什么是电脑的CPU(cpu详细介绍)
- AMD RX VEGA64显卡怎么样 AMD RX VEGA64首发性能详细评测+拆解图
- AMD RX VEGA64显卡怎么样 AMD RX VEGA 64评测
热门系统
推荐软件
推荐应用
推荐游戏
热门文章
常用系统
- 1系统之家windows10系统下载 x64位 专业版 Ghost 镜像 win10 v2021.10
- 2微软Win11系统 64位 正式版Ghost Windows11镜像 2022.05
- 3系统之家win7旗舰版 ghost系统 V2022.05官网镜像下载
- 4系统之家win7企业版纯净ghost系统 V2022.05镜像下载
- 5雨林木风win11系统下载 Ghost windows11 64位 专业版系统 V2021.10
- 6萝卜家园win10专业版 Ghost系统镜像下载安装 V2022.06
- 7深度技术WINDOWS10家庭版 GHOST X64位 V2022.04下载
- 8雨林木风win10系统下载 Ghost windows10 64位 企业版系统 V2021.10
- 9深度技术WINDOWS10纯净版自动激活21H2 X64位 V2022.04下载