—
by
硬盘被阵列标为 Failed 不等于盘坏。掉盘、SMART 假正常、多盘同时报错、盘位标错、背板故障——五类最常见的误判,以及正确的排查顺序。
大容量盘做 RAID 5,重建期间踩中不可恢复读错误(URE)的概率有多高;重建中性能为什么掉一半;控制器更换和双控降级运行的风险与规程。
RAID 卡缓存电池(BBU / 超级电容)失效会让控制器从回写降级为直写,写性能掉一个数量级。学习周期、更换后不开回写、断电时的数据风险,以及过保设备上这类耗材的供应问题。
一条 DIMM 报可纠错错误(CE)会让整个通道降频;插槽填充顺序装错会少认容量;而最难查的是不报错却隔三差五宕机的不可纠错错误(UCE)。从 BMC 日志入手的排查方法。
SSD 掉速的三种原因(SLC 缓存写满、可用空间不足、寿命节流);用 Percentage Used 和 TBW 判断剩余寿命;同批次上架的固件风险与分批升级。
冗余电源单模块失效是静默的;供电不稳会表现得像硬盘故障;风扇全速运转往往不是风扇的错;一个风扇停转可能让 CPU 长期高温。电源与散热件的排查与更换周期。
光模块厂商编码校验导致端口不亮;万兆口只跑千兆的三种原因;偶发丢包查三天最后是一根线。按 CRC 与误码计数判断物理层问题,以及由便宜到贵的更换顺序。
料号:7047314(服务器主板)
料号:PDC1000S12-DB(华为 1000W 电源模块 · S5731-H24T4XC 等机型)
料号:FAS8200(NetApp 控制器)