搬机房之前,大家担心的都是运输途中磕碰。
实际的故障统计不是这样。搬迁当天出问题的设备,多数不是被搬坏的,是本来就要坏的那一批,在同一时刻一起暴露了。
一、真正的风险在断电和复电
现象:整体断电搬迁或者长假停机,复电的时候有盘不转,或者识别不到。
原因:机械硬盘长期停转之后,主轴润滑状态和磁头停靠状态都会变化,重新启动所需的电流和扭矩都比日常运行时更高。一块在持续运行状态下完全正常的盘,可能过不了一次冷启动。
什么情况下最明显:盘龄越长越明显。用了五六年、一直没停过的盘,一次冷启动就可能是最后一次。
这就是为什么「一直好好的机器,搬完就坏了」——它不是搬坏的,是它已经到了只能靠惯性维持的阶段,而冷启动打断了这个惯性。
同样适用于:春节长假整体停机、机房年度断电检修、UPS 维护。任何一次计划性整体停电,都是同一类风险。
二、除了盘,还有三件事在搬迁现场高发
盘序错乱。拆下来的盘没有按原顺序装回去。多数控制器能从盘上的元数据重建阵列,但不是全部,也不是所有情况下都能。
线缆插错。多控制器、多背板的机器,线序接错的后果可能是一整组盘识别不到。
阵列信息丢失。尤其是在搬迁过程中顺便做了控制器或固件变更的情况下(见《RAID 重建的那几个小时》第三节)。
这三件事的共同点是:都能靠事前记录避免,而且事后补救都很贵。
三、搬迁前该做的准备
一、完整备份。 这是唯一一件没有替代方案的事。搬迁的风险再低也不是零,而备份的成本是确定的。
二、记录物理信息:
- 每台机器的盘位与盘序(拍照,不只是记文字)
- 线缆连接关系(贴标签,两端都贴)
- 阵列配置导出(控制器里能导的都导一份)
- 机柜位置与上下架顺序
三、关键型号的备件提前到位。不是「出问题再调货」,是在搬迁当天就在现场。硬盘、电源模块这两类是最常用的。
四、评估设备状态。 搬迁前做一次巡检,把已经有 SMART 趋势异常、有 CE 计数增长、电源模块已失效的机器标出来——这些就是最可能在复电时暴露的那一批。能提前换的提前换。
四、复电的做法
分批上电,逐台确认,不要一次全拉起来。
原因有两个:
- 瞬时启动电流。所有机器同时上电,浪涌电流可能超出配电设计余量。 机械盘的启动电流是运行电流的数倍。
- 出问题时能定位。一次拉起来一百台,其中三台有问题, 你要花很长时间才能找出是哪三台、以及为什么。
建议的顺序:先上网络和存储,确认正常;再分批上计算节点,每批之间留出确认时间。
逐台确认什么:所有盘是否识别、阵列状态是否正常、BMC 有没有新的硬件事件、风扇和电源状态。这一遍花的时间,比出问题之后回头查要少得多。
五、混合品牌机房的一个现实问题
搬迁和日常维保都会碰到同一个问题:同一个机房里的设备,往往不是一个品牌。
现状:国际第三方维保商的强项在国际品牌,国产设备的备件与授权覆盖有限;国内做运维外包的能修国产设备,海外又没有本地库房。
后果:同一个机房的设备被迫拆成两家甚至三家分包,响应口径各不相同——一家算「到场时间」,一家算「受理时间」。出事的时候互相推诿,最后还是客户自己在中间协调。
搬迁场景下更麻烦:搬迁是一次性、高强度、跨品牌的操作,需要的是一个统一的现场指挥,不是三家各管一摊。
我们的位置:国际品牌与国产品牌(华为、浪潮、新华三、联想、曙光、锐捷等)一份合同覆盖,国内 80+ 城市、海外 35+ 国家和地区,本地库房加本地工程师。一个对接人,一套口径,一份合同。
搬迁检查清单
搬迁前(至少提前两周)
- 完整备份,并验证备份可恢复
- 全量巡检,标记 SMART 异常 / CE 增长 / 电源已失效的机器
- 能提前更换的耗材提前换(硬盘、电源、缓存电池)
- 导出所有阵列配置
- 拍照记录盘位、盘序、线缆连接
- 关键型号备件到位,清点确认
- 确认新机房的配电容量能承受分批上电
搬迁当天
- 断电前做一次最终状态记录
- 按记录拆装,盘和托架不混台
- 现场备件箱开箱可取
复电
- 分批上电,先网络存储后计算
- 逐台确认盘识别、阵列状态、BMC 事件
- 记录本次出问题的设备清单,作为下一轮更换计划的输入
本文讨论的是机房搬迁与计划性停机中的普遍风险,不针对任何具体项目。关于备件所在地与响应时效的关系,见《选第三方维保要问清楚的五件事》。
