RAID 重建期间再坏一块盘的后果,取决于 RAID 级别和故障盘的角色:
单冗余阵列(RAID 5、RAID 3) 这是危险的场景。RAID 5 只能容忍 1 块盘故障,重建期间已经有 1 块盘在重建中(逻辑上已失效),如果再坏一块:
- 阵列直接崩溃,数据不可访问
- 此时只有求助专业数据恢复服务,成本极高且不保证成功
- 这就是为什么大容量 SATA 盘的 RAID 5 重建期间 URE(不可恢复读取错误)风险备受诟病——即便不是整盘故障,一个 URE 也可能导致重建失败
     
双冗余阵列(RAID 6、RAID 1+0 等) RAID 6 可容忍2 块盘同时故障:
- 重建期间再坏一块(共 2 块故障)→ 阵列仍可运行,但降级为单冗余状态,此时再坏一块才会崩溃
- 数据仍可通过校验恢复,但重建速度会进一步变慢 RAID 1+0 的容忍度取决于哪块盘坏:
- 再坏的盘与当前故障盘属于不同镜像对 → 阵列仍正常工作,但两对镜像各自只剩单盘
- 再坏的盘与当前故障盘属于同一镜像对 → 该镜像对数据丢失,阵列崩溃
     
重建期间为何更容易连环坏盘
重建过程需要全盘读取所有幸存盘的数据来计算校验,这比正常工作时的读取量大成百上千倍。如果盘已达寿命末期或存在共同的环境因素(温度、电源问题),连环失效的概率显著上升。
     
实际建议
- 重建期间尽量减少阵列负载,降低 URE 风险
- 优先选 RAID 6 而非 RAID 5,尤其对大容量盘 - 启用 热备盘(Hot Spare),让重建尽早开始 - 定期做 scrub/patrol read,提前发现潜在坏块 - 重要的数据始终要有独立备份,RAID 不是备份
莆田市晓林信息技术邮箱公司