万一主机或者RAID控制器报告这样的一个驱动器失败,那么驱动器会在脱离主机和在别处测试时重新工作良好。(我们都知道,关闭和打开电源可以解决很多计算机的问题)。事实上,研究表明可以容忍这种类型错误的故障驱动器作为可靠的,只要在它们重置后,便可以当做新的驱动器出厂。
实际上Ober先生找到了一位不愿透露姓名的数据中心运营者,与他分享其驱动器故障统计数字。这个数据中心虽然比谷歌或者Facebook的标准小,但也拥有相当巨大的20多万台服务器。
他们发现:
• 他们超过30%的SAS驱动器故障是错误的,加起来每天10-15个,或者说是千分之一的年度错误故障率。
• 直接与服务器主板相连的SATA驱动器,根据驱动器供应商的长期报告它有更高的将近50%的错误故障率,错误的故障率为惊人的每年1%。
一些厂商正在解决这一问题。五年前,Xiotech和Atrato谈到过“自愈”型磁盘阵列,在磁盘停止响应指令的时候它会执行修复任务而不是立即开始RAID重建。Xiotech与希捷(Seagate)紧密合作,甚至可以继续运行带有一个表面损坏的驱动器,或者映射访问绕过它来(将部分)磁头失效。当然,修复过程当中的第一步是在磁盘上执行一个硬重置。
由于行业的变幻无常,人们的注意力转到了闪存上,自愈型阵列不再时尚了。Atrato已经消失,而Xiotech——现在重新命名的X-IO已经显得褪色,有所关联的是,其最后的独立竞争对手Compellent、3Par甚至Nexsan都被收购了。
由于磁盘驱动器是一个双巨头垄断的市场,它的销售量大,产品利润低。我没望希捷还是西部数据(Western Digital)建立一个可以检测到错误故障并自我重置的高度冗余的电路板到驱动器中。但是有几样东西,包括LSI在内的业界厂商可以做到。
像LSI一样的SAS控制器供应商,可以构建错误故障检测和复位功能到控制器中。当驱动器响应失败时,控制器会在RAID开始重建之前给出一个快速反冲。这在SATA驱动器上比较难,因为它缺少一些必要的连接。但是控制SATA规范的人们,在接下来的几年可能在6-12Gbps升级中增加一个硬件复位功能。简单点儿说,阵列供应商可以增加一个切断到单独驱动器的电源来强制复位的功能。
无论你如何切断它,1%的AFR是不可接受的。这个行业应该致力于真正的解决方案,而不只是更快的重建(rebuild)。