b2科目四模拟试题多少题驾考考爆了怎么补救
b2科目四模拟试题多少题 驾考考爆了怎么补救

完整的解决方案:服务器硬盘故障预测的实践

电脑杂谈  发布时间:2020-09-08 14:11:08  来源:网络整理

服务器硬盘故障_鲁大师 硬盘存在故障_硬盘常见故障

“鹅厂互联网事务”由深圳市腾讯计算机系统技术工程业务组网络平台部运营。我们希望与所有类似人员交换和学习最新的网络和服务器行业动态信息。业内有识之士的合作伙伴,并分享腾讯的网络在服务器,规划,运营,研发,服务和其他实用干货方面,我们期待与您共同成长。

背景

随着腾讯业务的蓬勃发展,近年来服务器的数量迅速增长。随着时间的流逝,实时网络已逐渐积累了大量具有长期服务期限的服务器,并且服务器操作面临着日益严重的服务器整体老化问题。问题。从理论上讲,服务时间越长,服务器故障的可能性就越高。腾讯整个服务器网络的统计结果还表明,服务器的老化加剧,故障概率将加快,尤其是使用4年以上的设备的故障率。将会急剧上升。显然,具有较高故障率的老化设备将对现有网络服务产生巨大影响,并将大大增加运营复杂性和成本。

在这些故障中“贡献最大”的硬盘(如图1所示)。它占服务器组件故障的70%以上。这也是由于其最大的容量和生命周期相对较短(如表1所示),硬盘的生命周期通常只有3至5年。我们的服务器使用超过5年后,硬盘故障率非常高。

因此,如果您想快速有效地减少服务器故障的影响,则核心是减少硬盘故障的影响。目前,行业采用更多的故障监测和故障自动修复功能。如果无法修复,则只能更换磁盘并执行业务迁移。尽管这在一定程度上也发挥了作用,但它降低了数据丢失的风险和业务影响。影响力,但毕竟是事后的想法。故障是不可避免的,并且故障总是会发生,但是如果我们对未来有一对愿景,我们可以提前预测故障的发生,并平稳地迁移数据和业务。

一、硬盘预测面临的困难

尽管这种预测已经存在很长时间了,但很少有人能真正地做到准确。与地震类似,尽管可以通过监视地壳的活动和动物的异常行为来预先预测地震的发生,但还是有一些时间可以让人们提前搬到避难所,以最大程度地减少人身和财产损失,并且早在公元132年,地震仪就诞生了,但是到目前为止,它仍然无法准确预测地震的发生。由于涉及的因素太多,因此必须考虑所有方面。硬盘故障也是如此。自1950年代以来,它经历了一系列的技术创新和替代。到目前为止,仍然很难预测何时会破裂。尽管可以从统计数据中获得一些粗略的统计数据:服务器和关键组件的生命周期上限通常为5年,并且行业通常对5年以上的老化设备采用直接退役方案,但不适用于大型设备。卷。考虑到成本,业务迁移和其他问题,我们的解决方案仍然太任性。由于一种尺寸适合所有人,是否有一个折衷的解决方案可供选择?

服务器硬盘故障_鲁大师 硬盘存在故障_硬盘常见故障

二、硬盘故障预测的探索过程

俗话说:“一个聪明的女人,没有米饭就很难做饭。”没有进行预测的依据。因此,选择数据源是当务之急。只有有了数据,我们才能开始。但是面对大量的杂项数据,我们该如何播放呢?这涉及一系列数据处理,数据建模和模型验证过程(如图2所示)。为了获得更好的预测结果,可以重复进行多次建模,直到模型的预测结果达到标准为止。

1关于数据源

从13年以来,我们已经对硬盘故障进行了一系列的研究和分析。尽管数据挖掘技术现在变得越来越完善,但是预测的主要问题在于数据的选择,高质量的数据,最终实现良好的预测效果是决定性的,因此没有数据支持,那么预测呢? 。因此,我们经历了一系列的筛选过程。

开始时,很容易想到硬盘的主机-服务器,这是主要的影响因素,因为我们已经知道,随着服务器的保质期增加,总体故障率将逐渐增加增加,因此可以推测,如果是在货架时间的基础上,结合模型和业务等维度,我们能否给出一些推论甚至有价值的结果?因此我们使用聚类方法对此进行统计分析,但结果并非如此。也许这些服务器配置信息可以给出一些统计结果。我们想要的是即将发生故障的硬盘,而不是每组硬盘的总故障率几乎没有差异。

我们想知道的是单个磁盘的故障概率,并更清晰地标记危险磁盘,因此我们后来考虑了磁盘I / O,因为从直觉上我们认为磁盘负载越高,则磁盘发生的可能性越大。是要打破。因此决定尝试一下。我们分析了三个值:每秒磁盘读取和写入块的数量以及每秒用于IO操作的CPU时间的比例。通过比较各种方法,我们最终选择了两个相邻时间点之间的IO。更改的绝对值用作主要元数据,即下一个时间点和上一个时间点之间的IO差的绝对值,简称IO跳跃。它与磁盘故障之间的关系如图3所示:

从上图可以看出,发生故障时的IO跳转大小位于前10%,而发生故障的次数占66%以上。最初看到此消息使我们充满信心,可以使用它来预测磁盘故障。但最终预测准确率不到40%。

服务器硬盘故障_硬盘常见故障_鲁大师 硬盘存在故障

我们继续努力,并考虑了磁盘S.M.A.R.T(简称为自我监测分析和报告技术,SMART)。之所以将SMART视为核心数据,是因为其相关技术相对成熟,并且已经被业界认可近20年。第二个是,我们内部大多数的硬盘故障发现和修复也是根据SMART信息进行的,而SMART的使用是我们实际验证的结果,即所谓的“不相信广告字母的功效”。

2数据处理

在一定程度上积累了数据之后,发现问题来了。数据量太大。如何使用它?如果只是几百万个数据,它仍然很简单,但是现在有成百上千个具有一两百个维度的数据。没有设备怎么打?幸运的是,我们的工厂拥有与TDW一样大的系统。借助TDW强大的数据存储和计算功能,我们可以顺利进行此事。

并非所有一百多个维度的SMART信息都与故障密切相关。如果全部使用,其中一些将成为干扰项。因此,经过相关性分析和聚类分析,分层筛选后,最终仅选择其中之一。 13个项目用作我们建模的基本数据,如表2所示:

值得一提的是,由于每个特征分为原始值和标准值,原始值范围不同,会影响重量,因此这里我们主要采用标准值,可以理解为归一化值。还将对诸如重新分配的扇区数和当前待处理的扇区数之类的核心项目的原始值给予一定的考虑。例如,重点将放在具有800个坏块的硬盘故障上。

3个预测模型

此处选择支持向量机SVM对历史故障样本和非故障样本进行建模,然后将该模型用于数据。其他的故障预测方法,例如K-Means聚类,Logistic回归和神经网络,我们都尝试并遇到了很多陷阱,最终选择了SVM算法。

服务器硬盘故障_硬盘常见故障_鲁大师 硬盘存在故障

4个统计模型

上面提到的SVM是两个分类器,这意味着它在世界上是黑色还是白色,并且在中间状态下无所谓。然后的问题是,即使有一个句子,这个直率的男孩也给出了很多结果,就严重程度而言,我们如何判断哪些人“更糟”可被直接判处死刑,哪些人“还不错”可以判死刑吗?因此,这里我们基于历史预测结果,结合硬盘模型的尺寸,服务器类型,货架月份,版本号等,来计算每个小集合的正确比率,​​然后将其求逆,以便我们可以轻松地确定Up的优先级。如图6所示,横坐标表示每个小集合的数量。这里有10,000多个小型收藏。在点A之前,左侧相应小集合的正确率是100%,然后逐渐下降,因此累积正确率开始降低,到点B时,正确率是8 0. 93% 。如果继续右移,它将继续。降低到C点,即总正确率的4 4. 46%。因此,通过适当地设置“阈值”(对应于小集合的累积准确率,以下称为预测比率),可以首先释放重要和紧急的阈值,其余可以长期讨论。术语。此外,此“阈值”可随时调整,这增加了很多灵活性。

5种运营模式

使用预测模型,可以提供故障前磁盘的统计信息,而使用统计模型,可以提供故障前磁盘的预测比率。但是问题来了。对于可操作的同事,不同的服务器可能具有不同的优先级,并且此优先级仍可随时调整。为了支持我们,我们提供了操作模型设置,主要包括服务器类型,保质期,服务器运行状况,业务模块,预测比率,坏块比率,性能参数等。系统将预测任何规则将根据该设置表满足故障磁盘,自动启动故障过程。对于不符合任何规则的人员,将显示详细信息,以供操作同事进一步确认。

如图7所示(由于空间限制,仅列出了部分尺寸),第二行表示预测的失效,其预测比率在0. 6至0. 8之间,并且货架月份为3至6年板。如果仅查看预测比率,您可能会认为该指标略低,因为根据我们以前的标准:在启动故障凭单之前,预测比率必须达到80%或更高;对于低于80%的那些,没有过多考虑。但是,根据我们之前的统计,过去5年中旧机器的故障率将加快。如果机器的该部分已经发生故障,则故障的可能性将比正常机器大得多。考虑到这一点,我们在预测策略中结合了预测比率和销售月份。因此,第二种策略认为预测比率在60%到80%之间(略低于80%),并且也考虑在发布当月达到3到6年(旧机器),因此我们将更加自信。其他规则也基于不同维度之间的权衡取舍。

6总体框架

结合以上几点,我们基本上得到了我们系统的总体框架,如图8所示。提到SMART阈值检查可以用作简单的判断过程,它将直接判断核心的情况故障前SMART项远远超过正常值。此外,在应用程序层,我们将提供一个预测结果查询页面,您可以在其中查看预测顺序的状态和相关信息,设置操作模型,手动激活故障前故障单以及系统启动故障。处理过程。

鲁大师 硬盘存在故障_硬盘常见故障_服务器硬盘故障

三、效果文章

多个硬盘模型的故障预测已完成。表3显示了每种模型的准确性和故障范围。其中,前六种型号满足了操作要求并进行了升级,特别是覆盖了65%的SATA磁盘。编号七、进一步优化和验证后,将发布八个和两个模型。其余部分体积很小,需要进一步的优化和验证。

对于某些模型,提前天数和预测准确性的趋势如图9所示:

值得一提的是,当我们首先将预测故障单与实际故障故障单进行比较时,效果并不十分令人满意。因为我们的预测是基于SMART数据的,所以我们报告的故障前故障单都是基于SMART的“亚健康”或“重症”硬盘。实际的故障单是基于磁盘自检失败而无法修复的,以及系统dmesg信息中的错误关键字(主要包括SCSI设备离线,ATA设备超时和设备故障)。也就是说,对于硬盘故障,实际上需要更换磁盘。这个定义实际上是非常严格的,并且实际上遗漏了许多情况。由于在现场确认后会填写该陈述式的错误类型,因此如果不进行交换或未填写该陈述式的错误类型,将被视为我们的虚假报告。这确实比Dou E更错。此外,实际的故障单更多地依赖于OS级别的判断,从而暴露了一些可以捕获的问题。实际上,在某种程度上,会丢失一些担心运行状况但尚未报告的硬盘,这意味着硬件本身是当前最原始的运行状况。针对这些问题,我们向制造商提供了误报,以进行确认,确实将它们诊断为病理性磁盘甚至高风险磁盘。因此,我们不仅要依靠语句失败的类型,还要注意单个硬盘驱动器本身的健康状态。如果其SMART核心项目远远超过安全阈值,则还将用作故障判断。这也反映在运营模型中:预测比率基于实际故障单,坏块比率和性能指标反映了SMART的核心项目。有了这些支持,我们的预测准确性就可以逐步提高。

操作同事可以通过提供的预测管理页面执行一系列操作,包括查询批处理预测结果,手动触发故障单,处理策略管理,阈值管理,状态维护,处理进度管理和其他功能。从2016年2月到2016年5月,预计总共有2353个硬盘故障,并且在实时网络上已生成2340个单一故障。其中,有1962个订单是人工启动的,而有378个订单是自动启动的(初步比较谨慎,操作逐渐得到确认,逐渐放开)。可以成功预测的硬盘故障数量大约已覆盖SATA硬盘故障数量的50%,这导致影响业务超过5年的服务器的整体硬件故障率下降[ k3] 5%。

四、未来展望

故障预测类似于即将发生的地震预测。最重要的含义是为用户提供一个平静的时间进行数据和业务迁移或处理,并改善用户体验。但是预测技术的研究也是一个积累的问题。从加紧准备,渴望尝试到实际实施,它还经历了一系列磨练过程,最后的小小的效果就是最大的肯定。未来,将以SAS和SSD为核心,以期取得更大的成就。当然,我们还将与服务器制造商和设备供应商紧密合作,在固件和媒体底部分析硬件故障的原理,并挑战不断降低故障率。

注1:所有标有“鹅工厂网事项”的文字,图片和其他作品均属于“深圳市腾讯计算机系统”。未经官方授权不得使用。验证,将保留追究权利;

注2:本文图片部分来自互联网,如果您涉及相关的版权问题,请联系


本文来自电脑杂谈,转载请注明本文网址:
http://www.pc-fly.com/a/dianqi/article-316544-1.html

    相关阅读
      发表评论  请自觉遵守互联网相关的政策法规,严禁发布、暴力、反动的言论

      • 张红敏
        张红敏

        只能忍气吞声

      • 宫田幸季
        宫田幸季

        无论是民间还是当官的都滋长了一种戾气

      • 蔡押衙
        蔡押衙

        会在网上实名揭露吗

      热点图片
      拼命载入中...