本发明涉及故障告警,尤指一种基于配套维护信息记录的机房故障告警系统。
背景技术:
1、在现代信息技术架构中,机房作为企业和数据中心的重要组成部分,其稳定运行对于保障业务连续性和数据安全至关重要,在云计算、大数据及数字化服务包括数字化工厂均需要以数据机房为运营基础。然而,随着机房规模的扩大和设备数量的增加,机房管理和故障处理的复杂性也随之增加。尤其是当机房中的某一主机发生宕机或故障时,迅速准确地定位故障原因并进行相应的维修或更换,对于维护机房正常运行具有重要意义。
2、在传统的机房管理模式中,故障发生后,运维人员通常需要手动检查受影响主机的各个组件,以确定故障源。这一过程不仅效率低下,而且在面对机房内大量主机时,耗费的人力和时间成本极高。此外,由于缺乏有效的预警机制和故障预判断告警技术,运维人员往往难以在第一时间内判断故障发生的具体位置,导致故障恢复时间延长,进而影响到整个机房的运营人力成本和服务质量。
技术实现思路
1、为解决上述问题,本发明提供一种基于配套维护信息记录的机房故障告警系统。
2、为实现上述目的,本发明采用的技术方案是:
3、一种基于配套维护信息记录的机房故障告警系统,包括配套维护信息记录模块,生命周期模块、组件异常评估模块、智能故障判断模块和告警模块,所述配套维护信息记录模块分别与生命周期模块和智能故障判断模块连接,所述生命周期模块、所述组件异常评估模块和告警模块分别与所述智能故障判断模块连接;
4、所述配套维护信息记录模块,用于按照不同高度将机房中的主机进行温度区域划分,将同一区域内的若干个主机内的若干个组件进行矩阵排列,生成配套维护信息记录表,所述配套维护信息记录表用于通过对组件的维护活动进行数字化标记,所述维护活动包括日常维护、维修组件和更换组件;
5、所述生命周期模块用于根据配套维护信息记录表获取各个组件的维护次数和维修次数,以组件类别、温度区域、维护次数、维修次数和维护活动频率变化进行神经网络训练,通过神经网络输出组件的使用生命周期;
6、所述组件异常评估模块用于捕捉组件功耗异常和运行错误日志,并根据功耗异常和运行错误日志的发生频率生成组件的异常评估分值;
7、所述智能故障判断模块用于根据生命周期模块的输出和各个组件工作时长通过函数化得到故障概率分,当主机发生停机故障时,所述智能故障判断模块对若干个组件的故障概率分和异常评估分值进行加权得到若干个组件故障判断分值,根据故障判断分值选取疑似故障组件并控制播报模块进行告警。
8、进一步地,所述将同一区域内的若干个主机内的若干个组件进行矩阵排列包括以下步骤:
9、识别和记录每个主机的位置信息,包括主机所在的机架、行和列信息;
10、确定每个主机的组件信息,包括主机内部组件的类型和数量;
11、基于每个主机的位置信息和组件信息对同一温度区域内的主机及其内部组件进行矩阵排列,其中矩阵的行映射不同的主机,矩阵的列映射主机内部的组件。
12、进一步地,所述配套维护信息记录表用于通过对组件的维护类型进行数字化标记包括以下步骤:
13、为每项维护类型分配一个唯一的标识符,并记录维护的具体日期和时间;
14、对每项维护类型分配相应的预设数字代码。
15、进一步地,所述根据配套维护信息记录表获取各个组件的维护次数和维修次数包括以下步骤:
16、从配套维护信息记录表中提取每个组件的维护活动,包括对表中的每行数据进行识别,累加属于同一组件的维护活动数量;
17、以更换组件的时间为上一组件的生命周期末节点,并作为本组件的生命周期始节点分别统计组件生命周期中不同类型的维护活动次数,包括日常维护次数和维修组件次数。
18、进一步地,所述维护活动频率变化的获取步骤包括:
19、基于维护的具体日期和时间,通过预设时间窗口和移动步长进行计算时间窗口内的维护活动次数;
20、计算的时间窗口内的维护活动次数差值,并生成差值变化函数;
21、通过差值变化函数的切线斜率的变化率进行标准化得到维护活动频率变化分值。
22、进一步地,所述以组件类别、温度区域、维护次数、维修次数、维护活动频率变化和对应生命周期进行神经网络训练包括:
23、以组件类别、温度区域、组件生命周次内的维护次数、维修次数和维护活动频率变化分值作为神经网络的输入元素,以组件生命周期作为神经网络的输出进行训练;
24、通过反向传播调整网络参数,所述网络参数包括权重和偏置。
25、进一步地,所述根据功耗异常和运行错误日志的发生频率生成组件的异常评估分值包括:
26、对每个组件,持续监控并记录其功耗数据和产生的运行错误日志并标识为异常事件;
27、对标识的异常事件,计算其在预设时间段内的发生频率;
28、对异常事件的发生频率进行标准化得到组件的异常评估分值,所述异常事件的发生频率与组件的异常评估分值呈正相关。
29、进一步地,所述故障概率分的计算公式如下:
30、当时,;
31、当时,;
32、其中,为实际工作时长,为生命周期剩余,和为调节系数,为故障概率分。
33、进一步地,所述根据故障判断分值选取疑似故障组件包括:
34、根据故障判断分,使用最大值选取原则选取疑似故障组件。
35、本发明的有益效果在于:本发明通过配套维护信息记录模块收集机房中各个主机及其组件的维护活动数据,包括但不限于日常维护、维修组件和更换组件等信息。由于机房中主机的温度影响着主机部件的寿命,而机房的大型机架中往往是中间部分的主机温度较高,而靠近地面和天花板的主机温度相对由于空调或其他散热设备的影响导致温度相对埂堤,配套维护信息记录模块按照不同的温度区域将机房中的主机进行分类,并将同一区域内的若干个主机内的若干个组件进行矩阵排列,生成详细的配套维护信息记录表,工作人员通过配套维护信息记录表对每次维护进行记录,不仅可以对维护信息进行配套记录还为后续的故障分析和预测提供了基础数据。生命周期模块利用收集到的维护信息,通过神经网络训练模型,预测各个组件的使用生命周期。该模块考虑组件类别、温度区域、维护次数、维修次数和维护活动频率变化,输出的生命周期数据为智能故障判断模块提供了重要的预判依据。再通过组件异常评估模块监控组件的功耗异常和运行错误日志,根据这些异常和错误的发生频率生成组件的异常评估分值,进一步细化了故障预测的精确度。当主机发生停机故障时,智能故障判断模块对若干个组件的故障概率分和异常评估分值进行加权,得到各个组件的故障判断分值。根据故障判断分值,系统能够选取疑似故障组件,并通过告警模块发出预警,指导运维人员进行针对性的检修,提高了故障处理的效率和准确性,缩短了故障恢复时间。
1.一种基于配套维护信息记录的机房故障告警系统,其特征在于,包括配套维护信息记录模块,生命周期模块、组件异常评估模块、智能故障判断模块和告警模块,所述配套维护信息记录模块分别与生命周期模块和智能故障判断模块连接,所述生命周期模块、所述组件异常评估模块和告警模块分别与所述智能故障判断模块连接;
2.根据权利要求1所述的一种基于配套维护信息记录的机房故障告警系统,其特征在于,所述将同一区域内的若干个主机内的若干个组件进行矩阵排列包括以下步骤:
3.根据权利要求1所述的一种基于配套维护信息记录的机房故障告警系统,其特征在于,所述配套维护信息记录表用于通过对组件的维护类型进行数字化标记包括以下步骤:
4.根据权利要求1所述的一种基于配套维护信息记录的机房故障告警系统,其特征在于,所述根据配套维护信息记录表获取各个组件的维护次数和维修次数包括以下步骤:
5.根据权利要求3所述的一种基于配套维护信息记录的机房故障告警系统,其特征在于,所述维护活动频率变化的获取步骤包括:
6.根据权利要求5所述的一种基于配套维护信息记录的机房故障告警系统,其特征在于,所述以组件类别、温度区域、维护次数、维修次数、维护活动频率变化和对应生命周期进行神经网络训练包括:
7.根据权利要求1所述的一种基于配套维护信息记录的机房故障告警系统,其特征在于,所述根据功耗异常和运行错误日志的发生频率生成组件的异常评估分值包括:
8.根据权利要求1所述的一种基于配套维护信息记录的机房故障告警系统,其特征在于,所述故障概率分的计算公式如下:
9.根据权利要求1所述的一种基于配套维护信息记录的机房故障告警系统,其特征在于,所述根据故障判断分值选取疑似故障组件包括:
