CN120179435A - 一种基于故障模拟的集群可靠性测试方法及系统 - Google Patents

一种基于故障模拟的集群可靠性测试方法及系统 Download PDF

Info

Publication number
CN120179435A
CN120179435A CN202510182427.6A CN202510182427A CN120179435A CN 120179435 A CN120179435 A CN 120179435A CN 202510182427 A CN202510182427 A CN 202510182427A CN 120179435 A CN120179435 A CN 120179435A
Authority
CN
China
Prior art keywords
reliability
fault
cluster
model
key performance
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
CN202510182427.6A
Other languages
English (en)
Inventor
陈超星
周英耀
孙林鑫
梁锦钊
黄晓波
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
CSG Digital Power GRID Research Institute Co Ltd
Original Assignee
Southern Power Grid Digital Grid Research Institute Co Ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Southern Power Grid Digital Grid Research Institute Co Ltd filed Critical Southern Power Grid Digital Grid Research Institute Co Ltd
Priority to CN202510182427.6A priority Critical patent/CN120179435A/zh
Publication of CN120179435A publication Critical patent/CN120179435A/zh
Pending legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F11/00Error detection; Error correction; Monitoring
    • G06F11/008Reliability or availability analysis
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F11/00Error detection; Error correction; Monitoring
    • G06F11/30Monitoring
    • G06F11/3003Monitoring arrangements specially adapted to the computing system or computing system component being monitored
    • G06F11/3006Monitoring arrangements specially adapted to the computing system or computing system component being monitored where the computing system is distributed, e.g. networked systems, clusters, multiprocessor systems
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F11/00Error detection; Error correction; Monitoring
    • G06F11/30Monitoring
    • G06F11/3055Monitoring arrangements for monitoring the status of the computing system or of the computing system component, e.g. monitoring if the computing system is on, off, available, not available
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F11/00Error detection; Error correction; Monitoring
    • G06F11/30Monitoring
    • G06F11/34Recording or statistical evaluation of computer activity, e.g. of down time, of input/output operation ; Recording or statistical evaluation of user activity, e.g. usability assessment
    • G06F11/3452Performance evaluation by statistical analysis
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F11/00Error detection; Error correction; Monitoring
    • G06F11/30Monitoring
    • G06F11/34Recording or statistical evaluation of computer activity, e.g. of down time, of input/output operation ; Recording or statistical evaluation of user activity, e.g. usability assessment
    • G06F11/3457Performance evaluation by simulation
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F11/00Error detection; Error correction; Monitoring
    • G06F11/30Monitoring
    • G06F11/34Recording or statistical evaluation of computer activity, e.g. of down time, of input/output operation ; Recording or statistical evaluation of user activity, e.g. usability assessment
    • G06F11/3466Performance evaluation by tracing or monitoring
    • G06F11/3476Data logging
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F18/00Pattern recognition
    • G06F18/20Analysing
    • G06F18/21Design or setup of recognition systems or techniques; Extraction of features in feature space; Blind source separation
    • G06F18/213Feature extraction, e.g. by transforming the feature space; Summarisation; Mappings, e.g. subspace methods
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F18/00Pattern recognition
    • G06F18/20Analysing
    • G06F18/24Classification techniques
    • G06F18/241Classification techniques relating to the classification model, e.g. parametric or non-parametric approaches
    • G06F18/2411Classification techniques relating to the classification model, e.g. parametric or non-parametric approaches based on the proximity to a decision surface, e.g. support vector machines
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F18/00Pattern recognition
    • G06F18/20Analysing
    • G06F18/24Classification techniques
    • G06F18/243Classification techniques relating to the number of classes
    • G06F18/2433Single-class perspective, e.g. one-against-all classification; Novelty detection; Outlier detection
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F18/00Pattern recognition
    • G06F18/20Analysing
    • G06F18/27Regression, e.g. linear or logistic regression
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F18/00Pattern recognition
    • G06F18/20Analysing
    • G06F18/29Graphical models, e.g. Bayesian networks
    • G06F18/295Markov models or related models, e.g. semi-Markov models; Markov random fields; Networks embedding Markov models
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/04Architecture, e.g. interconnection topology
    • G06N3/044Recurrent networks, e.g. Hopfield networks
    • G06N3/0442Recurrent networks, e.g. Hopfield networks characterised by memory or gating, e.g. long short-term memory [LSTM] or gated recurrent units [GRU]
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/04Architecture, e.g. interconnection topology
    • G06N3/045Combinations of networks
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N7/00Computing arrangements based on specific mathematical models
    • G06N7/01Probabilistic graphical models, e.g. probabilistic networks
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F2123/00Data types
    • G06F2123/02Data types in the time domain, e.g. time-series data

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • General Engineering & Computer Science (AREA)
  • General Physics & Mathematics (AREA)
  • Data Mining & Analysis (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Artificial Intelligence (AREA)
  • Evolutionary Computation (AREA)
  • Quality & Reliability (AREA)
  • Evolutionary Biology (AREA)
  • Bioinformatics & Cheminformatics (AREA)
  • Computing Systems (AREA)
  • Bioinformatics & Computational Biology (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Mathematical Physics (AREA)
  • Software Systems (AREA)
  • Computer Hardware Design (AREA)
  • General Health & Medical Sciences (AREA)
  • Biomedical Technology (AREA)
  • Biophysics (AREA)
  • Computational Linguistics (AREA)
  • Molecular Biology (AREA)
  • Health & Medical Sciences (AREA)
  • Probability & Statistics with Applications (AREA)
  • Pure & Applied Mathematics (AREA)
  • Mathematical Optimization (AREA)
  • Mathematical Analysis (AREA)
  • Computational Mathematics (AREA)
  • Algebra (AREA)
  • Management, Administration, Business Operations System, And Electronic Commerce (AREA)

Abstract

本发明提供了一种基于故障模拟的集群可靠性测试方法,包括以下步骤:获取注入参数信息,基于注入参数信息和故障转移模型在集群中进行故障模拟,以得到复杂故障场景;基于复杂故障场景实时获取关键性能指标记录;基于预设可靠性检测模型和关键性能指标记录执行可靠性检测步骤,获取数据分析报告;基于数据分析报告、加权评分算法、异常检测算法和线性回归分析获取可靠性评分、影响分析结果和风险预测结果,完成对集群的可靠性检测。本发明提出的一种基于故障模拟的集群可靠性测试方法和系统,大大提高了测试效率和可靠性检测水平,通过在集群中进行故障模拟并结合可靠性检测模型,实现可靠性检测结果的精准量化,提高了可靠性检测效率和检测能力。

Description

一种基于故障模拟的集群可靠性测试方法及系统
技术领域
本发明涉及软件可靠性技术领域,尤其是涉及一种基于故障模拟的集群可靠性测试方法和系统。
背景技术
现代分布式系统广泛应用于云计算、大数据处理和高性能计算等领域。这些系统通常由多台机器组成的集群提供支持,集群中的节点通过复杂的交互机制共同完成任务。随着集群规模的扩展,其可靠性成为系统设计和运维的核心关注点。一旦集群某些节点出现故障,可能会对整个系统的性能和可用性造成严重影响。因此,如何有效评估集群在故障场景下的可靠性成为业界关注的焦点。
目前的集群可靠性测试方法主要集中在以下几种技术路径:静态分析方法:通过分析代码逻辑、架构设计和配置文件,识别可能导致故障的薄弱环节,这种方法通常依赖于专家经验和规则库支持;人工故障注入方法:由测试人员手动在集群某些节点上制造故障(如断网、服务崩溃等),然后观察系统行为并评估可靠性;仿真系统方法:利用虚拟化技术在仿真环境中模拟实际集群运行场景,并通过模拟故障进行测试;监控日志分析:通过长期分析系统日志数据,定位系统中可能存在的可靠性问题并评估其影响。尽管上述方法在一定程度上能够帮助评估集群的可靠性,但仍存在以下显著问题:静态分析无法覆盖实际运行中复杂的动态交互,结果通常带有主观性缺乏全面性和精确性;人工故障注入过程耗费大量时间和人力资源,同时难以系统化地模拟多种复杂故障场景,效率低下且覆盖率有限;仿真系统的测试环境与真实集群环境存在差异,与现实脱节,导致测试结果的可靠性存疑;现有技术缺乏统一的模型或指标体系,难以精准量化故障对集群可靠性的影响。
发明内容
本发明旨在提供一种基于故障模拟的集群可靠性测试方法和系统,以解决上述技术问题,提高了测试效率和可靠性检测水平,实现可靠性检测结果的精准量化。
为了解决上述技术问题,本发明提供了一种基于故障模拟的集群可靠性测试方法,包括以下步骤:
获取注入参数信息,基于注入参数信息和故障转移模型在集群中进行故障模拟,以得到复杂故障场景;
基于复杂故障场景实时获取关键性能指标记录;
基于预设可靠性检测模型和关键性能指标记录执行可靠性检测步骤:基于关键性能指标记录和长短期记忆网络算法获取时序特征变化结果;基于关键性能指标记录、向量机和注意力机制进行分类和拟合回归预测,获取分类预测结果;基于关键性能指标记录和异常检测算法获取指标突变情况;基于时序特征变化结果、分类预测结果和指标突变情况获取数据分析报告;
基于数据分析报告、加权评分算法、异常检测算法和线性回归分析获取可靠性评分、影响分析结果和风险预测结果,完成对集群的可靠性检测。
上述方案首先通过相应的故障模拟技术在真实的集群运行环境中进行故障模拟,确保测试结果更贴近实际场景,实现了高效、全面且精确地在集群中进行多类型复杂故障场景的故障模拟;同时实时采集相应的关键性能指标记录信息,通过可靠性检测模型进行关键性能指标记录的数据检测分析,并最终结合数据分析报告生成可靠性评分、影响分析结果和风险预测结果,实现可靠性检测结果的精准量化;通过该方法得到的可靠性检测结果能够直观反映集群系统的可靠性水平,便于不同集群系统之间的对比分析,同时显著减少了人工干预,提高了测试效率和检测能力。
进一步地,获取注入参数信息,基于注入参数信息和故障转移模型在集群中进行故障模拟,以得到复杂故障场景,包括:基于马尔可夫链构建故障转移模型;获取注入参数信息,采用并行注入技术基于注入参数信息和故障转移模型在集群中进行故障模拟,以得到复杂故障场景。
上述方案中,采用基于马尔可夫链构建的故障转移模型,可高效灵活地适用于各种复杂的系统故障转移场景,进而通过注入参数信息和故障转移模型实现在集群指定节点精准注入不同故障模拟的数据信息,包括多种模拟故障,进而在真实的集群中充分实现对复杂故障场景的模拟,为后续分析和性能评估提供详细的数据支持,确保测试结果更贴近实际场景,能够为运维决策提供直接参考,有助于故障定位与优化恢复策略的制定。
进一步地,在获取注入参数信息,基于注入参数信息和故障转移模型在集群中进行故障模拟,以得到复杂故障场景时,还包括:基于实时监控和反馈机制获取故障数据信息,当故障数据信息不符合预设可控范围时,基于故障数据信息调节注入参数信息,以得到最终复杂故障场景。
上述方案中,通过在故障模拟时采用实时监控集群的运行状态,并结合反馈机制获取故障数据信息,确保故障模拟过程的精确性与可控性,从而最大限度还原复杂故障场景。
进一步地,在获取注入参数信息,基于注入参数信息和故障转移模型在集群中进行故障模拟,以得到复杂故障场景时,还包括:基于实时监控和反馈机制调节获取故障数据信息,当故障数据信息符合预设异常范围时,基于故障数据信息和预设异常恢复策略调节注入参数信息,以使集群恢复正常运行状态。
上述方案中,通过在故障模拟时采用实时监控详细监控集群的运行状态,并结合反馈机制获取故障数据信息,在故障模拟出现异常时及时采用预设异常恢复策略进行调节恢复,以使集群恢复正常运行状态,保证集群系统在故障模拟和可靠性检测过程中的可控,还可结合可靠性检测得到结果对集群进行配置调整,以优化稳定性和抗故障能力。
进一步地,基于复杂故障场景实时获取关键性能指标记录,包括:创建自定义数据采集脚本;获取故障注入信号,基于故障注入信号、自定义数据采集脚本和复杂故障场景实时获取源数据信息;基于源数据信息和预设数据处理方式获取关键性能指标记录。
上述方案中,通过开发创建自定义数据采集脚本,通过获取故障注入信号自动开始数据的采集过程,实现对集群运行状态的全面实时监控和记录,并最终获得可靠性检测所需的关键性能指标记录,为后续分析和性能评估提供详细的数据支持。
进一步地,在基于预设可靠性检测模型和关键性能指标记录执行可靠性检测步骤中,可靠性检测模型预设过程包括:基于关键性能指标记录获取训练集和测试集;构建可靠性检测模型,基于训练集、测试集和可靠性检测模型执行模型训练步骤和模型优化步骤,得到预设可靠性检测模型。
上述方案中,通过关键性能指标记录形成训练集和测试集,以此对可靠性检测模型进行训练和优化,以最终获得精确度更高和检测更加可靠的预设可靠性检测模型。
进一步地,构建可靠性检测模型,基于训练集、测试集和可靠性检测模型执行模型训练步骤和模型优化步骤,得到预设可靠性检测模型,包括:
基于深度学习框架和机器学习算法构建可靠性检测模型;
基于训练集、测试集和可靠性检测模型执行模型训练步骤:
在可靠性检测模型中基于训练集和长短期记忆网络算法获取时序特征变化训练结果;基于训练集和异常检测算法获取训练指标突变情况;在初始检测模型中基于时序特征变化训练结果、训练指标突变情况、向量机和注意力机制进行分类和拟合回归预测,获取可靠性训练模型及训练评估结果;
基于可靠性训练模型执行模型优化步骤:基于训练评估结果获取评估准确率和损失函数,以基于交叉验证方法、评估准确率和损失函数迭代优化可靠性训练模型,获取可靠性优化模型;
基于测试集和可靠性优化模型获取测试评估结果,确定测试评估结果符合预设要求时得到预设可靠性检测模型。
上述方案中,在模型训练过程中,采用长短期记忆网络算法分析时序特征变化,根据模型和规则即异常检测算法两种方式利用趋势分析和异常检测算法识别指标突变,结合支持向量机、注意力机制拟合训练集进行分类与回归预测,完成模型的构建训练过程,接着通过交叉验证对训练模型进行迭代优化,并最终采用测试集进行模型测试,确认符合检测精度要求的模型作为后续检测所使用的预设可靠性检测模型,以支持后续生成可靠性评分和相关分析预测结果、报告等,为系统运行状态评估和优化建议提供数据支持。
进一步地,基于数据分析报告、加权评分算法、异常检测算法和线性回归分析获取可靠性评分、影响分析结果和风险预测结果,完成对集群的可靠性检测,包括:
基于数据分析报告和加权评分算法计算可靠性评分,其计算方式满足下式:
式中:R代表可靠性评分,w1代表第一关键性能指标的权重系数,w2代表第二关键性能指标的权重系数,ΔT代表第一关键性能指标,Tbase代表第一关键性能指标变化前的初始值,ΔR代表第二关键性能指标变化值,Rbase代表第二关键性能指标变化前的初始值;
基于数据分析报告、异常检测算法和线性回归分析获取影响分析结果和风险预测结果;
基于可靠性评分、影响分析结果和风险预测结果生成可视化可靠性报告,完成对集群的可靠性检测。
上述方案中,通过采用加权评分算法对数据分析报告进行计算、评估和进一步分析,计算出可靠性评分,精确量化了集群在相应复杂故障场景下运行时的可靠性检测结果,并且得到影响分析结果和风险预测结果,具体分析了相应故障对关键性能指标的影响及其变化,以及实现了对潜在风险的预测;并且根据分析计算结果自动生成可视化可靠性报告,直观反映集群系统的可靠性水平,便于不同集群系统之间的对比分析。
进一步地,基于可靠性评分、影响分析结果和风险预测结果生成可视化可靠性报告,完成对集群的可靠性检测,包括:
通过LLM模型基于可靠性评分、影响分析结果和风险预测结果生成优化建议;
基于可靠性评分、影响分析结果、风险预测结果和优化建议生成可视化可靠性报告,完成对集群的可靠性检测。
上述方案中,采用LLM模型结合已有的运行相关的知识图谱、可靠性评分、影响分析结果和风险预测结果,实现自动输出包含优化建议的分析报告,为系统运行状态评估和优化调整提供直观的数据支持和改进方法,以提升集群系统的稳定性和抗故障能力。
本发明首先通过相应的故障模拟技术在真实的集群运行环境中进行故障模拟,支持多种类型的故障注入和复杂场景的组合测试,覆盖率显著提升;同时通过模型分析可以发现多节点间的交互效应,实现了高效、全面且精确的复杂场景故障模拟;同时实时监控反馈集群运行状态,以及在故障模拟异常时进行异常恢复,保证了故障模拟以及后续测试过程的可控性与安全性;进而通过实时采集相应的关键性能指标记录信息,以结合训练优化后的可靠性检测模型在进行复杂故障模拟的基础上,通过关键性能指标记录进行数据检测分析,并最终通过数据分析报告生成可靠性评分、影响分析结果和风险预测结果,实现对故障前后集群运行状态变化的实时采集分析以及准确量化故障对可靠性的影响;通过该方法得到的可靠性检测结果能够直观反映集群系统的可靠性水平,将复杂的性能数据转化为易于理解和决策的可靠性指标,便于不同集群系统之间的对比分析,实现了故障注入、数据采集和分析全流程的自动化,显著减少了人工干预,提高了测试效率。
本发明还提供一种基于故障模拟的集群可靠性测试系统,用于实现一种基于故障模拟的集群可靠性测试方法,包括:
故障模拟模块,用于获取注入参数信息,基于注入参数信息和故障转移模型在集群中进行故障模拟,以得到复杂故障场景;
数据采集模块,用于基于复杂故障场景实时获取关键性能指标记录;
可靠性检测模块,用于基于预设可靠性检测模型和关键性能指标记录执行可靠性检测步骤:基于关键性能指标记录和长短期记忆网络算法获取时序特征变化结果;基于关键性能指标记录、向量机和注意力机制进行分类和拟合回归预测,获取分类预测结果;基于关键性能指标记录和异常检测算法获取指标突变情况;基于时序特征变化结果、分类预测结果和指标突变情况获取数据分析报告;
智能分析生成模块,用于基于数据分析报告、加权评分算法、异常检测算法和线性回归分析获取可靠性评分、影响分析结果和风险预测结果,完成对集群的可靠性检测。
本发明提供的系统首先通过故障模拟模块采用相应的故障模拟技术在真实的集群运行环境中进行故障模拟,确保测试结果更贴近实际场景,实现了高效、全面且精确地在集群中进行多类型复杂故障场景的故障模拟;同时基于数据采集模块实时采集相应的关键性能指标记录信息,接着通过可靠性检测模块基于可靠性检测模型实现对关键性能指标记录的数据检测分析生成相应的数据分析报告,并最终结合智能分析生成模块基于数据分析报告生成可靠性评分、影响分析结果和风险预测结果,实现可靠性检测结果的精准量化;通过该方法得到的可靠性检测结果能够直观反映集群系统的可靠性水平,便于不同集群系统之间的对比分析,同时显著减少了人工干预,提高了测试效率和检测能力。
附图说明
图1为本发明一实施例提供的一种基于故障模拟的集群可靠性测试方法示意图;
图2为本发明一实施例提供的一种基于故障模拟的集群可靠性评估框架测试方法示意图。
具体实施方式
下面将结合本发明实施例中的附图,对本发明实施例中的技术方案进行清楚、完整地描述,显然,所描述的实施例仅仅是本发明一部分实施例,而不是全部的实施例。基于本发明中的实施例,本领域普通技术人员在没有作出创造性劳动前提下所获得的所有其他实施例,都属于本发明保护的范围。
实施例一:
本实施例提供了一种基于故障模拟的集群可靠性测试方法,如图1所示,包括以下步骤:
S1:获取注入参数信息,基于注入参数信息和故障转移模型在集群中进行故障模拟,以得到复杂故障场景;
S2:基于复杂故障场景实时获取关键性能指标记录;
S3:基于预设可靠性检测模型和关键性能指标记录执行可靠性检测步骤:基于关键性能指标记录和长短期记忆网络算法获取时序特征变化结果;基于关键性能指标记录、向量机和注意力机制进行分类和拟合回归预测,获取分类预测结果;基于关键性能指标记录和异常检测算法获取指标突变情况;基于时序特征变化结果、分类预测结果和指标突变情况获取数据分析报告;
S4:基于数据分析报告、加权评分算法、异常检测算法和线性回归分析获取可靠性评分、影响分析结果和风险预测结果,完成对集群的可靠性检测。
上述方案首先通过相应的故障模拟技术在真实的集群运行环境中进行故障模拟,确保测试结果更贴近实际场景,实现了高效、全面且精确地在集群中进行多类型复杂故障场景的故障模拟;同时实时采集相应的关键性能指标记录信息,通过可靠性检测模型进行关键性能指标记录的数据检测分析,并最终结合数据分析报告生成可靠性评分、影响分析结果和风险预测结果,实现可靠性检测结果的精准量化;通过该方法得到的可靠性检测结果能够直观反映集群系统的可靠性水平,便于不同集群系统之间的对比分析,同时显著减少了人工干预,提高了测试效率和检测能力。
可选的,步骤S1包括:基于马尔可夫链构建故障转移模型;获取注入参数信息,采用并行注入技术基于注入参数信息和故障转移模型在集群中进行故障模拟,以得到复杂故障场景。
在具体实施过程中,通过随机故障注入算法和基于马尔可夫链的故障转移模型,在分布式集群中指定节点注入故障,结合系统资源监控信号(如CPU、内存、磁盘I/O等)与网络状态信号(如丢包率、延迟等),实现对网络延迟、节点宕机、磁盘故障、资源争用等多种故障类型的精准模拟,并且支持灵活配置故障注入的范围、时间和频率等多种注入参数信息,并通过并行注入技术提升模拟效率,结合实时监控与反馈机制确保模拟过程的精确性与可控性,从而最大限度还原复杂故障场景;在获取注入参数信息时,可以通过用户在工具界面直观便捷选择的目标集群,以及灵活配置故障注入的具体参数,包括选择故障类型(如网络延迟、节点宕机、磁盘故障、资源争用等)、受影响的节点范围、测试持续时间以及预设异常恢复策略;同时,还可设置故障触发条件和恢复机制,以确保测试过程的可控性与安全性。
可选的,在进行步骤S1时,还包括:基于实时监控和反馈机制获取故障数据信息,当故障数据信息不符合预设可控范围时,基于故障数据信息调节注入参数信息,以得到最终复杂故障场景。
可选的,在进行步骤S1时,还包括:基于实时监控和反馈机制调节获取故障数据信息,当故障数据信息符合预设异常范围时,基于故障数据信息和预设异常恢复策略调节注入参数信息,以使集群恢复正常运行状态。
在具体实施过程中,通过实时监控和反馈机制对集群运行状态进行实时监控与详细记录,采集的故障数据信息涵盖CPU利用率、内存占用、磁盘I/O速率、网络延迟等关键性能指标,并通过日志记录系统行为变化,为后续分析和性能评估提供详细的数据支持,有助于故障定位与优化恢复策略的制定;在实际应用过程中,假设给定一个具体的工艺参数范围,实时数据的采样频率支持1秒~10分钟的采样间隔,适配集群规模支持2~1000台节点的分布式集群;支持故障类型范围包括,网络延迟(50ms~1000ms)、CPU资源占用(10%~100%)、内存泄漏(10%100%)、磁盘I/O瓶颈(10MB/s100MB/s)等,当实时采样得到的故障数据信息超出支持故障类型范围时,则认为符合预设异常范围时,进行集群异常恢复,使集群恢复正常运行状态。
可选的,步骤S2包括:创建自定义数据采集脚本;获取故障注入信号,基于故障注入信号、自定义数据采集脚本和复杂故障场景实时获取源数据信息;基于源数据信息和预设数据处理方式获取关键性能指标记录。
在具体实施过程中,通过开发自定义监控数据采集脚本整合实时监控和反馈机制,在故障注入模拟的同时自动启动数据采集过程,获取相应数据信息,分布式上传集群的相关运行性能指标,并且结合kafka等消息队列传输保证性能指标传输的可靠性,通过spark、mapreduce等数据处理框架消费数据得到分布式集群运行时的关键性能指标,包括节点资源利用率、网络延迟、任务完成率、应用监控指标和服务可用性等,最终形成可靠性检测所需的关键性能指标记录。
可选的,在步骤S3中,可靠性检测模型预设过程包括:基于关键性能指标记录获取训练集和测试集;构建可靠性检测模型,基于训练集、测试集和可靠性检测模型执行模型训练步骤和模型优化步骤,得到预设可靠性检测模型。
可选的,构建可靠性检测模型,基于训练集、测试集和可靠性检测模型执行模型训练步骤和模型优化步骤,得到预设可靠性检测模型,包括:
基于深度学习框架和机器学习算法构建可靠性检测模型;
基于训练集、测试集和可靠性检测模型执行模型训练步骤:
在可靠性检测模型中基于训练集和长短期记忆网络算法获取时序特征变化训练结果;基于训练集和异常检测算法获取训练指标突变情况;在初始检测模型中基于时序特征变化训练结果、训练指标突变情况、向量机和注意力机制进行分类和拟合回归预测,获取可靠性训练模型及训练评估结果;
基于可靠性训练模型执行模型优化步骤:基于训练评估结果获取评估准确率和损失函数,以基于交叉验证方法、评估准确率和损失函数迭代优化可靠性训练模型,获取可靠性优化模型;
基于测试集和可靠性优化模型获取测试评估结果,确定测试评估结果符合预设要求时得到预设可靠性检测模型。
在具体实施过程中,采用深度学习框架并结合机器学习算法构建,设计过程中基于多层神经网络(如LSTM或CNN)提取时序特征,并结合决策树、支持向量机(SVM)或注意力机制模型进行分类和回归分析;在数据处理方面,采集系统运行过程中关键性能指标记录以及故障事件日志后,首先通过数据清洗、归一化和特征提取步骤进行数据预处理;训练阶段使用历史故障数据集进行处理,将处理后的数据进行标注得到训练和测试的数据集,采用训练集进行监督学习,并利用交叉验证优化模型参数,计算损失函数和准确率,并通过损失函数和准确率评估指标迭代优化模型性能。
在具体实施过程中,基于模型测试可靠性时,通过均值、标准差和偏差分析评估计算指标的稳定性,均值能够反映数据的集中趋势,标准差用于衡量数据的离散程度,偏差分析则有助于明确数据偏离均值的具体情况,并根据模型和规则两种方式利用趋势分析和异常检测算法识别指标突变。例如,CPU利用率持续超过80%可能指示资源瓶颈,而网络丢包率超过5%可能导致通信异常,从而表现为系统响应时间延长或服务不可用;在预测过程中,通过对比故障前后的系统状态变化,实时计算关键指标的偏差和异常分布,支持后续生成可靠性模型评分和趋势分析报告,为系统运行状态评估和优化提供数据支持。
可选的,步骤S4包括:
基于数据分析报告和加权评分算法计算可靠性评分,其计算方式满足下式:
式中:R代表可靠性评分,w1代表第一关键性能指标的权重系数,w2代表第二关键性能指标的权重系数,ΔT代表第一关键性能指标,Tbase代表第一关键性能指标变化前的初始值,ΔR代表第二关键性能指标变化值,Rbase代表第二关键性能指标变化前的初始值;
基于数据分析报告、异常检测算法和线性回归分析获取影响分析结果和风险预测结果;
基于可靠性评分、影响分析结果和风险预测结果生成可视化可靠性报告,完成对集群的可靠性检测。
可选的,基于可靠性评分、影响分析结果和风险预测结果生成可视化可靠性报告,完成对集群的可靠性检测,包括:
通过LLM模型基于可靠性评分、影响分析结果和风险预测结果生成优化建议;
基于可靠性评分、影响分析结果、风险预测结果和优化建议生成可视化可靠性报告,完成对集群的可靠性检测。
在具体实施过程中,计算各个指标单位平均变化趋势、变化幅度和变化速度等,利用异常检测算法分析故障对各指标的影响,如网络延迟增加10ms导致响应时间延长20%,并结合测试数据趋势预测潜在风险,最终,报告针对不同的性能瓶颈和异常表现,可以构建与之对应的提示词,例如:在工艺参数范围[具体范围]内,当出现[具体性能瓶颈或异常表现1]时,提示词为[提示词1],当出现[具体性能瓶颈或异常表现2]时,提示词为[提示词2],以此类推;并借助LLM模型推理,生成针对性的优化建议;并最终将分析结果以图表和文字形式输出,通过大模型结合已有的运行相关的知识图谱、可靠性检测相关数据及打分,自动输出可视化可靠性报告,分析报告设计可靠性评估指标、可靠性评分、影响分析、风险预测和优化建议、改进方案,并通过报告中的图标直观展示测试结果、优化建议。
本实施例首先通过相应的故障模拟技术在真实的集群运行环境中进行故障模拟,支持多种类型的故障注入和复杂场景的组合测试,覆盖率显著提升;同时通过模型分析可以发现多节点间的交互效应,实现了高效、全面且精确的复杂场景故障模拟;同时实时监控反馈集群运行状态,以及在故障模拟异常时进行异常恢复,保证了故障模拟以及后续测试过程的可控性与安全性;进而通过实时采集相应的关键性能指标记录信息,以结合训练优化后的可靠性检测模型在进行复杂故障模拟的基础上,通过关键性能指标记录进行数据检测分析,并最终通过数据分析报告生成可靠性评分、影响分析结果和风险预测结果,实现可靠性检测结果的精准量化;通过该方法得到的可靠性检测结果能够直观反映集群系统的可靠性水平,便于不同集群系统之间的对比分析,实现了故障注入、数据采集和分析全流程的自动化,显著减少了人工干预,提高了测试效率。
实施例二:
本实施例提供一种基于故障模拟的集群可靠性测试系统,用于实现一种基于故障模拟的集群可靠性测试方法,包括:
故障模拟模块,用于获取注入参数信息,基于注入参数信息和故障转移模型在集群中进行故障模拟,以得到复杂故障场景;
数据采集模块,用于基于复杂故障场景实时获取关键性能指标记录;
可靠性检测模块,用于基于预设可靠性检测模型和关键性能指标记录执行可靠性检测步骤:基于关键性能指标记录和长短期记忆网络算法获取时序特征变化结果;基于关键性能指标记录、向量机和注意力机制进行分类和拟合回归预测,获取分类预测结果;基于关键性能指标记录和异常检测算法获取指标突变情况;基于时序特征变化结果、分类预测结果和指标突变情况获取数据分析报告;
智能分析生成模块,用于基于数据分析报告、加权评分算法、异常检测算法和线性回归分析获取可靠性评分、影响分析结果和风险预测结果,完成对集群的可靠性检测。
本实施例提供的系统首先通过故障模拟模块采用相应的故障模拟技术在真实的集群运行环境中进行故障模拟,确保测试结果更贴近实际场景,实现了高效、全面且精确地在集群中进行多类型复杂故障场景的故障模拟;同时基于数据采集模块实时采集相应的关键性能指标记录信息,接着通过可靠性检测模块基于可靠性检测模型实现对关键性能指标记录的数据检测分析生成相应的数据分析报告,并最终结合智能分析生成模块基于数据分析报告生成可靠性评分、影响分析结果和风险预测结果,实现可靠性检测结果的精准量化;通过该方法得到的可靠性检测结果能够直观反映集群系统的可靠性水平,便于不同集群系统之间的对比分析,同时显著减少了人工干预,提高了测试效率和检测能力;且系统设计具备模块化和通用性,能够支持适配不同规模的集群,以根据需求扩展支持更多的故障类型和数据分析能力。
实施例三:
本实施提供一种基于故障模拟的集群可靠性评估框架,采用实施例提供的可靠性测试方法实现,如图2所示,其测试方法包括以下步骤:
S31:目标配置与参数设定,获取注入参数信息:通过工具界面选择目标集群,配置故障类型、注入范围、测试时长及预设异常恢复策略,并定义关键性能指标与评估标准;
S32:故障注入与模拟执行,得到复杂故障场景:基于注入参数信息在指定节点注入模拟故障,得到复杂故障场景,同时实时监控集群状态;
S33:数据采集与分析计算:采集各项关键性能指标,采用加权评分算法和异常检测分析评估故障影响,并结合预设可靠性检测模型生成可靠性评分与性能趋势分析;
S34:报告生成与结果评估:基于可靠性评分与性能趋势分析借助于LLM模型的推理生成技术自动生成可视化可靠性报告,包括可靠性评分、故障影响分析和改进建议,例如优化资源配置、提升网络性能或增加冗余设计;
S35:恢复与优化调整:若故障注入模拟过程中发生异常,执行预设异常恢复策略,恢复正常运行状态,并根据改进建议进一步调整系统配置,以优化稳定性和抗故障能力。
实施例四:
本实施提供一种基于单点故障的集群可靠性测试应用方案,包括以下过程:在一个由100台节点组成的分布式集群中,随机选择一台节点注入500ms网络延迟故障,利用可靠性检测模型进行分析评估,首先,采集系统吞吐量和响应时间等关键指标,并计算其故障前后的变化率,通过加权评分算法量化可靠性评分,具体公式为:
其中,R0代表可靠性评分,w10代表响应时间的权重系数,w20代表吞吐量的权重系数,ΔT0代表响应时间,Tbase0代表响应时间变化前的初始值,ΔR0代表吞吐量变化值,Rbase0代表吞吐量变化前的初始值;
当分析得出可靠性评分为85分环比下降时,表明系统在当前故障场景下存在一定性能下降,基于评估结果,建议优化网络路由配置,以降低延迟并提高集群稳定性。
在具体实施过程中,基于可靠性测试方法进行多点组合故障测试,示例如下:在同一集群中,同时模拟两台节点的CPU资源占用(90%)和一台节点的磁盘I/O瓶颈(90%),测试工具记录任务完成率下降比例,响应时间增加情况,最终输入到预设可靠性检测模型生成可靠性评分及可视化可靠性报告,自动生成建议增加负载均衡策略,并通过可视化可靠性报告改进模型。
在具体实施过程中,基于可靠性测试方法进行大规模集群故障测试时,示例如下:在一个由500台节点组成的分布式系统中,模拟10台节点的内存占满(100%)故障,采集相关数据,生成详细报告;报告中包括性能变化曲线,显示故障发生时系统的内存使用、响应时间和吞吐量等关键指标的变化,并记录系统在恢复期间的表现。例如,内存占满时,响应时间可能会显著上升,吞吐量则可能急剧下降,而在恢复过程中,这些指标逐步恢复至正常水平;根据这些数据,报告提出了优化内存管理策略的建议,如增加内存资源分配、改进内存回收机制或调整负载均衡策略,以提高系统的稳定性和故障恢复能力。
以上所述是本发明的优选实施方式,应当指出,对于本技术领域的普通技术人员来说,在不脱离本发明原理的前提下,还可以做出若干改进和润饰,这些改进和润饰也视为本发明的保护范围。

Claims (10)

1.一种基于故障模拟的集群可靠性测试方法,其特征在于,包括以下步骤:
获取注入参数信息,基于注入参数信息和故障转移模型在集群中进行故障模拟,以得到复杂故障场景;
基于复杂故障场景实时获取关键性能指标记录;
基于预设可靠性检测模型和关键性能指标记录执行可靠性检测步骤:
基于关键性能指标记录和长短期记忆网络算法获取时序特征变化结果;基于关键性能指标记录、向量机和注意力机制进行分类和拟合回归预测,获取分类预测结果;基于关键性能指标记录和异常检测算法获取指标突变情况;基于时序特征变化结果、分类预测结果和指标突变情况获取数据分析报告;
基于数据分析报告、加权评分算法、异常检测算法和线性回归分析获取可靠性评分、影响分析结果和风险预测结果,完成对集群的可靠性检测。
2.根据权利要求1所述的一种基于故障模拟的集群可靠性测试方法,其特征在于,所述获取注入参数信息,基于注入参数信息和故障转移模型在集群中进行故障模拟,以得到复杂故障场景,包括:
基于马尔可夫链构建故障转移模型;
获取注入参数信息,采用并行注入技术基于注入参数信息和故障转移模型在集群中进行故障模拟,以得到复杂故障场景。
3.根据权利要求1所述的一种基于故障模拟的集群可靠性测试方法,其特征在于,在所述获取注入参数信息,基于注入参数信息和故障转移模型在集群中进行故障模拟,以得到复杂故障场景时,还包括:基于实时监控和反馈机制获取故障数据信息,当故障数据信息不符合预设可控范围时,基于故障数据信息调节注入参数信息,以得到最终复杂故障场景。
4.根据权利要求3所述的一种基于故障模拟的集群可靠性测试方法,其特征在于,在所述获取注入参数信息,基于注入参数信息和故障转移模型在集群中进行故障模拟,以得到复杂故障场景时,还包括:
基于实时监控和反馈机制调节获取故障数据信息,当故障数据信息符合预设异常范围时,基于故障数据信息和预设异常恢复策略调节注入参数信息,以使集群恢复正常运行状态。
5.根据权利要求1所述的一种基于故障模拟的集群可靠性测试方法,其特征在于,所述基于复杂故障场景实时获取关键性能指标记录,包括:
创建自定义数据采集脚本;
获取故障注入信号,基于故障注入信号、自定义数据采集脚本和复杂故障场景实时获取源数据信息;
基于源数据信息和预设数据处理方式获取关键性能指标记录。
6.根据权利要求1所述的一种基于故障模拟的集群可靠性测试方法,其特征在于,在所述基于预设可靠性检测模型和关键性能指标记录执行可靠性检测步骤中,所述可靠性检测模型预设过程包括:
基于关键性能指标记录获取训练集和测试集;
构建可靠性检测模型,基于训练集、测试集和可靠性检测模型执行模型训练步骤和模型优化步骤,得到预设可靠性检测模型。
7.根据权利要求6所述的一种基于故障模拟的集群可靠性测试方法,其特征在于,所述构建可靠性检测模型,基于训练集、测试集和可靠性检测模型执行模型训练步骤和模型优化步骤,得到预设可靠性检测模型,包括:
基于深度学习框架和机器学习算法构建可靠性检测模型;
基于训练集、测试集和可靠性检测模型执行模型训练步骤:
在可靠性检测模型中基于训练集和长短期记忆网络算法获取时序特征变化训练结果;基于训练集和异常检测算法获取训练指标突变情况;在初始检测模型中基于时序特征变化训练结果、训练指标突变情况、向量机和注意力机制进行分类和拟合回归预测,获取可靠性训练模型及训练评估结果;
基于可靠性训练模型执行模型优化步骤:基于训练评估结果获取评估准确率和损失函数,以基于交叉验证方法、评估准确率和损失函数迭代优化可靠性训练模型,获取可靠性优化模型;
基于测试集和可靠性优化模型获取测试评估结果,确定测试评估结果符合预设要求时得到预设可靠性检测模型。
8.根据权利要求1所述的一种基于故障模拟的集群可靠性测试方法,其特征在于,所述基于数据分析报告、加权评分算法、异常检测算法和线性回归分析获取可靠性评分、影响分析结果和风险预测结果,完成对集群的可靠性检测,包括:
基于数据分析报告和加权评分算法计算可靠性评分,其计算方式满足下式:
式中:R代表可靠性评分,w1代表第一关键性能指标的权重系数,w2代表第二关键性能指标的权重系数,ΔT代表第一关键性能指标,Tbase代表第一关键性能指标变化前的初始值,ΔR代表第二关键性能指标变化值,Rbase代表第二关键性能指标变化前的初始值;
基于数据分析报告、异常检测算法和线性回归分析获取影响分析结果和风险预测结果;
基于可靠性评分、影响分析结果和风险预测结果生成可视化可靠性报告,完成对集群的可靠性检测。
9.根据权利要求8所述的一种基于故障模拟的集群可靠性测试方法,其特征在于,所述基于可靠性评分、影响分析结果和风险预测结果生成可视化可靠性报告,完成对集群的可靠性检测,包括:
通过LLM模型基于可靠性评分、影响分析结果和风险预测结果生成优化建议;
基于可靠性评分、影响分析结果、风险预测结果和优化建议生成可视化可靠性报告,完成对集群的可靠性检测。
10.一种基于故障模拟的集群可靠性测试系统,其特征在于,用于实现如权利要求1~9任一项所述的一种基于故障模拟的集群可靠性测试方法,包括:
故障模拟模块,用于获取注入参数信息,基于注入参数信息和故障转移模型在集群中进行故障模拟,以得到复杂故障场景;
数据采集模块,用于基于复杂故障场景实时获取关键性能指标记录;
可靠性检测模块,用于基于预设可靠性检测模型和关键性能指标记录执行可靠性检测步骤:基于关键性能指标记录和长短期记忆网络算法获取时序特征变化结果;基于关键性能指标记录、向量机和注意力机制进行分类和拟合回归预测,获取分类预测结果;基于关键性能指标记录和异常检测算法获取指标突变情况;基于时序特征变化结果、分类预测结果和指标突变情况获取数据分析报告;
智能分析生成模块,用于基于数据分析报告、加权评分算法、异常检测算法和线性回归分析获取可靠性评分、影响分析结果和风险预测结果,完成对集群的可靠性检测。
CN202510182427.6A 2025-02-19 2025-02-19 一种基于故障模拟的集群可靠性测试方法及系统 Pending CN120179435A (zh)

Priority Applications (1)

Application Number Priority Date Filing Date Title
CN202510182427.6A CN120179435A (zh) 2025-02-19 2025-02-19 一种基于故障模拟的集群可靠性测试方法及系统

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
CN202510182427.6A CN120179435A (zh) 2025-02-19 2025-02-19 一种基于故障模拟的集群可靠性测试方法及系统

Publications (1)

Publication Number Publication Date
CN120179435A true CN120179435A (zh) 2025-06-20

Family

ID=96025152

Family Applications (1)

Application Number Title Priority Date Filing Date
CN202510182427.6A Pending CN120179435A (zh) 2025-02-19 2025-02-19 一种基于故障模拟的集群可靠性测试方法及系统

Country Status (1)

Country Link
CN (1) CN120179435A (zh)

Cited By (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN120370660A (zh) * 2025-06-25 2025-07-25 云南意达智能科技有限公司 中药提取浓缩过程带ai识别的智能控制系统
CN120429182A (zh) * 2025-07-08 2025-08-05 深圳卓创智能科技有限公司 应用于出厂检测的笔记本多场景压力测试方法及系统
CN120475284A (zh) * 2025-07-15 2025-08-12 深圳市华旭科技开发有限公司 一种基于开源鸿蒙的水表数据采集方法

Cited By (4)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN120370660A (zh) * 2025-06-25 2025-07-25 云南意达智能科技有限公司 中药提取浓缩过程带ai识别的智能控制系统
CN120429182A (zh) * 2025-07-08 2025-08-05 深圳卓创智能科技有限公司 应用于出厂检测的笔记本多场景压力测试方法及系统
CN120475284A (zh) * 2025-07-15 2025-08-12 深圳市华旭科技开发有限公司 一种基于开源鸿蒙的水表数据采集方法
CN120475284B (zh) * 2025-07-15 2025-09-12 深圳市华旭科技开发有限公司 一种基于开源鸿蒙的水表数据采集方法

Similar Documents

Publication Publication Date Title
EP3557819B1 (en) Server failure detection method and system
CN120179435A (zh) 一种基于故障模拟的集群可靠性测试方法及系统
CN111290913A (zh) 一种基于运维数据预测的故障定位可视化系统和方法
CN113656323B (zh) 一种自动化测试、定位及修复故障的方法及存储介质
KR20180108446A (ko) Ict 인프라 관리 시스템 및 이를 이용한 ict 인프라 관리 방법
CN118093434A (zh) 一种智能化信息系统性能评估与测试方法及系统
CN119149923A (zh) 一种基于工业自动化的数字孪生方法、系统、计算设备及存储介质
CN119966504B (zh) 一种基于数字孪生的港口通信光缆路由检测方法及系统
CN109472097B (zh) 一种输电线路在线监测设备故障诊断方法
CN112906764B (zh) 基于改进bp神经网络的通信安全设备智能诊断方法及系统
CN118965247B (zh) 一种基于多源数据的电厂数据管理方法及系统
CN120256178A (zh) 一种基于物联网的存储硬盘远程诊断系统及方法
CN113962309A (zh) 一种无人船可靠性测试与评价方法
CN120197957A (zh) 一种基于人工智能的数据中心异常行为分析系统
CN117713084A (zh) 电力系统分区负荷需求预测方法、系统、设备及存储介质
CN119420629A (zh) 一种基于图卷积神经网络的微服务故障根因定位方法
Najar et al. Comparative machine learning study for estimating Peak cladding temperature in AP1000 under LOFW
CN114490149A (zh) 一种基于故障树的通用故障预测方法
CN120822604A (zh) 一种基于智能体的自动化运维方法及系统
CN120146468A (zh) 一种基于大数据的物业智能管理调配方法及系统
CN119782390A (zh) 一种变电站巡视报告生成方法和系统
CN118708648A (zh) 一种基于云计算的综合测试系统
CN118761640A (zh) 一种基于adc-神经网络的装备维修保障效能评估方法
CN110780660A (zh) 一种基于生产状态的烟草生产工业控制系统故障诊断方法
CN120045399B (zh) 基于强化学习的高速接口容错测试流程自适应生成方法

Legal Events

Date Code Title Description
PB01 Publication
PB01 Publication
SE01 Entry into force of request for substantive examination
SE01 Entry into force of request for substantive examination