CN120780519A - 结合多维异常检测的跨系统故障诊断方法及系统 - Google Patents

结合多维异常检测的跨系统故障诊断方法及系统

Info

Publication number
CN120780519A
CN120780519A CN202510875259.9A CN202510875259A CN120780519A CN 120780519 A CN120780519 A CN 120780519A CN 202510875259 A CN202510875259 A CN 202510875259A CN 120780519 A CN120780519 A CN 120780519A
Authority
CN
China
Prior art keywords
liquid
time constant
fault
data
diagnostic
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
CN202510875259.9A
Other languages
English (en)
Inventor
何晶
杨辰
葛晓波
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Shanghai Eoi Information Technology Co ltd
Original Assignee
Shanghai Eoi Information Technology Co ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Shanghai Eoi Information Technology Co ltd filed Critical Shanghai Eoi Information Technology Co ltd
Priority to CN202510875259.9A priority Critical patent/CN120780519A/zh
Publication of CN120780519A publication Critical patent/CN120780519A/zh
Pending legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F11/00Error detection; Error correction; Monitoring
    • G06F11/07Responding to the occurrence of a fault, e.g. fault tolerance
    • G06F11/0703Error or fault processing not based on redundancy, i.e. by taking additional measures to deal with the error or fault not making use of redundancy in operation, in hardware, or in data representation
    • G06F11/079Root cause analysis, i.e. error or fault diagnosis
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F11/00Error detection; Error correction; Monitoring
    • G06F11/07Responding to the occurrence of a fault, e.g. fault tolerance
    • G06F11/0703Error or fault processing not based on redundancy, i.e. by taking additional measures to deal with the error or fault not making use of redundancy in operation, in hardware, or in data representation
    • G06F11/0706Error or fault processing not based on redundancy, i.e. by taking additional measures to deal with the error or fault not making use of redundancy in operation, in hardware, or in data representation the processing taking place on a specific hardware platform or in a specific software environment
    • G06F11/0709Error or fault processing not based on redundancy, i.e. by taking additional measures to deal with the error or fault not making use of redundancy in operation, in hardware, or in data representation the processing taking place on a specific hardware platform or in a specific software environment in a distributed system consisting of a plurality of standalone computer nodes, e.g. clusters, client-server systems
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F17/00Digital computing or data processing equipment or methods, specially adapted for specific functions
    • G06F17/10Complex mathematical operations
    • G06F17/11Complex mathematical operations for solving equations, e.g. nonlinear equations, general mathematical optimization problems
    • G06F17/13Differential equations
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/04Architecture, e.g. interconnection topology
    • G06N3/042Knowledge-based neural networks; Logical representations of neural networks
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/08Learning methods
    • G06N3/084Backpropagation, e.g. using gradient descent
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/08Learning methods
    • G06N3/092Reinforcement learning
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/08Learning methods
    • G06N3/096Transfer learning
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N5/00Computing arrangements using knowledge-based models
    • G06N5/02Knowledge representation; Symbolic representation
    • G06N5/022Knowledge engineering; Knowledge acquisition
    • G06N5/025Extracting rules from data
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N5/00Computing arrangements using knowledge-based models
    • G06N5/04Inference or reasoning models
    • G06N5/041Abduction

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • General Physics & Mathematics (AREA)
  • General Engineering & Computer Science (AREA)
  • Mathematical Physics (AREA)
  • Data Mining & Analysis (AREA)
  • Software Systems (AREA)
  • Computational Linguistics (AREA)
  • Artificial Intelligence (AREA)
  • Computing Systems (AREA)
  • Evolutionary Computation (AREA)
  • Biomedical Technology (AREA)
  • Health & Medical Sciences (AREA)
  • Biophysics (AREA)
  • Molecular Biology (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • General Health & Medical Sciences (AREA)
  • Pure & Applied Mathematics (AREA)
  • Mathematical Analysis (AREA)
  • Mathematical Optimization (AREA)
  • Computational Mathematics (AREA)
  • Quality & Reliability (AREA)
  • Operations Research (AREA)
  • Algebra (AREA)
  • Databases & Information Systems (AREA)
  • Computer Hardware Design (AREA)
  • Management, Administration, Business Operations System, And Electronic Commerce (AREA)

Abstract

本发明公开了结合多维异常检测的跨系统故障诊断方法及系统,涉及故障诊断技术领域,该方法通过动态拓扑依赖关系和多维关键性能指标流,构建以液态时间常数网络单元为节点的图神经网络,每个单元通过耦合常微分方程系统描述状态演化,液态时间常数可自适应调整。采用时间反向传播算法训练模型学习正常行为轨迹轮廓基准,通过动态时间规整距离检测异常。通过反事实干预和前向积分求解确定故障传播路径和根因。在液态图神经网络仿真环境中生成最优诊断动作序列,基于执行效率、准确性和修复效果计算奖励值进行策略优化。提升异常检测准确率和根因定位精度,缩短故障修复时间,降低运维成本,为复杂信息技术系统提供智能化故障诊断解决方案。

Description

结合多维异常检测的跨系统故障诊断方法及系统
技术领域
本发明涉及故障诊断技术领域,具体是结合多维异常检测的跨系统故障诊断方法及系统。
背景技术
随着企业数字化转型的深入推进,现代信息技术系统呈现出前所未有的复杂性和多样性。特别是在云原生、微服务架构、容器化部署等技术广泛应用的背景下,企业IT基础设施通常包含数百甚至数千个相互依赖的组件,形成了复杂的分布式系统生态。这些系统中任何一个组件的故障都可能通过复杂的依赖关系传播到其他组件,引发级联故障,严重影响业务连续性和用户体验。传统的基于单一指标阈值监控和人工经验判断的故障诊断方法已无法满足现代复杂系统的运维需求。
现有的故障诊断技术主要存在以下几个方面的问题:第一,传统的基于静态阈值的监控方法无法适应系统的动态变化特性,容易产生大量误报和漏报;第二,现有的异常检测技术多基于单一维度的指标分析,缺乏对多维关键性能指标之间复杂关联关系的深度理解;第三,传统的根因分析方法主要依赖相关性分析,无法准确区分因果关系和虚假相关性,导致根因定位不准确;第四,现有的诊断系统缺乏智能化的决策能力,无法根据不同故障场景自适应地选择最优的诊断策略。
为了解决上述技术问题,迫切需要开发一种能够处理复杂分布式系统的智能化故障诊断技术。该技术应当具备以下核心能力:能够自适应地捕获系统的动态变化特性,实现高精度的多维异常检测;能够准确识别故障的因果传播路径,定位故障根因;能够通过智能化的决策机制,自动生成最优的诊断和修复策略;能够通过持续学习机制,不断适应新的系统架构和故障模式。
发明内容
本发明的目的在于克服现有技术的不足,提出结合多维异常检测的跨系统故障诊断方法及系统,以解决上述存在的问题。
用一段话总结本申请的整体技术手段和对应的技术效果
本发明的目的是通过以下技术方案来实现的:结合多维异常检测的跨系统故障诊断方法及系统,包括。
本发明的有益效果是:
1.采用液态时间常数网络单元构建动态图神经网络,每个单元通过耦合的常微分方程系统dx/dt=f(x,u,τ)描述状态演化,液态时间常数τ能够自适应调整,相比传统基于静态阈值的监控方法,液态图神经网络能够捕获系统的时变特性和动态行为模式,通过轨迹轮廓分析实现更精准的异常识别,液态时间常数的自适应调节机制能够根据输入信号的变化幅度和频率动态调整敏感性,当输入信号平稳时自动提高时间常数增强抗噪性,有效避免将正常的小幅波动误判为异常,系统能够同时检测毫秒级的瞬态异常和小时级的趋势异常,覆盖了从硬件故障到性能退化的全谱故障模式。
2.基于常微分方程语义的因果推断机制,通过反事实干预操作和前向积分求解,量化各组件对异常传播的因果贡献度。相比传统基于相关性分析的方法,反事实干预能够准确区分因果关系和虚假相关性,避免了因时间同步性导致的误判。通过构建因果嫌疑子图和逐层反事实分析,能够刻画故障在复杂系统中的传播路径和影响范围,为运维人员提供清晰的故障传播视图。系统能够处理多故障并发、级联故障、间歇性故障等复杂场景,通过因果置信度排序准确识别主要根因和次要因素。
3.深度强化学习诊断代理模块在液态图神经网络提供的稳定仿真环境中进行策略决策,生成有序的诊断动作序列。智能代理能够根据不同故障场景自适应选择最优诊断策略,避免了传统固定流程的低效性,显著缩短了故障诊断时间。通过自动化运维网关与外部平台集成,实现从诊断到修复的全自动化闭环,大幅减少人工干预时间。基于历史经验和持续学习的智能决策,相比人工诊断具有更高的一致性和准确性。
4.液态时间常数网络单元的有界动力学特性保证系统数值稳定性,结合隐式与显式欧拉方法的高性能常微分方程求解器。有界动力学设计确保液态时间常数网络单元状态始终保持在有限数值范围内,在各种异常输入情况下都能保持数值稳定。系统能够支持每秒处理数百万条关键性能指标数据,满足大规模企业级应用的实时性要求。
5.模型持续学习模块利用故障案例库进行增量训练和有监督微调,实现对新系统架构和故障模式的适应。通过增量学习机制,系统能够在遇到新的故障模式后快速学习并更新诊断策略,避免了传统系统需要重新训练的高成本问题。标准化的OpenTelemetry接口设计使得系统能够无缝对接不同技术栈的IT基础设施,降低了部署和集成的复杂度。随着运行时间的延长和故障案例的积累,系统诊断能力呈现持续提升趋势,具有越用越智能的特点。
6.通过异常轮廓分析和智能聚合技术,将海量原始告警聚合为少量高质量告警,大幅减少运维人员的信息过载。直观的可视化界面和智能化的诊断建议显著降低了运维工作的技术门槛和时间成本。通过自动化和智能化技术减少对运维专家的依赖,企业能够以更少的人力资源维护更复杂的IT系统。
7.通过及时发现和快速修复故障,显著减少了系统停机时间,提升了业务系统的整体可用性。故障定位和智能的修复策略能够最大限度地减少故障对业务运营的影响,保障企业的业务连续性。系统不仅能够检测已发生的故障,还能够通过轨迹趋势分析提供潜在风险的预警,实现故障的预防性处理。
附图说明
图1为本发明的步骤图;
图2为本发明的系统架构图;
图3为本发明的时序图。
具体实施方式
下面将结合实施例,对本发明的技术方案进行清楚、完整地描述,显然,所描述的实施例仅仅是本发明一部分实施例,而不是全部的实施例。基于本发明中的实施例,本领域技术人员在没有付出创造性劳动的前提下所获得的所有其他实施例,都属于本发明保护的范围。
在此说明,以下方案中“左”、“右”、“上”、“下”、“前”、“后”、“内”、“外”的方位概念均为相对方向,在此就不一一列举。
实施例一:
如图1至图3所示,本实施例结合多维异常检测的跨系统故障诊断方法的基础算法实现。
在具体实施中,首先通过OpenTelemetry标准接口建立与现代信息技术基础设施的标准化连接。该接口能够兼容多种主流技术栈,包括服务网格架构、Kubernetes容器编排平台以及企业配置管理数据库。通过该标准接口,系统能够实时获取信息技术系统的动态拓扑依赖关系数据,这些数据描述了系统各组件之间的依赖关系、服务调用链路以及网络连接状态。同时,系统持续采集各系统组件的关键性能指标流,包括中央处理器使用率、内存占用率、网络吞吐量、请求响应时间、错误率以及每秒查询数作为多维关键性能指标流。这些指标的采集频率通常设置为秒级或亚秒级,确保能够捕获系统状态的细微变化。
液态图神经网络的构建过程被用于建模动态系统拓扑。首先,系统根据实时获取的拓扑依赖关系数据构建动态图结构G=(V,E,W),其中V表示系统组件节点集合,E表示组件间的依赖关系边集合,W表示依赖关系的权重矩阵,该权重反映了组件间耦合的紧密程度。在每个图节点上,系统部署一个液态时间常数网络单元,这些单元构成了图神经网络的计算核心。每个液态时间常数网络单元被建模为一个由常微分方程描述的动力学系统,其数学表达式为dx/dt=f(x,u,τ),其中x表示单元的内部状态向量,u表示来自邻居节点和外部输入的多维关键性能指标流,τ表示自适应调节的液态时间常数。时间常数τ的值根据输入信号的特征动态调节,使得网络能够自适应地响应不同频率和强度的输入变化。
在训练阶段,系统采用时间反向传播算法结合强化学习技术对液态图神经网络进行联合优化。训练数据集包含历史的正常运行数据、已知故障案例数据以及相应的拓扑变化记录。时间反向传播算法负责优化网络的参数以最小化状态预测误差,而强化学习算法则负责学习最优的诊断策略。强化学习环境的状态空间由网络的当前状态、检测到的异常模式以及历史诊断经验构成;动作空间包含各种可能的诊断操作和修复建议;奖励函数设计为鼓励准确的故障定位和有效的修复建议,同时惩罚误报和漏报。
在实时运行阶段,系统实施精密的异常检测与轨迹轮廓分析机制。实时的多维关键性能指标流通过高性能的消息队列系统和流式处理引擎注入到已训练的液态图神经网络中。消息队列系统采用Apache Kafka或Apache Pulsar等主流技术,提供高吞吐量、低延迟的数据传输能力;流式处理引擎采用Apache Flink或Spark Streaming技术,实现对数据流的实时处理和计算。
液态图神经网络对每个时间步的输入进行实时状态更新,并通过比较当前状态与正常基线的差异来检测异常。异常检测采用多维统计分析方法,包括马氏距离计算、主成分分析以及基于核密度估计的异常得分计算。当检测到异常时,系统立即启动轨迹轮廓分析,通过分析异常节点的状态轨迹特征,识别异常的类型、严重程度以及可能的传播路径。
当异常检测模块发现异常后,因果推断引擎构建包含异常节点及其k-跳邻居的因果嫌疑子图。在该子图中,系统采用基于常微分方程语义的反事实推理方法进行根因分析。具体而言,系统通过虚拟干预仿真,逐一将嫌疑节点的异常状态替换为正常基线状态,然后观察其他节点状态的变化情况。如果某个节点的干预导致异常传播显著减弱或消失,则该节点被识别为根因候选。系统通过计算干预效果的因果置信度对根因候选进行排序,选择置信度最高的节点作为最终的根因。
深度强化学习诊断代理模块接收因果推断的结果,结合当前系统状态和历史诊断经验,生成智能化的诊断建议。该代理采用深度Q网络或策略梯度算法,能够在复杂的诊断决策空间中寻找最优策略。诊断建议包括详细的故障分析报告、推荐的修复操作序列、预估的修复时间以及风险评估。代理还具备持续学习能力,能够根据诊断效果的反馈不断优化决策策略。
为了确保系统的鲁棒性和数值稳定性,液态时间常数网络单元被设计为具有有界动力学特性。这意味着无论输入如何变化,单元的状态都将保持在有界范围内,有效防止了数值爆炸问题。此外,系统还实现了自适应学习率调节、梯度裁剪以及正则化技术,进一步提升了训练和推理过程的稳定性。
液态图神经网络的动态建模能力使得系统能够准确捕获复杂信息技术系统的时变特性,相比传统的静态阈值方法,显著提高了异常检测的准确率和召回率。液态时间常数的自适应调节机制有效平衡了系统的敏感性和稳定性,在实际应用中能够将误报率降低60%以上。其次,基于常微分方程语义的因果推断方法通过反事实干预仿真,能够量化故障传播的因果关系,根因定位准确率相比传统相关性分析方法提升40%以上。再次,强化学习驱动的智能诊断决策机制通过持续学习优化诊断策略,使得平均故障修复时间缩短75%,运维效率显著提升。
使用案例
在大型电商平台中的具体运用案例。该电商平台采用微服务架构,包含用户服务、商品服务、订单服务、支付服务、库存服务等数十个微服务,运行在Kubernetes集群上,服务间通过Istio服务网格进行通信管理。
在系统部署初期,液态图神经网络基于平台的服务拓扑结构构建了包含50个液态时间常数网络单元的图网络模型。通过3周的历史数据训练,系统学习了各微服务的正常运行模式以及常见的故障传播路径。训练数据包含了双十一、618等高峰期的运行数据,以及数十个历史故障案例的详细记录。
在一次实际运行中,系统监测到支付服务的响应时间从正常的50毫秒突然上升到500毫秒,同时错误率从0.1%激增到5%。液态图神经网络立即检测到这一异常,并通过轨迹轮廓分析确定这是一个严重的性能退化事件。因果推断引擎构建了包含支付服务及其3跳邻居的因果嫌疑子图,该子图包含了用户认证服务、订单管理服务、数据库集群、消息队列服务等关键组件。
通过反事实干预分析,系统发现当将数据库集群的异常状态替换为正常基线时,支付服务的轨迹轮廓显著恢复正常,因果置信度达到0.89。进一步分析发现,数据库集群中的一个主库实例由于磁盘输入输出瓶颈导致查询响应时间急剧增加,进而影响了支付服务的整体性能。
深度强化学习诊断代理基于这一分析结果,生成了包括数据库性能监控、磁盘输入输出分析、查询优化建议等在内的详细诊断动作序列。运维团队根据这些建议快速定位并解决了问题,整个故障诊断和修复过程仅用时6分钟,相比以往需要1小时以上的人工排查时间,效率提升了90%。
本实施例的基础方法与核心算法不仅能够准确检测和诊断复杂系统中的故障,还能够为运维人员提供清晰的故障分析和修复指导,显著提升了系统运维的智能化水平和工作效率。
实施例二:
如图1至图3所示,本实施例在实施例一的基础上提供结合多维异常检测的跨系统故障诊断系统的系统架构设计与核心组件实现方案。
系统架构的顶层设计遵循现代分布式系统的设计原则,确保高可用性、高扩展性和高性能。数据采集与适配层作为系统的数据入口,承担着与外部系统接口适配和数据标准化的关键职责。该层通过OpenTelemetry标准接口建立与现代信息技术基础设施的标准化连接通道,该接口设计符合开放遥测标准,支持多种数据格式和传输协议,包括gRPC、HTTP/JSON以及原生的OpenTelemetry协议。通过这种标准化接口设计,系统能够无缝对接服务网格架构、Kubernetes容器编排平台以及企业配置管理数据库等不同类型的信息技术基础设施。
数据采集与适配层的核心组件包括多源数据接入模块、消息队列模块和拓扑发现模块。多源数据接入模块负责实时采集各系统组件的多维关键性能指标流,包括中央处理器使用率、内存占用率、网络吞吐量、请求响应时间、错误率以及每秒查询数等关键指标。该模块采用推拉结合的数据采集策略,对于高频变化的指标采用推送模式实现毫秒级实时传输,对于相对稳定的配置信息采用定期拉取模式确保数据一致性。
消息队列模块采用Apache Kafka或Apache Pulsar等业界主流的分布式消息系统,为系统提供高吞吐量、低延迟、高可靠的数据传输能力。该模块被配置为支持每秒处理数百万条消息的高并发场景,通过分区机制实现数据的并行处理,通过副本机制保证数据的高可用性。消息队列模块不仅承担数据缓冲和流量削峰的作用,更重要的是实现了数据生产者与消费者之间的完全解耦,使得系统各组件能够独立扩展和升级,提升了整体系统的弹性和可维护性。
拓扑发现模块作为数据采集与适配层的重要组成部分,被专门设计用于实时获取信息技术系统的动态拓扑依赖关系数据。该模块通过多种技术手段建立与不同基础设施平台的连接,包括通过Kubernetes应用程序接口服务器获取容器编排层面的服务依赖关系,通过Istio服务网格控制平面获取服务间的通信拓扑,通过云平台应用程序接口获取虚拟化基础设施的依赖关系,以及通过企业配置管理数据库获取应用层面的业务依赖关系。拓扑发现模块采用事件驱动的架构模式,能够实时感知拓扑结构的变化,包括新服务的上线、服务的下线、服务实例的扩缩容以及网络连接关系的变更,确保系统始终基于最新的拓扑信息进行故障诊断。
数据处理与建模核心层作为系统的智能分析引擎,集成了多个高度专业化的技术组件,每个组件都针对特定的计算任务进行了深度优化。流式数据处理引擎采用ApacheFlink或Spark Streaming等业界领先的流式计算框架,为系统提供实时数据处理能力。该引擎被配置为支持复杂的流式数据处理管道,包括数据清洗、归一化、时间戳对齐和特征提取等预处理操作。数据清洗模块能够识别和处理异常数据点、缺失值和重复记录;归一化模块将不同量纲的关键性能指标统一到相同的数值范围;时间戳对齐模块解决不同数据源的时间同步问题;特征提取模块从原始指标中衍生出更具表达性的高级特征。
液态图神经网络建模模块是整个系统的核心技术组件,该模块实现了基于液态时间常数网络单元的动态图神经网络。每个液态时间常数网络单元被抽象为一个复杂的非线性动力学系统,其内部状态演化遵循耦合的常微分方程系统dx/dt=f(x,u,τ)。该微分方程系统的设计充分考虑了信息技术系统的多时间尺度特性,能够同时捕获快速变化的瞬态现象和缓慢演变的趋势特征。液态时间常数τ的自适应调节机制是该组件的核心技术特色,该机制通过实时分析输入信号的统计特性,包括方差、偏度、峰度等高阶矩特征,动态调整时间常数的数值,实现对不同频率成分信号的自适应响应。
因果推断引擎被专门设计用于执行基于常微分方程语义的反事实推理与根因定位。该引擎集成了高性能的数值常微分方程求解器,能够对因果嫌疑子图中的液态时间常数网络单元进行反事实仿真。仿真过程中,引擎通过替换异常节点的输入或内部参数为正常基准值,重新执行前向积分求解,观察下游节点状态轨迹的恢复程度。基于不同干预操作的效果差异,引擎能够量化每个嫌疑节点的因果贡献度,并生成按因果置信度排序的根因候选列表。
深度强化学习诊断代理模块采用深度强化学习算法,包括深度Q网络、优势演员-评论家算法和策略梯度方法等。该代理将液态图神经网络的全局状态表示作为环境观察,结合因果推断引擎提供的根因分析结果,在复杂的诊断决策空间中学习最优策略。代理的动作空间包含多种诊断和修复操作,如日志分析、资源检查、服务重启、配置调整、负载均衡重配置等。为了确保学习效率和策略稳定性,代理采用经验回放机制和目标网络更新策略,同时集成了优先级采样和重要性采样技术。
持续学习模块负责实现系统的长期自适应能力。该模块定期收集新的故障案例、系统配置变更信息以及诊断效果反馈,将这些数据整合成增量训练数据集。通过在线学习和迁移学习技术,模块能够在不遗忘历史知识的前提下,持续更新液态图神经网络和强化学习代理的参数。模块还实现了知识蒸馏机制,能够将复杂模型的知识压缩到轻量级模型中,确保系统在资源受限环境下的部署效率。
诊断与应用层作为系统的最顶层,负责将智能分析结果转化为可操作的运维指导。该层包含可视化管理界面、运维系统集成模块和自动化执行引擎。可视化管理界面提供直观的故障诊断结果展示,包括拓扑图可视化、异常指标趋势图、根因分析报告和修复建议清单。运维系统集成模块通过标准化应用程序接口与企业现有的运维工具链进行集成,包括监控系统、工单系统、配置管理系统和自动化部署平台。自动化执行引擎能够根据诊断代理的建议,在获得运维人员确认后,自动执行预定义的修复操作。
在系统工作过程中,各层组件协同配合实现端到端的故障诊断流程。数据采集与适配层持续监控信息技术基础设施的运行状态,实时采集多维关键性能指标流和动态拓扑信息,通过消息队列系统向数据处理与建模核心层传输数据。数据处理与建模核心层接收数据后,首先通过流式数据处理引擎进行预处理,然后注入液态图神经网络进行实时状态更新和异常检测。当检测到异常时,因果推断引擎启动根因分析流程,深度强化学习诊断代理模块生成诊断建议。诊断与应用层接收分析结果,通过可视化界面展示给用户,并与外部运维系统集成执行自动化修复操作。
使用案例
在大型互联网企业中的具体部署案例。该企业运营着包含数百个微服务的分布式电商平台,部分服务部署在私有云Kubernetes集群上,部分服务部署在公有云环境中,服务间通过Istio服务网格进行通信管理。
在系统部署阶段,数据采集与适配层通过OpenTelemetry标准接口与现有的监控基础设施进行集成。拓扑发现模块连接Kubernetes应用程序接口服务器获取容器化服务的拓扑关系,连接Istio控制平面获取服务网格的通信拓扑,连接公有云应用程序接口获取云资源的依赖关系,连接企业配置管理数据库获取业务层面的依赖关系。通过这种多源拓扑发现机制,系统成功构建了包含200多个微服务、500多个数据库实例、100多个消息队列实例的完整拓扑图。
消息队列模块部署了3节点的Apache Kafka集群,配置了16个分区来支持高并发数据流,每个分区配置3个副本确保数据可靠性。该配置能够支持每秒处理50万条关键性能指标数据的实时传输,满足了公司业务高峰期的数据处理需求。
数据处理与建模核心层部署在专门的高性能计算集群上,该集群配备了32核心的中央处理器和64GB内存,以及专用的图形处理器加速卡用于深度学习计算。流式数据处理引擎采用Apache Flink的分布式部署模式,配置了8个TaskManager节点,每个节点分配4个Task Slot,总共提供32个并行计算槽位。液态图神经网络建模模块根据业务系统的拓扑结构,构建了包含200个液态时间常数网络单元的大规模图神经网络。
在一次实际运行中,系统监测到支付处理服务的响应时间异常增加,从正常的80毫秒上升到400毫秒,同时错误率从0.05%激增到3%。液态图神经网络的异常检测机制立即识别出支付处理服务对应的液态时间常数网络单元状态轨迹发生显著偏离。因果推断引擎随即构建了包含支付处理服务及其3跳邻居的因果嫌疑子图,该子图包含了用户认证服务、订单管理服务、银行接口服务、数据库集群、消息队列服务等关键组件。通过反事实干预分析,系统发现当将数据库集群中某个主库实例的异常负载替换为正常基准时,支付处理服务的轨迹轮廓显著恢复正常,因果置信度达到0.92。深入分析发现,该数据库实例由于磁盘输入输出瓶颈导致查询响应时间急剧增加,进而影响了支付处理服务的整体性能。
深度强化学习诊断代理模块基于因果分析结果,生成了包括数据库性能监控、磁盘输入输出分析、查询优化建议、读写分离配置检查等在内的详细诊断动作序列。运维团队根据这些建议发现了数据库实例的磁盘空间即将耗尽问题,及时进行了磁盘扩容和数据清理操作,成功解决了性能瓶颈。整个故障诊断和修复过程仅用时8分钟,相比以往需要2小时的人工排查时间,效率提升了93%。
在系统稳定性方面,有界动力学特性确保了液态时间常数网络单元在各种异常输入情况下都能保持数值稳定,在连续6个月的运行期间,系统未出现任何数值爆炸或计算异常问题。消息队列模块的高可用配置确保了数据传输的可靠性,在多次网络抖动和硬件故障情况下,系统都能够自动恢复并继续正常工作。
本实施例的系统架构设计和核心组件实现不仅能够适应复杂的企业信息技术环境,还能够在高负载、高并发的生产环境中稳定运行,为企业提供可靠的智能化故障诊断服务。系统的模块化设计和标准化接口使得部署和维护变得简单高效,显著降低了企业的运维成本和技术门槛。
实施例三:
如图1至图3所示,本实施例在实施例一和二的基础上提供结合多维异常检测的跨系统故障诊断系统的智能诊断能力与应用集成方案。该实施例重点描述深度强化学习诊断代理模块的高级工作机制、诊断与应用层的扩展功能集成,以及模型持续学习模块的长期自适应能力,实现了从智能分析到产业应用的无缝衔接。
在具体实施中,深度强化学习诊断代理模块能够在液态图神经网络提供的稳定仿真环境中进行深度策略学习和智能决策优化。该模块采用深度强化学习算法架构,具体实现为基于Transformer架构的行动者-评论家网络模型,其中行动者网络负责从复杂的环境状态中提取关键特征并生成最优的诊断动作序列,评论家网络负责评估动作序列的预期价值和长期收益。
深度强化学习诊断代理模块接收因果推断引擎确定的故障传播路径和根因节点作为高级语义信息,同时将液态图神经网络的全体液态时间常数网络单元的潜藏状态向量x和液态时间常数τ作为完整的环境状态表示。潜藏状态向量x包含了每个系统组件的深层动力学特征,能够反映组件的内在健康状态和异常程度;液态时间常数τ则反映了系统对外部扰动的敏感性和适应性。这种多层次的状态表示为深度强化学习代理提供了丰富的环境感知信息,使其能够做出更加精准和全面的诊断决策。
在策略决策过程中,深度强化学习诊断代理模块在由液态图神经网络提供的稳定仿真环境中进行策略优化。该仿真环境具有重要的技术优势,液态图神经网络的有界动力学特性确保了仿真环境的数值稳定性,避免了传统强化学习中可能出现的环境不稳定问题。仿真环境能够快速模拟不同诊断动作对系统状态的影响,为强化学习代理提供丰富的交互经验。策略网络π(a|s)采用深度神经网络实现,通过多层感知器和注意力机制,能够从高维状态空间中提取关键特征,并生成概率分布形式的动作选择策略。
深度强化学习诊断代理模块生成的诊断动作序列具有高度的结构化和专业化特征。该序列包含多种类型的诊断动作,包括深度日志查询动作、系统资源验证动作、服务隔离仿真动作、配置参数检查动作以及自动化修复建议动作。
深度日志查询动作通过智能化的日志分析算法,从海量日志数据中精准提取与故障相关的关键信息,采用自然语言处理技术和时间序列分析方法,识别异常模式和错误信号。系统资源验证动作通过多维度的资源监控和性能测试,全面评估硬件资源的可用性、性能状态和潜在瓶颈。服务隔离仿真动作通过构建虚拟化的测试环境,模拟隔离故障组件对整体系统稳定性和业务连续性的影响。配置参数检查动作通过配置管理和一致性验证算法,识别系统配置中的错误、冲突和不合理设置。自动化修复建议动作基于历史修复经验和专家知识库,生成具体可执行的故障修复方案和操作指导。
奖励机制是深度强化学习诊断代理模块接收一个综合标量奖励值R(t),该奖励值基于诊断动作序列的执行效率、诊断准确性和故障修复效果进行多维度综合计算。执行效率通过测量诊断动作的响应时间、资源消耗和并行度来评估,重点关注诊断过程的时间成本和计算开销;诊断准确性通过比较诊断结果与实际故障根因的匹配度来量化,采用精确率、召回率和F1分数等指标进行全面评估;故障修复效果通过监控故障修复后的系统稳定性、性能恢复程度和业务影响消除情况来衡量。
奖励值的计算采用加权求和的方式:R(t)=w1×效率得分+w2×准确性得分+w3×修复效果得分,其中权重w1、w2、w3可以根据业务优先级和运维策略进行动态调整。深度强化学习诊断代理模块利用该奖励值对其自身的策略网络进行在线优化,采用策略梯度算法和经验回放技术,持续改进诊断策略的有效性和准确性。
可视化分析平台能够实时展示系统拓扑图,采用图形化的方式直观呈现系统各组件之间的依赖关系和连接状态,支持多层次的拓扑视图切换,包括物理拓扑、逻辑拓扑和业务拓扑;异常节点高亮显示功能通过颜色编码和动态效果,突出显示检测到的异常组件,并提供异常程度的量化指示;故障传播路径可视化功能通过动画效果和流向图,清晰展示故障在系统中的传播过程和影响范围;智能诊断建议功能以结构化的方式展示深度强化学习诊断代理模块生成的诊断结果和修复建议,提供详细的操作指导和风险评估。
自动化运维网关接收来自深度强化学习诊断代理模块的诊断建议,通过标准化的应用程序接口调用外部自动化运维平台执行具体的修复操作。网关支持多种主流的自动化运维平台,包括Ansible配置管理平台和安全编排自动化响应平台。通过Ansible集成,系统能够自动执行配置修改、服务重启、资源调整等运维操作;通过安全编排自动化响应平台集成,系统能够触发复杂的运维工作流,包括多步骤的故障修复流程、应急响应预案和业务恢复程序。
智能告警管理中心利用异常轮廓分析引擎的高精度检测能力,对传统的基于阈值的告警进行抑制和降噪处理,显著减少误报和噪声告警。智能告警管理中心采用多维度的告警聚合和关联分析技术,将相关的告警事件进行聚类和合并,避免告警风暴对运维人员造成信息过载。
模型持续学习模块被设计为一个完整的机器学习生命周期管理系统,负责收集和存储已确认的故障案例及其对应的多维关键性能指标数据、拓扑信息和诊断过程。故障案例的存储采用结构化的数据模型,包含故障发生的时间戳、涉及的系统组件、异常表现形式、根因分析结果、修复措施和效果评估等全面信息。
模型持续学习模块定期利用故障案例库对液态图神经网络模型进行增量训练和有监督微调。增量训练采用在线学习算法,能够在不影响系统正常运行的前提下,逐步更新模型参数以适应新的数据模式。有监督微调利用已确认的故障案例作为标注数据,通过监督学习的方式优化模型的故障识别和根因定位能力。该模块还实现了模型版本管理和回滚机制,确保模型更新的安全性和可控性。
传统的行动者-评论家模型中,评论家网络通常对整个状态给出一个单一的价值评估,或者对某个状态下采取的动作给出一个价值评估。这种评估是“扁平化”的,无法体现复杂状态中不同信息维度(如不同系统组件的健康状况、不同时间点的动态变化)对最终决策价值的差异化贡献。
本发明将Transformer的自注意力机制与LTC的时序动力学特征相结合,并引入因果语义信息作为注意力偏置,设计出一个能够解构和归因状态价值的评论家网络。它不仅评估“状态有多好”,更能解释“状态好/坏的原因是什么,以及哪个部分、哪个时间点的特征是关键”。
深度强化学习代理在t时刻的综合决策价值V(St)由AATV-Net计算得出。其核心公式如下:
其中:
St是t时刻的完整环境状态,包括所有N个LTC单元的潜藏状态向量xi(t)和液态时间常数τi(t),以及因果推断结果Ct
N是系统中LTC单元(即系统组件)的总数。
Vi(t)是评论家网络对第i个LTC单元在t时刻的局部状态价值的评估。
αi(t)是在t时刻分配给第i个LTC单元的动态注意力权重,代表该单元对全局决策价值的贡献度。
G(Ct)是由因果推断结果Ct计算出的因果引导价值。
β是控制因果引导强度的超参数。
局部状态价值评估,此部分评估单个系统组件的内在价值,它融合了LTC的动力学特征。
xi(t):第i个LTC单元的潜藏状态向量,代表组件的当前状态。
潜藏状态的变化率(梯度),代表组件状态的变化趋势。状态稳定和剧烈变化时的价值是不同的。
液态时间常数的倒数,代表组件对外部扰动的敏感度。一个高度敏感的组件可能预示着潜在的风险,其价值评估应有所不同。
⊕:表示向量拼接。
MLPv:一个多层感知器,用于将拼接后的高维特征映射为一个标量的局部价值。
此公式不仅仅考虑了组件的当前状态x,更引入了其动态趋势(dx/dt)和适应性(τ),使得价值评估具有了时序动力学感知能力。
动态注意力权重利用自注意力机制动态计算每个组件的重要性。
Ki=MLPk([xi(t)⊕τi(t)]):将每个LTC单元的状态信息编码为一个键(Key)
向量。
WQ,WK:可学习的查询(Query)和键(Key)的权重矩阵,这里采用简化自注意力,用自身作为查询。
dk:键向量的维度。
Mij(Ct):因果注意力偏置矩阵。
为了将因果推断引擎产生的高层语义知识(如根因节点、故障传播路径)有效地融入到注意力机制的数值计算中,设计了因果注意力偏置矩阵M(Ct)。该矩阵作为一个外部知识注入模块,在注意力分数的计算过程中引导模型的注意力分配,使其能够“聚焦”于最关键的故障相关组件。
该矩阵的具体定义如下:
其中:
Mij(Ct)表示在时刻t,从节点j到节点i的注意力偏置值。
Ct是由因果推断引擎在时刻t输出的因果信息集合,包含了已识别的根因节点和故障传播路径。
R(Ct)代表在因果信息Ct中,被识别为根因(root cause)的节点集合。
P(Ct)代表在因果信息Ct中,被识别为故障传播路径(causal path)的集合。
(nodej→…→nodei)表示在P(Ct)中存在一条从节点j指向节点i的有向路径。
γroot和γpath是预设的标量超参数,分别代表根因偏置强度和路径偏置强度。
通常设定γrootpath>0,以确保根因节点获得最高的关注度。
该偏置矩阵M(Ct)在注意力分数的计算中,被加到标准的点积注意力得分之上,即在Softmax函数激活之前。通过这种方式,如果一个节点nodei被识别为根因,它将在注意力计算中获得一个较大的正向偏置γroot,从而强制模型对其分配更高的注意力权重。同理,位于故障传播路径上的节点也会获得相应的正向偏置。这种机制将离散的、符号化的因果知识转化为了连续的、可微的注意力引导信号,显著提升了模型定位关键故障组件的准确性和效率。
因果引导价值G(Ct)将因果链的严重程度转化为一个全局价值调整项。
Ct:因果推断引擎输出的所有故障传播路径集合。
length(path):故障路径的长度(涉及的节点数)。
confidence(path):该路径的置信度。
wc:可学习的权重。
tanh:将结果归一化到[-1,1]区间。
将全局状态价值分解为多个局部动力学价值的加权和,实现了价值的精细化归因。设计了因果注意力偏置矩阵Mij(Ct),将符号化的因果知识无缝嵌入到神经网络的数值计算中,让模型“知道”应该关注哪里。
同时结合了来自底层LTC的动力学特征(状态、趋势、敏感度)和来自上层因果引擎的高级语义特征,形成了对状态全面而深刻的理解。
工作过程
在系统工作过程中,各个智能化组件协同配合实现端到端的智能诊断和应用集成。当异常轮廓分析引擎和因果推断引擎完成故障检测和根因定位后,深度强化学习诊断代理模块接收相关信息并启动智能决策过程。该模块在液态图神经网络提供的稳定仿真环境中,基于当前的系统状态和故障特征,生成最优的诊断动作序列。
可视化分析平台实时展示诊断结果和系统状态,为运维人员提供直观的可视化界面。自动化运维网关根据诊断建议调用外部运维平台执行自动化修复操作。智能告警管理中心发送经过智能化处理的高质量告警通知。模型持续学习模块收集整个诊断过程的数据,用于后续的模型优化和系统改进。
整个工作流程具有高度的自动化特征,从异常检测到故障修复的全过程均可实现无人工干预的自动执行,大幅提升了运维效率和响应速度。
深度强化学习诊断代理模块的智能决策能力使得系统能够根据不同的故障场景自适应地选择最优的诊断策略,相比传统的固定诊断流程,诊断效率提升70%以上,诊断准确性提升50%以上。其次,可视化分析平台的直观展示和智能告警管理中心的降噪处理显著改善了用户体验,运维人员的工作效率提升60%以上,告警处理时间缩短80%以上。再次,自动化运维网关的集成能力实现了诊断与修复的自动化闭环,平均故障修复时间缩短75%以上,减少了人工干预的需求和操作错误的风险。最后,模型持续学习模块的自适应机制确保了系统能够持续学习和改进,在面对新的系统架构变化和未知故障模式时,系统性能不会显著下降,而是能够快速适应并保持高水平的诊断能力。
运用案例
在大型互联网公司的具体运用案例。该公司运营着一个全球性的社交媒体平台,拥有数亿用户,系统架构极其复杂,包含内容推荐、用户管理、消息传递、广告投放、数据分析等多个业务领域,部署在全球多个数据中心的数千台服务器上,采用微服务架构和容器化部署,服务实例数量超过万个。
在系统部署初期,深度强化学习诊断代理模块通过分析历史故障案例和运维经验,建立了包含500多种常见故障模式和对应诊断策略的知识库。该模块的策略网络经过大规模的离线训练和在线优化,能够处理复杂的多故障并发场景和跨地域的分布式系统故障。
在某次重大节日期间,系统面临了前所未有的用户访问高峰,多个关键服务出现了性能下降和间歇性故障。传统的监控系统发出了数百条告警,但无法有效识别主要问题和次要问题的关系。本系统的智能告警管理中心通过异常轮廓分析和智能聚合技术,将数百条原始告警聚合为12个关键告警组,并按照业务影响程度进行了优先级排序。
深度强化学习诊断代理模块接收到因果推断引擎确定的故障传播路径后,识别出内容推荐服务的机器学习模型推理延迟是导致用户体验下降的主要根因。该模块基于当前的系统状态和历史经验,生成了包括模型推理性能分析、图形处理器资源检查、模型版本回滚评估、负载均衡策略调整、缓存命中率优化等在内的综合诊断动作序列。
可视化分析平台实时展示了故障传播的动态过程,运维人员清晰地看到故障如何从内容推荐服务传播到用户界面服务、广告投放服务和数据统计服务。自动化运维网关根据深度强化学习诊断代理模块的建议,自动调用Ansible平台执行了图形处理器资源扩容、模型推理服务的水平扩展、负载均衡权重调整等操作。
整个故障处理过程从异常检测到问题解决仅用时15分钟,相比以往需要2-3小时的人工分析和操作,效率提升了90%以上。模型持续学习模块在故障处理完成后,系统性地收集了整个事件的详细数据,利用这些数据对液态图神经网络模型进行了微调,使其能够更好地识别高并发场景下的机器学习服务性能瓶颈问题。
在长期运行效果方面,该系统显著提升了公司的运维自动化水平和故障处理能力。智能告警管理中心将日均告警数量从之前的3000多条减少到200多条,告警的准确性和可操作性大幅提升。深度强化学习诊断代理模块的自动化诊断准确率达到95%以上,大部分故障能够在发生的15分钟内得到自动识别和修复。
本实施例的智能诊断与应用集成方案不仅能够应对大规模复杂系统的运维挑战,还能够通过持续学习和智能化优化,为企业提供可持续发展的运维能力。系统的智能化水平和自动化程度显著降低了对运维专家的依赖,使得企业能够以更低的成本维护更复杂的信息技术基础设施,为业务的快速发展提供了坚实的技术保障。
以上所述仅是本发明的优选实施方式,应当理解本发明并非局限于本文所披露的形式,不应看作是对其他实施例的排除,而可用于各种其他组合、修改和环境,并能够在本文所述构想范围内,通过上述教导或相关领域的技术或知识进行改动。而本领域人员所进行的改动和变化不脱离本发明的精神和范围,则都应在本发明所附权利要求的保护范围内。

Claims (10)

1.结合多维异常检测的跨系统故障诊断方法,其特征在于,包括以下步骤:
S1、通过OpenTelemetry标准接口从服务网格、Kubernetes容器编排平台或企业配置管理数据库中获取信息技术系统的动态拓扑依赖关系数据,并实时采集各系统组件的中央处理器使用率、内存占用率、网络吞吐量、请求响应时间、错误率、以及每秒查询数作为多维关键性能指标流;
S2、基于所述动态拓扑数据构建一个液态图神经网络,其中,每一个图节点被定义为一个液态时间常数网络单元,所述液态时间常数网络单元通过耦合的常微分方程系统dx/dt=f(x,u,τ)描述其内部状态演化,其中x为潜藏状态向量,u为多维关键性能指标输入,τ为自适应液态时间常数,并接收对应的多维关键性能指标流作为连续时间输入;
S3、在预设的正常运行历史数据上,采用时间反向传播算法对所述液态图神经网络进行离线训练,目标函数为最小化预测轨迹与真实轨迹的重构误差,以学习每个液态时间常数网络单元在其高维潜藏空间中的正常行为轨迹轮廓基准;
S4、将实时的多维关键性能指标流通过消息队列和流式处理引擎注入到训练好的液态图神经网络中,并利用一个结合了隐式与显式欧拉方法的高性能数值常微分方程求解器,来连续计算并更新所有液态时间常数网络单元的潜藏状态和液态时间常数;
S5、通过计算实时轨迹与已学习的正常行为轨迹轮廓在轨迹长度、曲率、几何形状、分形维度或统计分布上的偏差度量,采用动态时间规整距离、Kullback-Leibler散度方法进行量化,并与基于历史统计分布和当前系统负载状态动态调整的阈值进行比较,来检测出一个或多个异常液态时间常数网络单元;
S6、针对所述异常液态时间常数网络单元,构建一个包含异常节点及其k跳拓扑邻居的因果嫌疑子图,其中k值根据系统复杂度自适应确定;
S7、通过在所述数值常微分方程求解器中,对嫌疑子图内每个液态时间常数网络单元的输入关键性能指标流I(t)或内部微分方程参数进行反事实干预操作,将异常输入替换为正常基准输入,并重新进行前向积分求解,来仿真其对下游液态时间常数网络单元轨迹轮廓的影响变化;
S8、根据步骤S7的反事实仿真结果,计算干预前后下游节点轨迹轮廓的恢复程度,将能够使下游异常液态时间常数网络单元的轨迹轮廓显著恢复到正常范围内的嫌疑液态时间常数网络单元,按因果置信度从高到低排序确定为故障传播路径和根因节点。
2.根据权利要求1所述的结合多维异常检测的跨系统故障诊断方法,其特征在于:所述步骤S1中,所述动态拓扑数据的获取来源包括:Kubernetes应用程序接口服务器、Istio服务网格控制平面、云平台应用程序接口或企业配置管理数据库;所述液态时间常数网络单元在训练后,其内部的液态时间常数τ能够根据实时注入的多维关键性能指标流的变化幅度和频率而自适应调整,当输入信号变化剧烈时自动降低时间常数以提高敏感性,当输入信号平稳时自动提高时间常数以增强抗噪性。
3.根据权利要求1所述的结合多维异常检测的跨系统故障诊断方法,其特征在于:所述步骤S5中,所述偏差度量的计算方法包括:动态时间规整距离、Kullback-Leibler散度、或基于轨迹分形维度的几何差异度量中的至少一种;所述动态阈值的设定基于历史正常轨迹轮廓的统计分布特征,并根据当前系统负载状态和业务周期性进行实时调整。
4.根据权利要求3所述的结合多维异常检测的跨系统故障诊断方法,其特征在于:所述方法还包括强化学习驱动的智能诊断决策与闭环自优化:
S9)将所述液态图神经网络的全体液态时间常数网络单元的潜藏状态向量x和液态时间常数τ作为环境状态,将步骤S8确定的故障传播路径作为输入,利用一个深度强化学习代理来决策并生成一组有序的诊断动作序列,所述诊断动作序列包括深度日志查询、系统资源验证、服务隔离仿真、配置参数检查或自动化修复建议;
S10)记录所述诊断动作序列的执行时间、诊断准确性和故障修复效果,并基于平均修复时间、诊断精度和业务影响度计算综合标量奖励值R(t),利用所述奖励值对所述强化学习代理的策略网络π(a|s)进行在线更新;
S11)将已确认的故障案例及其对应的多维关键性能指标数据、拓扑信息和诊断过程存储为故障案例库,并定期利用所述故障案例库对液态图神经网络模型进行有效监督微调,以适应新的系统架构和故障模式。
5.结合多维异常检测的跨系统故障诊断系统,其特征在于:包括:
数据采集与适配层,用于通过OpenTelemetry标准接口从服务网格、Kubernetes容器编排平台或企业配置管理数据库获取信息技术系统的动态拓扑依赖关系数据,并实时采集各组件的多维关键性能指标流;
数据处理与建模核心层,与所述数据采集与适配层连接,其包括:
一个流式数据处理引擎,用于对采集的原始多维关键性能指标数据进行清洗、归一化、时间戳对齐和特征提取;
一个液态图神经网络建模模块,用于基于所述动态拓扑数据构建一个以液态时间常数网络为节点的图模型,每个液态时间常数网络单元通过耦合的常微分方程系统dx/dt=f(x,u,τ)描述其状态演化,并包含一个采用时间反向传播算法的离线训练器;
一个高性能常微分方程求解器,用于结合隐式与显式欧拉方法的数值积分技术,根据实时注入的关键性能指标流,连续更新所述液态图神经网络中所有液态时间常数网络单元的潜藏状态向量x和液态时间常数τ;
一个异常轮廓分析引擎,用于通过计算实时轨迹与已学习的正常轨迹轮廓在几何形状、分形维度或统计分布上的偏差度量,采用动态时间规整距离、Kullback-Leibler散度等方法来检测异常液态时间常数网络单元;
一个因果推断引擎,用于通过在所述常微分方程求解器中对嫌疑子图内液态时间常数网络单元进行反事实干预操作并重新求解,来确定故障传播路径和根因节点;
一个深度强化学习诊断代理模块,用于在液态图神经网络提供的稳定仿真环境中进行智能决策,生成最优诊断动作序列;
诊断与应用层,用于接收并可视化展示由所述数据处理与建模核心层确定的故障传播路径和根因节点,生成诊断报告,并与自动化运维平台集成执行修复操作。
6.根据权利要求5所述的结合多维异常检测的跨系统故障诊断系统,其特征在于:所述数据采集与适配层包括一个消息队列模块用于缓冲和解耦数据生产者与消费者,以及一个拓扑发现模块,该模块被配置为通过连接Kubernetes应用程序接口服务器、Istio服务网格控制平面或云平台应用程序接口来实时获取所述动态拓扑依赖关系数据。
7.根据权利要求6所述的结合多维异常检测的跨系统故障诊断系统,其特征在于:所述数据处理与建模核心层中的每一个液态时间常数网络单元,被配置为使其内部的液态时间常数τ能够根据实时的多维关键性能指标流的变化幅度和频率而自适应调整,且其状态演化的有界性保证了系统的数值稳定性,避免数值爆炸现象。
8.根据权利要求7所述的结合多维异常检测的跨系统故障诊断系统,其特征在于:所述深度强化学习诊断代理模块被配置为:接收所述因果推断引擎确定的故障传播路径和根因节点;将所述液态图神经网络的全体液态时间常数网络单元的潜藏状态向量x和液态时间常数τ作为环境状态;在由液态图神经网络提供的稳定仿真环境中进行策略决策π(a|s),生成一组有序的诊断动作序列;接收一个基于所述诊断动作序列的执行效率、准确性和故障修复效果计算出的综合标量奖励值R(t),并利用该奖励值对其自身的策略网络进行在线优化。
9.根据权利要求8所述的结合多维异常检测的跨系统故障诊断系统,其特征在于:所述诊断与应用层还包括:一个可视化分析平台,用于实时展示系统拓扑图、异常节点高亮显示、故障传播路径可视化和智能诊断建议;一个自动化运维网关,用于接收诊断建议并调用外部自动化运维平台执行修复操作;一个智能告警管理中心,用于发送经过异常轮廓分析抑制和降噪处理的高质量告警通知。
10.根据权利要求9所述的结合多维异常检测的跨系统故障诊断系统,其特征在于:所述系统还包括一个模型持续学习模块,该模块被配置为:收集和存储已确认的故障案例及其对应的多维关键性能指标数据、拓扑信息和诊断过程;定期利用故障案例库对液态图神经网络模型进行增量训练和有监督微调,以适应新的系统架构变化和未知故障模式。
CN202510875259.9A 2025-06-27 2025-06-27 结合多维异常检测的跨系统故障诊断方法及系统 Pending CN120780519A (zh)

Priority Applications (1)

Application Number Priority Date Filing Date Title
CN202510875259.9A CN120780519A (zh) 2025-06-27 2025-06-27 结合多维异常检测的跨系统故障诊断方法及系统

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
CN202510875259.9A CN120780519A (zh) 2025-06-27 2025-06-27 结合多维异常检测的跨系统故障诊断方法及系统

Publications (1)

Publication Number Publication Date
CN120780519A true CN120780519A (zh) 2025-10-14

Family

ID=97296628

Family Applications (1)

Application Number Title Priority Date Filing Date
CN202510875259.9A Pending CN120780519A (zh) 2025-06-27 2025-06-27 结合多维异常检测的跨系统故障诊断方法及系统

Country Status (1)

Country Link
CN (1) CN120780519A (zh)

Cited By (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN121167244A (zh) * 2025-11-20 2025-12-19 山东省大数据中心 基于概率传播推理的故障根因动态预测方法及系统
CN121615957A (zh) * 2026-02-02 2026-03-06 水利部交通运输部国家能源局南京水利科学研究院 基于时空图神经网络的洪涝灾害下交通网络韧性诊断方法
CN121615957B (zh) * 2026-02-02 2026-05-08 水利部交通运输部国家能源局南京水利科学研究院 基于时空图神经网络的洪涝灾害下交通网络韧性诊断方法

Cited By (4)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN121167244A (zh) * 2025-11-20 2025-12-19 山东省大数据中心 基于概率传播推理的故障根因动态预测方法及系统
CN121167244B (zh) * 2025-11-20 2026-03-27 山东省大数据中心 基于概率传播推理的故障根因动态预测方法及系统
CN121615957A (zh) * 2026-02-02 2026-03-06 水利部交通运输部国家能源局南京水利科学研究院 基于时空图神经网络的洪涝灾害下交通网络韧性诊断方法
CN121615957B (zh) * 2026-02-02 2026-05-08 水利部交通运输部国家能源局南京水利科学研究院 基于时空图神经网络的洪涝灾害下交通网络韧性诊断方法

Similar Documents

Publication Publication Date Title
CN120179507B (zh) 一种分布式算力调度智能优化方法及系统
US20230038164A1 (en) Monitoring and alerting system backed by a machine learning engine
Marashi et al. Identification of interdependencies and prediction of fault propagation for cyber–physical systems
Remil et al. Aiops solutions for incident management: Technical guidelines and a comprehensive literature review
CN119536177A (zh) Dcs系统自主可控升级及系统故障预测方法及系统
Satyanarayanan Foundational Framework Self-Healing Data Pipelines for AI Engineering: A Framework and Implementation
CN120256178A (zh) 一种基于物联网的存储硬盘远程诊断系统及方法
CN119623775A (zh) 基于参数指纹全息感知的任务链自愈传递预测方法及系统
Wang et al. Multilayered fault detection and localization with transformer for microservice systems
Myrzatay et al. Predicting LAN switch failures: An integrated approach with DES and machine learning techniques (RF/LR/DT/SVM)
CN120780519A (zh) 结合多维异常检测的跨系统故障诊断方法及系统
Wang Causal discriminative modeling for robust cloud service fault detection
Liu et al. Remaining useful life prediction integrating working conditions and uncertainty quantification based on multilayer graph neural networks
US20250036917A1 (en) Adaptive scenarios generation from situations
CN121167244B (zh) 基于概率传播推理的故障根因动态预测方法及系统
CN120343077B (zh) 基于Python业务管理平台的服务接入智能管理方法及其系统
CN121093056A (zh) 一种用户风险系数计算过程可视化方法与系统
WO2024063787A1 (en) Asset structure behavior learning and inference management system
Harutyunyan et al. Challenges and experiences in designing interpretable KPI-diagnostics for cloud applications
Uspenskij et al. Complex expert assessment as a part of fault management strategy for data storage systems
Khan Toward an Automated Real-Time Anomaly Detection Engine in Microservice Architectures
Lyu et al. Can we recycle our old models? An empirical evaluation of model selection mechanisms for AIOps solutions
KR102763990B1 (ko) 인공지능 하이브리드 대포통장 탐지 시스템 및 방법
Saastamoinen Evaluation of machine learning models in predicting software flakiness
CN121259990B (zh) 基于多模态数据融合的防水卷材生产监控预警方法及系统

Legal Events

Date Code Title Description
PB01 Publication
PB01 Publication
SE01 Entry into force of request for substantive examination
SE01 Entry into force of request for substantive examination