CN120822604A - 一种基于智能体的自动化运维方法及系统 - Google Patents

一种基于智能体的自动化运维方法及系统

Info

Publication number
CN120822604A
CN120822604A CN202510866002.7A CN202510866002A CN120822604A CN 120822604 A CN120822604 A CN 120822604A CN 202510866002 A CN202510866002 A CN 202510866002A CN 120822604 A CN120822604 A CN 120822604A
Authority
CN
China
Prior art keywords
maintenance
layer
data
decision
agent
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
CN202510866002.7A
Other languages
English (en)
Inventor
王汉斌
徐士强
苏玉玲
贺兆印
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Inspur Cloud Information Technology Co Ltd
Original Assignee
Inspur Cloud Information Technology Co Ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Inspur Cloud Information Technology Co Ltd filed Critical Inspur Cloud Information Technology Co Ltd
Priority to CN202510866002.7A priority Critical patent/CN120822604A/zh
Publication of CN120822604A publication Critical patent/CN120822604A/zh
Pending legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N5/00Computing arrangements using knowledge-based models
    • G06N5/04Inference or reasoning models
    • G06N5/041Abduction
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/004Artificial life, i.e. computing arrangements simulating life
    • G06N3/006Artificial life, i.e. computing arrangements simulating life based on simulated virtual individual or collective life forms, e.g. social simulations or particle swarm optimisation [PSO]
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/04Architecture, e.g. interconnection topology
    • G06N3/042Knowledge-based neural networks; Logical representations of neural networks
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/08Learning methods
    • G06N3/092Reinforcement learning
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/08Learning methods
    • G06N3/096Transfer learning
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N5/00Computing arrangements using knowledge-based models
    • G06N5/02Knowledge representation; Symbolic representation
    • G06N5/022Knowledge engineering; Knowledge acquisition

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • General Engineering & Computer Science (AREA)
  • Data Mining & Analysis (AREA)
  • General Physics & Mathematics (AREA)
  • Software Systems (AREA)
  • Computational Linguistics (AREA)
  • Artificial Intelligence (AREA)
  • Evolutionary Computation (AREA)
  • Mathematical Physics (AREA)
  • Computing Systems (AREA)
  • Molecular Biology (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Biomedical Technology (AREA)
  • General Health & Medical Sciences (AREA)
  • Biophysics (AREA)
  • Health & Medical Sciences (AREA)
  • Debugging And Monitoring (AREA)

Abstract

本发明公开一种基于智能体的自动化运维方法及系统,涉及计算机运维技术领域,包括:构建包含数据采集层、状态感知层、决策层和执行层的智能体,其中,数据采集层采集IT系统多源数据,状态感知层分析数据感知系统状态,决策层基于感知结果决策生成运维指令,执行层执行指令;收集整理IT系统相关知识,构建知识图谱;使用历史运维数据对智能体进行训练,通过强化学习算法让智能体在不同的环境中进行尝试和探索,根据反馈结果不断调整自己的行为,优化其决策模型和运维策略;智能体实时监控IT系统,检测到异常事件时启动数据采集层、状态感知层、决策层和执行层,并根据决策结果自动执行相应的运维操作。本发明可以保障IT系统的稳定、高效运行。

Description

一种基于智能体的自动化运维方法及系统
技术领域
本发明涉及计算机运维技术领域,具体的说是一种基于智能体的自动化运维方法及系统。
背景技术
随着信息技术的飞速发展,企业的IT系统规模呈指数级扩张,架构愈发复杂,涵盖了从物理层的服务器、存储设备,到网络层的交换机、路由器,再到应用层的各类业务软件等多个层面。传统的运维方式主要依赖人工操作,运维人员需要手动进行故障排查、性能监控、资源调配等工作。这种方式不仅效率低下,而且容易出现人为失误,难以满足现代企业对IT系统高可用性、高性能和快速响应的要求。
近年来,AI大模型在自然语言处理、图像识别等领域取得了显著成果,也逐渐被引入到运维领域。一些基于大模型的运维辅助工具能够对运维日志和文档进行分析,提供故障诊断的参考建议。然而,这些应用仍存在较大局限性。大模型主要基于大规模无监督数据进行训练,在面对IT运维这种高度专业化、场景化的任务时,缺乏对特定系统架构和业务逻辑的深度理解,难以准确把握复杂多变的系统状态。在面对突发故障或大规模系统变更时,无法依据实时的系统状态和业务需求进行动态、精准的决策调整,导致系统停机时间延长,业务受到严重影响。同时,大模型的黑盒特性使得运维人员难以理解其决策过程,增加了决策的不确定性和风险。
因此,开发一种具有自主学习、精准决策能力,能够深度适配IT运维场景的自动化运维方法具有重要的现实意义。
发明内容
本发明针对目前技术发展的需求和不足之处,提供一种基于智能体的自动化运维方法及系统,利用智能体的自主学习和决策能力,实现对IT系统的智能化、自动化运维管理。
第一方面,本发明提供一种基于智能体的自动化运维方法,解决上述技术问题采用的技术方案如下:
一种基于智能体的自动化运维方法,其包括如下步骤:
S1、基于机器学习和深度学习技术构建智能体,智能体包含数据采集层、状态感知层、决策层和执行层,其中,数据采集层采集IT系统多源数据,状态感知层分析数据感知系统状态,决策层基于感知结果决策生成运维指令,执行层执行指令;
S2、收集整理IT系统相关知识,构建知识图谱,为智能体决策提供背景知识,使其能够在决策过程中进行更全面和深入的推理;
S3、使用历史运维数据对智能体进行训练,通过强化学习算法让智能体在不同的环境中进行尝试和探索,根据反馈结果不断调整自己的行为,优化其决策模型和运维策略;同时,定期更新训练数据,使智能体能够适应IT系统的不断变化和发展;
S4、智能体实时监控IT系统,检测到异常事件时依次启动数据采集层、状态感知层、决策层和执行层,并根据决策结果自动执行相应的运维操作;
S5、在运维操作执行过程中,智能体持续监控操作的效果,并根据实际情况进行动态调整。
可选的,所涉及数据采集层使用各类监控工具和API接口从IT系统的服务器、网络设备和应用程序组件中采集性能指标、日志信息和配置数据多源数据,并将数据存入时间序列数据库;
状态感知层采用数据分析技术对采集到的数据进行处理,实时感知系统的运行状态,识别系统中的异常模式和潜在风险;
基于状态感知层的识别结果,决策层运用预定义的运维策略、深度学习模型及知识图谱进行决策,生成相应的运维操作指令;
执行层通过调用系统管理工具和API接口将决策层生成的指令转化为实际的运维操作,对IT系统进行调整和优化。
进一步可选的,所涉及数据采集层集成多模态数据采集引擎,支持Prometheus和Zabbix监控协议,通过ETL工具实现结构化/非结构化数据清洗,建立时间序列数据库存储实时数据;
状态感知层基于图神经网络构建,借助知识图谱推理引擎实现多源数据关联分析、基于隐马尔可夫模型的时序异常检测及故障传播路径预测;
决策层采用双引擎决策机制,通过规则引擎预定义优先级策略,通过强化学习引擎构建基于PPO算法的运维决策模型,运维决策模型的奖励函数包含故障恢复时效、操作风险系数和资源优化增益;
执行层设计自适应操作适配器,支持Ansible Playbook生成的基础设施即代码操作、云原生Kubernetes API调用和应用层热修复。
可选的,执行步骤S2,首先收集整理IT系统的相关文档、运维手册和故障报告,从中提取关键信息,随后使用知识图谱构建工具将关键信息转化为节点和边,构建初始的知识图谱,再通过人工审核验证知识图谱的准确性和完整性,并通过不断更新和完善知识图谱,使其能够反映IT系统的最新状态和变化。
可选的,执行步骤S3,智能体的训练过程包括:
准备历史运维数据,包括系统状态数据、运维事件数据和对应的处理结果;
将准备的历史运维数据划分为训练集和测试集,使用训练集对智能体进行训练;训练过程中,设置超参数,调整机器学习模型的结构和参数,提高智能体的性能;
训练结束后,使用测试集对智能体进行评估,根据评估结果进一步优化智能体;
同时,定期收集新的运维数据,对智能体进行增量训练,使其能够不断学习和适应新的情况。
第二方面,本发明提供一种基于智能体的自动化运维系统,解决上述技术问题采用的技术方案如下:
一种基于智能体的自动化运维系统,其包括:
智能体构建模块,用于基于机器学习和深度学习技术构建智能体,智能体包含数据采集层、状态感知层、决策层和执行层,其中,数据采集层采集IT系统多源数据,状态感知层分析数据感知系统状态,决策层基于感知结果决策生成运维指令,执行层执行指令;
知识图谱构建模块,用于收集整理IT系统相关知识,构建知识图谱,为智能体决策提供背景知识,使其能够在决策过程中进行更全面和深入的推理;
训练优化模块,用于使用历史运维数据对智能体进行训练,通过强化学习算法让智能体在不同的环境中进行尝试和探索,根据反馈结果不断调整自己的行为,优化其决策模型和运维策略;同时,定期更新训练数据,使智能体能够适应IT系统的不断变化和发展;
智能体,用于实时监控IT系统,检测到异常事件时依次启动数据采集层、状态感知层、决策层和执行层,并根据决策结果自动执行相应的运维操作;在运维操作执行过程中,智能体持续监控操作的效果,并根据实际情况进行动态调整。
可选的,所涉及数据采集层使用各类监控工具和API接口从IT系统的服务器、网络设备和应用程序组件中采集性能指标、日志信息和配置数据多源数据,并将数据存入时间序列数据库;
状态感知层采用数据分析技术对采集到的数据进行处理,实时感知系统的运行状态,识别系统中的异常模式和潜在风险;
基于状态感知层的识别结果,决策层运用预定义的运维策略、深度学习模型及知识图谱进行决策,生成相应的运维操作指令;
执行层通过调用系统管理工具和API接口将决策层生成的指令转化为实际的运维操作,对IT系统进行调整和优化。
进一步可选的,所涉及数据采集层集成多模态数据采集引擎,支持Prometheus和Zabbix监控协议,通过ETL工具实现结构化/非结构化数据清洗,建立时间序列数据库存储实时数据;
状态感知层基于图神经网络构建,借助知识图谱推理引擎实现多源数据关联分析、基于隐马尔可夫模型的时序异常检测及故障传播路径预测;
决策层采用双引擎决策机制,通过规则引擎预定义优先级策略,通过强化学习引擎构建基于PPO算法的运维决策模型,运维决策模型的奖励函数包含故障恢复时效、操作风险系数和资源优化增益;
执行层设计自适应操作适配器,支持Ansible Playbook生成的基础设施即代码操作、云原生Kubernetes API调用和应用层热修复。
可选的,所涉及知识图谱构建模块具体包括:
信息收集与提取单元,用于收集整理IT系统的相关文档、运维手册和故障报告,从中提取关键信息;
知识图谱构建单元,用于使用知识图谱构建工具将关键信息转化为节点和边,构建初始的知识图谱,人工审核验证该知识图谱的准确性和完整性;
知识图谱更新单元,用于不断更新和完善知识图谱,使其能够反映IT系统的最新状态和变化。
可选的,所涉及训练优化模块具体包括:
数据准备单元,用于准备历史运维数据,包括系统状态数据、运维事件数据和对应的处理结果;
数据划分单元,用于将准备的历史运维数据划分为训练集和测试集;
智能体训练单元,用于使用训练集对智能体进行训练;训练过程中,设置超参数,调整机器学习模型的结构和参数,提高智能体的性能;
评估优化单元,用于使用测试集对智能体进行评估,根据评估结果进一步优化智能体,并输出;
定期收集单元,用于定期收集新的运维数据,对输出的智能体进行增量训练,使其能够不断学习和适应新的情况。
本发明的一种基于智能体的自动化运维方法及系统,与现有技术相比具有的有益效果是:
1、本发明利用智能体的自主学习和决策能力,实现对IT系统的智能化、自动化运维管理,能够实时感知系统状态,快速准确地处理各类运维事件,提高运维效率和质量,降低运维成本,保障IT系统的稳定、高效运行;
2、本发明的智能体能够实时监控IT系统,快速响应各类运维事件,自动执行运维操作,大大缩短了故障处理时间,提高了运维效率;通过知识图谱和机器学习模型,智能体能够充分利用历史数据和领域知识进行决策,避免了人为决策的主观性和片面性,在面对复杂的运维问题时,智能体可以综合考虑多种因素,制定出更合理、更有效的解决方案,提高了运维决策的准确性和科学性;智能体能够及时发现和解决潜在的问题,避免因系统故障导致的业务损失,降低企业的运营风险和成本;
3、本发明能提高运维效率,增强决策准确性,降低运维成本,提升系统稳定性,有效解决传统运维方式的不足,不仅适用于传统企业数据中心内各类服务器、网络设备以及应用软件的日常运维管理,还在云计算、边缘计算等新兴计算模式下的分布式系统运维场景中有着广泛的应用潜力。
附图说明
附图1是本发明实施例一的方法流程图;
附图2是本发明实施例二的模块连接框图;
附图3是本发明实施例一和二中智能体的架构图;
附图4是本发明实施例一和二中智能体的工作流程图。
具体实施方式
为使本发明的技术方案、解决的技术问题和技术效果更加清楚明白,以下结合具体实施例,对本发明的技术方案进行清楚、完整的描述。
实施例一:
结合附图1、3和4,本实施例提出一种基于智能体的自动化运维方法,其包括如下步骤:
S1、基于机器学习和深度学习技术构建智能体,智能体包含数据采集层、状态感知层、决策层和执行层,其中,数据采集层采集IT系统多源数据,状态感知层分析数据感知系统状态,决策层基于感知结果决策生成运维指令,执行层执行指令。
本步骤中,数据采集层使用Prometheus、Zabbix监控工具和API接口从IT系统的服务器、网络设备和应用程序组件中采集性能指标、日志信息和配置数据多源数据,并将数据存入InfluxDB分布式数据库。具体而言,数据采集层集成多模态数据采集引擎,支持Prometheus和Zabbix监控协议,通过ETL工具实现结构化/非结构化数据清洗,建立InfluxDB分布式数据库存储实时数据。
状态感知层采用数据分析技术(比如说聚类分析算法和异常检测算法)对采集到的数据进行处理,实时感知系统的运行状态,识别系统中的异常模式和潜在风险。具体而言,状态感知层基于图神经网络构建,借助知识图谱推理引擎实现多源数据关联分析、基于隐马尔可夫模型的时序异常检测及故障传播路径预测。
基于状态感知层的识别结果,决策层运用预定义的运维策略、深度学习模型(如神经网络、决策树)及知识图谱进行决策,生成相应的运维操作指令。具体而言,决策层采用双引擎决策机制,通过规则引擎预定义优先级策略,通过强化学习引擎构建基于PPO算法的运维决策模型,运维决策模型的奖励函数包含故障恢复时效、操作风险系数和资源优化增益。
执行层通过调用系统管理工具(如Ansible、SaltStack)和API接口将决策层生成的指令转化为实际的运维操作,对IT系统进行调整和优化。具体而言,执行层设计自适应操作适配器,支持Ansible Playbook生成的基础设施即代码操作、云原生Kubernetes API调用和应用层热修复。
S2、收集整理IT系统相关知识,构建知识图谱,为智能体决策提供背景知识,使其能够在决策过程中进行更全面和深入的推理。这一过程具体包括:
首先收集整理IT系统的相关文档、运维手册和故障报告,从中提取关键信息(如组件名称、属性、关系等);
随后使用知识图谱构建工具(如Neo4j)将关键信息转化为节点和边,构建初始的知识图谱,再通过人工审核验证知识图谱的准确性和完整性;
最后通过不断更新和完善知识图谱,使其能够反映IT系统的最新状态和变化。
S3、使用历史运维数据对智能体进行训练,通过强化学习算法让智能体在不同的环境中进行尝试和探索,根据反馈结果不断调整自己的行为,优化其决策模型和运维策略;同时,定期更新训练数据,使智能体能够适应IT系统的不断变化和发展。
智能体的训练过程包括:
准备历史运维数据,包括系统状态数据、运维事件数据和对应的处理结果;
将准备的历史运维数据划分为训练集和测试集,使用训练集对智能体进行训练;训练过程中,设置超参数,调整机器学习模型的结构和参数,提高智能体的性能;
训练结束后,使用测试集对智能体进行评估,根据评估结果进一步优化智能体;
同时,定期收集新的运维数据,对智能体进行增量训练,使其能够不断学习和适应新的情况。
S4、智能体实时监控IT系统,检测到异常事件时依次启动数据采集层、状态感知层、决策层和执行层,并根据决策结果自动执行相应的运维操作;
S5、在运维操作执行过程中,智能体持续监控操作的效果,并根据实际情况进行动态调整。
假设智能体实时监控IT系统,检测到某台服务器的内存使用率持续超过80%,且出现了应用程序响应缓慢的情况,依次启动数据采集层、状态感知层、决策层和执行层,数据采集层迅速采集该服务器的相关性能指标和日志信息,状态感知层分析这些数据,判断服务器可能存在的内存泄漏问题,决策层根据预定义的运维策略、深度学习模型及知识图谱进行决策,决定先尝试清理服务器的缓存,释放内存,执行层调用相应的命令行工具或API接口执行清理缓存操作。
操作完成后,智能体继续监控服务器的状态。如果内存使用率下降,应用程序响应恢复正常,则此次运维操作成功;如果问题仍然存在,智能体将进一步分析问题,尝试其他解决方案,如调整应用程序的内存分配参数或重启应用程序。
实施例二:
结合附图2、3和4,本实施例提出一种基于智能体的自动化运维系统,其包括:
智能体构建模块,用于基于机器学习和深度学习技术构建智能体,智能体包含数据采集层、状态感知层、决策层和执行层,其中,数据采集层采集IT系统多源数据,状态感知层分析数据感知系统状态,决策层基于感知结果决策生成运维指令,执行层执行指令;
知识图谱构建模块,用于收集整理IT系统相关知识,构建知识图谱,为智能体决策提供背景知识,使其能够在决策过程中进行更全面和深入的推理;
训练优化模块,用于使用历史运维数据对智能体进行训练,通过强化学习算法让智能体在不同的环境中进行尝试和探索,根据反馈结果不断调整自己的行为,优化其决策模型和运维策略;同时,定期更新训练数据,使智能体能够适应IT系统的不断变化和发展;
智能体,用于实时监控IT系统,检测到异常事件时依次启动数据采集层、状态感知层、决策层和执行层,并根据决策结果自动执行相应的运维操作;在运维操作执行过程中,智能体持续监控操作的效果,并根据实际情况进行动态调整。
本实施例中,数据采集层使用Prometheus、Zabbix监控工具和API接口从IT系统的服务器、网络设备和应用程序组件中采集性能指标、日志信息和配置数据多源数据,并将数据存入InfluxDB分布式数据库。具体而言,数据采集层集成多模态数据采集引擎,支持Prometheus和Zabbix监控协议,通过ETL工具实现结构化/非结构化数据清洗,建立InfluxDB分布式数据库存储实时数据。
状态感知层采用数据分析技术(比如说聚类分析算法和异常检测算法)对采集到的数据进行处理,实时感知系统的运行状态,识别系统中的异常模式和潜在风险。具体而言,状态感知层基于图神经网络构建,借助知识图谱推理引擎实现多源数据关联分析、基于隐马尔可夫模型的时序异常检测及故障传播路径预测。
基于状态感知层的识别结果,决策层运用预定义的运维策略、深度学习模型(如神经网络、决策树)及知识图谱进行决策,生成相应的运维操作指令。具体而言,决策层采用双引擎决策机制,通过规则引擎预定义优先级策略,通过强化学习引擎构建基于PPO算法的运维决策模型,运维决策模型的奖励函数包含故障恢复时效、操作风险系数和资源优化增益。
执行层通过调用系统管理工具(如Ansible、SaltStack)和API接口将决策层生成的指令转化为实际的运维操作,对IT系统进行调整和优化。具体而言,执行层设计自适应操作适配器,支持Ansible Playbook生成的基础设施即代码操作、云原生Kubernetes API调用和应用层热修复。
本实施例中,所涉及知识图谱构建模块具体包括:
信息收集与提取单元,用于收集整理IT系统的相关文档、运维手册和故障报告,从中提取关键信息(如组件名称、属性、关系等);
知识图谱构建单元,用于使用知识图谱构建工具(如Neo4j)将关键信息转化为节点和边,构建初始的知识图谱,人工审核验证该知识图谱的准确性和完整性;
知识图谱更新单元,用于不断更新和完善知识图谱,使其能够反映IT系统的最新状态和变化。
本实施例中,所涉及训练优化模块具体包括:
数据准备单元,用于准备历史运维数据,包括系统状态数据、运维事件数据和对应的处理结果;
数据划分单元,用于将准备的历史运维数据划分为训练集和测试集;
智能体训练单元,用于使用训练集对智能体进行训练;训练过程中,设置超参数,调整机器学习模型的结构和参数,提高智能体的性能;
评估优化单元,用于使用测试集对智能体进行评估,根据评估结果进一步优化智能体,并输出;
定期收集单元,用于定期收集新的运维数据,对输出的智能体进行增量训练,使其能够不断学习和适应新的情况。
基于本实施例的自动化运维系统,假设智能体实时监控IT系统,检测到某台服务器的内存使用率持续超过80%,且出现了应用程序响应缓慢的情况,依次启动数据采集层、状态感知层、决策层和执行层,数据采集层迅速采集该服务器的相关性能指标和日志信息,状态感知层分析这些数据,判断服务器可能存在的内存泄漏问题,决策层根据预定义的运维策略、深度学习模型及知识图谱进行决策,决定先尝试清理服务器的缓存,释放内存,执行层调用相应的命令行工具或API接口执行清理缓存操作。
操作完成后,智能体继续监控服务器的状态。如果内存使用率下降,应用程序响应恢复正常,则此次运维操作成功;如果问题仍然存在,智能体将进一步分析问题,尝试其他解决方案,如调整应用程序的内存分配参数或重启应用程序。
综上可知,采用本发明的一种基于智能体的自动化运维方法及系统,通过构建智能体、知识图谱以及完善的训练优化和运维流程,有效解决了传统运维方式存在的诸多问题,具有显著的技术优势和实际应用价值,能够为企业的IT系统运维提供高效、智能、可靠的解决方案,推动计算机运维技术领域的发展,具有广阔的应用前景和推广价值。
以上应用具体个例对本发明的原理及实施方式进行了详细阐述,这些实施例只是用于帮助理解本发明的核心技术内容。基于本发明的上述具体实施例,本技术领域的技术人员在不脱离本发明原理的前提下,对本发明所作出的任何改进和修饰,皆应落入本发明的专利保护范围。

Claims (10)

1.一种基于智能体的自动化运维方法,其特征在于,包括如下步骤:
S1、基于机器学习和深度学习技术构建智能体,智能体包含数据采集层、状态感知层、决策层和执行层,其中,数据采集层采集IT系统多源数据,状态感知层分析数据感知系统状态,决策层基于感知结果决策生成运维指令,执行层执行指令;
S2、收集整理IT系统相关知识,构建知识图谱,为智能体决策提供背景知识,使其能够在决策过程中进行更全面和深入的推理;
S3、使用历史运维数据对智能体进行训练,通过强化学习算法让智能体在不同的环境中进行尝试和探索,根据反馈结果不断调整自己的行为,优化其决策模型和运维策略;同时,定期更新训练数据,使智能体能够适应IT系统的不断变化和发展;
S4、智能体实时监控IT系统,检测到异常事件时依次启动数据采集层、状态感知层、决策层和执行层,并根据决策结果自动执行相应的运维操作;
S5、在运维操作执行过程中,智能体持续监控操作的效果,并根据实际情况进行动态调整。
2.根据权利要求1所述的一种基于智能体的自动化运维方法,其特征在于,所述数据采集层使用各类监控工具和API接口从IT系统的服务器、网络设备和应用程序组件中采集性能指标、日志信息和配置数据多源数据,并将数据存入时间序列数据库;
所述状态感知层采用数据分析技术对采集到的数据进行处理,实时感知系统的运行状态,识别系统中的异常模式和潜在风险;
基于状态感知层的识别结果,所述决策层运用预定义的运维策略、深度学习模型及知识图谱进行决策,生成相应的运维操作指令;
所述执行层通过调用系统管理工具和API接口将决策层生成的指令转化为实际的运维操作,对IT系统进行调整和优化。
3.根据权利要求2所述的一种基于智能体的自动化运维方法,其特征在于,所述数据采集层集成多模态数据采集引擎,支持Prometheus和Zabbix监控协议,通过ETL工具实现结构化/非结构化数据清洗,建立时间序列数据库存储实时数据;
所述状态感知层基于图神经网络构建,借助知识图谱推理引擎实现多源数据关联分析、基于隐马尔可夫模型的时序异常检测及故障传播路径预测;
所述决策层采用双引擎决策机制,通过规则引擎预定义优先级策略,通过强化学习引擎构建基于PPO算法的运维决策模型,运维决策模型的奖励函数包含故障恢复时效、操作风险系数和资源优化增益;
所述执行层设计自适应操作适配器,支持Ansible Playbook生成的基础设施即代码操作、云原生Kubernetes API调用和应用层热修复。
4.根据权利要求1所述的一种基于智能体的自动化运维方法,其特征在于,执行步骤S2,首先收集整理IT系统的相关文档、运维手册和故障报告,从中提取关键信息,随后使用知识图谱构建工具将关键信息转化为节点和边,构建初始的知识图谱,再通过人工审核验证知识图谱的准确性和完整性,并通过不断更新和完善知识图谱,使其能够反映IT系统的最新状态和变化。
5.根据权利要求1所述的一种基于智能体的自动化运维方法,其特征在于,执行步骤S3,智能体的训练过程包括:
准备历史运维数据,包括系统状态数据、运维事件数据和对应的处理结果;
将准备的历史运维数据划分为训练集和测试集,使用训练集对智能体进行训练;训练过程中,设置超参数,调整机器学习模型的结构和参数,提高智能体的性能;
训练结束后,使用测试集对智能体进行评估,根据评估结果进一步优化智能体;
同时,定期收集新的运维数据,对智能体进行增量训练,使其能够不断学习和适应新的情况。
6.一种基于智能体的自动化运维系统,其特征在于,其包括:
智能体构建模块,用于基于机器学习和深度学习技术构建智能体,智能体包含数据采集层、状态感知层、决策层和执行层,其中,数据采集层采集IT系统多源数据,状态感知层分析数据感知系统状态,决策层基于感知结果决策生成运维指令,执行层执行指令;
知识图谱构建模块,用于收集整理IT系统相关知识,构建知识图谱,为智能体决策提供背景知识,使其能够在决策过程中进行更全面和深入的推理;
训练优化模块,用于使用历史运维数据对智能体进行训练,通过强化学习算法让智能体在不同的环境中进行尝试和探索,根据反馈结果不断调整自己的行为,优化其决策模型和运维策略;同时,定期更新训练数据,使智能体能够适应IT系统的不断变化和发展;
智能体,用于实时监控IT系统,检测到异常事件时依次启动数据采集层、状态感知层、决策层和执行层,并根据决策结果自动执行相应的运维操作;在运维操作执行过程中,智能体持续监控操作的效果,并根据实际情况进行动态调整。
7.根据权利要求6所述的一种基于智能体的自动化运维系统,其特征在于,所述数据采集层使用各类监控工具和API接口从IT系统的服务器、网络设备和应用程序组件中采集性能指标、日志信息和配置数据多源数据,并将数据存入时间序列数据库;
所述状态感知层采用数据分析技术对采集到的数据进行处理,实时感知系统的运行状态,识别系统中的异常模式和潜在风险;
基于状态感知层的识别结果,所述决策层运用预定义的运维策略、深度学习模型及知识图谱进行决策,生成相应的运维操作指令;
所述执行层通过调用系统管理工具和API接口将决策层生成的指令转化为实际的运维操作,对IT系统进行调整和优化。
8.根据权利要求7所述的一种基于智能体的自动化运维系统,其特征在于,所述数据采集层集成多模态数据采集引擎,支持Prometheus和Zabbix监控协议,通过ETL工具实现结构化/非结构化数据清洗,建立时间序列数据库存储实时数据;
所述状态感知层基于图神经网络构建,借助知识图谱推理引擎实现多源数据关联分析、基于隐马尔可夫模型的时序异常检测及故障传播路径预测;
所述决策层采用双引擎决策机制,通过规则引擎预定义优先级策略,通过强化学习引擎构建基于PPO算法的运维决策模型,运维决策模型的奖励函数包含故障恢复时效、操作风险系数和资源优化增益;
所述执行层设计自适应操作适配器,支持Ansible Playbook生成的基础设施即代码操作、云原生Kubernetes API调用和应用层热修复。
9.根据权利要求6所述的一种基于智能体的自动化运维系统,其特征在于,所述知识图谱构建模块具体包括:
信息收集与提取单元,用于收集整理IT系统的相关文档、运维手册和故障报告,从中提取关键信息;
知识图谱构建单元,用于使用知识图谱构建工具将关键信息转化为节点和边,构建初始的知识图谱,人工审核验证该知识图谱的准确性和完整性;
知识图谱更新单元,用于不断更新和完善知识图谱,使其能够反映IT系统的最新状态和变化。
10.根据权利要求6所述的一种基于智能体的自动化运维系统,其特征在于,所述训练优化模块具体包括:
数据准备单元,用于准备历史运维数据,包括系统状态数据、运维事件数据和对应的处理结果;
数据划分单元,用于将准备的历史运维数据划分为训练集和测试集;
智能体训练单元,用于使用训练集对智能体进行训练;训练过程中,设置超参数,调整机器学习模型的结构和参数,提高智能体的性能;
评估优化单元,用于使用测试集对智能体进行评估,根据评估结果进一步优化智能体,并输出;
定期收集单元,用于定期收集新的运维数据,对输出的智能体进行增量训练,使其能够不断学习和适应新的情况。
CN202510866002.7A 2025-06-26 2025-06-26 一种基于智能体的自动化运维方法及系统 Pending CN120822604A (zh)

Priority Applications (1)

Application Number Priority Date Filing Date Title
CN202510866002.7A CN120822604A (zh) 2025-06-26 2025-06-26 一种基于智能体的自动化运维方法及系统

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
CN202510866002.7A CN120822604A (zh) 2025-06-26 2025-06-26 一种基于智能体的自动化运维方法及系统

Publications (1)

Publication Number Publication Date
CN120822604A true CN120822604A (zh) 2025-10-21

Family

ID=97366836

Family Applications (1)

Application Number Title Priority Date Filing Date
CN202510866002.7A Pending CN120822604A (zh) 2025-06-26 2025-06-26 一种基于智能体的自动化运维方法及系统

Country Status (1)

Country Link
CN (1) CN120822604A (zh)

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN121722653A (zh) * 2026-02-25 2026-03-24 新芯航途(苏州)科技有限公司 一种功能安全信号的故障决策系统和芯片

Cited By (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN121722653A (zh) * 2026-02-25 2026-03-24 新芯航途(苏州)科技有限公司 一种功能安全信号的故障决策系统和芯片

Similar Documents

Publication Publication Date Title
CN114048600B (zh) 一种数字孪生驱动的多模型融合工业系统异常检测方法
CN110008288B (zh) 用于网络故障分析的知识图谱库的构建方法及其应用
CN110493025B (zh) 一种基于多层有向图的故障根因诊断的方法及装置
CN118967147B (zh) 一种基于多字段解析与融合的售后触发管理方法及系统
CN111290913A (zh) 一种基于运维数据预测的故障定位可视化系统和方法
CN112147974B (zh) 基于化工过程知识自动化的报警根原因诊断方法
CN112884452A (zh) 一种智能运维多源数据采集可视化分析系统
CN120822604A (zh) 一种基于智能体的自动化运维方法及系统
CN119204730A (zh) 一种化工园区智能管理方法及系统
CN119557134A (zh) 云计算平台的故障处理方法、装置、电子设备及存储介质
CN119646541A (zh) 一种云电脑端到端故障根因分析方法及系统
CN120179435A (zh) 一种基于故障模拟的集群可靠性测试方法及系统
CN118819781A (zh) 一种气象卫星数据全流程优化调度的方法及系统
CN120849171A (zh) 一种基于知识图谱的数据库异常根因定位方法及系统
CN121167244B (zh) 基于概率传播推理的故障根因动态预测方法及系统
CN116302984B (zh) 一种测试任务的根因分析方法、装置及相关设备
CN120371675B (zh) 基于强化学习的数据库故障处理方法及系统
CN118827342A (zh) 互联网设备故障诊断方法及系统
CN111277427B (zh) 一种数据中心网络设备的巡检方法及系统
CN119025396B (zh) 后端服务自动化设计方法及系统
CN120780519A (zh) 结合多维异常检测的跨系统故障诊断方法及系统
CN120276930A (zh) 一种智能运维平台自动化性能监控与调优方法及装置
CN119248560A (zh) 一种机场数据服务接口故障分析方法及系统
CN119417438A (zh) 一种智能运维方法、系统、装置及存储介质
CN118708648A (zh) 一种基于云计算的综合测试系统

Legal Events

Date Code Title Description
PB01 Publication
PB01 Publication
SE01 Entry into force of request for substantive examination
SE01 Entry into force of request for substantive examination