CN118380997B - 一种基于td3的电力系统暂态稳定紧急控制策略生成方法 - Google Patents
一种基于td3的电力系统暂态稳定紧急控制策略生成方法 Download PDFInfo
- Publication number
- CN118380997B CN118380997B CN202410410491.0A CN202410410491A CN118380997B CN 118380997 B CN118380997 B CN 118380997B CN 202410410491 A CN202410410491 A CN 202410410491A CN 118380997 B CN118380997 B CN 118380997B
- Authority
- CN
- China
- Prior art keywords
- power system
- control
- network
- action
- state
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Active
Links
Classifications
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/08—Learning methods
- G06N3/092—Reinforcement learning
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06Q—INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR ADMINISTRATIVE, COMMERCIAL, FINANCIAL, MANAGERIAL OR SUPERVISORY PURPOSES; SYSTEMS OR METHODS SPECIALLY ADAPTED FOR ADMINISTRATIVE, COMMERCIAL, FINANCIAL, MANAGERIAL OR SUPERVISORY PURPOSES, NOT OTHERWISE PROVIDED FOR
- G06Q50/00—Information and communication technology [ICT] specially adapted for implementation of business processes of specific business sectors, e.g. utilities or tourism
- G06Q50/06—Energy or water supply
-
- H—ELECTRICITY
- H02—GENERATION; CONVERSION OR DISTRIBUTION OF ELECTRIC POWER
- H02J—ELECTRIC POWER NETWORKS; CIRCUIT ARRANGEMENTS OR SYSTEMS FOR SUPPLYING OR DISTRIBUTING ELECTRIC POWER; SYSTEMS FOR STORING ELECTRIC ENERGY
- H02J3/00—Circuit arrangements for AC mains or AC distribution networks
- H02J3/001—Arrangements for handling faults or abnormalities, e.g. emergencies or contingencies
-
- H—ELECTRICITY
- H02—GENERATION; CONVERSION OR DISTRIBUTION OF ELECTRIC POWER
- H02J—ELECTRIC POWER NETWORKS; CIRCUIT ARRANGEMENTS OR SYSTEMS FOR SUPPLYING OR DISTRIBUTING ELECTRIC POWER; SYSTEMS FOR STORING ELECTRIC ENERGY
- H02J3/00—Circuit arrangements for AC mains or AC distribution networks
- H02J3/001—Arrangements for handling faults or abnormalities, e.g. emergencies or contingencies
- H02J3/0014—Arrangements for handling faults or abnormalities, e.g. emergencies or contingencies for preventing or reducing power oscillations in networks
-
- H—ELECTRICITY
- H02—GENERATION; CONVERSION OR DISTRIBUTION OF ELECTRIC POWER
- H02J—ELECTRIC POWER NETWORKS; CIRCUIT ARRANGEMENTS OR SYSTEMS FOR SUPPLYING OR DISTRIBUTING ELECTRIC POWER; SYSTEMS FOR STORING ELECTRIC ENERGY
- H02J2103/00—Details of circuit arrangements for mains or AC distribution networks
- H02J2103/30—Simulating, planning, modelling, reliability check or computer assisted design [CAD] of electric power networks
Landscapes
- Engineering & Computer Science (AREA)
- Physics & Mathematics (AREA)
- Business, Economics & Management (AREA)
- Health & Medical Sciences (AREA)
- Theoretical Computer Science (AREA)
- Power Engineering (AREA)
- Economics (AREA)
- General Physics & Mathematics (AREA)
- General Health & Medical Sciences (AREA)
- General Business, Economics & Management (AREA)
- Biophysics (AREA)
- Strategic Management (AREA)
- Tourism & Hospitality (AREA)
- Marketing (AREA)
- Human Resources & Organizations (AREA)
- Water Supply & Treatment (AREA)
- Public Health (AREA)
- Life Sciences & Earth Sciences (AREA)
- Artificial Intelligence (AREA)
- Biomedical Technology (AREA)
- Primary Health Care (AREA)
- Computational Linguistics (AREA)
- Data Mining & Analysis (AREA)
- Evolutionary Computation (AREA)
- Molecular Biology (AREA)
- Computing Systems (AREA)
- General Engineering & Computer Science (AREA)
- Mathematical Physics (AREA)
- Software Systems (AREA)
- Feedback Control In General (AREA)
- Supply And Distribution Of Alternating Current (AREA)
Abstract
本发明提供一种基于TD3的电力系统暂态稳定紧急控制策略生成方法,包括包括如下步骤:构建电力系统暂态稳定紧急控制的TD3模型;初始化TD3模型中actor网络和critic网络的参数;构建TD3模型的经验回放缓冲区;基于初始化后的actor网络和critic网络以及经验回放缓冲区,使用TD3算法对actor网络和critic网络进行离线训练;基于离线训练后的TD3模型在电力系统实时场景中生成紧急控制策略并实施以维持暂态稳定性。本发明实现了电力系统在面临暂态稳定性挑战时的紧急控制,通过训练actor网络和critic网络,能够生成有效的控制策略,提高电力系统在突发事件下的暂态稳定性。
Description
技术领域
本发明涉及电力系统控制领域,具体是一种基于TD3的电力系统暂态稳定紧急控制策略生成方法,用于提高电力系统在面临暂态失稳情况下的稳定性和鲁棒性。
背景技术
电力系统的暂态稳定性是指电力系统在遭受外部扰动后,能够在一定时间内恢复到新的平衡状态的能力。在面临突发故障或负荷波动时,电力系统可能面临暂态失稳的风险,导致电力系统崩溃或发生停电。因此,开发高效的暂态稳定控制策略对于确保电力系统的可靠运行至关重要。
传统的电力系统控制方法主要依赖于经验规则和线性控制器,这些方法在复杂的非线性和时变电力系统中表现出限制。随着深度强化学习技术的发展,利用强化学习算法来设计电力系统暂态稳定控制策略成为一种备受关注的方法。然而,现有的方法往往面临收敛速度慢、稳定性差以及在实际电力系统中泛化能力不足等挑战。在实际电力系统中,由于系统的非线性和不确定性,传统控制方法难以提供足够鲁棒性的控制策略。因此,需要一种能够充分考虑电力系统的动态特性、非线性特性和多变因素的电力系统暂态稳定紧急控制策略生成方法。
发明内容
本发明的目的在于提供一种基于TD3的电力系统暂态稳定紧急控制策略生成方法,通过深度强化学习的框架,结合离线经验回放缓冲区和双Q学习的思想,实现了电力系统在面临暂态稳定性挑战时的紧急控制,通过训练actor网络和critic网络,该方法能够生成有效的控制策略,提高电力系统在突发事件下的暂态稳定性。
一种基于TD3的电力系统暂态稳定紧急控制策略生成方法,包括如下步骤:
步骤一、构建电力系统暂态稳定紧急控制的TD3模型;
步骤二、初始化TD3模型中actor网络和critic网络的参数;
步骤三、构建TD3模型的经验回放缓冲区,用于训练时样本的存取;
步骤四、基于步骤二初始化后的actor网络和critic网络以及步骤三构建的经验回放缓冲区,使用TD3算法对actor网络和critic网络进行离线训练;
步骤五、基于步骤四离线训练后的TD3模型在电力系统实时场景中生成紧急控制策略并实施以维持暂态稳定性。
进一步的,所述步骤一具体包括:
步骤1.1:定义电力系统状态集合st={δGi(t),VNj(t)},其中δGi(t)表示t时间的第i台发电机的功角,VNj(t)表示t时间的第j个节点的电压幅值,st作为神经网络的输入层输入;
步骤1.2:定义电力系统输出动作集合at={kG1,kG2,...,kGm,kL1,kL1,...,kLl},其中kGi表示第i台发电机的切除系数,i=1,2,...,m;kLj表示第j个负荷的切除系数,j=1,2,...,l,切除系数k表示对当前发电机/负荷的切除量占当前发电机/负荷额定容量的比例,0≤k≤1;
发电机的切除控制按照整台切除来设置,即:
负荷的切除控制按照一定间隔p%来设置,即:
步骤1.3:定义电力系统暂态稳定判断标准TSI:
其中|Δδmax|表示步骤3.1中任意两台发电机中最大相对功角差,TSI>0时,
系统稳定,反之系统失稳;
步骤1.4:定义即时奖励函数Rt:
Rt=Rstate+Rothers
Rothers=rc+rv+rs
其中:
Rstate表示控制后系统状态的奖励值,rstable表示系统稳定时候的Rstate值,取正数,runstable表示系统不稳定时候的Rstate值,取负数;
Rothers表示控制后其他奖励值;
rc表示控制成本奖励值,根据切除量的加权和给予惩罚,反映切机和切负荷的成本:
PGi=PratedGikGi,PLj=PratedLjkLj
PGi表示第i台发电机的切除量,PratedGi表示第i台发电机的额定容量;PLj表示第i个负荷的切除量,PratedLj表示第i个负荷的额定容量。m为发电机数量,l为负荷数量;
rv表示电压约束奖励值,根据超出上下限的大小给予惩罚,以限制控制后各节点电压:
cv表示电压越限惩罚系数,rn表示节点n电压的越限值,Vn表示第n个节点的电压值,和分别表示第n个节点的电压幅值的上下限;
rs表示控制步数奖励,根据控制步数的总次数给予惩罚,以最少的动作次
数完成控制目标:
rs=csNstep
cs表示控制步数惩罚系数,Nstep表示控制次数。
进一步的,所述步骤二具体包括:
步骤2.1:在actor网络中,初始化包括状态输入层、多个全连接隐藏层和输出层的神经网络参数,其中输入数据是电力系统状态集合st,输出数据是电力系统输出动作集合at,输出层的节点数等于电力系统的可行动作空间维度Daction,以确保生成合理的控制动作,Daction为电力系统输出动作集合α的长度;
步骤2.2:在critic网络中,初始化包括状态输入层、动作输入层、多个全连接隐藏层和输出层的神经网络参数,其中输入数据为电力系统状态和输出动作集合{st,at},输出层的节点数为1,输出数据为对应状态和输出动作组合的Q值Q(st,at):
其中:
Q(st,at)表示状态st下采取动作at的Q值;
Rt表示状态st下采取动作at的即时奖励;
γ是折扣因子,用于平衡当前奖励和未来奖励的重要性;
st+1表示采取动作at后转移到的下一个状态;
at+1表示st+1状态下选择的动作;
表示在下一个状态st+1选择最优动作的Q值;
步骤2.3:设定离线训练的迭代次数、每次迭代中的训练步数和收敛标准。
进一步的,所述步骤三具体包括:
步骤3.1:采集电力系统仿真数据,包括系统状态st和st+1,控制动作at,并根据数据计算对应奖励Rt;
步骤3.2设定经验回放缓冲区的存储容量,并按照时间顺序将采集到的数据以et={st,at,Rt,st+1}的格式存储到缓冲区中,构建经验回放缓冲区。
进一步的,所述步骤四具体包括:
步骤4.1:随机从经验回放缓冲区抽样批量的经验数据作为训练样本;
步骤4.2:对训练样本使用actor网络生成当前状态下st的控制动作at,通过仿真获得执行控制动作后系统状态st+1,计算得到奖励值Rt,并通过critic网络评估该动作的Q值;
步骤4.3:使用双Q学习方法,计算当前状态下的目标值Qt,并计算critic网络输出的Q值与目标值Qt的均方误差;
步骤4.4:利用均方误差最小化的优化算法更新critic网络的参数;
步骤4.5:计算actor网络的策略梯度;
步骤4.6:利用梯度上升法,更新actor网络的参数,以提高生成控制动作的质量;
步骤4.7:以et={st,at,Rt,st+1}的格式存储于经验缓冲区作为经验数据;
步骤4.8重复以上步骤,直到达到预定的训练步数或达到收敛标准完成离线训练。
进一步的,所述步骤五具体包括:
步骤5.1:获取当前电力系统的实时状态st,包括发电机功角δGi(t)、节点电压VNj(t);
步骤5.2:输入当前状态到已经离线训练好的TD3模型的actor网络中,生成相应的紧急控制动作at;
步骤5.3:将生成的紧急控制动作应用到电力系统中,实施紧急控制策略;
步骤5.4:实时监测实施后的电力系统状态响应,包括TSI、电压等暂态稳定性指标,并利用响应信息更新actor网络中的实时状态表示,以保持网络的准确性和泛化能力;
步骤5.5:如果系统响应符合预期,继续维持当前控制策略;如果系统响应不理想,将状态信息添加到经验回放缓冲区中,供后续离线训练和改进控制策略。
本发明具有强大的场景适应性和卓越的实用性,通过引入深度强化学习算法TD3,能够有效地学习和优化电力系统的暂态稳定控制策略。电力系统属于一种高维的状态空间,在面临暂态稳定问题时的控制策略属于连续动作空间,相比于其它深度强化学习算法,TD3能够综合考虑多个时间步的信息,更全面地学习电力系统的动态演化,因而能够更灵活地处理高维状态空间,并且有效地应对连续动作空间的问题,使其能够在实时控制场景中迅速应对电力系统的动态变化,同时,其采用的经验回放缓冲区和双Q学习技术也有效提高了算法的稳定性和效率,进一步提升了其性能。因此,本发明为电力系统暂态稳定性的提升提供了一种创新的、鲁棒的解决方案。
附图说明
图1是本发明实施例一种基基于TD3的电力系统暂态稳定紧急控制策略生成方法的流程示意图;
图2是本发明实施例WEPRI-36节点系统架构图;
图3是采用本发明实施例紧急控制策略前的功角曲线;
图4是采用本发明实施例紧急控制策略前的仿真图;
图5是采用本发明实施例紧急控制策略后的功角曲线;
图6是采用本发明实施例紧急控制策略后的仿真图。
具体实施方式
为使本发明实施例的目的、技术方案和优点更加清楚,下面将结合本发明实施例中的附图,对本发明实施例中的技术方案进行清楚、完整地描述,显然,所描述的实施例是本发明的一部分实施例,而不是全部的实施例。基于本发明中的实施例,本领域普通技术人员在没有做出创造性劳动的前提下所获得的所有其他实施例,都属于本发明保护的范围。
请参阅图1,本发明实施例提供一种基于TD3的电力系统暂态稳定紧急控制策略生成方法,包括如下步骤:
步骤一、构建电力系统暂态稳定紧急控制的TD3模型;
所述步骤一具体包括:
步骤1.1:定义电力系统状态集合st={δGi(t),VNj(t)},其中δGi(t)表示t时间的第i台发电机的功角,VNj(t)表示t时间的第j个节点的电压幅值,st作为神经网络的输入层输入;
步骤1.2:定义电力系统输出动作集合at={kG1,kG2,...,kGm,kL1,kL1,...,kLl},其中kGi表示第i台发电机的切除系数,i=1,2,...,m;kLj表示第j个负荷的切除系数,j=1,2,...,l,切除系数k表示对当前发电机/负荷的切除量占当前发电机/负荷额定容量的比例,0≤k≤1;
发电机的切除控制按照整台切除来设置,即:
负荷的切除控制按照一定间隔p%来设置,即:
步骤1.3:定义电力系统暂态稳定判断标准TSI:
其中|Δδmax|表示步骤3.1中任意两台发电机中最大相对功角差,TSI>0时,
系统稳定,反之系统失稳;
步骤1.4:定义即时奖励函数Rt:
Rt=Rstate+Rothers
Rothers=rc+rv+rs
其中:
Rstate表示控制后系统状态的奖励值,rstable表示系统稳定时候的Rstate值,取正数,runstable表示系统不稳定时候的Rstate值,取负数;
Rothers表示控制后其他奖励值;
rc表示控制成本奖励值,根据切除量的加权和给予惩罚,反映切机和切负荷的成本:
PGi=PratedGikGi,PLj=PratedLjkLj
PGi表示第i台发电机的切除量,PratedGi表示第i台发电机的额定容量;PLj表示第i个负荷的切除量,PratedLj表示第i个负荷的额定容量。m为发电机数量,l为负荷数量;
rv表示电压约束奖励值,根据超出上下限的大小给予惩罚,以限制控制后各节点电压:
cv表示电压越限惩罚系数,rn表示节点n电压的越限值,Vn表示第n个节点的电压值,和分别表示第n个节点的电压幅值的上下限;
rs表示控制步数奖励,根据控制步数的总次数给予惩罚,以最少的动作次数完成控制目标:
rs=csNstep
cs表示控制步数惩罚系数,Nstep表示控制次数。
步骤1.1–1.4构建了电力系统暂态稳定紧急控制的TD3模型框架,通过框架的设定,使该方法能够在具有动态特性、非线性特性和多变因素的电力系统遇到暂态稳定故障问题时提供有效的控制策略,并且显著提高TD3离线训练的效率。
步骤二、初始化TD3模型中actor网络和critic网络的参数;
所述步骤二具体包括:
步骤2.1:在actor网络中,初始化包括状态输入层、多个全连接隐藏层和输出层的神经网络参数,其中输入数据是电力系统状态集合st,输出数据是电力系统输出动作集合at,输出层的节点数等于电力系统的可行动作空间维度Daction,以确保生成合理的控制动作,Daction为电力系统输出动作集合α的长度;
步骤2.2:在critic网络中,初始化包括状态输入层、动作输入层、多个全连接隐藏层和输出层的神经网络参数,其中输入数据为电力系统状态和输出动作集合{st,at},输出层的节点数为1,输出数据为对应状态和输出动作组合的Q值Q(st,at):
其中:
Q(st,at)表示状态st下采取动作at的Q值;
Rt表示状态st下采取动作at的即时奖励;
γ是折扣因子,用于平衡当前奖励和未来奖励的重要性;
st+1表示采取动作at后转移到的下一个状态;
at+1表示st+1状态下选择的动作;
表示在下一个状态st+1选择最优动作的Q值;
步骤2.3:设定离线训练的迭代次数、每次迭代中的训练步数和收敛标准。
步骤2.1–2.3设置了actor和critic神经网络的参数,通过参数的设定,能够帮助TD3模型实现更好的训练效果。
步骤三、构建TD3模型的经验回放缓冲区,用于训练时样本的存取;
所述步骤三具体包括:
步骤3.1:采集电力系统仿真数据,包括系统状态st和st+1,控制动作at,并根据数据计算对应奖励Rt;
步骤3.2设定经验回放缓冲区的存储容量,并按照时间顺序将采集到的数据以et={st,at,Rt,st+1}的格式存储到缓冲区中,构建经验回放缓冲区。
步骤31–3.2构建了TD3模型的经验回放缓冲区,用于训练时样本的存取,通过经验回放缓冲区的构建,能够降低数据的相关性并且提高模型的训练效率。
步骤四、基于步骤二初始化后的actor网络和critic网络以及步骤三构建的经验回放缓冲区,使用TD3算法对actor网络和critic网络进行离线训练;
所述步骤四具体包括:
步骤4.1:随机从经验回放缓冲区抽样批量的经验数据作为训练样本;
步骤4.2:对训练样本使用actor网络生成当前状态下st的控制动作at,通过仿真获得执行控制动作后系统状态st+1,计算得到奖励值Rt,并通过critic网络评估该动作的Q值;
步骤4.3:使用双Q学习方法,计算当前状态下的目标值Qt,并计算critic网络输出的Q值与目标值Qt的均方误差;
步骤4.4:利用均方误差最小化的优化算法更新critic网络的参数;
步骤4.5:计算actor网络的策略梯度;
步骤4.6:利用梯度上升法,更新actor网络的参数,以提高生成控制动作的质量;
步骤4.7:以et={st,at,Rt,st+1}的格式存储于经验缓冲区作为经验数据;
步骤4.8重复以上步骤,直到达到预定的训练步数或达到收敛标准完成离线训练。
步骤4.1–4.8完成了TD3模型的离线训练过程。完成离线训练后的TD3模型将能够根据输入状态st生成对应的输出动作at,此时的输出动作at即为针对当前输入状态st生成的紧急控制动作。
步骤五、基于步骤四离线训练后的TD3模型在电力系统实时场景中生成紧急控制策略并实施以维持暂态稳定性。
所述步骤五具体包括:
步骤5.1:获取当前电力系统的实时状态st,包括发电机功角δGi(t)、节点电压VNj(t);
步骤5.2:输入当前状态到已经离线训练好的TD3模型的actor网络中,生成相应的紧急控制动作at;
步骤5.3:将生成的紧急控制动作应用到电力系统中,实施紧急控制策略;
步骤5.4:实时监测实施后的电力系统状态响应,包括TSI、电压等暂态稳定性指标,并利用响应信息更新actor网络中的实时状态表示,以保持网络的准确性和泛化能力;
步骤5.5:如果系统响应符合预期,继续维持当前控制策略;如果系统响应不理想,将状态信息添加到经验回放缓冲区中,供后续离线训练和改进控制策略。
本发明适用于电力系统稳定控制技术领域,用于恢复电力系统在发生严重故障后的暂态稳定性,针对以上问题,本实施例通过PSASP7.41采用基频为50Hz的WEPRI-36节点电力系统进行仿真,用于说明紧急控制策略生成方法效果。该系统含有8台发电机,10个负荷,系统架构如图2所示。TD3模型及训练基于PyTorch 1.12.1搭建,采用Python3.7语言进行编程。
模型状态空间包括8台发电机的功角、36个节点的母线电压,故状态空间维度数为44。设置分段切除负荷的比例p%为10%,输出动作空间包括8个切机动作和100个切负荷动作,动作空间维度数为108。Actor网络和Critic网络的隐藏层层数均为3层,每层包含的神经元个数分别为50,25和50。Critic网络学习率为0.0005,Actor网络学习率为0.0001,经验回访池容量设置为1×105,经验回放训练批次为64,折旧因子为0.90,软更新系数为0.001。
初始时刻系统处于稳定状态,设置离线学习故障场景为输电线AC34的50%处发生三相短路故障,故障持续时间为0.2s,设置学习的目标为故障切除后5s内保持暂态稳定。
本实施例采用暂态稳定指数(Transient Stability Index,TSI)作为稳定判据:
式中|Δδmax|为仿真时长内任意两台发电机相对功角差的最大值。当TSI>0时,系统状态为稳定,反之,判定为失稳状态。
当故障场景为输电线AC34的50%处时,0.02s发生三相短路故障,0.22s故障切除。在不实施任何紧急控制策略的情况下,通过暂稳仿真得到结果如图3和图4所示,从图3可以看出,4、7、8号发电机的功角曲线与其他发电机功角曲线失去同调性,从图4可以看出,发电机最大功角差在1s时已经越过了360度基准线以下,TSI<0,说明系统处于失稳状态。
根据TD3模型可得此场景下的紧急控制策略如表1所示,在仿真中应用该控制策略,得到仿真结果如图5和图6所示,从图5可以看出,在切除7号发电机和母线23负荷的10%之后,发电机的功角曲线恢复同调性,同时从图6可以看出,发电机最大功角差一直保持在360度基准线以下,TSI>0,说明系统在执行了紧急控制策略之后恢复了稳定性,可见该方法的有效性。
表1 AC34三相短路故障下紧急控制策略结果
本发明利用TD3算法中的离线学习机制,通过不断在仿真环境中采样、经验回放、更新网络参数的方式,优化控制策略,以适应电力系统不同工况下的紧急控制需求。同时,采用目标网络的软更新机制,有效减缓网络更新的速度,提高控制策略的稳定性。本发明不仅提高了电力系统的暂态稳定性,还具备一定的泛化能力,能够适应不同电力系统结构和工况下的紧急控制问题。在实际应用中,本发明为电力系统提供了一种智能、自适应的暂态稳定紧急控制方案,为电力系统运行安全和可靠性提供了新的解决思路。
以上所述,仅为本发明的具体实施方式,但本发明的保护范围并不局限于此,任何属于本技术领域的技术人员在本发明揭露的技术范围内,可轻易想到的变化或替换,都应涵盖在本发明的保护范围之内。因此,本发明的保护范围应该以权利要求的保护范围为准。
Claims (4)
1.一种基于TD3的电力系统暂态稳定紧急控制策略生成方法,其特征在于,包括如下步骤:
步骤一、构建电力系统暂态稳定紧急控制的TD3模型;
步骤二、初始化TD3模型中actor网络和critic网络的参数;
步骤三、构建TD3模型的经验回放缓冲区,用于训练时样本的存取;
步骤四、基于步骤二初始化后的actor网络和critic网络以及步骤三构建的经验回放缓冲区,使用TD3算法对actor网络和critic网络进行离线训练;
步骤五、基于步骤四离线训练后的TD3模型在电力系统实时场景中生成紧急控制策略并实施以维持暂态稳定性;
所述步骤一具体包括:
步骤1.1:定义电力系统状态集合,其中表示t时间的第i台发电机的功角,表示t时间的第j个节点的电压幅值,作为神经网络的输入层输入;
步骤1.2:定义电力系统输出动作集合,其中 表示第i台发电机的切除系数,;表示第j个负荷的切除系数,,切除系数表示对当前发电机/负荷的切除量占当前发电机/负荷额定容量的比例,;
发电机的切除控制按照整台切除来设置,即:
;
负荷的切除控制按照一定间隔来设置,即:
;
步骤1.3:定义电力系统暂态稳定判断标准:
;
其中表示步骤3.1中任意两台发电机中最大相对功角差,时,系统稳定,反之系统失稳;
步骤1.4:定义即时奖励函数:
;
;
;
其中:
表示控制后系统状态的奖励值,表示系统稳定时候的值,取正数,表示系统不稳定时候的值,取负数;
表示控制后其他奖励值;
表示控制成本奖励值,根据切除量的加权和给予惩罚,反映切机和切负荷的成本:
;
;
表示第i台发电机的切除量,表示第i台发电机的额定容量;表示第i个负荷的切除量,表示第i个负荷的额定容量,为发电机数量,为负荷数量;
表示电压约束奖励值,根据超出上下限的大小给予惩罚,以限制控制后各节点电压:
;
;
表示电压越限惩罚系数,表示节点n电压的越限值,表示第n个节点的电压值,和分别表示第n个节点的电压幅值的上下限;
表示控制步数奖励,根据控制步数的总次数给予惩罚,以最少的动作次数完成控制目标:
;
表示控制步数惩罚系数,表示控制次数;
所述步骤五具体包括:
步骤5.1:获取当前电力系统的实时状态,包括发电机功角、节点电压;
步骤5.2:输入当前状态到已经离线训练好的TD3模型的 actor 网络中,生成相应的紧急控制动作;
步骤5.3:将生成的紧急控制动作应用到电力系统中,实施紧急控制策略;
步骤5.4:实时监测实施后的电力系统状态响应,包括、电压暂态稳定
性指标,并利用响应信息更新 actor 网络中的实时状态表示,以保持网络的准确性和泛化能力;
步骤5.5:如果系统响应符合预期,继续维持当前控制策略;如果系统响应不理想,将状态信息添加到经验回放缓冲区中,供后续离线训练和改进控制策略。
2.如权利要求1所述的基于TD3的电力系统暂态稳定紧急控制策略生成方法,其特征在于:所述步骤二具体包括:
步骤2.1:在 actor 网络中,初始化包括状态输入层、多个全连接隐藏层和输出层的神经网络参数,其中输入数据是电力系统状态集合,输出数据是电力系统输出动作集合,输出层的节点数等于电力系统的可行动作空间维度,以确保生成合理的控制动作,为电力系统输出动作集合的长度;
步骤2.2:在 critic 网络中,初始化包括状态输入层、动作输入层、多个全连接隐藏层和输出层的神经网络参数,其中输入数据为电力系统状态和输出动作集合,输出层的节点数为1,输出数据为对应状态和输出动作组合的Q值:
;
其中:
表示状态下采取动作的Q值;
表示状态下采取动作的即时奖励;
是折扣因子,用于平衡当前奖励和未来奖励的重要性;
表示采取动作后转移到的下一个状态;
表示状态下选择的动作;
表示在下一个状态选择最优动作的Q值;
步骤2.3:设定离线训练的迭代次数、每次迭代中的训练步数和收敛标准。
3.如权利要求2所述的基于TD3的电力系统暂态稳定紧急控制策略生成方法,其特征在于:所述步骤三具体包括:
步骤3.1:采集电力系统仿真数据,包括系统状态和,控制动作,并根据数据计算对应奖励;
步骤3.2 设定经验回放缓冲区的存储容量,并按照时间顺序将采集到的数据以的格式存储到缓冲区中,构建经验回放缓冲区。
4.如权利要求3所述的基于TD3的电力系统暂态稳定紧急控制策略生成方法,其特征在于:所述步骤四具体包括:
步骤4.1:随机从经验回放缓冲区抽样批量的经验数据作为训练样本;
步骤4.2:对训练样本使用 actor 网络生成当前状态下的控制动作,通过仿真获得执行控制动作后系统状态,计算得到奖励值,并通过 critic 网络评估该动作的值;
步骤4.3:使用双学习方法,计算当前状态下的目标值,并计算 critic 网络输出的值与目标值的均方误差;
步骤4.4:利用均方误差最小化的优化算法更新 critic 网络的参数;
步骤4.5:计算 actor 网络的策略梯度;
步骤4.6:利用梯度上升法,更新 actor 网络的参数,以提高生成控制动作的质量;
步骤4.7:以的格式存储于经验缓冲区作为经验数据;
步骤4.8 重复以上步骤,直到达到预定的训练步数或达到收敛标准完成离线训练。
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| CN202410410491.0A CN118380997B (zh) | 2024-04-07 | 2024-04-07 | 一种基于td3的电力系统暂态稳定紧急控制策略生成方法 |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| CN202410410491.0A CN118380997B (zh) | 2024-04-07 | 2024-04-07 | 一种基于td3的电力系统暂态稳定紧急控制策略生成方法 |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| CN118380997A CN118380997A (zh) | 2024-07-23 |
| CN118380997B true CN118380997B (zh) | 2025-06-03 |
Family
ID=91907546
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| CN202410410491.0A Active CN118380997B (zh) | 2024-04-07 | 2024-04-07 | 一种基于td3的电力系统暂态稳定紧急控制策略生成方法 |
Country Status (1)
| Country | Link |
|---|---|
| CN (1) | CN118380997B (zh) |
Families Citing this family (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN119647216B (zh) * | 2025-02-18 | 2025-05-02 | 中铁电气化局集团有限公司 | 一种地铁直流供电系统的短路模拟测试方法和系统 |
Citations (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN112668235A (zh) * | 2020-12-07 | 2021-04-16 | 中原工学院 | 基于离线模型预训练学习的ddpg算法的机器人控制方法 |
| CN116203839A (zh) * | 2022-12-19 | 2023-06-02 | 清华大学 | 智能网联新能源汽车集成式能效优化控制方法与系统 |
Family Cites Families (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN117060423A (zh) * | 2023-07-05 | 2023-11-14 | 国网福建省电力有限公司经济技术研究院 | 一种考虑电力系统暂态电压稳定的紧急控制方法及终端 |
-
2024
- 2024-04-07 CN CN202410410491.0A patent/CN118380997B/zh active Active
Patent Citations (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN112668235A (zh) * | 2020-12-07 | 2021-04-16 | 中原工学院 | 基于离线模型预训练学习的ddpg算法的机器人控制方法 |
| CN116203839A (zh) * | 2022-12-19 | 2023-06-02 | 清华大学 | 智能网联新能源汽车集成式能效优化控制方法与系统 |
Also Published As
| Publication number | Publication date |
|---|---|
| CN118380997A (zh) | 2024-07-23 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| CN112310980B (zh) | 交直流混联电网直流闭锁频率安全稳定评估方法及系统 | |
| CN114217524A (zh) | 一种基于深度强化学习的电网实时自适应决策方法 | |
| CN116760047A (zh) | 基于安全强化学习算法的配电网电压无功控制方法及系统 | |
| CN115940294B (zh) | 多级电网实时调度策略调整方法、系统、设备及存储介质 | |
| CN115186884B (zh) | 一种基于小波分解的超短期风电功率预测方法及存储介质 | |
| Sun et al. | Hybrid reinforcement learning for power transmission network self-healing considering wind power | |
| CN115577647B (zh) | 电网故障类型识别方法与智能体构建方法 | |
| CN119439709B (zh) | 基于Bi-LSTM和DDPG算法的输电线路施工设备平行控制方法及装置 | |
| CN120855275A (zh) | 一种配电网自愈策略生成与优化方法、系统、设备及介质 | |
| CN114219045A (zh) | 配电网风险动态提前预警方法、系统、装置及存储介质 | |
| CN118473010B (zh) | 一种基于孤岛节点分析的电网风险优化配置方法及系统 | |
| CN111105025A (zh) | 基于数据驱动启发式优化的城市高压配电网阻塞管理方法 | |
| CN118380997A (zh) | 一种基于td3的电力系统暂态稳定紧急控制策略生成方法 | |
| CN115601196A (zh) | 基于多阶段学习的电力系统调控智能体训练方法、设备及存储介质 | |
| CN117060423A (zh) | 一种考虑电力系统暂态电压稳定的紧急控制方法及终端 | |
| CN115345380A (zh) | 一种基于人工智能的新能源消纳电力调度方法 | |
| CN115133540A (zh) | 一种配电网无模型的实时电压控制方法 | |
| CN102141778B (zh) | 一种受核糖体rna启发的高阶控制器参数优化方法 | |
| CN118657072B (zh) | 自适应稳压器参数优化的方法、系统及设备 | |
| CN114330649A (zh) | 一种基于进化学习和深度强化学习的电压调节方法及系统 | |
| CN120341877A (zh) | 电力系统的调节方法、装置以及电子设备 | |
| CN118100134A (zh) | 基于图卷积网络的强化学习的机组组合求解方法和装置 | |
| CN117933439A (zh) | 基于深度强化学习的微电网优化能量管理系统 | |
| CN111478292B (zh) | 一种基于深度强化学习的电力系统的故障切除方法和系统 | |
| CN121436615B (zh) | 一种基于多智能体共识优化的分布式光伏调度方法 |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| PB01 | Publication | ||
| PB01 | Publication | ||
| SE01 | Entry into force of request for substantive examination | ||
| SE01 | Entry into force of request for substantive examination | ||
| GR01 | Patent grant | ||
| GR01 | Patent grant |