CN121386355A - 冷库pid控制参数优化方法、装置、设备和存储介质 - Google Patents
冷库pid控制参数优化方法、装置、设备和存储介质Info
- Publication number
- CN121386355A CN121386355A CN202511720912.0A CN202511720912A CN121386355A CN 121386355 A CN121386355 A CN 121386355A CN 202511720912 A CN202511720912 A CN 202511720912A CN 121386355 A CN121386355 A CN 121386355A
- Authority
- CN
- China
- Prior art keywords
- refrigeration house
- energy consumption
- parameters
- temperature
- pid control
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
Classifications
-
- Y—GENERAL TAGGING OF NEW TECHNOLOGICAL DEVELOPMENTS; GENERAL TAGGING OF CROSS-SECTIONAL TECHNOLOGIES SPANNING OVER SEVERAL SECTIONS OF THE IPC; TECHNICAL SUBJECTS COVERED BY FORMER USPC CROSS-REFERENCE ART COLLECTIONS [XRACs] AND DIGESTS
- Y02—TECHNOLOGIES OR APPLICATIONS FOR MITIGATION OR ADAPTATION AGAINST CLIMATE CHANGE
- Y02E—REDUCTION OF GREENHOUSE GAS [GHG] EMISSIONS, RELATED TO ENERGY GENERATION, TRANSMISSION OR DISTRIBUTION
- Y02E60/00—Enabling technologies; Technologies with a potential or indirect contribution to GHG emissions mitigation
- Y02E60/14—Thermal energy storage
Landscapes
- Devices That Are Associated With Refrigeration Equipment (AREA)
Abstract
本申请涉及智能温控领域,提供一种冷库PID控制参数优化方法、装置、设备和存储介质。方法包括:采集冷库恒温阶段的温度数据及能耗数据;基于温度数据及能耗数据,建立表征冷库温度与能耗之间映射关系的数学模型;基于预设的兼顾冷库温度稳定性与能耗优化的奖励函数及数学模型,构建深度强化学习模型;通过深度强化学习模型的智能体与冷库环境交互学习,确定用于调节冷库PID控制的优化参数。本申请提供的冷库PID控制参数优化方法、装置、设备和存储介质能够有效建立冷库温度与能耗映射关系的数学模型,通过奖励函数以及数学模型构建深度强化学习模型,并通过深度强化学习调节冷库PID控制的优化参数。
Description
技术领域
本发明涉及智能温控技术领域,尤其涉及一种冷库PID控制参数优化方法、装置、设备和存储介质。
背景技术
冷库作为冷链物流的核心节点,其内部温度的持续稳定是保证存储物品品质、降低损耗率的关键。目前,工业应用中普遍采用比例-积分-微分(Proportional-Integral-Derivative,PID)控制器实施冷库温度调节,该控制方式通过比例、积分、微分环节的协同作用修正温度偏差,实现闭环控制。
在实际部署中,传统PID控制器的参数多依赖工程经验采用离线方式整定,常用方法包括临界比例法、反应曲线法等,通过试验获取系统临界振荡参数或阶跃响应曲线,再依据经验公式计算比例系数、积分时间与微分时间,参数整定完成后在运行过程中保持固定不变。
上述控制策略存在显著技术缺陷:其一,难以应对冷库实际运行中的多源时变热扰动,如库内外温差导致的围护结构漏热、果蔬等货品呼吸作用产生的附加热源,以及库门频繁启闭带来的瞬时热负荷冲击,叠加制冷设备启停惯性引入的控制滞后,导致恒温阶段库内温度持续波动,既威胁存储物品品质安全,又因制冷功率频繁调整造成能源浪费。其二,近年出现的改进PID算法多针对降温-恒温全流程设计,未聚焦恒温阶段的波动抑制核心需求,且建模多采用理想仿真数据,未结合实际工况的动态扰动特征,导致模型与现场运行状态偏差较大,难以实现精准控制。
发明内容
本申请实施例提供一种冷库PID控制参数优化方法、装置、设备和存储介质,可以解决技术解决传统PID控制在恒温阶段的参数固定的技术问题,提升冷库恒温阶段的温度稳定性。
第一方面,本申请实施例提供一种冷库PID控制参数优化方法,包括:
采集冷库恒温阶段的温度数据及能耗数据;
基于温度数据及能耗数据,建立表征冷库温度与能耗之间映射关系的数学模型;
基于预设的兼顾冷库温度稳定性与能耗优化的奖励函数及数学模型,构建深度强化学习模型;
通过深度强化学习模型的智能体与冷库环境交互学习,确定用于调节冷库PID控制的优化参数。
在一个实施例中,基于预设的兼顾冷库温度稳定性与能耗优化的奖励函数及数学模型,构建深度强化学习模型,具体可以实现为:
基于数学模型构建环境交互模块,环境交互模块用于反馈不同PID控制参数输入下的冷库的温度动态变化以及能耗情况;
基于奖励函数构建智能体评价模块;
构建智能体学习模块,智能体学习模块用于学习适配冷库多场景的PID控制参数调整策略;
将环境交互模块、智能体评价模块、智能体学习模块进行整合,构建深度强化学习模型。
在又一个实施例中,上述环境交互模块由状态空间St和动作空间At组成,包括:
状态空间St用于反映冷库当前运行状态;
状态空间St包括温度偏差、温度偏差变化率、热扰动强度估值、制冷功率及累计能耗中的至少一项;
动作空间At是指影响冷库环境所输出的控制操作的集合;
动作空间At包括冷库PID的比例系数增量、积分系数增量、微分系数增量中的至少一项。
在又一个实施例中,上述奖励函数是指将多个单一控制目标对应的奖励项,通过权重分配组合而成的综合价值评估函数;
奖励函数为温度稳定性奖励项、能耗奖励项及功率平滑性奖励项的加权和;
其中,温度稳定性奖励项是指当前温度偏差绝对值的单调递减函数;
能耗奖励项是指当前累积能耗与预设最优能耗基准值的比值函数;
功率平滑性奖励项是指当前制冷功率变化率绝对值的单调递减函数。
在又一个实施例中,上述智能体学习模块包括Actor网络、Critic网络、目标Actor网络、目标Critic网络及经验回放池;
其中,Actor网络用于输出PID控制参数调整量、Critic网络用于评价动作价值、目标Actor网络用于提供动作基准、目标Critic网络用于提供价值基准,经验回放池用于存储交互样本;
通过深度强化学习模型的智能体与冷库环境交互学习,确定用于调节冷库PID控制的优化参数,包括:
重复执行预设的迭代步骤对PID控制参数的调整策略进行更新,直至最后一轮迭代得到的PID控制参数调整量对应的奖励达到预设目标值,以最后一轮迭代得到的基于Actor网络参数输出的PID控制器参数作为冷库PID控制的优化参数;
迭代步骤包括:
基于上一轮迭代后得到的冷库下一状态空间St+1、奖励Rt以及经验回放池中存储的转移样本,对上一轮迭代后的Critic网络参数、Actor网络参数进行更新,获取本轮迭代后的Critic网络参数、Actor网络参数;
其中,更新过程包括:通过最小化时序差分误差更新本轮Critic网络参数,再基于本轮Critic网络输出的动作价值计算策略梯度,按最大化期望累积奖励方向更新本轮Actor网络参数;
更新完成后,采用软更新策略同步目标Actor网络、目标Critic网络的参数;
基于本轮迭代后的Actor网络参数,对本轮冷库当前运行状态空间St进行输出PID控制参数调整量At,并基于At更新PID控制器参数、生成制冷功率控制信号u(t),并作用于冷库,获取本轮迭代后的冷库下一状态空间St+1、奖励Rt;
其中,第一轮迭代所用的冷库当前运行状态为初始冷库状态空间S0、初始PID控制参数为预设初始值,第一轮迭代所用的Critic网络参数、Actor网络参数为初始化参数,第一轮迭代输出的动作At为Actor网络基于初始状态空间S0输出的首个PID控制参数调整量。
在又一个实施例中,基于温度数据及能耗数据,建立表征冷库温度与能耗之间映射关系的数学模型,具体可以实现为:
基于温度数据,构建表征冷库温度动态变化规律的温度传递函数;
对温度传递函数进行拉普拉斯变换,得到与PID控制匹配的目标温度传递函数;
基于能耗数据,构建能耗函数;
基于目标温度传递函数及能耗函数,构建数学模型。
第二方面,本申请实施例提供一种冷库PID控制参数优化装置,包括:采集模块、处理模块、构建模块和优化模块。
上述采集模块,用于:采集冷库恒温阶段的温度数据及能耗数据;
上述处理模块,用于:基于温度数据及能耗数据,建立表征冷库温度与能耗之间映射关系的数学模型;
上述构建模块,用于:基于预设的兼顾冷库温度稳定性与能耗优化的奖励函数及数学模型,构建深度强化学习模型;
上述优化模块,用于:通过深度强化学习模型的智能体与冷库环境交互学习,确定用于调节冷库PID控制的优化参数。
第三方面,本申请实施例提供一种电子设备,包括处理器和存储有计算机程序的存储器,处理器执行程序时实现第一方面的冷库PID控制参数优化方法的步骤。
第四方面,本申请实施例提供一种非暂态计算机可读存储介质,其上存储有计算机程序,计算机程序被处理器执行时实现第一方面的冷库PID控制参数优化方法的步骤。
第五方面,本申请实施例提供一种计算机程序产品,包括计算机程序,计算机程序被处理器执行时实现第一方面的冷库PID控制参数优化方法的步骤。
本申请提供的冷库PID控制参数优化方法、装置、设备和存储介质,能够实时采集冷库恒温阶段的温度数据与能耗数据;基于该两类数据构建精准表征温度与能耗映射关系的数学模型;结合预设的兼顾温度稳定性与能耗优化的奖励函数及所述数学模型,搭建深度强化学习模型;通过该模型的智能体与冷库动态环境交互学习,动态输出用于调节冷库PID控制的优化参数。本申请通过数据驱动与深度强化学习融合,实现PID参数的智能动态整定,无需人工干预,既提升冷库恒温精度、减少温度波动,又能优化能耗配置,适配冷库复杂动态工况。
附图说明
为了更清楚地说明本申请或现有技术中的技术方案,下面将对实施例或现有技术描述中所需要使用的附图作一简单地介绍,显而易见地,下面描述中的附图是本申请的一些实施例,对于本领域普通技术人员来讲,在不付出创造性劳动的前提下,还可以根据这些附图获得其他的附图。
图1为本申请实施例提供的冷库PID控制参数优化方法的流程示意图;
图2为本申请实施例提供的冷库PID控制参数优化装置的结构示意图;
图3为本申请实施例提供的电子设备的结构示意图。
具体实施方式
为使本申请的目的、技术方案和优点更加清楚,下面将结合本申请中的附图,对本申请中的技术方案进行清楚、完整地描述,显然,所描述的实施例是本申请一部分实施例,而不是全部的实施例。基于本申请中的实施例,本领域普通技术人员在没有作出创造性劳动前提下所获得的所有其他实施例,都属于本申请保护的范围。
在本申请的描述中,需要理解的是,术语“上”、“下”、“左”、“右”、“前”、“后”、“内”、“外”等指示的方位或位置关系为基于附图所示的方位或相对位置关系,仅是为了便于描述本申请和简化描述,而不是指示或暗示所指的装置或元件必须具有特定的方位、以特定的方位构造和操作,因此不能理解为对本申请的限制。如无特殊说明,在满足附图所示的相对位置关系的情况下,上述方位性的描述可以在实际应用的过程中灵活设置。
术语“第一”、“第二”仅用于描述目的,而不能理解为指示或暗示相对重要性或者隐含指明所指示的技术特征的数量。由此,限定有“第一”、“第二”的特征可以明示或者隐含地包括一个或者更多个该特征。在本申请的描述中,除非另有说明,“多个”的含义是两个或两个以上。
在本申请的描述中,需要说明的是,除非另有明确的规定和限定,术语“安装”、“相连”、“连接”、“连通”应做广义理解,例如,可以是固定连接,也可以是可拆卸连接,或一体地连接。可以是直接相连,也可以通过中间媒介间接相连,可以是两个元件内部的连通。对于本领域的普通技术人员而言,可以根据具体情况理解上述术语在本申请中的具体含义。
在本申请实施例中,术语“包括”、“包含”或者其任何其他变体意在涵盖非排他性的包含,从而使得包括一系列要素的过程、物品或者装置不仅包括那些要素,而且还包括没有明确列出的其他要素,或者是还包括为这种过程、物品或者装置所固有的要素。在没有更多限制的情况下,由语句“包括一个……”限定的要素,并不排除在包括该要素的过程、物品或者装置中还存在另外的相同要素。
在本申请实施例中,“示例性的”或者“例如”等词用于表示作例子、例证或说明。本申请实施例中被描述为“示例性的”或者“例如”的任何实施例或设计方案不应被解释为比其他实施例或设计方案更优选或更具优势。确切而言,使用“示例性的”或者“例如”等词旨在以具体方式呈现相关概念。
在本申请实施例中,至少一个还可以描述为一个或多个,多个可以是两个、三个、四个或者更多个,本申请不做限制。
在本说明书的描述中,具体特征、结构、材料或者特点可以在任何的一个或多个实施例或示例中以合适的方式结合。
为了便于理解,首先对本申请实施例中涉及的名词进行解释。
比例-积分-微分(Proportional-Integral-Derivative,PID):是工业闭环控制中常用的算法,通过比例、积分、微分三个环节协同作用,修正被控量与设定值的偏差,实现精准控制。
拉普拉斯变换:是一种将时域函数转换为复频域函数的数学变换,可简化线性系统的微分方程求解与动态特性分析。
图1为本申请实施例提供的冷库PID控制参数优化方法的流程示意图。参照图1,本申请实施例提供一种冷库PID控制参数优化方法,可以包括:
步骤S101:采集冷库恒温阶段的温度数据及能耗数据。
其中,温度数据是指能够反映冷库内部温度状态、外部环境热扰动及影响温度稳定的关键关联数据。
可选地,温度数据包括冷库内部实时温度(反映库内实际温控状态,是判断温度偏差的直接指标)、冷库外部环境温度(影响围护结构漏热强度,是外部热扰动的关键参数)、库门开关事件数据(记录库门启闭时间及频次,对应瞬时热负荷冲击,是时变热扰动的重要来源)等,但不限于此,本申请实施例对此不作具体限制。
能耗数据是指能够表征制冷系统为维持恒温所消耗能量及能耗与温度调节关联性的特征数据。
可选地,能耗数据包括制冷系统实时制冷功率(直接反映制冷设备能量消耗强度,是计算总能耗的基础)、与温度偏差相关的波动附加能耗基础数据等,但不限于此,本申请实施例对此不作具体限制。
例如,温度数据采集:采用工业级PT100铂电阻温度传感器(测量精度±0.1℃,量程-50℃~100℃),于冷库内多存储区域、库外通风无直射处分别部署;库门处装门磁开关传感器(响应≤10ms)。温度数据1次/分钟采集,库门状态触发式记录。
能耗数据采集:用霍尔电流传感器(±0.5%精度)、电压模块(±0.2%精度),串/并联制冷主回路,1次/分钟同步采集电流电压。
步骤S102:基于温度数据及能耗数据,建立表征冷库温度与能耗之间映射关系的数学模型。
其中,数学模型是指基于步骤S101采集的温度数据与能耗数据,结合能量守恒定律构建的温度传递函数与能耗模型耦合体系,用于定量描述温度动态变化与能耗消耗的关联规律。
具体地,构建数学模型的步骤包括:
步骤1:基于温度数据,构建表征冷库温度动态变化规律的温度传递函数。
具体地,基于能量守恒定律,结合温度数据构建温度传递函数,温度传递函数的微分方程形式为:
其中,C表示冷库内部等效比热容,表示t时刻库内实际温度与设定温度的偏差,表示制冷功率,表示制冷系数,表示制冷设备启停惯性损失,表示t时刻总热扰动热量。
需要说明的是,总热扰动热量由围护结构漏热、货物呼吸热、周期性微小热扰动及库门开启扰动叠加构成。
步骤2:对温度传递函数进行拉普拉斯变换,得到与PID控制匹配的目标温度传递函数。
具体地,目标温度传递函数满足下述公式:
其中,表示传递函数,表示冷库温度偏差的拉普拉斯变换,表示控制输入的拉普拉斯变换,K表示系统增益,Ts表示时间常数。
步骤3:基于能耗数据,构建能耗函数。
具体地,能耗函数满足下述公式:
其中,E表示总能耗,T表示恒温持续时间,u(t)表示制冷功率,表示与温度偏差相关的波动附加能耗。
步骤3:基于目标温度传递函数及能耗函数,构建数学模型。
将目标温度传递函数与能耗函数耦合,形成表征温度-能耗映射关系的数学模型。
步骤S103:基于预设的兼顾冷库温度稳定性与能耗优化的奖励函数及数学模型,构建深度强化学习模型。
其中,奖励函数是一套量化评价标准,以数学形式定义智能体(比如冷库的温控决策系统)的某一操作行为是否优秀,并通过奖励值(正/负、大/小)作为反馈信号,指导模型学习兼顾冷库温度稳定性与能耗优化的最优控制策略。
简单来说,奖励函数就像给模型的评分规则:模型做出的温控操作(比如调整制冷设备功率、启停频率、送风风速等)能让冷库温度更稳定、能耗更低,就给高正奖励;如果导致温度波动超标(比如偏离设定值过多)或能耗浪费(比如设备空转、过度制冷),就给低奖励甚至负奖励。
具体地,构建深度强化学习模型的步骤包括:
步骤1:基于数学模型构建环境交互模块。
其中,环境交互模块用于反馈不同PID控制参数输入下的冷库的温度动态变化以及能耗情况。
环境交互模块由状态空间St和动作空间At组成,包括:
状态空间St用于反映冷库当前运行状态。
可选地,状态空间St包括温度偏差、温度偏差变化率、热扰动强度估值、制冷功率及累计能耗中的至少一项。
动作空间At是指影响冷库环境所输出的控制操作的集合。
可选地,动作空间At包括冷库PID的比例系数增量、积分系数增量、微分系数增量中的至少一项。
步骤2:基于奖励函数构建智能体评价模块。
奖励函数是指将多个单一控制目标对应的奖励项,通过权重分配组合而成的综合价值评估函数。
奖励函数为温度稳定性奖励项、能耗奖励项及功率平滑性奖励项的加权和。
具体地,奖励函数满足下述公式:
其中,表示时刻t的综合奖励值,表示温度稳定性奖励项的权重系数,表示温度稳定性奖励项,表示能耗奖励项的权重系数,表示能耗奖励项,表示功率平滑性奖励项的权重系数,表示功率平滑性奖励项。
温度稳定性奖励项是指当前温度偏差绝对值的单调递减函数;
能耗奖励项是指当前累积能耗与预设最优能耗基准值的比值函数;
功率平滑性奖励项是指当前制冷功率变化率绝对值的单调递减函数。
步骤3:构建智能体学习模块。
其中,智能体学习模块用于学习适配冷库多场景的PID控制参数调整策略。
具体地,智能体学习模块包括Actor网络、Critic网络、目标Actor网络、目标Critic网络及经验回放池。
其中,Actor网络用于基于当前状态空间St输出PID参数调整量At。
Critic网络用于评价当前状态St与动作At对应的动作价值Q(St,At)。
目标Actor/目标Critic网络:分别提供动作基准与价值基准,避免训练震荡。
经验回放池用于存储状态St-动作At-奖励Rt-下一状态St+1的转移样本,用于网络参数更新。
步骤3:将环境交互模块、智能体评价模块、智能体学习模块进行整合,构建深度强化学习模型。
环境交互模块、智能体评价模块、智能体学习模块通过数据交互链路形成闭环,实现状态采集-动作输出-奖励反馈-策略更新的迭代优化。
步骤S104:通过深度强化学习模型的智能体与冷库环境交互学习,确定用于调节冷库PID控制的优化参数。
具体地,重复执行预设的迭代步骤对PID控制参数的调整策略进行更新,直至最后一轮迭代得到的PID控制参数调整量对应的奖励达到预设目标值,以最后一轮迭代得到的基于Actor网络参数输出的PID控制器参数作为冷库PID控制的优化参数。
迭代步骤包括:
基于上一轮迭代后得到的冷库下一状态空间St+1、奖励Rt以及经验回放池中存储的转移样本,对上一轮迭代后的Critic网络参数、Actor网络参数进行更新,获取本轮迭代后的Critic网络参数、Actor网络参数。
其中,更新过程包括:通过最小化时序差分误差更新本轮Critic网络参数,再基于本轮Critic网络输出的动作价值计算策略梯度,按最大化期望累积奖励方向更新本轮Actor网络参数。
更新完成后,采用软更新策略同步目标Actor网络、目标Critic网络的参数。
在本申请实施例中,目标网络的作用最终体现在让PID控制参数的更新更稳定、更高效,目标Critic网络的稳定价值评估,能更准确地反馈当前PID参数调整量的优劣,避免因价值估计波动导致PID参数调优方向错误。目标Actor网络的稳定动作生成,能确保基于当前状态调整PID参数的策略更新更可靠,最终让PID控制在冷库温度-能耗协同优化中表现更鲁棒。
基于本轮迭代后的Actor网络参数,对本轮冷库当前运行状态空间St进行输出PID控制参数调整量At,并基于At更新PID控制器参数、生成制冷功率控制信号u(t),并作用于冷库,获取本轮迭代后的冷库下一状态空间St+1、奖励Rt。
其中,第一轮迭代所用的冷库当前运行状态为初始冷库状态空间S0、初始PID控制参数为预设初始值,第一轮迭代所用的Critic网络参数、Actor网络参数为初始化参数,第一轮迭代输出的动作At为Actor网络基于初始状态空间S0输出的首个PID控制参数调整量。
下面对迭代步骤进行详细说明。
步骤1:将冷库当前状态空间St输入至Actor网络,输出动作空间At,At表示PID控制参数调整量。
步骤2:根据PID控制参数调整量At更新冷库当前的PID控制参数。
步骤3:基于更新后的PID控制参数生成制冷功率控制信号u(t)。
步骤3:采集冷库在控制信号u(t)作用下的反馈数据,基于数学模型以及奖励函数,计算得到当前奖励Rt及下一时刻状态空间St+1。
步骤5:将转移样本(St,At,Rt,St+1)存入经验回放池。
步骤6:从经验回放池中随机抽取批量转移样本,通过最小化时序差分误差更新Critic网络的参数。
步骤7:基于Critic网络输出的动作价值Q(St,At)计算策略梯度,采用梯度上升法更新Actor网络的参数。
步骤8:通过软更新策略,同步目标Actor网络与目标Critic网络的参数。
步骤9:迭代优化:重复步骤1-8,直至模型收敛(即累积奖励值趋于稳定,控制策略满足温控精度、能耗及操作平滑要求)。
本申请实施例提供的冷库PID控制参数优化方法,采用演员-评论家架构(Actor-Critic Architecture,Actor-Critic):Actor网络负责根据当前状态生成最优动作,输出当前最佳PID参数调整量,通过学习状态与动作的映射关系,自动确定PID参数的调整方向和幅度;而Critic网络则负责评估Actor网络输出动作的价值(Q值),根据奖励函数计算当前状态-动作对应的奖励值,将评估结果反馈给Actor网络,用于策略改进。
综上,本申请实施例提供的冷库PID控制参数优化方法,能够实时采集冷库恒温阶段的温度数据与能耗数据;基于该两类数据构建精准表征温度与能耗映射关系的数学模型;结合预设的兼顾温度稳定性与能耗优化的奖励函数及所述数学模型,搭建深度强化学习模型;通过该模型的智能体与冷库动态环境交互学习,动态输出用于调节冷库PID控制的优化参数。本申请通过数据驱动与深度强化学习融合,实现PID参数的智能动态整定,无需人工干预,既提升冷库恒温精度、减少温度波动,又能优化能耗配置,适配冷库复杂动态工况。
上述主要对本申请提供的方案进行了介绍。相应的,本申请还提供了一种冷库PID控制参数优化装置,该装置用于实现上述方法实施例。
下面对本申请实施例提供的冷库PID控制参数优化装置进行描述,下文描述的冷库PID控制参数优化装置与上文描述的冷库PID控制参数优化方法可相互参照。
图2为本申请实施例提供的冷库PID控制参数优化装置的结构示意图。如图2所示,本申请实施例提供一种冷库PID控制参数优化装置,可以包括:
采集模块201,用于:采集冷库恒温阶段的温度数据及能耗数据;
处理模块202,用于:基于所述温度数据及所述能耗数据,建立表征冷库温度与能耗之间映射关系的数学模型;
构建模块203,用于:基于预设的兼顾冷库温度稳定性与能耗优化的奖励函数及所述数学模型,构建深度强化学习模型;
优化模块203:用于:通过所述深度强化学习模型的智能体与冷库环境交互学习,确定用于调节冷库PID控制的优化参数。
在一个实施例中,构建模块203,具体用于基于数学模型构建环境交互模块,环境交互模块用于反馈不同PID控制参数输入下的冷库的温度动态变化以及能耗情况;
基于奖励函数构建智能体评价模块;
构建智能体学习模块,智能体学习模块用于学习适配冷库多场景的PID控制参数调整策略;
将环境交互模块、智能体评价模块、智能体学习模块进行整合,构建深度强化学习模型。
在又一个实施例中,上述上述环境交互模块由状态空间St和动作空间At组成,包括:
状态空间St用于反映冷库当前运行状态;
状态空间St包括温度偏差、温度偏差变化率、热扰动强度估值、制冷功率及累计能耗中的至少一项;
动作空间At是指影响冷库环境所输出的控制操作的集合;
动作空间At包括冷库PID的比例系数增量、积分系数增量、微分系数增量中的至少一项。
在又一个实施例中,上述奖励函数是指将多个单一控制目标对应的奖励项,通过权重分配组合而成的综合价值评估函数;
奖励函数为温度稳定性奖励项、能耗奖励项及功率平滑性奖励项的加权和;
其中,温度稳定性奖励项是指当前温度偏差绝对值的单调递减函数;
能耗奖励项是指当前累积能耗与预设最优能耗基准值的比值函数;
功率平滑性奖励项是指当前制冷功率变化率绝对值的单调递减函数。
在又一个实施例中,上述智能体学习模块包括Actor网络、Critic网络、目标Actor网络、目标Critic网络及经验回放池;
其中,Actor网络用于输出PID控制参数调整量、Critic网络用于评价动作价值、目标Actor网络用于提供动作基准、目标Critic网络用于提供价值基准,经验回放池用于存储交互样本;
通过深度强化学习模型的智能体与冷库环境交互学习,确定用于调节冷库PID控制的优化参数,包括:
重复执行预设的迭代步骤对PID控制参数的调整策略进行更新,直至最后一轮迭代得到的PID控制参数调整量对应的奖励达到预设目标值,以最后一轮迭代得到的基于Actor网络参数输出的PID控制器参数作为冷库PID控制的优化参数;
迭代步骤包括:
基于上一轮迭代后得到的冷库下一状态空间St+1、奖励Rt以及经验回放池中存储的转移样本,对上一轮迭代后的Critic网络参数、Actor网络参数进行更新,获取本轮迭代后的Critic网络参数、Actor网络参数;
其中,更新过程包括:通过最小化时序差分误差更新本轮Critic网络参数,再基于本轮Critic网络输出的动作价值计算策略梯度,按最大化期望累积奖励方向更新本轮Actor网络参数;
更新完成后,采用软更新策略同步目标Actor网络、目标Critic网络的参数;
基于本轮迭代后的Actor网络参数,对本轮冷库当前运行状态空间St进行输出PID控制参数调整量At,并基于At更新PID控制器参数、生成制冷功率控制信号u(t),并作用于冷库,获取本轮迭代后的冷库下一状态空间St+1、奖励Rt;
其中,第一轮迭代所用的冷库当前运行状态为初始冷库状态空间S0、初始PID控制参数为预设初始值,第一轮迭代所用的Critic网络参数、Actor网络参数为初始化参数,第一轮迭代输出的动作At为Actor网络基于初始状态空间S0输出的首个PID控制参数调整量。
在又一个实施例中,处理模块202,具体用于:基于温度数据,构建表征冷库温度动态变化规律的温度传递函数;
对温度传递函数进行拉普拉斯变换,得到与PID控制匹配的目标温度传递函数;
基于能耗数据,构建能耗函数;
基于目标温度传递函数及能耗函数,构建数学模型。
在一些实施例中,该冷库PID控制参数优化装置为了实现上述功能,其包含了执行各个功能相应的硬件结构和/或软件模块。本领域技术人员应该很容易意识到,结合本文中所公开的实施例描述的各示例的单元及算法步骤,本申请能够以硬件或硬件和计算机软件的结合形式来实现。某个功能究竟以硬件还是计算机软件驱动硬件的方式来执行,取决于技术方案的特定应用和设计约束条件。专业技术人员可以对每个特定的应用来使用不同方法来实现所描述的功能,但是这种实现不应认为超出本申请的范围。
本申请实施例可以根据上述方法实施例对冷库PID控制参数优化装置进行功能模块的划分,例如,可以对应各个功能划分各个功能模块,也可以将两个或两个以上的功能集成在一个特征提取模块中。上述集成的模块既可以采用硬件的形式实现,也可以采用软件功能模块的形式实现。需要说明的是,本申请实施例中对模块的划分是示意性的,仅仅为一种逻辑功能划分,实际实现时可以有另外的划分方式。
图3为本申请实施例提供的电子设备的结构示意图,如图3所示,该电子设备可以包括:处理器(processor)310、通信接口(Communication Interface)320、存储器(memory)330和通信总线340,其中,处理器310,通信接口320,存储器330通过通信总线340完成相互间的通信。处理器310可以调用存储器330中的逻辑指令,以执行冷库PID控制参数优化方法的步骤,该方法包括:采集冷库恒温阶段的温度数据及能耗数据;基于温度数据及能耗数据,建立表征冷库温度与能耗之间映射关系的数学模型;基于预设的兼顾冷库温度稳定性与能耗优化的奖励函数及数学模型,构建深度强化学习模型;通过深度强化学习模型的智能体与冷库环境交互学习,确定用于调节冷库PID控制的优化参数。
此外,上述的存储器330中的逻辑指令可以通过软件功能单元的形式实现并作为独立的产品销售或使用时,可以存储在一个计算机可读取存储介质中。基于这样的理解,本申请的技术方案本质上或者说对现有技术做出贡献的部分或者该技术方案的部分可以以软件产品的形式体现出来,该计算机软件产品存储在一个存储介质中,包括若干指令用以使得一台计算机设备(可以是个人计算机,服务器,或者网络设备等)执行本申请各个实施例方法的全部或部分步骤。而前述的存储介质包括:U盘、移动硬盘、只读存储器(ROM,Read-Only Memory)、随机存取存储器(RAM,Random Access Memory)、磁碟或者光盘等各种可以存储程序代码的介质。
另一方面,本申请实施例还提供一种计算机程序产品,计算机程序产品包括计算机程序,计算机程序可存储在非暂态计算机可读存储介质上,计算机程序被处理器执行时,计算机能够执行上述各实施例所提供的冷库PID控制参数优化方法的步骤,例如包括:采集冷库恒温阶段的温度数据及能耗数据;基于温度数据及能耗数据,建立表征冷库温度与能耗之间映射关系的数学模型;基于预设的兼顾冷库温度稳定性与能耗优化的奖励函数及数学模型,构建深度强化学习模型;通过深度强化学习模型的智能体与冷库环境交互学习,确定用于调节冷库PID控制的优化参数。
另一方面,本申请实施例还提供一种处理器可读存储介质,处理器可读存储介质存储有计算机程序,计算机程序用于使处理器执行上述各实施例提供的方法的步骤,例如包括:采集冷库恒温阶段的温度数据及能耗数据;基于温度数据及能耗数据,建立表征冷库温度与能耗之间映射关系的数学模型;基于预设的兼顾冷库温度稳定性与能耗优化的奖励函数及数学模型,构建深度强化学习模型;通过深度强化学习模型的智能体与冷库环境交互学习,确定用于调节冷库PID控制的优化参数。
处理器可读存储介质可以是处理器能够存取的任何可用介质或数据存储设备,包括但不限于磁性存储器(例如软盘、硬盘、磁带、磁光盘(MO)等)、光学存储器(例如CD、DVD、BD、HVD等)、以及半导体存储器(例如ROM、EPROM、EEPROM、非易失性存储器(NAND FLASH)、固态硬盘(SSD))等。
以上所描述的装置实施例仅仅是示意性的,其中作为分离部件说明的单元可以是或者也可以不是物理上分开的,作为单元显示的部件可以是或者也可以不是物理单元,即可以位于一个地方,或者也可以分布到多个网络单元上。可以根据实际的需要选择其中的部分或者全部模块来实现本实施例方案的目的。本领域普通技术人员在不付出创造性的劳动的情况下,即可以理解并实施。
通过以上的实施方式的描述,本领域的技术人员可以清楚地了解到各实施方式可借助软件加必需的通用硬件平台的方式来实现,当然也可以通过硬件。基于这样的理解,上述技术方案本质上或者说对现有技术做出贡献的部分可以以软件产品的形式体现出来,该计算机软件产品可以存储在计算机可读存储介质中,如ROM/RAM、磁碟、光盘等,包括若干指令用以使得一台计算机设备(可以是个人计算机,服务器,或者网络设备等)执行各个实施例或者实施例的某些部分的方法。
最后应说明的是:以上实施例仅用以说明本申请的技术方案,而非对其限制;尽管参照前述实施例对本申请进行了详细的说明,本领域的普通技术人员应当理解:其依然可以对前述各实施例所记载的技术方案进行修改,或者对其中部分技术特征进行等同替换;而这些修改或者替换,并不使相应技术方案的本质脱离本申请各实施例技术方案的精神和范围。
Claims (10)
1.一种冷库PID控制参数优化方法,其特征在于,所述方法包括:
采集冷库恒温阶段的温度数据及能耗数据;
基于所述温度数据及所述能耗数据,建立表征冷库温度与能耗之间映射关系的数学模型;
基于预设的兼顾冷库温度稳定性与能耗优化的奖励函数及所述数学模型,构建深度强化学习模型;
通过所述深度强化学习模型的智能体与冷库环境交互学习,确定用于调节冷库PID控制的优化参数。
2.根据权利要求1所述的冷库PID控制参数优化方法,其特征在于,所述基于预设的兼顾冷库温度稳定性与能耗优化的奖励函数及所述数学模型,构建深度强化学习模型,包括:
基于所述数学模型构建环境交互模块,所述环境交互模块用于反馈不同PID控制参数输入下的冷库的温度动态变化以及能耗情况;
基于所述奖励函数构建智能体评价模块;
构建智能体学习模块,所述智能体学习模块用于学习适配冷库多场景的PID控制参数调整策略;
将所述环境交互模块、所述智能体评价模块、智能体学习模块进行整合,构建所述深度强化学习模型。
3.根据权利要求2所述的冷库PID控制参数优化方法,其特征在于,所述环境交互模块由状态空间St和动作空间At组成,包括:
所述状态空间St用于反映冷库当前运行状态;
所述状态空间St包括温度偏差、温度偏差变化率、热扰动强度估值、制冷功率及累计能耗中的至少一项;
所述动作空间At是指影响冷库环境所输出的控制操作的集合;
所述动作空间At包括所述冷库PID的比例系数增量、积分系数增量、微分系数增量中的至少一项。
4.根据权利要求2所述的冷库PID控制参数优化方法,其特征在于,所述奖励函数是指将多个单一控制目标对应的奖励项,通过权重分配组合而成的综合价值评估函数;
所述奖励函数为温度稳定性奖励项、能耗奖励项及功率平滑性奖励项的加权和;
其中,所述温度稳定性奖励项是指当前温度偏差绝对值的单调递减函数;
所述能耗奖励项是指当前累积能耗与预设最优能耗基准值的比值函数;
所述功率平滑性奖励项是指当前制冷功率变化率绝对值的单调递减函数。
5.根据权利要求2所述的冷库PID控制参数优化方法,其特征在于,所述智能体学习模块包括Actor网络、Critic网络、目标Actor网络、目标Critic网络及经验回放池;
其中,所述Actor网络用于输出PID控制参数调整量、所述Critic网络用于评价动作价值、所述目标Actor网络用于提供动作基准、所述目标Critic网络用于提供价值基准,所述经验回放池用于存储交互样本;
所述通过所述深度强化学习模型的智能体与冷库环境交互学习,确定用于调节冷库PID控制的优化参数,包括:
重复执行预设的迭代步骤对所述PID控制参数的调整策略进行更新,直至最后一轮迭代得到的PID控制参数调整量对应的奖励达到预设目标值,以最后一轮迭代得到的基于Actor网络参数输出的PID控制器参数作为所述冷库PID控制的优化参数;
所述迭代步骤包括:
基于上一轮迭代后得到的冷库下一状态空间St+1、奖励Rt以及所述经验回放池中存储的转移样本,对上一轮迭代后的Critic网络参数、Actor网络参数进行更新,获取本轮迭代后的Critic网络参数、Actor网络参数;
其中,更新过程包括:通过最小化时序差分误差更新本轮Critic网络参数,再基于本轮Critic网络输出的动作价值计算策略梯度,按最大化期望累积奖励方向更新本轮Actor网络参数;
更新完成后,采用软更新策略同步所述目标Actor网络、所述目标Critic网络的参数;
基于本轮迭代后的Actor网络参数,对本轮冷库当前运行状态空间St进行输出PID控制参数调整量At,并基于所述At更新PID控制器参数、生成制冷功率控制信号u(t),并作用于冷库,获取本轮迭代后的冷库下一状态空间St+1、奖励Rt;
其中,第一轮迭代所用的冷库当前运行状态为初始冷库状态空间S0、初始PID控制参数为预设初始值,第一轮迭代所用的Critic网络参数、Actor网络参数为初始化参数,第一轮迭代输出的动作At为Actor网络基于初始状态空间S0输出的首个PID控制参数调整量。
6.根据权利要求1所述的冷库PID控制参数优化方法,其特征在于,所述基于所述温度数据及能耗数据,建立表征冷库温度与能耗之间映射关系的数学模型,包括:
基于所述温度数据,构建表征冷库温度动态变化规律的温度传递函数;
对所述温度传递函数进行拉普拉斯变换,得到与所述PID控制匹配的目标温度传递函数;
基于所述能耗数据,构建能耗函数;
基于所述目标温度传递函数及所述能耗函数,构建所述数学模型。
7.一种冷库PID控制参数优化装置,其特征在于,包括:
采集模块,用于:采集冷库恒温阶段的温度数据及能耗数据;
处理模块,用于:基于所述温度数据及所述能耗数据,建立表征冷库温度与能耗之间映射关系的数学模型;
构建模块,用于:基于预设的兼顾冷库温度稳定性与能耗优化的奖励函数及所述数学模型,构建深度强化学习模型;
优化模块,用于:通过所述深度强化学习模型的智能体与冷库环境交互学习,确定用于调节冷库PID控制的优化参数。
8.一种电子设备,包括处理器和存储有计算机程序的存储器,其特征在于,所述处理器执行所述计算机程序时实现权利要求1至6任一项所述的冷库PID控制参数优化方法的步骤。
9.一种非暂态计算机可读存储介质,其上存储有计算机程序,其特征在于,所述计算机程序被处理器执行时实现如权利要求1至6任一项所述的冷库PID控制参数优化方法的步骤。
10.一种计算机程序产品,包括计算机程序,其特征在于,所述计算机程序被处理器执行时实现权利要求1至6任一项所述的冷库PID控制参数优化方法的步骤。
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| CN202511720912.0A CN121386355A (zh) | 2025-11-21 | 2025-11-21 | 冷库pid控制参数优化方法、装置、设备和存储介质 |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| CN202511720912.0A CN121386355A (zh) | 2025-11-21 | 2025-11-21 | 冷库pid控制参数优化方法、装置、设备和存储介质 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| CN121386355A true CN121386355A (zh) | 2026-01-23 |
Family
ID=98475870
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| CN202511720912.0A Pending CN121386355A (zh) | 2025-11-21 | 2025-11-21 | 冷库pid控制参数优化方法、装置、设备和存储介质 |
Country Status (1)
| Country | Link |
|---|---|
| CN (1) | CN121386355A (zh) |
Citations (6)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN112161422A (zh) * | 2020-10-22 | 2021-01-01 | 武汉新浩爽制冷科技有限公司 | 一种优化冷库能耗的确定方法及装置 |
| CN115103562A (zh) * | 2022-05-27 | 2022-09-23 | 内蒙古工业大学 | 数据中心空调的分布式智能控制方法 |
| CN117308286A (zh) * | 2023-09-06 | 2023-12-29 | 南京壹格软件技术有限公司 | 一种机理模型联合深度强化学习的空调系统优化控制方法 |
| CN119644711A (zh) * | 2024-12-31 | 2025-03-18 | 中网智慧(雄安)科技有限公司 | 基于深度强化学习的ai模型自适应调优方法 |
| CN120215250A (zh) * | 2025-03-26 | 2025-06-27 | 陕西理工大学 | 一种基于强化学习的pid控制器参数自整定方法 |
| CN120610511A (zh) * | 2025-08-12 | 2025-09-09 | 宜宾四川大学产业技术研究院 | 基于深度强化学习的数控机床直线轴冷却控制方法及系统 |
-
2025
- 2025-11-21 CN CN202511720912.0A patent/CN121386355A/zh active Pending
Patent Citations (6)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN112161422A (zh) * | 2020-10-22 | 2021-01-01 | 武汉新浩爽制冷科技有限公司 | 一种优化冷库能耗的确定方法及装置 |
| CN115103562A (zh) * | 2022-05-27 | 2022-09-23 | 内蒙古工业大学 | 数据中心空调的分布式智能控制方法 |
| CN117308286A (zh) * | 2023-09-06 | 2023-12-29 | 南京壹格软件技术有限公司 | 一种机理模型联合深度强化学习的空调系统优化控制方法 |
| CN119644711A (zh) * | 2024-12-31 | 2025-03-18 | 中网智慧(雄安)科技有限公司 | 基于深度强化学习的ai模型自适应调优方法 |
| CN120215250A (zh) * | 2025-03-26 | 2025-06-27 | 陕西理工大学 | 一种基于强化学习的pid控制器参数自整定方法 |
| CN120610511A (zh) * | 2025-08-12 | 2025-09-09 | 宜宾四川大学产业技术研究院 | 基于深度强化学习的数控机床直线轴冷却控制方法及系统 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| CN114784823B (zh) | 基于深度确定性策略梯度的微电网频率控制方法及系统 | |
| CN118466224B (zh) | 用于电推进系统的流量控制方法及系统 | |
| Dougherty et al. | A practical multiple model adaptive strategy for single-loop MPC | |
| Privara et al. | Model predictive control of a building heating system: The first experience | |
| CN117469774B (zh) | 空调系统调控方法、装置、电子设备及存储介质 | |
| CN119475934B (zh) | 基于多区域耦合模型的中央空调系统能耗模拟方法 | |
| CN119846973B (zh) | 基于自适应控制的供料仓智能管理方法及系统 | |
| CN118466173B (zh) | 一种犬舍环境温度控制优化方法 | |
| CN119644711A (zh) | 基于深度强化学习的ai模型自适应调优方法 | |
| CN120523046B (zh) | 低温蒸发结晶机参数调节方法、装置、设备及存储介质 | |
| Trabelsi et al. | Fuzzy identification of a greenhouse | |
| Taylor et al. | Proportional-integral-plus (PIP) control of ventilation rate in agricultural buildings | |
| Singh et al. | Optimization of PID controller based on various tuning methods | |
| CN121187129A (zh) | 一种基于模型预测控制的工业炉温控优化方法及系统 | |
| CN119620804A (zh) | 一种基于pid的微生物发酵温度控制方法 | |
| Gouadria et al. | Comparison between self-tuning fuzzy PID and classic PID controllers for greenhouse system | |
| CN121279136A (zh) | 一种管壳式换热器的数字孪生能效预测控制方法及换热器 | |
| CN120972700A (zh) | 集成控制器智能化分析与管理方法及系统 | |
| CN120631069A (zh) | 基于多目标奖励q学习的双容水箱控制方法、系统、设备及介质 | |
| Yörük et al. | Performance optimization of PID controllers for DC machine drives using PSO, ACO, and hybrid PSO-ACO algorithms | |
| CN120255323B (zh) | 基于强化学习的控制器参数优化方法与任务控制方法 | |
| CN121300102B (zh) | 一种基于强化学习的再生资源生产线自适应控制方法 | |
| CN121953659A (zh) | 一种隧道窑焙烧控制方法、系统及电子设备、存储介质 | |
| CN121660403B (zh) | 基于数字孪生模型的耐盐碱水稻育种盐度智能调控方法 | |
| CN121048249B (zh) | 室内环境控制方法及其系统、设备、介质 |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| PB01 | Publication | ||
| PB01 | Publication | ||
| SE01 | Entry into force of request for substantive examination | ||
| SE01 | Entry into force of request for substantive examination |