PG(中国电子)股份有限公司-PG智能科技引领生活

0516-89726919
当前位置: 首页 > 新闻动态 > 行业新闻

使用改进的混合深度强化学习算法的多目标暖通空调控制

2026-08-07 03:29:52 小编

  

使用改进的混合深度强化学习算法的多目标暖通空调控制(图1)

  )排放量的14%,这凸显了对更高效控制策略的需求。本研究在致动器包含离散和连续变量的场景中研究了数据驱动的HVAC控制,这一混合挑战在深度强化学习(DRL)中很少被涉及。研究人员在Ene

  )排放量的14%,这凸显了对更高效控制策略的需求。本研究在致动器包含离散和连续变量的场景中研究了数据驱动的HVAC控制,这一混合挑战在深度强化学习(DRL)中很少被涉及。研究人员在EnergyPlus中建模了一个400 m

  的大学阶梯教室,控制变量包括空气处理单元开关、送风温度和送风质量流量,将其理论化为一个层次化马尔可夫决策过程(MDP)。通过帕累托(Pareto)优化调整了一个多目标奖励函数,以平衡HVAC能耗、室内温度、CO

  浓度和区域供热需求。针对一个特定的模型预测控制器(MPC),研究人员评估了四种为此混合环境改进的离策略(off-policy)DRL算法:离散化的双深度Q网络(DDQN)基线、通过松弛改进的双延迟深度确定性策略梯度(TD3)、带有辅助双深度Q网络头的软演员-评论家(SAC-DDQN)以及带有可微Gumbel-Sigmoid的软演员-评论家(SAC-Gumbel)。在确定性日适应测试中,SAC-Gumbel在大约比替代方法少50%的回合内收敛。此外,与MPC基线相比,它在保持热舒适和空气质量限值的同时,将平均HVAC电力消耗降低了近20%。在跨越五个不同气候区和占用日历的全年评估中,与替代智能体相比,SAC-Gumbel实现了最低的累积惩罚,并将区域供热需求降低了9%–23%。这些结果表明,SAC-Gumbel是日前HVAC控制最合适的方法,以适中的训练时间提供接近最优的性能。

  在全球气候变暖与能源消耗双重压力下,暖通空调(HVAC)系统作为建筑能耗的主要来源,其优化控制已成为研究热点。2022年,HVAC系统约占全球最终能源消耗的16.4%,并贡献了全球运行二氧化碳(CO

  )排放量的14%。传统控制方法如ON/OFF和比例-积分-微分(PID)控制器无法同时处理多个目标(如降低能耗与维持舒适度),且缺乏前瞻性决策能力。模型预测控制(MPC)虽能通过约束优化求解,但缺乏学习机制,计算负担持续存在。深度强化学习(DRL)通过数据驱动方式提供了一种替代方案,但现有研究未直接解决致动器同时包含连续和离散动作空间的混合HVAC控制问题。为此,研究人员在《Energy and AI》上发表论文,提出两种改进的离策略(off-policy)DRL算法(SAC-DDQN和SAC-Gumbel),在模拟的大学阶梯教室中实现多目标HVAC控制,旨在最小化能耗同时维持室内温度与CO

  研究人员采用了以下关键技术方法:首先,利用EnergyPlus构建400 m2大学阶梯教室的仿真模型,并通过Python/Gym接口与DRL智能体交互,模拟时间步长为15分钟。其次,将控制问题建模为层次化马尔可夫决策过程(MDP),状态空间包含室内温度、CO2浓度、能耗等内生变量及天气、占用等外生变量;动作空间为混合型:送风温度(连续[15,30]°C)、送风质量流量(连续[0.3,5] kg/s)和空气处理单元(AHU)开关(离散{0,1})。奖励函数通过帕累托(Pareto)优化对375组权重进行网格搜索,最终选定权重向量w=(80,7,1,4)以平衡能耗、热舒适与空气质量。算法方面,比较了四种改进的离策略DRL算法:离散化的双深度Q网络(DDQN)、基于松弛的双延迟深度确定性策略梯度(TD3)、带有辅助DDQN头的软演员-评论家(SAC-DDQN)以及带有可微Gumbel-Sigmoid的SAC(SAC-Gumbel),并以MPC为基线。训练数据使用了来自卢森堡、圣迭戈、开普敦、珀斯、布雷斯特和里斯本六个地点的天气文件(EPW格式)及在线工具生成的占用日程。

  7.1. 帕累托(Pareto)奖励权重选择:通过对375个权重组合进行穷举网格搜索,并基于单日训练(11月3日)评估SAC-Gumbel的性能,研究人员确定了帕累托前沿。最终选择权重向量w=(80,7,1,4),该配置在占用期间将CO2和室内温度违规限制在8%以下,同时实现最低总能耗,并用于后续所有评估。

  7.2. 适应测试:在确定性转移函数(P)下,SAC-Gumbel在六个代表性日期的训练中收敛速度最快,比替代方法快约50%的回合数。与MPC基线相比,SAC-Gumbel将HVAC平均电力消耗降低近20%(190.67±61.54×106J vs. 237.83±5.85×106J),同时保持热舒适与空气质量。DDQN因离散化动作空间和早期随机动作导致性能最差;TD3因固定阈值影响梯度传播;SAC-DDQN表现略优于TD3但能效稍低。MPC因混合整数非线性规划(MINLP)求解困难及模型失配导致策略僵硬,始终难以超越DRL方法。

  7.3. 泛化测试:在随机转移函数下,使用卢森堡数据训练后,在五个不同气候区(圣迭戈、开普敦、珀斯、布雷斯特、里斯本)进行全年评估。SAC-Gumbel在所有气候区获得最低平均累积得分,同时保持室内温度(>

  24°C和2违规次数第二低,且HVAC电力消耗和区域供热需求均低于其他DRL智能体。SAC-DDQN表现次优但能耗略高;DDQN虽无CO2违规但电力消耗最高;TD3温度调节变异性较大。

  讨论部分总结了SAC-Gumbel在混合动作空间中的优势,其端到端可微设计(Gumbel-Softmax结合高斯分布)避免了阈值处理,实现更快收敛和更优权衡。研究局限性包括:帕累托权重选择仅基于短期(1天50回合)训练,可能非最优但增强了泛化性;超参数通过有限试错确定;状态向量未显式捕获时间依赖性,未来可引入循环神经网络(RNN)或变换器(Transformer)。研究结论翻译如下:本研究解决了涉及混合动作空间的HVAC控制挑战,这一主题在现有DRL文献中很少被研究。通过将EnergyPlus大学阶梯教室模型与Python/Gym接口集成,问题被公式化为一个马尔可夫决策过程,包含离散(AHU开/关)和连续(送风温度、室外空气流量)控制变量。通过帕累托前沿搜索推导出多目标奖励函数,以平衡能耗、CO

  浓度和热舒适。三种主流离策略DRL算法被修改以处理这种混合层次化动作空间。修改后的智能体表现出有前景的性能,特别是SAC-Gumbel,它结合了软演员-评论家与可微Gumbel-Sigmoid用于离散控制。在确定性日适应测试中,它收敛速度几乎比其他方法快两倍。在全年跨气候泛化测试中,与TPG电子网站D3、SAC-DDQN和DDQN相比,它获得了最低的累积惩罚,同时降低了HVAC电力和区域供热需求。对约200人容量的大型阶梯教室的应用表明,基于SAC的智能体能够管理大量供暖和制冷负荷,同时处理多个目PG电子网站标。整合占用模式进一步凸显了智能体对占用者存在和行为的自适应响应。基于结果,得出两个实际结论:第一,使用SAC-Gumbel进行每日再训练以合理的仿真努力实现了接近最优的控制,当外生预报可用时,为传统模型预测控制和其他DRL方法提供了实用替代方案;第二,所有方法在泛化上的持续差距表明,需要扩展状态信息,如序列感知RNN、长短期记忆网络(LSTM)或变换器模型,以及元强化学习预训练,以支持无需大量再训练的现场快速适应。未来工作将考虑占用者交互以评估智能体性能,更好地捕捉真实动态并改进控制策略。

联系专业的商务顾问,制定方案,专业设计,一对一咨询及其报价详情
服务热线服务热线 0516-89726919
免费互联网咨询服务

联系我们 contact us
0516-89726919