Building2Building: A Large Scale Benchmark for Generalizable Real-World Reinforcement Learning

TL;DR

B2B用EnergyPlus生成6000栋建筑,系统评测RL的目标、动力学、动作空间与跨域泛化。

cs.LG 🔴 高级 2026-07-18 22 次浏览
Vincent Taboga Justin Veilleux Doseok Jang Anushree Rankawat Pierre-Luc Bacon
强化学习 HVAC控制 泛化 EnergyPlus 跨域迁移

核心发现

方法论

论文提出Building2Building(B2B):基于EnergyPlus和参数化建筑生成器构造Gymnasium环境。每类建筑生成1000个实例,共6000个,覆盖住宅、餐厅、仓库、零售店、小型办公室和中型办公室。任务分别改变奖励目标、建筑动力学、可控执行器及建筑域,并以PPO和基于结构化形态表示的Amorpheus变体作为基线。

关键结果

  • 动力学适应实验比较100个逐建筑PPO专家、非专门化PPO和带建筑参数的参数化PPO。专家在已训练建筑上表现最好;参数化模型优于不提供建筑信息的模型,说明楼面面积、建造年份、执行器数量等上下文有助于迁移。
  • 跨域实验在零售店、快餐餐厅、小型办公室和中型办公室上联合训练1M环境步,测试20栋未见建筑。基于类型特定编码器/解码器与Transformer的Amorpheus变体能够处理异构观测、动作空间,并在部分建筑上超过ASHRAE Guideline 36启发式反应控制基线。
  • B2B将动作维度变化显式标准化:单元式系统可从5维变为10维,中央系统从33维变为36维,反向迁移亦被定义;奖励采用归一化舒适度和能耗项,使统一wE跨建筑比较成为可能。

研究意义

B2B把HVAC从单建筑案例研究转化为大规模、可复现实验领域。它填补了现有RLBench、Meta-World和Sinergym等基准在真实物理、多建筑差异及异构接口方面的空缺,使研究者能够独立分析目标适应、动力学适应、动作空间迁移和跨域泛化。产业上,跨建筑训练可能减少为每栋建筑建立精确数字孪生和从零训练控制器的成本。由于建筑约占全球能耗三分之一、HVAC约占其中近一半,潜在节能与减排价值显著。

技术贡献

核心工程贡献包括参数化建筑生成管线、EnergyPlus到Gymnasium的自动转换、统一评测协议及结构化形态表示。形态由公共属性、节点类型、局部属性,以及split/join映射组成;热区和HVAC设备成为图节点,允许图神经网络、异构Transformer和类型异构编码器处理不同维度的接口。论文还提供ASHRAE Guideline 36风格的PI与Trim-and-Respond基线,并用compute_normalized_score相对反应控制器归一化回报。

新颖性

新颖性不在于提出新的RL优化器,而在于首次将大规模、物理 grounded 的建筑HVAC环境与异构形态迁移问题结合为统一基准。相较主要集中于机器人或游戏、通常只改变摩擦或目标位置的Meta-World、RLBench和Procgen,B2B同时改变建筑结构、气候、观测空间、动作空间与奖励目标。

局限性

  • 结果主要来自EnergyPlus仿真,尚未证明在传感器噪声、执行器延迟、设备故障和真实楼宇安全约束下仍能保持性能。
  • 实验算法覆盖PPO及一个Amorpheus变体,缺少更多元的元学习、离线RL、世界模型和持续学习对比;部分结果为图示定性分析,完整数值有限。
  • 随机设定点用于增加难度,但不代表典型住户行为;生成建筑虽多样,仍受ASHRAE原型与北美地点分布限制。

未来方向

后续应扩展气候与建筑原型,引入真实运行数据、校准仿真、噪声和安全约束;比较Successor Features、元RL、超网络、离线RL及图Transformer。还应报告跨季节长期收益、迁移样本效率、计算成本和真实部署的节能、舒适度及集成成本。

AI 总览摘要

强化学习在控制任务中成绩突出,但通常只针对单一环境训练。一旦建筑结构、气候、传感器、执行器或舒适目标改变,策略便可能失效。现有Meta-World、RLBench等基准主要面向机器人,Sinergym、CityLearn等HVAC平台也只有少量建筑,难以系统研究真实世界泛化。

Building2Building(B2B)以EnergyPlus为物理基础,结合住宅生成器和基于ASHRAE 90.1商业原型的参数化生成器,在北美16个地点采样住宅、餐厅、仓库、零售店、小型办公室和中型办公室,共6000个环境。每个环境遵循Gymnasium接口,同时用包含公共属性、局部节点和图结构的形态表示描述不同观测与动作空间。基准分别测试目标、动力学、动作空间和跨域适应。

实验显示,100栋测试住宅上的参数化PPO优于不带建筑上下文的非专门化PPO;跨域实验用Amorpheus风格Transformer在四类建筑上联合训练1M步,并测试20栋未见建筑,在部分案例中超过ASHRAE Guideline 36反应控制器。B2B的重要价值是把“能否迁移”变成可重复测量的问题,但目前仍限于仿真,真实部署、安全性、故障鲁棒性和更广泛算法比较仍待研究。

深度分析

研究背景

RL控制研究多在单一任务上取得结果。Procgen、RLBench、Meta-World和DM Control推动了泛化研究,但主要覆盖游戏与机器人,环境接口通常固定。HVAC研究则常选择一栋楼,通过EnergyPlus或其他平台证明节能,却很少检验跨建筑迁移。B2B利用建筑在热力学规律上的共性与结构、气候、设备上的差异,建立新的真实物理控制测试场。

核心问题

目标是让策略面对未见建筑、不同奖励、动力学、观测维度和执行器集合仍能控制温度并平衡能耗。难点在于建筑热惯性、区域耦合和设备差异造成长期非平稳性;固定输入输出的MLP无法直接处理异构空间;统一奖励权重又会受建筑规模和设备能耗尺度影响。

核心创新

  • �� 6000个EnergyPlus环境覆盖六类建筑。
  • �� 四种任务分别隔离目标适应、动力学变化、动作空间迁移和跨域泛化。
  • �� 结构化形态表示把建筑编码为公共部分与带类型节点的图,并以split/join连接Gymnasium空间。
  • �� 通过基线性能定义归一化常数,令同一wE具有跨建筑含义。
  • �� 提供ASHRAE Guideline 36风格反应控制器和统一分数函数。

方法详解

  • �� 生成:住宅生成器模拟魁北克住宅库存;商业生成器基于ASHRAE 90.1原型,在16个北美地点采样面积、窗墙比、保温和渗透率。
  • �� 接口:观测包括天气、日历、区域温度和单位面积HVAC能耗;动作控制SAT、风量、风阀、再热盘管或温控器。
  • �� 奖励:r_t=−(1/(Zτ_T))Σ_z(T_z−T_z^target)^2−w_E E_HVAC/τ_E。
  • �� 训练:PPO用于目标和动力学实验;跨域使用类型特定线性编码器/解码器、共享Transformer的Amorpheus变体。
  • �� 评估:以反应控制器归一化累计回报,并观察温度偏差与跨建筑失败长尾。

实验设计

每类建筑生成1000个环境,划分训练集和测试集。动力学适应使用单区住宅、常数21°C设定点、wE=0,比较100个逐建筑专家、非专门化PPO和参数化PPO。跨域实验联合训练零售店、餐厅、小型办公室和中型办公室,各取一个建筑并每10次PPO更新重采样,训练1M步,测试20栋未见建筑。动作迁移设置5→10、33→36及反向变化。

结果分析

逐建筑专家在其训练建筑上取得最佳归一化回报,非专门化与参数化策略存在明显差距;后者通过建筑属性条件化改善动力学适应。三类模型总体能跟踪温度,但前两者在100栋测试建筑中出现失败长尾。跨域Amorpheus策略适配了异构空间,并在部分20栋测试建筑上超过归一化分数1.0的反应控制基线。

应用场景

物业管理者可用B2B式跨建筑预训练策略作为新楼宇控制器初始化,再以少量本地数据微调。低层执行器控制可覆盖热泵、屋顶机、VAV风阀和再热系统。实际使用前需要EnergyPlus校准、传感器接入、动作安全边界、人工接管和持续监控,以避免舒适度或设备风险。

局限与展望

EnergyPlus虽具高保真热模型,但不能完整反映真实传感器噪声、通信延迟、设备老化和住户行为。实验规模大于传统HVAC基准,却主要验证PPO和单个Amorpheus变体,缺乏全面算法排序与统计显著性。北美原型和气候覆盖也限制外推。未来需结合真实数据、风险敏感RL、故障测试、长期季节评估和在线安全学习。

通俗解读 非专业人士也能看懂

把每栋建筑想成一家不同的餐厅。餐厅有共同任务:让客人舒服、又不要浪费电;但厨房大小、炉子数量、房间布局和天气都不同。传统方法像给每家餐厅雇一名只熟悉本店的厨师,换一家店就要重新学习。

B2B先用EnergyPlus这个“虚拟建筑实验室”造出6000家不同餐厅,包含住宅、商店和办公室等类型。控制器每次能看到室外天气、时间、各房间温度和用电量,然后调整送风、温度和阀门。研究者还故意改变目标温度、建筑材料和可操作设备,检查控制器能否适应。

它的关键做法像设计一套模块化厨房:共同信息放在中央,不同房间和设备作为带标签的模块。这样,一个控制器不必要求每家店都有完全一样的按钮。实验表明,知道建筑面积、年份和设备数量的控制器比完全不了解建筑情况的控制器更容易迁移;跨四种建筑训练的控制器还在部分新建筑上超过传统规则。可是,真实建筑比模拟更嘈杂,仍需现场验证。

简单解释 像给14岁少年讲一样

想象你在玩一个“管理学校空调”的游戏。目标是让每个教室舒服,同时别把电费花光。问题是,每所学校的教室数量、墙壁厚度、空调按钮和天气都不一样。如果你只在一所学校练习,到了另一所学校,很可能按错按钮,教室也会忽冷忽热。

这篇论文做了一个超大的练习场,叫B2B。研究者用EnergyPlus造出6000栋不同建筑:房子、餐厅、仓库、商店和办公室。智能体每隔一段时间观察天气、日期、房间温度和耗电量,再决定风量、送风温度或阀门怎么调。研究者还会换目标,比如只追求舒适,或同时省电。

最酷的是,建筑的“按钮数量”可以不同。普通神经网络像一台只有固定数量插孔的机器,换建筑就不兼容;B2B把房间和设备整理成带类型的模块,让模型知道“这是一个房间”“那是一个风阀”。跨四类建筑训练后,它在20栋没见过的建筑上测试,部分表现超过传统控制规则。

不过这还是模拟游戏,不是真正的学校。现实中可能有坏传感器、延迟、学生开窗和设备故障。因此,下一步要让它在真实或校准过的建筑里安全试运行,并证明真的省电又不牺牲舒适度!

术语表

Reinforcement Learning(强化学习)

智能体通过与环境交互,根据奖励学习行动策略。其目标通常是最大化长期累计回报。

B2B用PPO训练HVAC控制策略。

EnergyPlus

由美国国家可再生能源实验室支持的建筑能耗与热行为模拟器。它依据热力学和设备模型计算建筑状态。

B2B所有建筑环境的物理基础。

PPO

Proximal Policy Optimization,一种限制策略更新幅度的策略梯度算法。它通常以剪切目标提高训练稳定性。

用于目标适应和动力学适应基线。

Morphology(形态)

描述一个具体环境的结构、节点类型、属性以及观测和动作映射。它使不同接口的环境可被统一表达。

B2B用建筑、热区和HVAC设备构成形态图。

Goal Adaptation(目标适应)

环境动力学和接口不变,但奖励目标或设定点发生变化。它检验策略是否能调整行为偏好。

B2B改变wE和恒定、占用驱动或随机设定点。

ASHRAE Guideline 36

面向高性能HVAC运行序列的行业指导规范。论文据此实现PI回路与Trim-and-Respond反应控制器。

作为主要工程基线。

开放问题 这项研究留下的未解疑问

  • 1 仿真策略在真实建筑中的迁移幅度仍未知,尤其是噪声、延迟、设备故障和住户干预共同存在时,安全约束与在线校准需要实证。
  • 2 B2B尚未系统比较元RL、离线RL、世界模型和持续学习,也未充分报告样本效率、计算成本及统计显著性。
  • 3 北美ASHRAE原型能否代表其他国家、极端气候和老旧建筑,仍需更广泛数据与跨地区验证。

应用场景

近期应用

新楼宇控制器初始化

物业团队可在大量B2B风格建筑上预训练策略,再用目标楼宇的少量EnergyPlus校准数据微调。部署前应接入温度、天气和能耗传感器,并设置动作上下界、人工接管和舒适度报警。

HVAC算法标准评测

研究机构可用6000个环境统一比较PPO、图网络、元学习和超网络,分别测量目标、动力学、动作空间及跨域迁移,而不必为每篇论文重新搭建单栋楼仿真系统。

远期愿景

跨建筑能源管理平台

成熟后,建筑运营商可维护一个能理解不同房间和设备类型的通用策略,在新楼宇接入后快速适应,降低数字孪生和控制器开发成本,并扩大节能控制覆盖面。

原文摘要

Reinforcement learning (RL) has achieved strong results in control, yet learned policies remain brittle to changes in dynamics, action spaces, observation spaces, or goals, a critical limitation for real-world deployment. Existing benchmarks offer limited diversity and complexity, making it difficult to rigorously study transfer, multi-task learning, and meta-learning in RL. We introduce Building2Building (B2B), a large-scale suite of realistic Heating, Ventilation, and Air Conditioning (HVAC) control environments built on EnergyPlus, a state-of-the-art building simulator. B2B is fully compatible with the Gymnasium interface and features a parametric building generator, enabling the systematic generation of diverse building configurations with heterogeneous observation and action spaces. Based on this suite, we define benchmark tasks targeting key open challenges in RL, including goal adaptation, dynamics adaptation, action-space shifts, and cross-domain transfer. By providing a large-scale, diverse, and physically grounded testbed with standardized evaluation protocols, B2B enables systematic investigation of generalization and transfer in continuous control. Beyond advancing research on generalization in RL, this new benchmark also carries significant societal implications by enabling improved HVAC control at scale, one of the most energy-intensive systems in buildings.

cs.LG cs.AI