← 最新论文
🤖 machine learning

RESCAST-100K: A Comprehensive Dataset for Cross-Domain Residential Load and Indoor Temperature Forecasting

本文介绍了 RESCAST-100K,这是一个包含 100,000 个模拟数据集和 5 个真实世界住宅数据集的大规模基准测试,旨在系统地评估并改进利用先进机器学习架构进行短期能源负荷和室内温度预测的跨域泛化能力。

原作者: Jainam Dhruva, Yousaf Raza, A. B. Siddique, Simone Silvestri

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Jainam Dhruva, Yousaf Raza, A. B. Siddique, Simone Silvestri

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一名学生如何预测房屋内部的天气。问题在于,每栋房子都是不同的:有的在炎热的佛罗里达,有的在寒冷的明尼苏达;有的拥有砖墙,有的则是木墙;有的使用燃气暖炉,有的则使用热泵。

如果你只用一个特定城市中特定房屋的数据来教这个学生,那么当你要求他预测另一栋完全不同的房屋的温度时,他很可能会失败。这就是能源预测中的大问题:我们没有足够的数据涵盖每一种类型的房屋,来训练出一个完美的模型。

RESCAST-100K 正是为此而生。

你可以将这篇论文看作是为 AI 模型引入了一个庞大的、超级智能的“训练场”。以下是他们所构建的内容,通过简单的语言进行解释:

1. “虚拟城市”中的 10 万个家庭

与其等待收集现实房屋的数据(这既慢、又贵,且涉及隐私),作者们利用了一个名为 EnergyPlus 的高科技模拟器,创建了一个由 10 万个美国住宅组成的数字孪生城市。

  • 多样性: 他们并没有只制作 10 万个完全相同的盒子。他们制作了一个多样化的城市。他们改变了地理位置(地理环境)、气候、墙体材料、供暖系统以及房屋的大小。
  • 数据: 对于每一个虚拟家庭,他们每 15 分钟记录一次数据,持续一整年,记录了三项内容:
    1. 总能耗(Total Energy Load): 整栋房子消耗了多少电量。
    2. HVAC 能耗(HVAC Load): 专门用于供暖和空调系统的电量。
    3. 室内温度(Indoor Temperature): 室内有多热或多冷。
  • 上下文信息: 他们还给了 AI 一些“线索”,比如室外天气、温控器设置,以及房屋的静态细节(例如“它有砖墙”)。

2. “训练测试”(跨领域挑战)

这个数据集真正的魔力不仅在于其规模,更在于他们如何利用它来测试 AI。

想象一下,你让一名学生在纽约的房屋(寒冷、砖墙、燃气暖炉)上进行学习。然后,你立即将他测试在亚利桑那州的房屋上(炎热、灰泥墙、热泵)。这被称为**“跨领域”(Cross-Domain)**测试。

大多数旧的数据集只能让你在学生已经见过的房屋上进行测试。而 RESCAST-100K 允许你设置特定的“挑战”:

  • 地理偏移(Geography Shift): 在北方训练,在南方测试。
  • 气候偏移(Climate Shift): 在潮湿地区训练,在干燥地区测试。
  • 设备偏移(Equipment Shift): 在使用暖炉的房屋上训练,在热泵房屋上测试。

这有助于研究人员观察 AI 究竟是在“学习物理规则”,还是仅仅在死记硬背它所学习过的特定房屋。

3. “缺失的拼图碎片”问题

在现实世界中,数据往往是凌乱的。有时传感器会损坏,或者某个房子没有智能温控器,导致 AI 缺少关键线索(例如室外温度)。

作者们通过在训练期间故意隐藏部分数据来测试他们的 AI 模型。他们想看看:如果缺少天气预报或温控器设置,AI 是否仍能做出良好的预测?

4. 结果:谁赢得了比赛?

他们测试了几种不同类型的 AI “大脑”(架构),以观察哪一种能够应对这些艰苦且多变的环境。

  • 失败者: 传统的模型(如简单的循环神经网络 RNN)和标准的“Transformer”模型(许多现代 AI 工具所使用的类型)在房屋类型发生变化时表现挣扎。当规则从寒冷气候转向炎热气候时,它们会感到困惑。
  • 获胜者: 两种特定类型的模型表现最好:
    1. MLP-Mixers (TSMixer): 这些模型擅长同时观察所有不同的线索(天气、墙体类型等)并将它们混合在一起以寻找模式。它们在预测能耗方面表现最佳。
    2. Cross-Attention 模型 (TimeXer): 这些模型擅长在关注外部因素的同时,专注于房屋温度历史的特定“故事”。它们在预测实际室内温度方面表现最佳。

核心发现: 那些在处理“缺失数据”和“不同房屋类型”方面表现优秀的模型,正是使用了这些先进的混合(Mixing)和注意力(Attention)技术的模型。

5. “从模拟到现实”的真实检验

最后,作者们将他们在 10 万个虚拟房屋上训练的模型,应用到了 5 个真实世界的数据集(即有真实人类居住的实际房屋)上进行测试。

  • 结果: 正如预期的那样,由于现实生活中的人是不可预测的(他们开窗、留灯的方式与模拟器所预测的不同),模型在真实房屋上的表现并不完美。
  • 一线希望: 即使没有针对真实数据进行重新训练,在虚拟城市中训练的模型在预测能耗的“总体形状”(概率预测)方面也表现得相当出色。它们在说“很可能在 50 到 60 kWh 之间”方面,比精确猜测具体数值要好得多。

总结

这篇论文介绍了 RESCAST-100K,这是一个包含 10 万个模拟美国住宅的庞大且可配置的数据集。它作为一个严苛的测试场,旨在测试 AI 是否能够学习在任何房屋中预测能源使用,即使它从未见过该特定类型的房屋。研究发现,相比于旧模型,先进的 AI 模型(Mixers 和 Cross-Attention)在适应新环境和处理缺失数据方面表现得更为出色,这为未来更智能的能源管理提供了一条充满希望的路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →