GHGbench: A Unified Multi-Entity, Multi-Task Benchmark for Carbon Emission Prediction
本文介绍了 GHGbench,这是一个用于预测公司和建筑级碳排放的统一开放基准,它通过提供大规模、协调一致的数据集来解决数据碎片化问题,并揭示分布外泛化是主要挑战,其中表格基础模型和多模态遥感嵌入显著优于传统基线。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你试图预测两种截然不同的事物所产生的污染量:一家巨型企业和一栋单独的办公楼。
长期以来,试图用计算机完成这项工作,就像用不同的秤、不同的计量单位,以及散落在上千个上锁文件柜中的数据来比较苹果和橘子。有些数据隐藏在付费墙之后,有些以不同语言呈现,还有些则完全缺失。
GHGbench 是作者们为了解决这一混乱局面而构建的新“通用翻译器”和“试验场”。你可以把它想象成一个巨大的开源视频游戏关卡,不同的 AI 模型可以在其中竞赛,看谁最擅长预测碳排放。
以下是他们所做工作和发现结果的简要分解:
1. 游戏的两条“赛道”
该基准测试包含两个截然不同的关卡,因为公司和建筑是截然不同的“物种”。
- 公司赛道(企业巨头): 这一关卡使用了来自超过 12,000 家公司的数据。这就像试图根据一家公司的规模、所属行业(如银行业或科技业)及其财务报告来猜测其污染量。作者们收集了 32,000 条此类数据记录。
- 建筑赛道(混凝土块): 这一关卡要困难得多。它使用了来自美国、澳大利亚和新加坡 26 个城市近 100,000 栋独立建筑的数据。这就像试图仅通过查看地址、面积和天气来猜测某栋特定房屋的用电量。他们将来自 13 个不同城市门户的数据整合成了单一、干净的格式。
2. 竞赛规则
作者们并没有让 AI 模型随意猜测。他们制定了严格的规则,以检验模型究竟是真正聪明,还是仅仅在死记硬背答案:
- “同一社区”测试: 模型能否预测它以前见过的建筑的排放量?(简单模式)。
- “新城市”测试: 模型能否预测它从未见过的城市的排放量?(困难模式)。这就像在纽约教学生,然后去悉尼考他们。
- “时间旅行”测试: 模型能否根据今年的数据预测明年的排放量?
3. 重大惊喜(他们的发现)
作者们运行了多种类型的 AI(从简单的数学模型到像超级智能大脑一样的复杂“基础模型”),并发现了三个主要问题:
惊喜 #1:建筑比公司更难预测。
预测公司的污染就像根据身高和职位猜测一个人的体重;这是相当可预测的。预测建筑的污染则像根据地址猜测一个人的体重,因为它取决于许多不可见的因素,例如里面有多少人、他们何时开灯以及冰箱有多旧。数据无法告诉你这些信息,因此 AI 在此方面更加吃力。惊喜 #2:“新城市”问题巨大。
性能差距最大的地方不在于不同的 AI 模型之间,而在于“见过数据”和“首次见到数据”之间。- 类比: 想象一个死记硬背数学测试答案的学生。他们在该测试中得了 100%。但如果给他们一份包含相同数学问题但使用不同国家货币的试卷,他们可能会不及格。
- 结果: 大多数模型在迁移到新城市时都彻底失败。然而,一个名为 TabPFN(一种“表格基础模型”)的特定模型是第一个显示出它实际上能够学习游戏的规则而不仅仅是死记硬背答案的模型,在迁移到新城市时击败了旧的标准模型。
惊喜 #3:卫星照片是应对新城市的秘密武器。
当 AI 模型试图猜测新城市的排放量而陷入困境时,添加建筑物的卫星图像有所帮助。- 类比: 如果你只有一份地址列表(文本),你可能会猜测雪城中的房屋与炎热城市中的房屋供暖方式不同。但如果你能在卫星照片中看到屋顶,你就能判断它是否被雪覆盖、是否有太阳能电池板,或者是否被树木环绕。卫星图像为 AI 提供了“视觉线索”,帮助它泛化到以前从未见过的地方。
4. “灾难性”失败
该论文还强调了 AI 完全崩溃的地方。
- “城市迁移”崩溃: 当从数据丰富的城市迁移到数据极少的城市时,一些模型不仅仅是表现稍差;它们彻底崩溃,给出了 wildly 错误的预测(例如预测一栋建筑排放负污染)。
- “行业因子”上限: 试图仅通过查找行业的“标准污染数值”(例如,“所有银行排放 X 量”)来猜测排放量过于粗糙。它忽略了单个公司的具体细节,导致巨大误差。
总结
GHGbench 是一个终于让研究人员能够公平比较 AI 模型的工具包。它表明,虽然 AI 在预测其熟悉公司的污染方面表现良好,但预测新城市中建筑物的污染仍然非常困难。然而,使用特定类型的“基础模型”并结合卫星照片,是解决这一难题最有前景的前进方向。
作者们已将所有代码、数据配方和结果向公众开放,以便其他科学家能够在此基础上开展工作,而无需从头开始。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。