← Nieuwste papers
🤖 machine learning

RESCAST-100K: A Comprehensive Dataset for Cross-Domain Residential Load and Indoor Temperature Forecasting

Dit artikel introduceert RESCAST-100K, een grootschalige benchmark bestaande uit 100.000 gesimuleerde en vijf real-world residentiële datasets, ontworpen om de cross-domein generalisatie voor kortetermijnvoorspellingen van energiebelasting en binnentemperatuur systematisch te evalueren en te verbeteren met behulp van geavanceerde machine learning-architecturen.

Oorspronkelijke auteurs: Jainam Dhruva, Yousaf Raza, A. B. Siddique, Simone Silvestri

Gepubliceerd 2026-06-03
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jainam Dhruva, Yousaf Raza, A. B. Siddique, Simone Silvestri

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een student probeert te leren hoe je het weer binnen in een huis voorspelt. Het probleem is dat elk huis anders is: sommige zijn in het warme Florida, andere in het koude Minnesota; sommige hebben bakstenen muren, andere hebben houten muren; sommige gebruiken gasbranders, andere warmtepompen.

Als je de student alleen traint met gegevens uit één specifiek huis in één specifieke stad, zal hij waarschijnlijk falen wanneer je hem vraagt om de temperatuur in een totaal ander huis te voorspellen. Dit is het grote probleem bij energievoorspelling: we hebben niet genoeg gegevens van elk type huis om een perfect model voor elk huis te trainen.

Maak kennis met RESCAST-100K.

Beschouw dit artikel als de introductie van een enorme, super-slimme "trainingsgym" voor AI-modellen. Hier is wat ze hebben gebouwd, eenvoudig uitgelegd:

1. De "Virtuele Stad" van 100.000 Huizen

In plaats van te wachten op het verzamelen van gegevens van echte huizen (wat traag, duur en vaak privacygevoelig is), hebben de auteurs een hoogtechnologische simulator genaamd EnergyPlus gebruikt om een digitale tweeling van 100.000 Amerikaanse huizen te creëren.

  • De Variatie: Ze hebben niet zomaar 100.000 identieke dozen gemaakt. Ze maakten een diverse stad. Ze varieerden de locatie (geografie), het klimaat, de wandmaterialen, de verwarmingssystemen en de grootte van de woningen.
  • De Gegevens: Voor elk virtueel huis legden ze drie dingen elke 15 minuten vast gedurende een heel jaar:
    1. Totaal Energieverbruik: Hoeveel elektriciteit het hele huis verbruikte.
    2. HVAC-verbruik: Hoeveel elektriciteit de verwarming en airconditioning specifiek verbruikten.
    3. Binnentemperatuur: Hoe warm of koud het binnen was.
  • De Context: Ze gaven de AI ook "aanwijzingen" zoals het weer buiten, de thermostaatinstellingen en de statische details van het huis (zoals "het heeft een bakstenen muur").

2. De "Trainingsproef" (Cross-Domain Uitdaging)

De echte magie van deze dataset is niet alleen de omvang; het is hoe ze het gebruiken om de AI te testen.

Stel je voor dat je een student traint op huizen in New York (koud, bakstenen muren, gasbranders). Train je hen vervolgens direct op huizen in Arizona (heet, stucwerk muren, warmtepompen). Dit wordt een "Cross-Domain" test genoemd.

De meeste oude datasets laten je alleen testen op huizen die de student al heeft gezien. RESCAST-100K laat je specifieke "uitdagingen" opzetten:

  • Geografische Verschuiving: Train in het Noorden, test in het Zuiden.
  • Klimatologische Verschuiving: Train in een vochtige zone, test in een droge zone.
  • Apparatuur Verschuiving: Train op huizen met branders, test op huizen met warmtepompen.

Dit helpt onderzoekers om te zien of hun AI daadwerkelijk "de regels van de natuurkunde leert" of gewoon de specifieke huizen die het bestudeerde uit het hoofd leert.

3. Het "Ontbrekende Puzzelstukje" Probleem

In de echte wereld zijn gegevens vaak rommelig. Soms gaat een sensor kapot, of heeft een huis geen slimme thermostaat, waardoor de AI belangrijke aanwijzingen mist (zoals de buitentemperatuur).

De auteurs testten hun AI-modellen door tijdens de training doelbewust een deel van deze gegevens te verbergen. Ze wilden zien: Kan de AI nog steeds een goede gok maken als de weerbericht of de thermostaatinstelling ontbreekt?

4. De Resultaten: Wie won het spel?

Ze testten verschillende soorten AI-"hersenen" (architecturen) om te zien welke het beste om kon gaan met deze moeilijke, veranderende omstandigheden.

  • De Verliezers: Traditionele modellen (zoals eenvoudige Recurrent Neural Networks) en standaard "Transformer"-modellen (het soort dat veel moderne AI-tools aandrijft) hadden moeite wanneer het type huis veranderde. Ze raakten in de war wanneer de regels verschoven van koude naar warme klimaten.
  • De Winnaars: Twee specifieke soorten modellen presteerden het best:
    1. MLP-Mixers (TSMixer): Deze modellen zijn erg goed in het tegelijkertijd bekijken van alle verschillende aanwijzingen (weer, type muur, etc.) en het mengen van deze informatie om patronen te vinden. Ze waren het beste in het voorspellen van het energieverbruik.
    2. Cross-Attention Modellen (TimeXer): Deze modellen zijn goed in het focussen op het specifieke "verhaal" van de temperatuurgeschiedenis van het huis, terwijl ze tegelijkertijd aandacht besteden aan externe factoren. Ze waren het beste in het voen het voorspellen van de werkelijke binnentemperatuur.

Belangrijkste bevinding: De modellen die goed waren in het omgaan met "ontbrekende gegevens" en "verschillende typen huizen", waren de modellen die deze geavanceerde meng- en aandachtstechnieken gebruikten.

5. De "Sim-to-Real" Realiteitscheck

Ten slotte namen de auteurs de modellen die getraind waren op hun 100.000 virtuele huizen en testten ze op vijf real-world datasets (echte huizen waar echte mensen wonen).

  • Het Resultaat: Zoals verwacht waren de modellen niet perfect op echte huizen omdat echte mensen onvoorspelbaar zijn (ze openen ramen, laten lichten aan, etc. op manieren die de simulator niet had voorspeld, etc.).
  • De Zilveren Rand: Zelfs zonder te hertrainen op de echte gegevens, waren de modellen die getraind waren op de virtuele stad verrassend goed in het voorspellen van de algemene vorm van het energieverbruik (probabilistische voorspelling). Ze waren beter in het zeggen van: "Het is waarschijnlijk tussen de 50 en 60 kWh," dan in het raden van het exacte getal.

Samenvatting

Het artikel introduceert RESCAST-100K, een enorme, configureerbare dataset van 100.000 gesimuleerde Amerikaanse huizen. Het dient als een rigoureuze testomgeving om te zien of AI kan leren om het energieverbruik in elk huis te voorspellen, zelfs als het dat specifieke type huis nog nooit heeft gezien. Ze ontdekten dat geavanceerde AI-modellen (Mixers en Cross-Attention) veel beter zijn in het aanpassen aan nieuwe omgevingen en het omgaan met ontbrekende gegevens dan oudere modellen, wat een veelbelovende weg biedt naar slimmer energiebeheer in de toekomst.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →