← Nieuwste papers
💰 quantitative finance

A harmonised dataset for Earth system foundation models

Dit artikel introduceert WorldTensor, een geharmoniseerde wereldwijde dataset die diverse milieuvariabelen en sociaaleconomische variabelen uitlijnt op een gestandaardiseerd raster van 0,25° en een jaarlijks kader om het trainen van multimodale Earth system foundation models mogelijk te maken die gekoppelde mens-milieu-dynamiek vastleggen.

Oorspronkelijke auteurs: Carlos Rodriguez-Pardo, Massimo Tavoni

Gepubliceerd 2026-07-07
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Carlos Rodriguez-Pardo, Massimo Tavoni

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je de Aarde voor als een enorme, complexe machine met twee hoofdmotoren: de natuurlijke wereld (weer, oceanen, bossen) en de menselijke wereld (steden, boerderijen, elektriciteitscentrales, economieën). Lange tijd hebben wetenschappers "superhersenen" (genaamd foundation models) gebouwd om te begrijpen hoe deze motoren werken. Echter, er was een groot probleem: de superhersenen waren alleen gevoed met data over de natuurlijke motor. Ze wisten alles van regen en wind, maar ze waren bijna blind voor hoe mensen steden bouwen, brandstof verbranden of geld verplaatsen.

Dit artikel introduceert WorldTensor, een enorme nieuwe "gebruiksaanwijzing" die ontworpen is om dit blinde vlek te verhelpen. Denk aan WorldTensor niet als een enkel boek, maar als een gigantische, perfect georganiseerde bibliotheek waar elk enkel feit over de planeet — van een regendruppel tot een fabrieksschoorsteen — op hetzelfde type papier staat geschreven, in dezelfde taal en in dezelfde lade is opgeborgen.

Hier is hoe het artikel het onderverdeelt:

1. Het Probleem: Een Rommelige Stapel Puzzels

Voordat WorldTensor bestond, was het bestuderen van de Aarde en de mens samen alsof je een puzzel probeert op te lossen waarbij de helft van de stukjes uit een afbeelding van de oceaan komt, en de andere helft uit een afbeelding van een stad, maar ze zijn allemaal verschillende groottes, verschillende vormen en gedrukt in verschillende talen.

  • Sommige data is dagelijks (zoals het weer); sommige is slechts eens in enkele jaren (zoals bevolkingsaantallen).
  • Sommige data is een raster van vierkantjes (zoals een kaart); sommige is slechts een lijst met punten (zoals de locaties van elektriciteitscentrales).
  • Sommige kaarten gebruiken verschillende coördinatensystemen, waardoor het onmogelijk is om ze uit te lijnen.

Wetenschappers moesten maanden besteden aan alleen al het opschonen en afstemmen van deze data voordat ze überhaupt aan hun onderzoek konden beginnen.

2. De Oplossing: De "WorldTensor" Bibliotheek

De auteurs creëerden WorldTensor, een geharmoniseerde dataset die fungeert als een universele vertaler en een meesterorganisator.

  • Het Raster: Ze namen honderden verschillende databronnen en dwongen ze allemaal op één enkel, standaard raster (0,25 graden, ongeveer de grootte van een groot stadsblok). Stel je voor dat je een foto met hoge resolutie, een schets en een lijst met getallen neemt en ze allemaal op exact hetzelfde ruitjespapier print zodat ze perfect op één lijn liggen.
  • De Tijd: Ze standaardiseerden de tijd naar een jaarlijks ritme. Als een bron dagelijkse data had, vatten ze die samen in een jaarlijks gemiddelde. Als een bron slechts elke 5 jaar data had, vulden ze de gaten in om een vloeiende jaarlijkse tijdlijn te maken.
  • De Inhoud: Het is een "multimodale" mix. Het bevat niet alleen het weer; het heeft:
    • Natuur: Oceanen, ijs, bodem, bossen en luchtkwaliteit.
    • Mensen: Bevolking, BBP (rijkdom), elektriciteitscentrales, wegen en zelfs conflictzones.
    • De Mix: Hoe mensen de natuur veranderen (zoals het kappen van bossen) en hoe de natuur mensen beïnvloedt (zoals overstromingen die steden raken).

3. Hoe Ze Het Gebouwd Hebben (De Keukenanalogie)

Beschouw de databronnen als rauwe ingrediënten uit verschillende markten. Sommige zijn verse vis (dagelijks weer), andere zijn gedroogde bonen (jaarlijkse volkstelling) en sommige zijn specerijen (punten op een kaart van fabrieken).

  • Regridding: Ze namen de "vis" en hakten deze in stukjes van dezelfde grootte als de "bonen".
  • Rasterization: Ze namen de "specerijen" (stippen op een kaart) en verspreidden deze zodat ze eruitzagen als een gladde laag kruiden op het raster.
  • Standardisering: Ze zorgden ervoor dat elk ingrediënt in dezelfde eenheden werd gemeten (zoals het omrekenen van kopjes naar grammen) en duidelijk werd gelabeld.
  • Kwaliteitscontrole: Ze controleerden de ingrediënten om te zien of ze niet bedorven waren. Als een getal fysiek onmogelijk was (zoals een temperatuur van 500°C op Aarde), markeerden ze dit. Ze controleerden ook of de "kaart" geen scheuren of naden had waar de randen niet overeenkwamen.

4. Hoe Het Eruitziet

Het artikel laat zien dat deze dataset enorm is. Het bevat meer dan 52.000 bestanden die de jaren 1900 tot 2025 beslaan.

  • Het bevat 14 verschillende "afdelingen" (zoals Klimaat, Energie, Menselijke Systemen, Gevaren).
  • Het stelt een computer in staat om te zien dat een verandering in emissies (mens) gekoppeld is aan een verandering in luchtkwaliteit (natuur), of dat verstedelijking (mens) gekoppeld is aan overstromingsrisico (natuur).

5. Waarom Het Belangrijk Is (De Training van de "Superhersenen")

Het hoofddoel van WorldTensor is het trainen van Foundation Models.

  • Vóór: Een superbrein leerde het weer te voorspellen, maar begreep niet dat het bouwen van een dam de rivierloop verandert, of dat een oorlog het boerenbedrijf stopt.
  • Nu: Met WorldTensor kan een superbrein de gekoppelde dynamiek leren. Het kan leren hoe menselijke acties en natuurlijke krachten op een wereldwijde schaal op elkaar inwerken.

Het artikel valideert dit door aan te tonen dat de data werkt. Wanneer ze de data testten tegen echte historische gebeurtenissen (zoals El Niño in 1997 of de pandemie van 2020), toonde de data correct de pieken en dalen in temperatuur, emissies en conflicten aan. Het bewees dat de "bibliotheek" accuraat is en klaar is om door computers gelezen te worden.

Samenvatting

WorldTensor is een enorme, schone en georganiseerde dataset die de "Mens"- en "Aarde"-motoren eindelijk op dezelfde pagina plaatst. Het verandert een chaotische stapel mismatchende kaarten en getallen in één samenhangend beeld van onze planeet, waardoor AI eindelijk kan leren hoe we op en met de Aarde leven, in plaats van de Aarde alleen in isolatie te bestuderen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →