← Nieuwste papers
💻 computer science

GeoCore-9B: Towards Geo-Aware Generative Foundation Models in Earth Observation

Het artikel introduceert GeoCore-9B, een generatief basismodel met 9 miljard parameters dat vanaf nul is getraind op wereldwijde aardobservatiegegevens met behulp van een Flow Matching-gebaseerde Diffusion Transformer en een nieuwe Geospatial Semantic Alignment-verliesfunctie om state-of-the-art prestaties te behalen in visuele getrouwheid en geografische structurele nauwkeurigheid voor diverse EO-toepassingen.

Oorspronkelijke auteurs: Jeonghyeok Do, Munchurl Kim

Gepubliceerd 2026-08-04
📖 9 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jeonghyeok Do, Munchurl Kim

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren om de hele planeet Aarde vanuit de ruimte te tekenen. Je zou kunnen denken: "Makkelijk! Laat hem gewoon een miljoen foto's van katten, auto's en zonsondergangen zien en hij zal alles kunnen tekenen." Maar hier komt de addertjes onder het gras: foto's van katten zijn genomen vanuit ooghoogte, met perspectief en schaduwen die dingen driedimensionaal laten lijken. Satellietfoto's worden echter recht van boven genomen, als een kaart. Ze hebben niet hetzelfde "gevoel". Als je een robot probeert te leren met alleen maar kattenfoto's, raakt hij in de war. Hij kan proberen een stad te tekenen met een horizonlijn of een bos eruit laten zien alsof het kantelt, omdat hij probeert "grondniveau-regels" toe te passen op een "vogelperspectief". Dit is het grote puzzelstuk waar wetenschappers in de aardobservatie (EO) een oplossing voor zoeken: hoe bouwen we een AI die het unieke, platte en fysiek nauwkeurige karakter van satellietbeelden begrijpt zonder in de strik van de gewoontes van reguliere fotografie te trappen?

Maak kennis met GeoCore-9B, een nieuwe digitale kunstenaar die weigert de oude wegen te volgen. In plaats van te proberen te leren van kattenfoto's en zichzelf daarna te "fine-tunen", werd dit model vanaf het begin getraind — met een blanco canvas — met behulp van uitsluitend 10 miljoen echte satellietbeelden. Denk aan een student die de algemene kunstles overslaat en direct naar een gespecialiseerde school voor kaartmakers gaat. Deze 9 miljard parameters grote reus raadt niet alleen wat een stad lijkt; hij weet precies waar deze is. Je kunt hem de opdracht geven: "Teken een dichtbebouwde stad op deze specifieke breedtegraad en lengtegraad, met deze specifieke grondresolutie," en hij zal gehoor geven.

De onderzoekers ontdekten dat door het model te leren letten op echte wereldcoördinaten en fysieke schalen, het beelden creëert die niet alleen mooi zijn, maar ook geografisch accuraat. Ze ontdekten ook een slimme truc om het model sneller te laten leren: ze gebruikten een "leraar"-netwerk (een bevroren, expert AI die al weet hoe hij terrein moet herkennen) om tijdens de training hints te fluisteren aan de student. Dit maakte het uiteindelijke model niet langzamer of zwaarder; het maakte het leerproces simpelweg veel gerichter. Het resultaat? GeoCore-9B kan verbazingwekkend realistische satellietgezichten genereren, wolken uit wazige foto's verwijderen en zelfs radarbeelden (die eruitzien als statische ruis) vertalen naar heldere optische plaatjes. Het suggereert dat wanneer we stoppen met proberen de aardobservatie in het mal van de reguliere fotografie te persen, we instrumenten kunnen bouen die onze planeet werkelijk begrijpen.

Het Probleem: De "Katfoto-val"

Lama tijd waren de beste AI-modellen voor het genereren van afbeeldingen getraind op de favoriete onderwerpen van het internet: natuurlijke foto's van mensen, dieren en landschappen. Deze modellen, zoals de beroemde "Stable Diffusion", zijn geweldig in het maken van kunst. Maar wanneer wetenschappers probeerden deze te gebruiken om satellietbeelden te genereren, liep het mis.

Stel je voor dat je een hond probeert te leren zwemmen door hem foto's van vogels te laten zien. De hond zal misschien proberen met zijn oren te flapperen of te vliegen in plaats van te peddelen. Zo ook waren deze AI-modellen "bevooroordeeld" naar perspectief. Ze verwachtten dat objecten een horizon hadden, vanuit een hoek werden bekeken en een specifieke "informele" schaal hadden. Maar satellietbeelden zijn orthografisch — ze zijn recht van boven gezien zonder horizon, waarbij een huis even groot lijkt of het nu op de voorgrond staat of op de achtergrond.

Wanneer onderzoekers probeerden deze "natuurlijke beeld"-modellen satellietkaarten te laten tekenen, waren de resultaten vaak vreemd. De AI tekende wegen die de lucht in krulden of gebouwen die leken te hellen. Het probeerde de regels van een straatfoto toe te passen op een kaart vanuit de ruimte. Het artikel betoogt dat simpelweg "fine-tunen" (bijsturen) van deze bestaande modellen niet genoeg is, omdat de onderliggende "hersenen" van het model nog steeds denkt in termen van katten en auto's, en niet in continenten en steden.

De Oplossing: Een Model Geboren uit de Ruimte

Om dit op te lossen, bouwden de auteurs GeoCore-9B. Dit is een massief generatief fundamentmodel met 9 miljard parameters. Het cruciale verschil? Het is niet getraind op de fotocollectie van het internet. Het is uitsluitend getraind op 10 miljoen satellietbeelden uit een dataset genaamd Git-10M.

Beschouw GeoCore-9B als een cartograaf die nog nooit een straatfoto heeft gezien. Hij kent de wereld alleen van bovenaf. Het is gebouwd op een nieuwe architectuur genaamd een Diffusion Transformer (DiT) met behulp van Flow Matching. In eenvoudige termen: "diffusie" is als beginnen met een wolk van statische ruis en deze stap voor stap langzaam verfijnen tot een helder beeld. "Flow Matching" is een gladdere, efficiëntere manier om die ruis naar een helder beeld te leiden, vooral bij enorme modellen.

Maar een model dat alleen weet hoe het moet tekenen is niet genoeg; het moet ook weten waar het moet tekenen. GeoCore-9B is "geo-bewust". Het neemt drie speciale inputs mee naast een tekstbeschrijving:

  1. Tekst: Wat je wilt zien (bijv. "een drukke haven").
  2. Ground Sample Distance (GSD): Hoe gedetailleerd de afbeelding moet zijn (bijv. 1 meter per pixel versus 32 meter per pixel).
  3. Coördinaten: De exacte breedtegraad en lengtegraad.

Dit stelt het model in staat om te zeggen: "Oké, je wilt een haven? Bij een resolutie van 1 meter in New York, teken ik kleine bootjes en kranen. Maar bij een resolutie van 32 meter in de Sahara, teken ik een brede, zanderige kustlijn." Het past zijn "penseelstreken" aan op basis van de fysieke realiteit van de locatie.

Het Geheime Ingrediënt: De Fluisterende "Leraar"

Het trainen van een 9 miljard parameters groot model vanaf nul is ongelooflijk moeilijk. Het is also kind een complexe taal leren leren zonder boeken; ze kunnen vastlopen of onzin gaan uitkramen. De onderzoekers merkten op dat zonder hulp de beelden van het model soms "gedesoriënteerd" waren of fragmentarische texturen hadden.

Om dit op te lossen, introduceerden ze een Geospatial Semantic Alignment (GSA) loss. Hier is de analogie: Stel je voor dat de student (GeoCore-9B) een kaart tekent. Naast hem zit een bevroren leraar (een gespecialiseerde AI genaamd DINOv3-Sat) die een expert is in het herkennen van terrein, maar niet is toegestaan om iets te tekenen. De leraar kijkt naar de schets van de student en fluistert: "Hé, die rivier ziet er een beetje grillig uit; echte rivieren zijn vloeiender," of "Dat bosperceel is te verspreid."

De student luistert en past zijn tekening aan om te voldoen aan de structurele hints van de leraar. Cruciaal is dat deze "leraar" alleen wordt gebruikt tijdens de trainingsfase. Zodra de student klaar is, wordt de leraar verwijderd. Dit betekent dat het uiteindelijke model net zo snel en lichtgewicht is als het zonder de leraar zou zijn, maar het heeft veel beter geleerd over structurele regels. Het artikel laat zien dat deze truc de kwaliteit van de gegenereerde beelden aanzienlijk verbeterde, waardoor wegen rechter werden en gebouwen realistischer werden, zonder extra kosten toe te voegen aan het eindproduct.

Wat Kan Het Doen?

De auteurs testten GeoCore-9B op verschillende manieren om te zien of het daadwerkelijk nuttig was, en niet alleen een generator van mooie plaatjes.

1. Tekst-naar-Beeld Generatie:
Wanneer gevraagd werd om scènes te tekenen op basis van tekst, presteerde GeoCore-9B beter dan eerdere modellen. Waar andere AI's worstelden met vreemde artefacten (zoals huizen die in de lucht zweven), produceerde GeoCore-9B beelden die eruit zagen als authentieke satellietfoto's. Het kon complexe prompts aan zoals "een dichtbebouwde metropool met meren en een metalen koepel" en kreeg de lay-out juist voor elkaar.

2. Schaalbewustzijn:
Een van de meest indrukwekkende prestaties was het vermogen om op commando van "zoomniveau" te veranderen. Als je vroeg om een resolutie van 1 meter, tekende het fijne details zoals individuele auto's en bomen. Als je vroeg om een resolutie van 32 meter, tekende het brede patronen zoals grote velden en stadswijken. Eerdere modellen raakten vaak in de war door kleine auto's te tekenen bij een lage zoom of gigantische bomen bij een hoge zoom. GeoCore-9B begreep de fysica van schaal.

3. De "Zonder-Tekst" Uitdaging:
De onderzoekers testten het model zelfs zonder het een tekstbeschrijving te geven, enkel met breedtegraad en lengtegraad. Verrassend genoeg kon GeoCore-9B nog steeds accuraat terrein genereren voor die specifieke locatie. Als je de coördinaten van de Sahara gaf, tekende het zandduinen. Als je de coördinaten van New York City gaf, tekende het wolkenkrabbers. Dit bewijst dat het model echt de "geografische priors" van de Aarde heeft geleerd, en niet alleen tekst-beeldparen heeft uit het hoofd geleerd.

4. Praktische Reddingmissies:
Het model was niet alleen bedoeld voor het maken van nieuwe plaatjes; het werd ook getest op het oplossen van echte problemen.

  • Wolkenverwijdering: Satellietcamera's worden vaak geblokkeerd door wolken. GeoCore-9B was in staat om naar een bewolkte afbeelding te kijken en te "hallucineren" (voorspellen) hoe de grond eronder uitzag, waardoor de wolken werden verwijderd en wegen en velden met hoge nauwkeurigheid zichtbaar werden.
  • SAR-naar-Optische Vertaling: Radarbeelden (SAR) zien eruit als statische ruis en zijn moeilijk te lezen voor mensen. GeoCore-9B kon een ruisig radarbeeld nemen en dit vertalen naar een heldere optische foto. Het deed dit beter dan veel gespecialiseerde tools die specifiek voor deze taak zijn ontworpen.

Het Oordeel

Het artikel suggereert dat GeoCore-9B een nieuwe standaard zet voor het genereren van aardobservatiedata. Het bewijst dat het trainen van een massief model vanaf nul op satellietdata, in plaats van het proberen aan te passen van natuurlijke beeldmodellen, tot betere resultaten leidt. Het model is niet alleen een "speeltje" dat mooie plaatjes maakt; het toont sterk potentieel voor real-world toepassingen zoals rampenmonitoring, stedelijke planning en milieumonitoring.

De auteurs merken echter voorzichtig op dat dit een startpunt is. Het model genereert momenteel RGB-beelden (kleur) en vertrouwt op een vooraf getrainde "encoder" (een tool die afbeeldingen comprimeert) die oorspronkelijk is ontworpen voor natuurlijke foto's. Dit betekent dat er beperkingen kunnen zijn aan de mate waarin het zeer kleine details perfect kan behouden. Ze wijzen er ook op dat, hoewel het model geweldig is in het genereren van beelden, we voorzichtig moeten zijn met "geografische deepfakes": valse beelden die zo echt lijken dat ze gebruikt kunnen worden om desinformatie over echte plaatsen te verspreiden.

Kortom, GeoCore-9B is een enorme sprong voorwaarts. Het is de eerste keer dat een model van deze omvang is gebouwd om specifiaal de aarde vanuit de ruimte te begrijpen, waarbij het leert de aarde te tekenen niet als een verzameling objecten, maar als een samenhangende, geografisch accurate kaart. Het suggereert dat de toekomst van aardobservatie ligt in modellen die de unieke geometrie van onze planeet respecteren, in plaats van te proberen deze in de vorm van een selfie te dwingen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →