← Últimos artículos
💻 computer science

GeoCore-9B: Towards Geo-Aware Generative Foundation Models in Earth Observation

El artículo presenta GeoCore-9B, un modelo fundacional generativo de 9 mil millones de parámetros entrenado desde cero con datos globales de observación de la Tierra utilizando un Transformador de Difusión basado en Flow Matching y una novedosa pérdida de Alineación Semántica Geoespacial para lograr un rendimiento de vanguardia en fidelidad visual y precisión estructural geográfica para diversas aplicaciones de EO.

Autores originales: Jeonghyeok Do, Munchurl Kim

Publicado 2026-08-04
📖 9 min de lectura🧠 Análisis profundo

Autores originales: Jeonghyeok Do, Munchurl Kim

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot a dibujar el planeta Tierra entero desde el espacio. Podrías pensar: "¡Fácil! Solo enséñale un millón de fotos de gatos, coches y atardeceres, y aprenderá a dibujar cualquier cosa". Pero aquí está el truco: las fotos de gatos se toman a la altura de los ojos, con perspectiva y sombras que hacen que las cosas parezcan 3D. Las fotos de satélite, sin embargo, se toman desde arriba, como un mapa. No tienen el mismo "sentimiento". Si intentas enseñar a un robot usando solo fotos de gatos, se confundirá. Podría intentar dibujar una ciudad con una línea de horizonte o hacer que un bosque parezca inclinado, porque está intentando aplicar reglas de "nivel de suelo" a una vista de "ojo de pájaro". Este es el gran rompecabezas que los científicos en Observación de la Tierra (EO) están tratando de resolver: ¿cómo construimos una IA que entienda la naturaleza única, plana y físicamente precisa de las imágenes de satélite sin que la engañen los hábitos de la fotografía convencional?

Entra GeoCore-9B, un nuevo artista digital que se niega a copiar las viejas formas. En lugar de intentar aprender de las fotos de gatos y luego "ajustarse" a sí mismo, este modelo fue entrenado desde cero —comenzando con un lienzo en blanco— usando solo 10 millones de imágenes de satélite reales. Piensa en él como un estudiante que se salta la clase de arte general y va directamente a una escuela especializada en cartografía. Este gigante de 9 mil millones de parámetros no solo adivina cómo se ve una ciudad; sabe exactamente dónde está. Se le puede decir: "Dibuja una ciudad densa en esta latitud y longitud específica, con esta resolución de terreno específica", y obedecerá.

Los investigadores descubrieron que al enseñar al modelo a prestar atención a las coordenadas del mundo real y a las escalas físicas, se crean imágenes que no solo son bonitas, sino geográficamente precisas. También descubrieron un truco ingenioso para ayudar al modelo a aprender más rápido: usaron una red "maestra" (una IA experta y congelada que ya sabe reconocer el terreno) para susurrar pistas al estudiante durante el entrenamiento. Esto no hizo que el modelo final fuera más lento o pesado; simplemente hizo que el proceso de aprendizaje fuera mucho más enfocado. ¿El resultado? GeoCore-9B puede generar vistas de satélite asombrosamente realistas, eliminar nubes de fotos borrosas e incluso traducir imágenes de radar (que parecen ruido estático) en imágenes ópticas claras. Esto sugiere que cuando dejamos de intentar que la observación de la Tierra encaje en el molde de la fotografía regular, podemos construir herramientas que realmente comprendan nuestro planeta.

El Problema: La Trampa de la "Foto de Gato"

Durante mucho tiempo, los mejores modelos de IA para generar imágenes fueron entrenados con los temas favoritos de internet: fotos naturales de personas, animales y paisajes. Estos modelos, como el famoso "Stable Diffusion", son increímente buenos creando arte. Pero cuando los científicos intentaron usar ellos para generar imágenes de satélite, las cosas salieron mal.

Imagina intentar enseñarle a un perro a nadar mostrándole fotos de pájaros. El perro podría intentar batir sus orejas o volar en lugar de nadar. Del mismo modo, estos modelos de IA estaban "sesgados" hacia la perspectiva. Esperaban que los objetos tuvieran un horizonte, que fueran vistos desde un ángulo y que tuvieran una escala "casual" específica. Pero las imágenes de satélite son ortográficas: son vistas directas desde arriba sin horizonte, donde una casa parece tener el mismo tamaño tanto si está en primer plano como en el fondo.

Cuando los investigadores intentaron forzar a estos modelos de "imágenes naturales" a dibujar mapas de satélite, los resultados fueron a menudo extraños. La IA dibujaba carreteras que se curvaban hacia el cielo o edificios que parecían inclinarse. Estaba intentando aplicar las reglas de una foto a nivel de calle a un mapa desde el espacio. El artículo argumenta que simplemente "ajustar" (hacer ajustes finos) estos modelos existentes no es suficiente porque el "cerebro" subyacente del modelo sigue pensando en términos de gatos y coches, no de continentes y ciudades.

La Solución: Un Modelo Nacido del Espacio

Para solucionar esto, los autores construyeron GeoCore-9B. Este es un modelo fundacional generativo masivo con 9 mil millones de parámetros. ¿La diferencia clave? No fue entrenado con la colección de fotos de internet. Fue entrenado exclusivamente con 10 millones de imágenes de satélite de un conjunto de datos llamado Git-10M.

Piensa en GeoCore-9B como un cartógrafo que nunca ha visto una foto a nivel de calle. Solo conoce el mundo desde arriba. Fue construido sobre una nueva arquitectura llamada Transformer de Difusión (DiT) utilizando Flow Matching. En términos simples, la "difusión" es como empezar con una nube de ruido estático y refinarla lentamente en una imagen clara, paso a paso. El "Flow Matching" es una forma más suave y eficiente de guiar ese ruido hacia una imagen clara, especialmente para modelos gigantes.

Pero un modelo que solo sabe dibujar no es suficiente; necesita saber dónde dibujar. GeoCore-9B es "geo-consciente". Toma tres entradas especiales junto con una descripción de texto:

  1. Texto: Lo que quieres ver (por ejemplo, "un puerto concurrido").
  2. Distancia de Muestreo del Terreno (GSD): Qué tan detallada debe ser la imagen (por ejemplo, 1 metro por píxel frente a 3^{\text{el}} 32 metros por píxel).
  3. Coordenadas: La latitud y longitud exactas.

Esto permite al modelo decir: "Bien, ¿quieres un puerto? A una resolución de 1 metro en Nueva York, dibujaré barcos y grúas diminutos. Pero a una resolución de 32 metros en el Sahara, dibujaré una costa arenosa amplia". Adapta sus "pinceladas" basándose en la realidad física de la ubicación.

La Fórmula Secreta: El Susurro del "Maestro"

Entrenar un modelo de 9 mil millones de parámetros desde cero es increíblemente difícil. Es como intentar enseñarle a un niño pequeño a hablar un lenguaje complejo sin libros; podría quedarse estancado o empezar a inventar tonterías. Los investigadores notaron que, sin ayuda, las imágenes del modelo a veces parecían "desorientadas" o tenían texturas fragmentadas.

Para resolverlo, introdujeron una pérdida de Alineación Semántica Geoespacial (GSA). Aquí está la analogía: Imagina que el estudiante (GeoCore-9B) está dibujando un mapa. Sentado junto a él hay un maestro congelado (una IA especializada llamada DINOv3-Sat) que es experto en reconocer el terreno pero no tiene permitido dibujar nada. El maestro mira el boceto del estudiante y le susurra: "Oye, ese río se ve un poco dentado; los ríos reales son más suaves", o "Ese parche de bosque está demasiado disperso".

El estudiante escucha y ajusta su dibujo para coincir con las pistas estructurales del maestro. Crucialmente, este "maestro" solo se utiliza durante la fase de entrenamiento. Una vez que el estudiante está listo, el maestro se retira. Esto significa que el modelo final es tan rápido y ligero como lo sería sin el maestro, pero aprendió reglas estructurales mucho mejores. El artículo muestra que este truco mejoró significamente la calidad de las imágenes generadas, haciendo que las carreteras fueran más rectas y los edificios más realistas, sin añadir ningún costo extra al producto final.

¿Qué Puede Hacer?

Los autores probaron GeoCore-9B de varias maneras para ver si era realmente útil, no solo un generador de imágenes bonitas.

1. Generación de Texto a Imagen:
Cuando se le pidió dibujar escenas basadas en texto, GeoCore-9B superó a los modelos anteriores. Mientras que otras IA luchaban con artefactos extraños (como casas flotando en el cielo), GeoCore-9B produjo imágenes que parecían fotos de satélite auténticas. Podía manejar prompts complejos como "una metrópolis densa con lagos y una cúpula metálica" y lograr el diseño correcto.

2. Conciencia de Escala:
Una de las hazañas más impresionantes fue su capacidad para cambiar su "nivel de zoom" bajo demanda. Si pedías una resolución de 1 metro, dibujaba detalles finos como coches y árboles individuales. Si pedías una resolución de 32 metros, dibujaba patrones amplios como grandes campos y bloques de la ciudad. Los modelos previos a menudo se confundían, dibujando coches diminutos en un zoom bajo o árboles gigantes en un zoom alto. GeoCore-9B entendía la física de la escala.

3. El Desafío de "Sin Texto":
Los investigadores incluso probaron el modelo sin darle ninguna descripción de texto, solo latitud y longitud. Sorprendentemente, GeoCore-9B aún podía generar un terreno preciso para esa ubicación específica. Si le dabas las coordenadas del Sahara, dibujaba dunas de arena. Si le dabas las coordenadas de la ciudad de Nueva York, dibujaba rascacielos. Esto demuestra que el modelo había aprendido verdaderamente los "priors geográficos" de la Tierra, no solo memorizado pares de texto-imagen.

4. Misiones de Rescate Prácticas:
El modelo no era solo para crear nuevas imágenes; también fue probado para solucionar problemas del mundo real.

  • Eliminación de Nubes: Las cámaras de satélite a menudo se ven bloqueadas por las nubes. GeoCore-9B fue capaz de mirar una imagen nublada y "alucinar" (predecir) cómo se veía el suelo debajo, eliminando las nubes y revelando carreteras y campos con alta precisión.
  • Traducción de SAR a Óptico: Las imágenes de radar (SAR) parecen ruido estático y son difíciles de leer para los humanos. GeoCore-9B podía tomar una imagen de radar ruidosa y traducirla en una foto óptica clara. Lo hizo mejor que muchas herramientas especializadas diseñadas para esta tarea.

El Veredicto

El artículo sugiere que GeoCore-9B establece un nuevo estándar para la generación de datos de observación de la Tierra. Demuestra que entrenar un modelo masivo desde cero con datos de satélite, en lugar de intentar adaptar modelos de imágenes naturales, conduce a mejores resultados. El modelo no es solo un "juguete" que hace imágenes bonitas; muestra un fuerte potencial para aplicaciones del mundo real como el monitoreo de desastres, la planificación urbana y el seguimiento ambiental.

Sin embargo, los autores advierten cuidadosamente que esto es un punto de partida. El modelo actualmente genera imágenes RGB (color) y depende de un "codificador" preentrenado (una herramienta que comprime imágenes) que fue diseñado originalmente para fotos naturales. Esto significa que puede haber algunos límites en cuanto a cuántos detalles minúsculos puede preservar perfectamente. También señalan que, aunque el modelo es excelente generando imágenes, debemos tener cuidado con los "deepfakes geográficos": imágenes falsas que parecen tan reales que podrían usarse para difundir desinformación sobre lugares reales.

En resumen, GeoCore-9B es un gran salto adelante. Es la primera vez que un modelo de este tamaño se construye específicamente para entender la Tierra desde el espacio, aprendiendo a dibujar nuestro planeta no como una colección de objetos, sino como un mapa coherente y geográficamente preciso. Sugiere que el futuro de la observación de la Tierra reside en modelos que respeten la geometría única de nuestro planeta, en lugar de intentar forzarla en la forma de un selfie.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →