Resumen Técnico: Estimación de la Biomasa Sobre el Suelo con Modelos Fundacionales Geoespaciales
Planteamiento del Problema
La estimación precisa de la Biomasa Sobre el Suelo (AGB, por sus siglas en inglés) a partir de imágenes satelitales es crítica para el monitoreo global de las reservas de carbono y las políticas climáticas. Sin embargo, la generación de mapas de AGB de alta resolución, globales y actualizados regularmente sigue siendo una tarea de regresión desafiante. Los enfoques actuales enfrentan tres limitaciones principales: (1) sesgos persistentes donde las señales satelitales se saturan sobre doseles densos, lo que conduce a una subestimación de la biomasa alta; (2) una distribución desigual de las etiquetas de referencia (por ejemplo, las huellas de GEDI están confinadas a latitudes inferiores a ~51.6°, excluyendo los bosques boreales); y (3) costos computacionales prohibitivos para procesar petabytes de datos de Observación de la Tierra (EO) a una resolución de 10 m. Si bien los Modelos Fundacionales Geoespaciales (GFM) han surgido como un paradigma para el aprendizaje de representaciones de propósito general a partir de datos de EO no etiquetados, su utilidad para tareas de regresión cuantitativa como la estimación de biomasa permanece en gran medida inexplorada, ya que la mayoría de los benchmarks existentes se centran en la clasificación y la segmentación.
Metodología
Los autores presentan un benchmark exhaustivo de los GFM para la estimación de AGB a escala global utilizando el conjunto de datos AGBD, un benchmark listo para el aprendizaje automático que abarca diversos biomas con aproximadamente 16 millones de muestras que emparejan valores de biomasa GEDI L4A con datos satelitales multifuente (Sentinel-2, ALOS-2 PALSAR-2 y características auxiliares).
El estudio distingue dos modos distintos de despliegue de GFM y los evalúa frente a una línea base de estado del arte (SOTA) totalmente supervisada:
- Codificadores Congelados (Distribución de Pesos): Se evaluaron 11 GFM distribuidos como pesos de modelo (por ejemplo, CROMA, Prithvi, SSL4EO-MoCo) dentro del marco PANGAEA. Estos modelos se ejecutaron como codificadores congelados, con solo un decodificador específico de la tarea (UPerNet) entrenado en la parte superior. Crucialmente, estos modelos fueron restringidos al subconjunto de características de entrada que soportan (principalmente bandas ópticas de Sentinel-2), careciendo de acceso a la variable L-band SAR y a las variables auxiliares disponibles en el conjunto de datos completo de AGBD.
- Embeddings Precomputados (Listos para Usar): Dos productos de embeddings, AlphaEarth Foundations (AEF) y TESSERA, fueron evaluados. Estos son representaciones por píxel, precomputadas, derivadas de datos de EO multimodales y multitemporales. Los autores probaron estos embeddings utilizando Sondas Lineales (LP), Perceptrones Multicapa (MLP) y la red totalmente convolucional de estado del arte (fcn_film).
La evaluación incluyó:
- Benchmarking Estándar: Comparación del RMSE en el conjunto de datos AGBD.
- Pruebas de Generalización: Evaluación del desempeño en escenarios de transferencia cero-shot entre regiones (entrenamiento en todas las regiones excepto la objetivo) y entre años (entrenamiento en 2019, prueba en 2020).
- Validación Operacional: Comparación de los resultados con el conjunto de datos independiente AGBref y el producto operacional de ESA CCI Biomass.
Contribuciones Clave
- Benchmark Exhaustivo: Los autores evaluaron 11 GFM de distribución de pesos y dos productos de embeddings en el conjunto de datos AGBD, el conjunto de datos de biomasa más grande y geográficamente diverso listo para aprendizaje automático disponible.
- Análisis Comparativo: Establecieron una comparación directa entre codificadores GFM congelados, embeddings precomputados y un modelo SOTA totalmente supervisado entrenado con las características puras de AGBD.
- Experimentos de Generalización: El estudio diseñó y analizó experimentos específicos para probar las capacidades de generalización geográfica (trans-continental) y temporal (trans-anual).
- Validación Operacional: Los resultados fueron validados contra un conjunto de referencia independiente (AGBref) y comparados con los mapas de biomasa de ESA CCI ampliamente utilizados.
Resultados
- Los Codificadores Congelados se Desempeñan Inferiormente: Cuando se ejecutan como codificadores congelados, los 11 GFM de distribución de pesos se desempeñan sustancialmente por debajo del modelo SOTA totalmente supervisado entrenado con las características puras de AGBD. El mejor GFM (SSL4EO-MoCo) logró un RMSE de 60.56 Mg/ha, comparado con los 53.73 Mg/ha de la línea base supervisada. Esta brecha se atribuye a la incapacidad de los modelos para ingerir datos de L-band SAR y datos auxiliares, así como a su restricción a entradas de fecha única o bandas específicas.
- Los Embeddings Precomputados Sobresalen: En contraste, los productos de embeddings precomputados demostraron ser altamente efectivos. Un MLP entrenado únicamente con los embeddings de AEF (52.22 Mg/ha) superó a la línea base supervisada entrenada con las características puras de AGBD. El mejor resultado general fue logrado por el modelo fcn_film entrenado con los embeddings de AEF aumentados con características puras seleccionadas (cobertura de la tierra, pendiente, aspecto, coordenadas), logrando un RMSE de 50.79 Mg/ha.
- Generalización: Los modelos basados en AEF demostraron una capacidad de generalización geográfica y temporal superior. En transferencias de región cero-shot (por ejemplo, hacia África y América del Sur), AEF redujo el RMSE entre un 17 y un 25% en comparación con las características puras. Sin embargo, en el sur de Asia, AEF por sí solo sufrió una caída en el desempeño en entornos zero-shot, lo cual fue mitigado por la configuración AEF+ (manteniendo las características puras). Temporalmente, los embeddings de AEF se mantuvieron estables a través de brechas de años donde las características espectrales puras se degradaron significativamente.
- Paridad Operacional: Cuando se evaluó contra el conjunto de datos independiente AGBref, el modelo entrenado con los embeddings de AEF (entrenado en solo 11 regiones) alcanzó una paridad cercana con el producto globalmente calibrado de ESA CCI en términos de R² y RMSE, a pesar del uso de datos de referencia distribuidos globalmente por este último.
Significancia y Reivindicaciones
El artículo sostiene que la promesa de los modelos fundacionales para el monitoreo ambiental cuantitativo se realiza mejor cuando un modelo entrenado en datos multimodales, multitemporales y ricos se distribuye como una capa de embedding precomputada y accesible, en lugar de como pesos para que los usuarios los ejecuten como codificadores congelados.
Los autores argumentan que:
- La Riqueza de la Entrada es Crítica: El desempeño superior de AEF y TESSERA proviene no solo de la escala de preentrenamiento, sino de la riqueza del contexto de entrada (multimodal, multitemporal) destilado en los embeddings. Los GFM de distribución de pesos a menudo carecen de la flexibilidad arquitectónica para ingerir los sensores específicos (por ejemplo, SAR de banda L) requeridos para una estimación precisa de la biomasa.
- Eficiencia y Accesibilidad: Los embeddings precomputados eliminan la necesidad de la extracción de características intensiva en GPU, permitiendo que modelos ligeros (como un simple MLP) superen a redes totalmente supervisadas complejas entrenadas con datos puros.
- Robustez: Los embeddings proporcionan representaciones ecológicas transferibles que generalizan mejor en el espacio y el tiempo, aunque retener las características puras (AEF+) ofrece una salvaguarda contra fallos fuera de la distribución en regiones ecológicamente distintas.
El estudio concluye que, si bien los rasgos de los GFM congelados pueden ser altamente informativos, su utilidad está actualmente limitada por las restricciones de entrada y las fricciones de ingeniería. El camino más efectivo hacia adelante implica, o bien hacer que los modelos de distribución de pesos sean lo suficientemente flexibles para manejar diversos tipos de entradas y resoluciones, o continuar sirviendo las representaciones como capas de embeddings precomputadas y listas para el análisis.