Resumen Técnico: Un Marco Generativo para la Creación de una Población Sintética Multiatributo y Geográficamente Explícita
Planteamiento del Problema
La creación de poblaciones sintéticas con múltiples atributos es fundamental para las técnicas de geosimulación, incluyendo la microsimulación y el modelado basado en agentes. Sin embargo, los métodos existentes enfrentan desafíos significativos para reconstruir las distribuciones conjuntas de atributos individuales a nivel regional utilizando únicamente datos agregados (por ejemplo, estadísticas a nivel de sector censal). Los datos agregados registran distribuciones marginales, pero carecen de información sobre cómo coocurren los atributos a nivel individual. En consecuencia, los métodos tradicionales como el Ajuste Proporcional Iterativo (IPF) o el Muestreo Jerárquico suelen depender de heurísticas fijas o estructuras probabilísticas que no logran capturar la no estacionariedad espacial. Esto conduce a sesgos demográficos internos (por ejemplo, combinaciones poco realistas de edad-ingresos-educación) y a una pérdida de la heterogeneidad poblacional, particularmente en regiones con perfiles demográficos distintos. Además, aunque los métodos de optimización combinatoria (CO) pueden preservar las distribuciones específicas de cada región utilizando datos a nivel individual, son computacionalmente costosos, específicos de cada región y carecen de generalización entre diferentes áreas geográficas.
Metodología
Los autores proponen un marco generativo jerárquico basado en la difusión, diseñado para crear una población sintética nacional y geográficamente explícita para los Estados Unidos (50 estados y Washington, D.C.). El marco opera en tres pasos principales:
Preparación de Datos y Construcción de Vectores:
- Objetivos de Entrenamiento (p): Se utilizan datos a nivel individual de la Muestra de Microdatos de Uso Público (PUMS) de 2023 de la Encuesta sobre la Comunidad Estadounidense (ACS), que cubre 2,462 Áreas de Microdatos de Uso Público (PUMAs), para construir el objetivo de entrenamiento. Esto implica mapear las variables de PUMS a contenedores categóricos definidos en tablas agregadas de la ACS para crear un vector de 3,000 dimensiones que representa la verdadera distribución conjunta regional de cinco atributos: edad, género, educación, empleo e ingresos.
- Vectores de Condición (c y h): Los datos censales agregados (Tablas Detalladas de la ACS) se convierten en distribuciones de probabilidad para formar el vector de condición c, que representa las distribuciones marginales. Adicionalmente, los datos espaciales (Puntos de Interés - POI y flujos de conmutación LODES) se agregan y codifican en un vector de representación espacial h para capturar las características funcionales y preservar la no estacionariedad espacial.
Proceso Generativo Jerárquico (Modelo de Difusión):
Para abordar la complejidad de predecir una distribución conjunta de 3,000 dimensiones en una sola etapa, el marco emplea un proceso de difusión de dos etapas:
- Etapa 1 (Generación Gruesa): Un modelo de difusión predice una distribución conjunta gruesa (p^coarse) utilizando los vectores de condición c y h. El espacio objetivo se reduce de 3,000 combinaciones de grano fino a 960 combinaciones gruesas mediante la agrupación de categorías adyacentes o sustantivamente similares (por ejemplo, comprimiendo grupos de edad). Esta etapa aprende la estructura demográfica amplia preservando las variaciones espaciales.
- Etapa 2 (Refinamiento de Grano Fino): Un segundo modelo de difusión refina las predicciones gruesas en la distribución conjunta completa de 3,000 dimensiones (p^). Este toma el grupo grueso g y su probabilidad predicha como entrada, y luego predice la distribución de probabilidad condicional (p^k∣ginner) para las combinaciones de grano fino dentro de ese grupo. La probabilidad final para cualquier combinación específica k se calcula como el producto de la probabilidad gruesa y la probabilidad de refinamiento interna-gruesa.
Generación de Individuos Sintéticos y Asignación de Ubicación:
- Muestreo: Los individuos sintéticos se muestrean a partir de la distribución conjunta completa predicha p^ para cada PUMA.
- Ubicación de Residencia: Los individuos se asignan a sectores censales específicos dentro de un PUMA utilizando un proceso de ajuste proporcional iterativo, restringido por la distribución conjunta predicha y las distribuciones marginales de edad y género de los datos de la ACS a nivel de sector. Se asignan coordenadas de residencia explícitas (latitud/longitud) a lo largo de la red vial residencial, espaciadas aproximadamente cada 50 metros.
- Ubicación de Trabajo: Los individuos empleados se asignan a sectores de trabajo basados en las probabilidades de flujo de conmutación de LODES desde su sector de residencia. Se asignan coordenadas de lugar de trabajo explícitas a lo largo de vías secundarias e intersecciones.
Contribuciones Clave
- Marco de Difusión Jerárquica: El artículo introduce una novedosa arquitectura de difusión de dos etapas que logra reconstruir distribuciones conjuntas complejas y de alta dimensión de cinco atributos, preservando la no estacionariedad espacial, superando las limitaciones de los modelos de una sola etapa y los métodos de heurística fija.
- Población Geográficamente Explícita: El marco genera una población sintética de 332,387,543 individuos a través de 2,462 PUMAs, con ubicaciones explícitas de hogar y trabajo, en lugar de solo distribuciones de atributos.
- Escalabilidad y Generalización: A diferencia de los métodos de optimización combinatoria que son específicos de una región, este marco utiliza un modelo entrenado para generar poblaciones para regiones excluidas del conjunto de entrenamiento, demostrando transferibilidad a través de toda la nación.
Resultados y Validación
El marco fue validado mediante verificaciones de consistencia interna y un experimento regional de control (excluyendo Michigan):
- Reconstrucción de la Distribución Conjunta: Las poblaciones generadas lograron una Distancia de Variación Total (TVD) media de 0.116 contra las distribuciones conjuntas objetivo de PUMS, lo que representa un solapamiento del 88.4%.
- Consistencia Marginal: La población sintética preservó las distribuciones marginales con diferencias absolutas promedio (AAD) bajas en comparación con los datos censales agregados (por ejemplo, 0.0012 para edad, 0.0009 para género).
- Comparación con Líneas Base: En el experimento de control, el marco propuesto superó al Ajuste Proporcional Iterativo (IPF), a la Optimación Combinatoria (CO) y a un Modelo Probabilístico de Difusión (DDPM) de una sola etapa. El método propuesto logró una TVD media de 0.119, lo que representa una mejora del 6.3% sobre IPF y CO, y una mejora del 19.1% sobre la línea base de DDPM de una sola etapa.
- Coocurrencia de Atributos: El análisis de descomposición por pares mostró que el marco mejoró significativamente la reconstrucción de combinaciones de atributos no registrados explícitamente en los datos agregados (por ejemplo, educación–ingresos, edad–ingresos), indicando una capacidad para inferir dependencias socioeconómicas latentes.
Significancia y Reivindicaciones
Los autores afirman que este marco proporciona un enfoque escalable y generalizado para la creación de poblaciones sintéticas multiatributo y geográficamente explícitas tanto a nivel regional como nacional. Al reconstruir las distribuciones conjuntas específicas de cada región con alta fidelidad, la población sintética resultante introduce comportamientos más realistas en las geosimulaciones, como el modelado basado en agentes. Esta capacidad permite la exploración posterior del surgimiento de fenómenos urbanos complejos impulsados por las interacciones humanas. El trabajo aborda la brecha crítica entre los datos censales agregados y la necesidad de datos sintéticos a nivel individual que sean realistas y respeten la heterogeneidad espacial.
Limitaciones y Trabajo Futuro
Los autores reconocen algunas limitaciones:
- Granularidad de la Edad: El uso de restricciones a nivel de PUMA resulta en grupos de edad en lugar de edades exactas, particularmente para el rango de edad amplio de 5 a 17 años.
- Ubicaciones Diurnas: El marco actual no asigna ubicaciones diurnas (por ejemplo, escuelas) para individuos menores de 18 años, ya que los datos de LODES solo cubren a adultos empleados.
- Asignación Espacial: La precisión de la asignación de ubicación de hogar y lugar de trabajo está limitada por la disponibilidad de datos espaciales (redes viales, POIs, flujos de conmutación). El trabajo futuro busca incorporar señales de mayor granularidad para fortalecer la asignación espacial.
Disponibilidad de Datos y Código
Los conjuntos de datos resultantes (organizados por estado en formato .csv) están disponibles en OSF, y todos los scripts de procesamiento, entrenamiento y validación están disponibles en GitHub.