Resumo Técnico: Um Framework Generativo para a Criação de População Sintética Multiatributo e Geograficamente Explícita
Definição do Problema
A criação de populações sintéticas multiatributo é fundamental para técnicas de geo-simulação, incluindo micro-simulação e modelagem baseada em agentes. No entanto, os métodos existentes enfrentam desafios significativos para reconstruir distribuições conjuntas regionais de atributos individuais utilizando apenas dados de nível agregado (por exemplo, estatísticas ao nível de setores censitários). Dados agregados registram distribuições marginais, mas carecem de informações sobre como os atributos coocorrem ao nível individual. Consequentemente, métodos tradicionais como o Ajustamento Proporcional Iterativo (IPF) ou a Amostragem Hierárquica dependem frequentemente de heurísticas fixas ou estruturas probabilísticas que falham em capturar a não-estacionariedade espacial. Isso leva a vieses demográficos internos (por exemplo, combinações irreais de idade-renda-escolaridade) e uma perda de heterogeneidade populacional, particularmente em regiões com perfis demográficos distintos. Além disso, embora métodos de otimização combinatória (CO) possam preservar distribuições específicas da região usando dados de nível individual, eles são computacionalmente caros, específicos para cada região e carecem de generalização para diferentes áreas geográficas.
Metodologia
Os autores propõem um framework generativo baseado em difusão hierárquica projetado para criar uma população sintética nacional e geograficamente explícita para os Estados Unidos (50 estados e Washington, D.C.). O framework opera em três etapas principais:
Preparação de Dados e Construção de Vetores:
- Alvos de Treinamento (p): Dados de nível individual da amostra de microdados do American Community Survey (ACS) PUMS de 2023, cobrindo 2.462 Áreas de Microdados de Uso Público (PUMAs), são usados para construir o alvo de treinamento. Isso envolve o mapeamento de variáveis PUMS para bins categóricos definidos em tabelas agregadas do ACS para criar um vetor de 3.000 dimensões que representa a verdadeira distribuição conjunta regional de cinco atributos: idade, gênero, escolaridade, emprego e renda.
- Vetores de Condição (c e h): Dados censitários de nível agregado (Tabelas Detalhadas do ACS) são convertidos em distribuições de probabilidade para formar o vetor de condição c, representando distribuições marginais. Adicionalmente, dados espaciais (POI e fluxos de comutação LODES) são agregados e codificados em um vetor de representação espacial h para capturar características funcionais e preservar a não-estacionariedade espacial.
Processo Generativo Hierárquico (Modelo de Difusão):
Para abordar a complexidade de prever uma distribuição conjunta de 3.000 dimensões em um único estágio, o framework emprega um processo de difusão em dois estágios:
- Estágio 1 (Geração Grossa): Um modelo de difusão prevê uma distribuição conjunta grossa (p^coarse) usando os vetores de condição c e h. O espaço alvo é reduzido de 3.000 combinações detalhadas para 960 combinações grossas através do agrupamento de categorias adjacentes ou substantivamente similares (por exemplo, comprimindo grupos de idade). Este estágio aprende a estrutura demográfica ampla enquanto preserva as variações espaciais.
- Estágio 2 (Refinamento de Grão Fino): Um segundo modelo de difusão refina as previsões grossas para a distribuição conjunta completa de 3.000 dimensões (p^). Ele recebe o grupo grosseiro g e sua probabilidade prevista como entrada, e então prevê a distribuição de probabilidade condicional (p^k∣ginner) para as combinações de grão fino dentro desse grupo. A probabilidade final para qualquer combinação específica k é calculada como o produto da probabilidade grossa e da probabilidade de refinamento interno grossa.
Geração de Indivíduos Sintéticos e Atribuição de Localização:
- Amostragem: Indivíduos sintéticos são amostrados a partir da distribuição conjunta completa p^ prevista para cada PUMA.
- Local de Residência: Os indivíduos são alocados a setores censitários específicos dentro de um PUMA usando um processo de ajuste proporcional iterativo restrito pela distribuição conjunta prevista e pelas distribuições marginais de idade e gênero dos dados de nível de setor do ACS. Coordenadas de residência explícitas (latitude/longitude) são atribuídas ao longo da rede viária residencial, espaçadas aproximadamente a 50 metros.
- Local de Trabalho: Indivíduos empregados são atribuídos a setores de trabalho baseados nas probabilidades de fluxo de comutação LODES de seu setor de residência. Coordenadas de local de trabalho explícitas são atribuídas ao longo de estradas secundárias e interseções.
Principais Contribuições
- Framework de Difusão Hierárquica: O artigo introduz uma nova arquitetura de difusão de dois estágios que consegue reconstruir distribuições conjuntas de cinco atributos de alta dimensão e alta complexidade, preservando a não-estacionariedade espacial, superando as limitações de modelos de estágio único e métodos de heurística fixa.
- População Geograficamente Explícita: O framework gera uma população sintética de 332.387.543 indivíduos em 2.462 PUMAs, completa com locais de residência e trabalho explícitos, em vez de apenas distribuições de atributos.
- Escalabilidade e Generalização: Ao contrário dos métodos de otimização combinatória que são específicos para cada região, este framework utiliza um modelo treinado para gerar populações para regiões excluídas do conjunto de treinamento, demonstrando transferibilidade por todo o país.
Resultados e Validação
O framework foi validado através de verificações de consistência interna e um experimento regional de controle (excluindo Michigan):
- Reconstrução da Distribuição Conjunta: As populações geradas alcançaram uma Distância de Variação Total (TVD) média de 0,116 contra as distribuições conjuntas alvo do PUMS, representando uma sobreposição de 88,4%.
- Consistência Marginal: A população sintética preservou as distribuições marginais com baixas diferenças absolutas médias (AAD) em comparação com os dados agregados do censo (ex: 0,0012 para idade, 0,0009 para gênero).
- Comparação com Baselines: No experimento de controle, o framework proposto superou o Ajustamento Proporcional Iterativo (IPF), a Otimização Combinatória (CO) e um Modelo Probabilístico de Difusão (DDPM) de estágio único. O método proposto alcançou uma TVD média de 0,119, representando uma melhoria de 6,3% sobre o IPF e CO, e uma melhoria de 19,1% sobre o baseline de DDPM de estágio único.
- Coocorrência de Atributos: A análise de decomposição pareada mostrou que o framework melhorou significativamente a reconstrução de combinações de atributos não registrados explicitamente em dados agregados (ex: educação–renda, idade–renda), indicando uma capacidade de inferir dependências socioeconômicas latentes.
Significância e Alegações
Os autores alegam que este framework fornece uma abordagem escalável e generalizada para a criação de populações sintéticas multiatributo e geograficamente explícitas tanto em níveis regionais quanto nacionais. Ao reconstruir distribuições conjuntas específicas de regiões com alta fidelidade, a população sintética resultante introduz comportamentos mais realistas em geo-simulações, como a modelagem baseada em agentes. Essa capacidade permite a exploração futura da emergência de fenômenos urbanos complexos impulsionados por interações humanas. O trabalho aborda a lacuna crítica entre dados censitários agregados e a necessidade de dados sintéticos de nível individual realistas que respeitem a heterogeneidade espacial.
Limitações e Trabalhos Futuros
Os autores reconhecem algumas limitações:
- Granularidade da Idade: O uso de restrições ao nível de PUMA resulta em grupos de idade em vez de idades exatas, particularmente para a faixa etária ampla de 5 a 17 anos.
- Localizações Diurnas: O framework atual não atribui locais diurnos (ex: escolas) para indivíduos menores de 18 anos, pois os dados LODES cobrem apenas adultos empregados.
- Atribuição Espacial: A precisão da atribuição de localização de residência e trabalho é limitada pelos dados espaciais disponíveis (redes viárias, POIs, fluxos de comutação). Trabalhos futuros visam incorporar sinais mais granulares para fortalecer a atribuição espacial.
Disponibilidade de Dados e Código
Os conjuntos de dados resultantes (organizados por estado em formato .csv) estão disponíveis no OSF, e todos os scripts de processamento, treinamento e validação estão disponíveis no GitHub.