Resumo Técnico: Regressão Simbólica Probabilística para Descoberta de Equações via Florestas Simbólicas Regularizadas e Induzidas por Operadores
1. Definição do Problema
A Regressão Simbólica (RS) visa descobrir expressões analíticas interpretáveis que regem as relações entrada-saída diretamente a partir de dados, uma tarefa central na aprendizagem de máquina científica. Embora os métodos de RS existentes (por exemplo, programação genética, regressão simbólica profunda e abordagens de compressão de sinais) tenham mostrado potencial, eles enfrentam desafios estatísticos e computacionais significativos:
- Dependência Heurística: Muitos métodos dependem de heurísticas de busca estocástica que lutam para equilibrar a precisão preditiva com a complexidade da expressão, particularmente em conjuntos de dados científicos ruidosos e de pequenas amostras.
- Caracterização de Incerteza: As abordagens atuais oferecem uma caracterização limitada da incerteza simbólica, frequentemente retornando uma única "melhor" expressão sem quantificar a plausibilidade de explicações estruturais alternativas.
- Lacunas Teóricas: Há uma escassez de tratamentos teóricos relativos às taxas de concentração posterior para regressão simbólica, particularmente sob condições de especificação incorreta ou não-identificabilidade (onde expressões algebricamente distintas produzem predições idênticas).
O artigo aborda essas lacunas propondo um framework probabilístico unificado que trata expressões simbólicas como conjuntos de árvores, permitindo a propagação total da incerteza e garantias teóricas rigorosas.
2. Metodologia: O Framework BayeSymX
Os autores introduzem o BayeSymX (Bayesian Symbolic regression forests for eXpression discovery), um framework probabilístico que modela a superfície de regressão desconhecida f como uma combinação afim de árvores simbólicas (uma "floresta simbólica").
2.1 Estrutura do Modelo
O modelo assume observações yi=f(xi)+ϵi, onde:
yi=β0+j=1∑Kg(xi;Tj)βj+ϵi
Aqui, g(x;Tj) representa a avaliação da j-ésima árvore simbólica Tj, e β são os coeficientes de regressão externos. As árvores são construídas recursivamente a partir de uma biblioteca de características primárias e operadores (unários e binários).
2.2 Especificações de Priors
O framework emprega uma especificação Bayesiana hierárquica projetada para regularizar a complexidade e aprender preferências adaptativas aos dados:
- Prior de Topologia de Árvore: Uma probabilidade de divisão dependente da profundidade pm=α0(1+m)−δ0 penaliza árvores profundas, impondo uma forma de navalha de Occam que favorece representações mais simples.
- Priors de Operador e Característica: Ao contrário de abordagens de pesos fixos, o BayeSymX utiliza priors de Dirichlet sobre os pesos de atribuição de operadores e características específicos de cada árvore. Isso permite que o modelo aprenda quais operadores e características são relevantes para árvores específicas de maneira adaptativa aos dados.
- Coeficientes de Regressão: Priors conjugados Normal-Inversa-Gamma (NIG) são colocados sobre os coeficientes externos β e a variância do ruído σ2, garantindo a propagação total da incerteza através de todos os parâmetros do modelo.
2.3 Inferência Posterior
- Marginalização: Os parâmetros contínuos (β,σ2) são marginalizados analiticamente usando a conjugação NIG, resultando em uma posterior conjunta marginal (JMP) sobre o espaço discreto das florestas simbólicas.
- Amostragem: Um amostrador Metropolis-within-partially-collapsed Gibbs é usado para explorar o espaço de expressão simbólica. O amostrador emprega sete movimentos locais de árvore (crescer, podar, substituição de subárvore, deletar, inserir, alterar característica, alterar operador) para navegar no espaço discreto.
- Seleção de Modelo (Janela de Occam): Em vez de selecionar uma única melhor árvore, o BayeSymX utiliza uma abordagem de janela de Occam. Ele retém um conjunto de florestas de alta probabilidade posterior (Jr) para capturar a incerteza entre múltiplos modelos simbólicos plausíveis.
- Refinamento: Um passo de refinamento pós-MCMC utiliza o Critério de Informação Bayesiano (BIC) para podar árvores redundantes e simplificar algebricamente as expressões finais.
3. Principais Contribuições
3.1 Garantias Teóricas
O artigo estabelece novos resultados de concentração posterior para regressão simbólica, um campo que carecia de tratamento teórico rigoroso:
- Realizabilidade Aproximada: Sob pressupostos de regularidade brandos, os autores provam que a posterior se concentra em torno da função geradora de dados real f0 a uma taxa governada pelo equilíbrio entre o erro de aproximação empírica e uma nova escala de complexidade simbólica (CK,S,n) derivada.
- Taxas Quase-Paramétricas: No caso de representabilidade simbólica finita exata, o framework atinge uma taxa de concentração quase-paramétrica de O(n−1/2(lognloglogn)1/2).
- Especificação Incorreta e Desigualdades Oráculo: Sob especificação simbólica incorreta (onde f0 não está na classe do modelo), o artigo estabelece um resultado de concentração oráculo agudo. A posterior se concentra em torno do erro de aproximação populacional ótimo sem exigir a existência de um conjunto finito de minimizadores de Kullback-Leibler ou condições de teste especializadas tipicamente necessárias na teoria clássica de especificação incorreta.
- Tratamento de Não-Identificabilidade: As garantias são formuladas ao nível de funções preditivas, reconhecendo que múltiplas estruturas simbólicas distintas podem representar a mesma função.
3.2 Inovações Metodológicas
- Florestas Induzidas por Operadores: O uso de florestas (ensembles) em vez de árvores únicas permite estruturas científicas aditivas mantendo a interpretabilidade.
- Aprendizado Adaptativo aos Dados: Os priors de Dirichlet sobre os pesos de operadores/características permitem que o modelo aprenda adaptativamente as preferências estruturais, evitando as restrições rígidas de priors de pesos fixos encontradas em métodos anteriores de RS Bayesiana (ex: BSR).
- Sumarização Consciente de Incerteza: A estratégia da janela de Occam fornece uma maneira fundamentada de relatar múltiplos modelos científicos concorrentes em vez de uma única estimativa pontual.
4. Resultados Empíricos
Os autores avaliam o BayeSymX contra competidores de estado da arte (incluindo gplearn, operon, PySR, DSR, QLattice, SISSO++, BMS e BSR) em dois benchmarks distintos:
4.1 Equações de Feynman (SRBench)
- Configuração: Recuperação de 5 leis físicas das Lições de Feynman sob níveis variáveis de ruído e complexidades estruturais.
- Descobertas: O BayeSymX alcançou consistentemente um equilíbrio superior entre precisão preditiva (menor RMSE de teste), parcimônia simbólica (expressões compactas) e recuperação estrutural exata. Métodos concorrentes frequentemente falharam em recuperar a estrutura correta ou produziram expressões excessivamente complexas para atingir a mesma precisão. O BayeSymX demonstrou robustez ao aumento dos níveis de ruído, onde outros métodos degradaram significativamente.
4.2 Descoberta de Catalisadores de Perovskita de Óxido
- Configuração: Descoberta de "genes de materiais" (descritores) que ligam a composição do catalisador à atividade de reação de evolução de oxigênio (OER).
- Descobertas: O BayeSymX identificou expressões de descritores compactas e cientificamente interpretáveis (26–40 nós) que recuperaram relações conhecidas de estrutura-atividade (envolvendo fator de tolerância μ, eletronegatividades χA,χB). Em contraste, competidores de alta precisão como o operon produziram expressões pesadas (90–104 nós), enquanto métodos compactos como o PySR mostraram menor desempenho preditivo. O BayeSymX ocupou a fronteira de Pareto do equilíbrio entre precisão-complexidade.
5. Significância e Alegações
O artigo afirma que o BayeSymX representa um avanço significativo na regressão simbólica probabilística ao:
- Unificar Estrutura e Incerteza: Fornecer um framework que aprende conjuntamente a estrutura simbólica, controla a complexidade via regularização e quantifica a incerteza entre múltiplos modelos plausíveis.
- Rigor Teórico: Oferecer as primeiras garantias de concentração posterior para regressão simbólica que lidam tanto com a representabilidade exata quanto com a especificação incorreta, estabelecendo taxas quase-paramétricas e desigualdades oráculo agudas.
- Utilidade Científica: Demonstrar que abordagens probabilísticas podem superar métodos heurísticos e baseados em aprendizagem profunda na recuperação de leis científicas interpretáveis, particularmente em regimes de amostras pequenas e ruidosos, típicos da descoberta de materiais e física.
Os autores concluem que o framework é particularmente adequado para cenários de descoberta científica onde o conhecimento de domínio guia a seleção de características, mas a forma funcional subjacente permanece desconhecida e requer um tratamento robusto da incerteza estrutural.