Résumé Technique : Régression Symbolique Probabiliste pour la Découverte d'Équations via des Forêts Symboliques Régularisées et Induites par Opérateurs
1. Énoncé du Problème
La régression symbolique (SR) vise à découvrir des expressions analytiques interprétables qui régissent les relations entrées-sorties directement à partir de données, une tâche centrale en apprentissage automatique scientifique. Bien que les méthodes de SR existantes (par exemple, la programmation génétique, la régression symbolique profonde et les approches de compression de signal) aient montré des promesses, elles font face à des défis statistiques et computationnels importants :
- Dépendance aux Heuristiques : De nombreuses méthodes reposent sur des heuristiques de recherche stochastiques qui peinent à équilibrer la précision prédictive et la complexité de l'expression, particulièrement dans les jeux de données scientifiques bruités et de petits échantillons.
- Caractérisation de l'Incertitude : Les approches actuelles offrent une caractérisation limitée de l'incertitude symbolique, retournant souvent une expression unique « optimale » sans quantifier la plausibilité d'explications structurelles alternatives.
- Lacunes Théoriques : Il existe une rareté de traitements théoriques concernant les taux de concentration a posteriori pour la régression symbolique, particulièrement dans des conditions de spécification erronée ou de non-identifiabilité (où des expressions algébriquement distinctes produisent des prédictions identiques).
L'article traite ces lacunes en proposant un cadre probabiliste unifié qui traite les expressions symboliques comme des ensembles d'arbres, permettant une propagation complète de l'incertitude et des garanties théoriques rigoureuses.
2. Méthodologie : Le Cadre BayeSymX
Les auteurs introduisent BayeSymX (Bayesian Symbolic regression forests for eXpression discovery), un cadre probabiliste qui modélise la surface de régression inconnue f comme une combinaison affine d'arbres symboliques (une « forêt symbolique »).
2.1 Structure du Modèle
Le modèle suppose que les observations yi=f(xi)+ϵi, où :
yi=β0+j=1∑Kg(xi;Tj)βj+ϵi
Ici, g(x;Tj) représente l'évaluation du j-ème arbre symbolique Tj, et β sont les coefficients de régression extérieurs. Les arbres sont construits de manière récursive à partir d'une bibliothèque de caractéristiques primaires et d'opérateurs mathématiques (unaires et binaires).
2.2 Spécifications des Priors
Le cadre emploie une spécification bayésienne hiérarchique conçue pour régulariser la complexité et apprendre des préférences adaptatives aux données :
- Prior de Topologie d'Arbre : Une probabilité de division dépendante de la profondeur pm=α0(1+m)−δ0 pénalise les arbres profonds, imposant une forme de rasoir d'Occam qui favorise les représentations plus simples.
- Priors d'Opérateurs et de Caractéristiques : Contrairement aux approches à poids fixes, BayeSymX utilise des priors de Dirichlet sur les poids d'assignation des opérateurs et des caractéristiques spécifiques à chaque arbre. Cela permet au modèle d'apprendre de manière adaptative quels opérateurs et caractéristiques sont pertinents pour des arbres spécifiques.
- Coefficients de Régression : Des priors conjugués Normaux-Inverse-Gamma (NIG) sont placés sur les coefficients β et la variance du bruit σ2, assurant une propagation complète de l'incertitude à travers tous les paramètres du modèle.
2.3 Inférence A Posteriori
- Marginalisation : Les paramètres continus (β,σ2) sont marginalisés analytiquement via la conjugaison NIG, produisant une distribution a posteriori marginale jointe (JMP) sur l'espace discret des forêts symboliques.
- Échantillonnage : Un échantillonneur de type Metropolis-au-sein-d'un Gibbs partiellement effondré est utilisé pour explorer l'espace des expressions symboliques. L'échantillonneur emploie sept mouvements d'arbres locaux (croissance, élagage, remplacement de sous-arbre, suppression, insertion, changement de caractéristique, changement d'opérateur) pour naviguer dans l'espace discret.
- Sélection de Modèle (Fenêtre d'Occam) : Au lieu de sélectionner un seul meilleur arbre, BayeSymX utilise une approche de fenêtre d'Occam. Elle conserve un ensemble de forêts à haute probabilité a posteriori (Jr) pour capturer l'incertitude à travers plusieurs modèles symboliques plausibles.
- Raffinement : Une étape de raffinement post-MCMC utilise le critère d'information bayésien (BIC) pour élaguer les arbres redondants et simplifier algébriquement les expressions finales.
3. Contributions Clés
3.1 Garanties Théoriques
L'article établit de nouveaux résultats de concentration a posteriori pour la régression symbolique, un domaine manquant jusqu'alors de traitement théorique rigoureux :
- Réalisabilité Approchée : Sous des hypothèses de régularité modérées, les auteurs prouvent que le postérieur se concentre autour de la fonction génératrice de données réelle f0 à un taux régi par l'échange entre l'erreur d'approximation empirique et une nouvelle échelle de complexité symbolique (CK,S,n) dérivée.
- Taux Quasi-Paramétriques : Dans le cas d'une représentabilité symbolique finie exacte, le cadre atteint un taux de concentration quasi-paramétrique de O(n−1/2(lognloglogn)1/2).
- Spécification Erronée et Inégalités d'Oracle : Sous spécification symbolique erronée (où f0 n'est pas dans la classe du modèle), l'article établit un résultat de concentration d'oracle précis. Le postérieur se concentre autour de l'erreur d'approximation de la population optimale sans nécessiter l'existence d'un ensemble fini de minimiseurs de Kullback-Leibler ou de conditions de test spécialisées typiquement requises dans la théorie classique de la spécification erronée.
- Gestion de la Non-Identifiabilité : Les garanties sont formulées au niveau des fonctions prédictives, reconnaissant que de multiples structures symboliques distinctes peuvent représenter la même fonction.
3.2 Innovations Méthodologiques
- Forêts Induites par Opérateurs : L'utilisation de forêts (ensembles) plutôt que d'arbres uniques permet des structures scientifiques additives tout en maintenant l'interprétabilité.
- Apprentissage Adaptatif aux Données : Les priors de Dirichlet sur les poids d'opérateurs/caractéristiques permettent au modèle d'apprendre les préférences structurelles de manière adaptative, évitant les contraintes rigides des priors à poids fixes trouvés dans les méthodes de SR bayésiennes précédentes (ex: BSR).
- Synthèse Sensible à l'Incertitude : La stratégie de la fenêtre d'Occam fournit un moyen principled pour rapporter plusieurs hypothèses scientifiques concurrentes plutôt qu'une estimation ponctuelle unique.
4. Résultats Empiriques
Les auteurs évaluent BayeSymX par rapport aux concurrents de pointe (incluant gplearn, operon, PySR, DSR, QLattice, SISSO++, BMS et BSR) sur deux benchmarks distincts :
4.1 Équations de Feynman (SRBench)
- Configuration : Récupération de 5 lois physiques issues des cours de Feynman sous différents niveaux de bruit et complexités structurelles.
- Résultats : BayeSymX a systématiquement atteint un équilibre supérieur entre précision prédictive (RMSE de test le plus bas), parcimonie symbolique (expressions compactes) et récupération structurelle exacte. Les méthodes concurrentes ont souvent soit échoué à récupérer la structure correcte, soit produit des expressions trop complexes pour atteindre une précision similaire. BayeSymX a démontré une robustesse face à l'augmentation des niveaux de bruit là où les autres méthodes se sont dégradées de manière significative.
4.2 Découverte de Catalyseurs de Perovskite d'Oxyde
- Configuration : Découverte de « gènes de matériaux » (descripteurs) reliant la composition du catalyseur à l'activité de la réaction d'évolution de l'oxygène (OER).
- Résultats : BayeSymX a identifié des expressions de descripteurs compactes et scientifiquement interprétables (26–40 nœuds) qui ont récupéré des relations structure-activité connues (impliquant par exemple le facteur de tolérance μ, les électronégativités χA,χB). En revanche, des concurrents à haute précision comme operon ont produit des expressions lourdes (90–104 nœuds), tandis que des méthodes compactes comme PySR présentaient une performance prédictive plus faible. BayeSymX occupait la frontière de Pareto du compromis précision-complexité.
5. Signification et Revendications
L'article affirme que BayeSymX représente une avancée significative dans la régression symbolique probabiliste en :
- Unifiant Structure et Incertitude : Fournissant un cadre qui apprend conjointement la structure symbolique, contrôle la complexité via la régularisation et quantifie l'incertitude à travers plusieurs modèles plausibles.
- Rigueur Théorique : Offrant les premiers garanties de concentration a posteriori pour la régression symbolique qui gèrent à la fois la représentabilité exacte et la spécification erronée, établissant des taux quasi-paramétriques et des inégalités d'oracle précises.
- Utilité Scientifique : Démontrant que les approches probabilistes peuvent surpasser les méthodes heuristiques et basées sur le deep learning pour récupérer des lois scientifiques interprétables, particulièrement dans les régimes de faibles échantillons et de bruit typiques de la découverte de matériaux et de la physique.
Les auteurs concluent que le cadre est particulièrement adapté aux contextes de découverte scientifique où la connaissance du domaine guide la sélection des caractéristiques, mais où la forme fonctionnelle sous-jacente reste inconnue et nécessite une gestion robuste de l'incertitude structurelle.