Résumé Technique : Découverte d'Équations Scientifiques par LLM via l'Optimisation de Politique Régularisée par Tokens Informée par la Physique
1. Énoncé du Problème
La régression symbolique (SR) vise à distiller des équations mathématiques interprétables à partir de données observationnelles, servant ainsi de pierre angulaire à la découverte des lois physiques. Bien que les approches récentes exploitent les modèles de langage de grande taille (LLM) pour générer des hypothèses d'équations en capitalisant sur les acquis scientifiques pré-entraînés, les cadres existants souffrent de deux limitations critiques :
- Génération Statique : Les méthodes actuelles traitent les LLM comme des générateurs statiques, s'appuyant sur un guidage au niveau du prompt (apprentissage en contexte) pour orienter la recherche évolutive. Ce paradigme ne permet pas de mettre à jour les représentations internes du modèle basées sur le retour de la recherche, empêchant le modèle d'internaliser les signaux d'évaluation ou d'adapter sa stratégie de génération à la structure spécifique du problème.
- Recherche Agnostique à la Physique : Les cadres existants privilégient souvent la correction syntaxique au détriment de la validité physique. Sans contraintes rigoureuses, les LLM produisent fréquemment des équations qui s'ajustent numériquement aux données mais violent les principes physiques fondamentaux (par exemple, l'homogénéité dimensionnelle) ou contiennent des structures mathématiquement redondantes, menant au surapprentissage et à une inutilisabilité pratique.
Le défi consiste à transformer le LLM d'un proposant statique en un générateur adaptatif capable d'aligner dynamiquement sa distribution générative avec les caractéristiques structurelles et physiques du système cible.
2. Méthodologie : PiT-PO
Les auteurs proposent PiT-PO (Physics-informed Token-Regularized Policy Optimization), un cadre unifié qui fait le pont entre l'exploration évolutive pilotée par LLM et une vérification rigoureuse. Le cadre opère via un processus évolutif en boucle fermée piloté par deux mécanismes synergiques :
2.1 Évolution du LLM en cours de recherche
Contra-rément aux approches standards qui maintiennent le LLM figé, PiT-PO utilise l'Optimisation de Politique Relative de Groupe (GRPO) pour mettre à jour les paramètres du LLM pendant la recherche évolutive.
- Mécanisme : Le LLM est traité comme une politique πθ générant des séquences de tokens. La GRPO échantillonne un groupe de sorties, les évalue, et met à jour les paramètres de la politique pour maximiser une perte de substitution.
- Avantage : Ce réglage fin « en cours de recherche » permet au modèle de consolider des motifs symboliques efficaces et de guider l'exploration ultérieure plus efficacement, transformant les acquis scientifiques généraux en expertise spécifique au domaine à la volée.
2.2 Signaux d'Apprentissage à Doubles Contraintes
Pour garantir que les équations générées soient à la fois scientifiquement valides et structurellement parcimonieuses, PiT-PO introduit un mécanisme de double contrainte qui génère un feedback granulaire au niveau du token.
A. Contraintes Physiques Hiérarchiques
Un système de récompense impose la validité scientifique via un filtre hiérarchique :
- Contraintes de Niveau Général : Des pénalités pour l'Homogénéité Dimensionnelle (Pdim) et la Différentiabilité (Pdiff) afin d'élaguer les structures physiquement impossibles (ex: discordances d'unités).
- Contraintes Spécifiques au Domaine : Des connaissances expertes sont injectées sous forme de biais inductifs. Pour la modélisation de la turbulence, cela inclut des contraintes sur la Réalisabilité (valeurs propres positives du stress de Reynolds), la Cohérence des Conditions aux Limites (décroissance du stress aux parois), l'Échelle Asymptotique (mise à l'échelle cubique dans les sous-couches visqueuses) et la Cohérence Énergétique.
- Activation par Porte (Gated Activation) : Les pénalités physiques ne sont activées qu'après qu'une équation candidate atteint un seuil de précision d'ajustement de base, permettant une exploration « gratuite » lors des premières étapes avant d'imposer une conformité stricte.
B. Contraintes Mathématiques Guidées par des Théorèmes
Pour traiter la redondance mathématique, les auteurs introduisent le Théorème d'Exclusion de Support.
- Théorie : Ce théorème fournit une garantie théorique pour identifier les fausses découvertes (termes redondants) basée sur l'amplitude des coefficients ajustés par rapport à l'interférence interne et externe d'autres fonctions de base.
- Pénalité au niveau du Token : Si un terme est identifié comme redondant (son amplitude de coefficient tombe sous un seuil dérivé), une pénalité au niveau du token (Ptok) est appliquée aux tokens spécifiques constituant ce terme. Cette pénalité est logarithmique, imposant des pénalités plus fortes sur les termes ayant de plus petits coefficients.
2.3 Mise à Jour de la Politique Sensible aux Tokens
La GRPO standard assigne un avantage uniforme à tous les tokens d'une séquence. PiT-PO affine cela en synthétisant la récompense globale avec la pénalité au niveau du token.
- Avantage Sensible aux Tokens (A^i,k) : L'avantage pour le k-ième token est calculé en standardisant la récompense globale et en soustrayant la pénalité locale du token si celui-ci appartient à un terme redondant.
- Effet : Cela crée un paysage de « double pression » où les récompenses globales guident la politique vers des équations physiquement cohérentes, tandis que les pénalités locales extraient chirurgicalement les termes redondants, garantissant que la politique apprenne explicitement à supprimer les structures théoriquement redondantes.
2.4 Pipeline d'Entraînement
Le cadre utilise une topologie multi-îlots pour prévenir la convergence prématurée :
- Exploration par Îlots : Plusieurs îlots isolés font évoluer des lignées distinctes d'équations pour maintenir la diversité de la recherche.
- Évolution en cours de recherche : Les trajectoires de tous les îlots sont agrégées pour effectuer l'optimisation de la politique en utilisant LoRA (Low-Rank Adaptation) pour l'efficacité.
- Sélection Hiérarchique : Un mécanisme de sélection naturelle retient les candidats les plus performants et réinitialise les îlots sous-performants avec des graines à haute fitness.
3. Résultats Clés
3.1 Performance sur les Benchmarks
PiT-PO a été évalué sur le LLM-SR Suite et le LLM-SRBench contre des bases de référence de pointe (incluant GPlearn, PySR, uDSR, RAG-SR et LLM-SR).
- Précision : PiT-PO a atteint des performances de pointe, récupérant le plus grand nombre d'équations de vérité terrain. Sur le LLM-SR Suite, il a atteint 100 % de précision sur l'Oscillation 1 et 99,99 % sur l'Oscillation 2 (en utilisant le backbone 8B). Il a nettement surpassé les bases de référence sur la croissance d'E. coli et a obtenu des résultats compétitifs sur le Stress-Déformation, bien qu'il n'ait pas surpassé la base de référence 4o-mini sur ce dernier.
- Précision Symbolique : Sur LLM-SRBench (239 tâches), PiT-PO a obtenu la plus haute Précision Symbolique (SA) dans toutes les catégories (Chimie, Biologie, Physique, Science des Matériaux), démontrant une capacité supérieure à récupérer la forme symbolique correcte plutôt que de simplement ajuster numériquement.
- Efficacité : PiT-PO a démontré une convergence plus rapide et la capacité d'échapper aux régimes de stagnation où les méthodes de base (comme LLM-SR) plafonnent à un faible MSE mais avec des structures incorrectes.
3.2 Autonomisation des Petits Modèles
Une découverte significative est que PiT-PO permet à des modèles de petite échelle et open-source de rivaliser ou de surpasser de grands modèles propriétaires dans des contextes spécifiques.
- En utilisant un modèle Llama-3.2-1B quantifié, PiT-PO a atteint des performances compétitives ou supérieures à LLM-SR utilisant Mixtral 8x7B et 4o-mini sur les tâches d'Oscillation et la croissance d'E. coli. Cependant, sur la tâche Stress-Déformation, le modèle 1B (76,91 % de précision) était moins performant que la base de référence 4o-mini (85,33 %), indiquant que si le cadre réduit considérablement l'écart de capacité, il ne surpasse pas universellement tous les géants propriétaires sur chaque métrique.
- Cela suggère que l'optimisation de la politique en cours de recherche améliore efficacement les petits modèles, démocratisant l'accès aux outils de découverte scientifique de haute performance sur du matériel de classe grand public, particulièrement pour les tâches où la découverte structurelle est primordiale.
3.3 Application Réelle : Modélisation de la Turbulence
Le cadre a été appliqué pour découvrir des relations constitutives non linéaires pour l'anisotropie du stress de Reynolds dans un Écoulement sur Collines Périodiques.
- Performance : Le modèle découvert a amélioré les approches RANS traditionnelles (spécifiquement le modèle k−ω SST) en produisant des stress de Reynolds anisotropes plus proches des références de Simulation Numérique Directe (DNS).
- Fidélité Physique : Le modèle appris a montré une cohérence physique accrue, réduisant les extrêmes non physiques et fournissant des prédictions plus précises des bulles de séparation de flux et des coefficients de frottement pariétal par rapport aux méthodes RANS standards et autres méthodes de SR.
3.4 Études d'Ablation
Les études d'ablation ont confirmé la nécessité des deux composants :
- Supprimer les contraintes physiques (sans Phy) a entraîné une détérioration substantielle du NMSE et de la généralisation.
- Supprimer la régularisation par token (sans TokenReg) a entraîné la persistance de termes redondants et un écart de généralisation plus important entre les données de distribution interne (ID) et de distribution externe (OOD).
4. Signification et Revendications
L'article affirme que PiT-PO déplace fondamentalement le rôle des LLM dans la découverte scientifique, passant de proposants statiques à des générateurs adaptatifs et informés par la physique.
- Cohérence Scientifique : En intégrant des contraintes physiques hiérarchiques et une régularisation par token guidée par des théorèmes, PiT-PO aligne la génération avec la fitness numérique, la cohérence scientifique et la parcimonie simultanément.
- Démocratisation : La capacité de PiT-PO à autonomiser de petits modèles (ex: 1 milliard de paramètres) pour rivaliser avec des géants à code source fermé sur des tâches de découverte clés établit une méthodologie pratique pour la découverte scientifique automatisée qui ne dépend pas de ressources de calcul massives ou d'API propriétaires, bien que la performance varie selon la complexité de la tâche.
- Utilité Pratique : L'application réussie à la modélisation de la turbulence démontre que les corrections symboliques découvertes ont une valeur tangible dans les flux de travail d'ingénierie réels, améliorant les prédictions de champs d'écoulement au-delà de ce qui est possible avec les modèles linéaires standards.
Les auteurs concluent que cette approche établit un nouveau niveau de performance pour les benchmarks de SR et offre une voie robuste pour intégrer les connaissances physiques spécifiques au domaine dans la dynamique d'apprentissage des LLM.