← Derniers articles
🤖 machine learning

InsightSR: Refining Symbolic Regression Search Spaces via Parallel Semantic and Structural LLM Guidance

InsightSR est un nouveau cadre de régression symbolique qui améliore le moteur de programmation génétique PySR en exploitant les grands modèles de langage pour affiner de manière itérative l'espace de recherche grâce à une guidance sémantique et structurelle, atteignant une précision et une généralisation de pointe en transformant la construction d'arbres d'expressions profonds en l'assemblage d'arbres peu profonds sur des caractéristiques sémantiquement informées.

Auteurs originaux : Yating Ling, Wenjing Cun, Zhitang Chen

Publié 2026-08-27
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Yating Ling, Wenjing Cun, Zhitang Chen

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

La science a toujours reposé sur une idée simple et puissante : que le comportement complexe du monde naturel peut être décrit par des lois mathématiques concises. Lorsqu'un physicien observe une pomme qui tombe ou une orbite planétaire, il ne voit pas seulement un mouvement ; il cherche l'équation cachée qui le régit. Cette recherche de la formule sous-jacente est appelée régression symbolique. Contrairement aux modèles informatiques standards qui apprennent des motifs en ajustant des millions de curseurs internes pour s'adapter aux données, la régression symbolique tente d'écrire l'équation elle-même, en utilisant des blocs de construction mathématiques familiers comme l'addition, la multiplication et les fonctions trigonométriques. L'objectif est de trouver une règle qui soit non seulement précise, mais aussi assez simple pour qu'un humain puisse la lire et la comprendre. Cependant, trouver ces règles est incroyablement difficile. Le nombre de combinaisons mathématiques possibles croît si rapidement qu'il devient un océan de possibilités vaste et chaotique. La plupart des recherches informatiques s'y perdent, produisant des formules qui s'adaptent parfaitement aux données mais qui n'ont aucun sens physique, ou elles échouent simplement à trouver la véritable loi car l'espace de recherche est trop vaste pour être exploré complètement.

Une équipe de chercheurs a développé une nouvelle approche pour naviguer dans ce chaos, combinant la puissance de recherche brute des algorithmes évolutionnaires avec la capacité de raisonnement des modèles de langage de grande taille. Leur système, nommé InsightSR, ne demande pas à l'ordinateur de deviner directement la réponse finale. Au lieu de cela, il utilise le modèle de langage comme un guide pour remodeler la recherche elle-même. Imaginez une équipe d'explorateurs tentant de trouver un chemin spécifique à travers une forêt dense et inexplorée. Dans l'ancienne méthode, les explorateurs erreraient au hasard, espérant tomber par chance sur le bon sentier. Dans cette nouvelle méthode, le modèle de langage agit comme un guide expérimenté qui connaît le terrain général. Il ne marche pas sur le chemin à leur place, mais il leur indique quelles directions sont physiquement impossibles à prendre et suggère quels outils pourraient être utiles pour le voyage.

Le système fonctionne en divisant la guidance en deux flux complémentaires. Le premier flux se concentre sur le « squelette » de l'équation. Le modèle de langage examine les unités physiques des données — par exemple, si une variable représente le temps, la distance ou la masse — et propose des structures de base qui doivent être cohérentes sur le plan dimensionnel. Cela signifie qu'il écarte toute combinaison mathématique qui violerait les lois de la physique, comme l'ajout d'une mesure de temps à une distance. En amorçant la recherche avec ces points de départ physiquement plausibles, le système évite de perdre du temps sur des milliards de formules impossibles. Le second flux se concentre sur les ingrédients eux-mêmes. Le modèle de langage suggère de nouvelles façons de transformer les données brutes, comme élever une variable au carré ou prendre son sinus, en se basant sur des motifs observés lors de tentatives précédentes. Ces nouveaux éléments sont ajoutés au réservoir d'ingrédients disponibles pour le moteur de recherche. Au fil du temps, le réservoir d'ingrédients s'enrichit, permettant au système de construire des relations complexes à partir de combinaisons simples et peu profondes plutôt que d'essayer de construire des arbres profonds et emmêlés de données brutes.

Ce processus n'est pas une supposition ponctuelle, mais une boucle continue de raffinement. Après que l'ordinateur a généré un ensemble d'équations candidates, le modèle de langage les évalue. Il vérifie non seulement si elles correspondent bien aux chiffres, mais aussi si les nouveaux éléments étaient utiles et si la structure fait sens. Ce retour d'information est stocké dans une base de connaissances dynamique qui informe le tour de recherche suivant. Le système apprend de ses succès et de ses échecs, rétrécissant progressivement la recherche vers les solutions les plus prometteuses. Cela crée un cycle d'autocorrection où la recherche devient plus ciblée et plus efficace à chaque itération.

Les chercheurs ont testé cette méthode sur trois ensembles de défis distincts. Premièrement, ils ont utilisé un test de référence comprenant 100 équations physiques célèbres, allant de la mécanique classique à la théorie quantique. Dans ce test, le système a réussi à retrouver la formule originale exacte 95 % du temps, une amélioration significative par rapport aux méthodes précédentes. Il a également obtenu des performances exceptionnelles sur un ensemble plus large de problèmes scientifiques couvrant la chimie, la biologie et la science des matériaux, atteignant une précision de plus de 80 % sur des tâches impliquant des transformations complexes. Enfin, l'équipe a testé le système sur des données du monde réel, telles que les vibrations d'un oscillateur et les schémas de croissance de bactéries. Dans ces scénarios, le système a non seulement trouvé des formules précises, mais a également maintenu ses performances lorsqu'il était testé sur des données qu'il n'avait jamais vues auparavant, démontant une forte capacité de généralisation.

Les résultats suggèrent qu'en intégrant un modèle de langage comme une couche de guidage autour d'un moteur de recherche traditionnel, il est possible de surmonter les doubles défis de l'immensité de l'espace de recherche et de la cohérence physique. Le système ne remplace pas la recherche évolutionnaire ; il la raffine, transformant une exploration aveugle et aléatoire en une découverte intentionnelle et guidée. En déplaçant la charge de la construction d'arbres profonds et complexes de variables brutes vers l'assemblage de combinaisons simples à partir d'un ensemble de caractéristiques préalablement enrichi, la méthode rend la découverte des lois scientifiques plus efficace et plus fiable. Cette approche offre une voie pratique vers la découverte scientifique automatisée, montrant que la combinaison du raisonnement humain et de la recherche basée sur la machine peut révéler les lois mathématiques cachées qui régissent notre monde.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →