← Derniers articles
⚛️ phenomenology

LLM-Based FORM Code Generation with Verification-Driven Fine-Tuning

Cet article traite du manque de support de l'IA pour le langage de manipulation symbolique FORM en démontrant que les modèles de langage de pointe échouent aux tâches FORM en zero-shot, puis introduit un pipeline de fine-tuning piloté par la vérification utilisant le binaire FORM comme oracle pour entraîner un modèle compact de 8 milliards de paramètres qui surpasse des modèles de pointe beaucoup plus grands en matière d'exécution de code et de correction tout en préservant les capacités de raisonnement général.

Auteurs originaux : Bakar Chargeishvili

Publié 2026-09-22
📖 4 min de lecture🧠 Analyse approfondie

Auteurs originaux : Bakar Chargeishvili

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Dans le monde subatomique, où les particules entrent en collision et se désintègrent en des fractions de seconde, les physiciens théoriciens s'appuient sur un langage spécialisé pour décrire les mathématiques de leurs découvertes. Ce langage, nommé Form, n'est pas un outil de programmation à usage général, mais un système hautement spécifique conçu pour gérer des expressions algébriques d'une complexité phénoménale. Lorsque les scientifiques calculent le comportement des particules en utilisant la théorie quantique des champs, les formules qui en résultent peuvent contenir des millions, voire des milliards de termes. Les programmes informatiques à usage général plantent souvent face à des calculs aussi massifs, mais Form est conçu pour les gérer en stockant les étapes intermédiaires sur un disque dur plutôt que dans la mémoire de l'ordinateur. Depuis des décennies, cet outil est devenu indispensable pour percer les secrets de l'univers, pourtant il reste difficile à apprendre. Sa syntaxe est unique, ses règles sont impitoyables, et jusqu'à présent, il n'existait aucune intelligence artificielle capable d'aider un humain à écrire du code pour lui.

Ce fossé technologique a présenté un défi unique pour les chercheurs de l'Institut de technologie de Karlsruhe. Ils ont posé une question fondamentale : une intelligence artificielle moderne, entraînée sur de vastes quantités de données issues d'Internet, pourrait-elle apprendre à écrire du code pour un langage qui existe à peine dans ces données ? La réponse qu'ils ont trouvée est un non catégorique. Lorsqu'ils ont testé les modèles d'IA les plus puissants et les plus avancés disponibles — certains contenant des centaines de milliards de paramètres — ces géants de l'intelligence artificielle ont totalement échoué. Sans manuel ni guide pour les guider, ils n'ont pas pu générer une seule ligne de code Form valide. Pour l'IA, ce langage était effectivement invisible, un domaine à ressources nulles où la taille même du modèle importait moins que l'absence d'un entraînement spécifique.

Pour résoudre ce problème, les chercheurs ont adopté une approche différente. Au lieu de compter sur un modèle massif pour deviner les règles, ils ont construit une IA spécialisée, plus petite, et l'ont instruite à l'aide d'une méthode rigoureuse et auto-correctrice. Ils ont créé un pipeline dans lequel une IA puissante générait des programmes candidats basés sur de simples instructions en anglais, mais ces programmes n'étaient pas acceptés immédiatement. Au lieu de cela, ils étaient injectés dans le logiciel Form proprement dit pour vérifier s'ils s'exécutaient correctement. Si le code produisait une erreur ou un résultat erroné, il était rejeté. Seuls les programmes ayant passé chaque contrôle — syntaxe, exécution et cohérence logique — étaient conservés. Ce processus a généré une bibliothèque vérifiée de plus de 4 600 exemples, allant de tutoriels simples à des calculs de physique complexes.

En utilisant ces données de haute qualité et vérifiées, l'équipe a affiné un modèle d'IA compact de huit milliards de paramètres. Le résultat fut un spécialiste surpassant les modèles les plus grands et les plus coûteux du monde. Sur un ensemble de 664 tâches de calcul spécifiques, ce petit modèle spécialisé en a résolu 97,7 % correctement. En revanche, les plus grands modèles de pointe, même lorsqu'ils disposaient d'un guide de syntaxe à consulter, n'ont réussi à générer un code syntaxiquement valide et exécutable que pour environ 75 % de ces mêmes tâches. L'avantage était encore plus marqué sur les tâches ouvertes où l'objectif était décrit mais la méthode non spécifiée ; le modèle spécialisé réussissait à générer un code exécutable 83 % du temps, tandis que les meilleurs modèles géants n'y parvenaient que 60 % du temps.

Plus surprenant encore, les chercheurs ont découvert que cet entraînement spécialisé n'avait pas fait « oublier » à l'IA ses autres compétences. Le modèle a conservé ses capacités de raisonnement général et de codage, ne montrant qu'une infime baisse de performance sur les tests standards de mathématiques et de logique. Cela suggère qu'enseigner une compétence de niche à une IA ne nécessite pas de sacrifier son intelligence générale. L'étude démontre que pour les langages scientifiques hautement spécialisés, la clé du succès ne réside pas dans la taille brute du modèle, mais dans la qualité et la vérification des données dont il apprend. En utilisant le logiciel lui-même comme enseignant pour vérifier chaque leçon, les chercheurs ont créé un outil qui peut désormais assister les physiciens dans l'écriture du code complexe nécessaire à l'exploration des lois fondamentales de la nature, abaissant ainsi la barrière à l'entrée pour un langage qui constitue depuis longtemps un goulot d'étranglement en physique des hautes énergies.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →