VeriSoftBench: Repository-Scale Formal Verification Benchmarks for Lean
Ce papier présente VeriSoftBench, un benchmark de 500 obligations de preuve en Lean 4 issu de projets de vérification logicielle réels, qui révèle que les modèles de langage performants en mathématiques peinent à s'adapter aux contextes de dépôts riches en dépendances et que la performance dépend fortement de la gestion efficace de ces dépendances transitoires.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
🍳 Le Problème : La Cuisine vs. La Bibliothèque de Recettes
Imaginez que vous apprenez à cuisiner avec un robot très intelligent (une IA).
- L'ancien défi (Mathlib) : Jusqu'à présent, on entraînait ces robots avec des exercices de mathématiques classiques. C'est comme si on leur donnait une bible de cuisine universelle (Mathlib) où tout le monde utilise les mêmes termes : "sel", "poivre", "four". Les recettes sont standardisées. Les robots sont devenus excellents pour résoudre ces problèmes parce qu'ils connaissent par cœur cette bible commune.
- Le nouveau défi (VeriSoftBench) : Mais dans la vraie vie, quand on vérifie des logiciels (comme un système de freinage de voiture ou un protocole bancaire), chaque entreprise crée sa propre cuisine. Ils inventent leurs propres ingrédients, leurs propres ustensiles et leurs propres règles. C'est comme si chaque restaurant avait son propre livre de recettes unique, rempli de termes bizarres que personne d'autre ne connaît, et où les recettes dépendent les unes des autres sur plusieurs étages.
VeriSoftBench, c'est un nouveau concours de cuisine créé par les chercheurs pour tester les robots dans ce contexte réel, chaotique et personnalisé.
🧪 Ce qu'ils ont créé : Le "Super-Marché" des Recettes
Les chercheurs ont collecté 500 défis (des preuves à écrire) provenant de vrais projets de logiciels open-source.
- L'ambiance : Contrairement aux anciens tests où tout était au même endroit, ici, pour résoudre un problème, le robot doit souvent aller chercher des informations dans d'autres fichiers, d'autres dossiers, et même dans d'autres bibliothèques du projet.
- L'analogie : C'est comme si on demandait au robot de préparer un gâteau, mais que la recette disait : "Utilisez la farine du tiroir B, le sucre du sous-sol du voisin, et la règle de cuisson du chapitre 4 du livre de l'année dernière". Le robot doit naviguer dans un immense labyrinthe pour trouver les bons ingrédients.
🔍 Les Trois Grandes Découvertes
En testant les meilleurs robots (les IA les plus avancées) sur ce nouveau défi, ils ont fait trois découvertes surprenantes :
Les champions des maths sont perdus dans le supermarché :
Les robots qui étaient des génies pour résoudre les problèmes de mathématiques (avec la bible universelle) se sont plantés ici. Ils ne savent pas s'adapter aux règles spécifiques de chaque projet. C'est comme un chef étoilé qui sait faire un parfait soufflé, mais qui panique quand on lui demande de cuisiner avec des ingrédients inventés sur place.Plus c'est compliqué, plus c'est dur (L'effet "Téléphone Arabe") :
Plus le robot doit faire de liens entre différents fichiers pour trouver la solution (plus la "chaîne de dépendances" est longue), moins il réussit.- Analogie : Imaginez que pour comprendre une phrase, vous devez d'abord lire un mot dans le chapitre 1, qui vous renvoie au chapitre 5, qui vous renvoie au chapitre 2, etc. Plus la chaîne est longue, plus le robot oublie le début de l'histoire et se trompe.
Donner la bonne recette aide, mais ne suffit pas :
Les chercheurs ont testé deux façons de donner les informations au robot :- Mode "Tout le supermarché" : On donne au robot tout le projet (des millions de pages). Il est noyé sous l'information et se perd.
- Mode "Panier de courses" (Curated) : On ne donne au robot que les ingrédients strictement nécessaires pour la recette. Ça marche mieux !
- Le bémol : Même avec le "panier de courses" parfait, les robots réussissent encore mal. Cela signifie que le problème n'est pas seulement de trouver l'information, mais de comprendre comment l'utiliser dans un contexte complexe.
💡 Pourquoi est-ce important ?
Jusqu'à présent, on pensait que les IA allaient bientôt pouvoir vérifier tous les logiciels automatiquement. Ce papier nous dit : "Attention, ce n'est pas encore pour demain !"
Les benchmarks actuels (les tests) sont trop faciles et trop "propres". Pour que les IA deviennent vraiment utiles dans le monde réel (pour sécuriser nos avions, nos banques, etc.), nous devons leur apprendre à naviguer dans des projets désordonnés, à comprendre le jargon spécifique de chaque équipe, et à faire des liens complexes entre des documents éloignés.
En résumé : VeriSoftBench est un nouveau terrain de jeu plus réaliste et plus difficile qui nous force à arrêter de surestimer nos IA et à travailler sur leur capacité à comprendre le "vrai monde" du développement logiciel.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.