CAM-Bench: A Benchmark for Computational and Applied Mathematics in Lean
Cet article présente CAM-Bench, une nouvelle évaluation Lean 4 comprenant 1 000 problèmes formalisés en mathématiques appliquées et computationnelles qui remédie à la sous-représentation de ces domaines dans les évaluations existantes en utilisant un pipeline de récupération de dépendances pour adapter des exercices de manuels scolaires et en analysant les performances des grands modèles de langage sur des tâches nécessitant un suivi du contexte local et l'application de théorèmes élémentaires.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayiez d'enseigner à un robot brillant mais littéral comment faire des mathématiques. Vous avez deux façons de le tester :
- Le test « Corrigé » : Vous donnez au robot un problème de mathématiques, et il écrit le nombre final. Si le nombre est juste, vous lui donnez une étoile dorée. C'est ainsi que fonctionnent la plupart des tests actuels de mathématiques pour l'IA.
- Le test « Étape par étape » : Vous demandez au robot d'écrire chaque étape logique, comme une démonstration dans un manuel, puis vous vérifiez si chaque étape est logiquement inébranlable. C'est beaucoup plus difficile, mais cela prouve que le robot comprend réellement les mathématiques, et non qu'il devine simplement la réponse.
Ce papier présente un nouveau test « Étape par étape », ultra-sévère, appelé CAM-Bench.
Le Problème : Le Robot Ne Connait Que les Mathématiques « Olympiades »
Actuellement, la plupart des tests pour l'IA en mathématiques ressemblent à des énigmes d'Olympiades. Ce sont des casse-têtes astucieux et autonomes (comme « Prouvez que si X est vrai, alors Y est vrai »). L'IA excelle dans ces exercices car ils ressemblent à des jeux de logique isolés.
Mais les mathématiques du monde réel — comme l'ingénierie, la finance ou la physique — sont différentes. Ce n'est généralement pas une énigme bien rangée. C'est plutôt comme suivre une recette dans un livre de cuisine.
- La recette (le problème) suppose que vous savez déjà ce que signifie « faire revenir ».
- Elle suppose que vous avez un type spécifique de poêle (une définition du chapitre 3).
- Elle suppose que vous savez comment hacher des oignons (un algorithme du chapitre 1).
Si vous donnez simplement au robot la dernière phrase de la recette (« Faites la soupe »), il est perdu car il ne possède pas le « contexte local » (les définitions, les outils, les étapes précédentes) que l'auteur original supposait que vous aviez.
CAM-Bench est conçu pour tester si l'IA peut gérer cette mathématique de style « livre de cuisine », spécifiquement dans des domaines comme l'optimisation (trouver la meilleure façon de faire quelque chose), l'algèbre linéaire numérique (faire des mathématiques avec de gigantesques grilles de nombres) et l'analyse numérique (approximer des solutions).
La Solution : Le Pipeline « Détective du Contexte »
Les auteurs n'ont pas simplement pris des problèmes dans des manuels pour les donner à l'IA. Ils ont construit un pipeline sophistiqué (une chaîne de montage) pour préparer les problèmes. Imaginez cela comme un Détective du Contexte :
- La Preuve Brute : Ils commencent par un exercice de manuel désordonné qui dit : « Utilisez l'Algorithme 16.4 pour résoudre le Problème 16.76. »
- Le Travail d'Enquête : Le pipeline retourne dans le livre pour découvrir ce qu'est réellement « l'Algorithme 16.4 ». Il fouille les définitions, les formules et les hypothèses cachées dans les chapitres précédents.
- La Reconstruction : Il assemble toutes ces pièces dispersées en un seul grand « théorème informel » autonome. C'est comme prendre une recette qui dit « ajoutez la sauce secrète » et la réécrire sous la forme « ajoutez la sauce faite de tomates, de basilic et d'ail ».
- La Traduction : Enfin, il traduit cette histoire propre et autonome en Lean, un langage informatique strict qui agit comme un professeur de mathématiques super-pédant. Si la logique présente même un tout petit trou, Lean la rejette.
Les Résultats : L'IA est Bloquée dans le « Livre de Cuisine »
Les auteurs ont testé certains des modèles d'IA les plus intelligents au monde sur cette nouvelle référence. Voici ce qui s'est passé :
- L'Écart « Corrigé » : Les modèles d'IA étaient en fait plutôt bons pour résoudre les problèmes en anglais simple (obtenir la bonne réponse). Mais lorsqu'ils devaient écrire la preuve en Lean (le langage strict), leur taux de réussite s'est effondré.
- Analogie : C'est comme si l'IA pouvait vous dire comment faire un gâteau dans une conversation, mais si vous lui demandez d'écrire les instructions pour un robot qui ne peut pas deviner quoi que ce soit, le robot brûle la cuisine.
- L'Échec du « Contexte Local » : L'IA continuait d'oublier les « règles locales ». Elle tentait d'utiliser un outil qui n'existait pas dans le chapitre actuel, ou elle manquait une petite hypothèse (comme « le nombre doit être positif ») que le manuel sous-entendait mais n'explicitait pas dans cette phrase spécifique.
- Le Problème de la « Chaîne Longue » : Les vrais problèmes de mathématiques nécessitent souvent une longue chaîne de petites étapes (comme construire une maison brique par brique). Les modèles d'IA se perdaient souvent au milieu de la chaîne, oubliant ce qu'ils construisaient ou perdant le contrôle de l'objectif à long terme.
La Mise à Niveau « Agent »
Les chercheurs ont également essayé une méthode plus avancée où l'IA agit comme un détective humain avec une boîte à outils. Au lieu de simplement deviner la réponse, l'IA est autorisée à :
- Demander de l'aide à l'ordinateur (Lean) lorsqu'elle fait une erreur.
- Vérifier son propre travail.
- Réessayer en fonction du message d'erreur.
Cette approche « Agent » a bien mieux fonctionné, doublant le taux de réussite. Cependant, elle était encore loin d'être parfaite et coûtait beaucoup plus de « puissance cérébrale » (jetons informatiques) à exécuter.
Le Constat Final
CAM-Bench montre que si l'IA devient bonne pour résoudre des énigmes mathématiques, elle lutte toujours avec les mathématiques appliquées qui nécessitent de comprendre le contexte, de se souvenir des règles locales et de construire de longs arguments logiques étape par étape.
Le papier conclut que pour rendre l'IA véritablement fiable pour les mathématiques du monde réel, nous devons cesser de la tester sur des énigmes isolées et commencer à la tester sur ces problèmes « livres de cuisine » désordonnés et riches en contexte. Les modèles actuels ressemblent à des étudiants qui peuvent mémoriser les réponses mais qui n'ont pas encore appris à construire une maison à partir de zéro.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.