First Proof Second Batch
Cet article évalue les capacités des systèmes d'IA actuels à résoudre des mathématiques de niveau recherche en présentant les problèmes, la méthodologie et les résultats de l'évaluation de plusieurs modèles d'IA sur dix problèmes distincts fournis par des mathématiciens, ainsi que des documents supplémentaires incluant des solutions humaines et des rapports de réviseurs.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez un groupe de mathématiciens décidant d'organiser un « concours de cuisine » à enjeux élevés, mais au lieu de préparer des gâteaux, ils demandent à une Intelligence Artificielle de concocter de nouvelles preuves mathématiques. Ce document est le bulletin de notes officiel du deuxième tour de ce concours, appelé First Proof Second Batch.
Voici l'histoire de ce qui s'est passé, décomposée en termes simples.
La Mise en Place : Un Nouvel Examen
Lors du premier tour de cette expérience, les organisateurs ont laissé n'importe qui tenter de résoudre les problèmes. C'était un peu comme une porte ouverte. Pour ce deuxième tour, ils voulaient être beaucoup plus stricts et scientifiques.
- Les Chefs (Les Systèmes d'IA) : Ils ont invité quatre « chefs » spécifiques pour la compétition. Il ne s'agissait pas de simples ordinateurs ; c'étaient des systèmes d'IA avancés conçus par de grandes universités (comme UCLA et Princeton) et une entreprise (OpenAI).
- Les Ingrédients (Les Problèmes) : Les organisateurs ne leur ont pas donné de vieux problèmes de mathématiques résolus trouvés dans les manuels. Au lieu de cela, ils leur ont donné 10 nouveaux puzzles non résolus que de vrais mathématiciens humains avaient récemment découverts dans leurs propres recherches. C'étaient des problèmes qui n'avaient pas encore été postés sur Internet ou publiés dans des revues.
- Les Règles : L'IA devait résoudre ces problèmes par elle-même, sans que des humains ne lui murmurent des réponses à l'oreille. Les organisateurs ont surveillé chaque étape, enregistré chaque mot tapé par l'IA et tenu un registre strict du coût de fonctionnement de la « cuisine ».
Le Jugement : Un Test de Dégustation à l'Aveugle
Une fois que l'IA a soumis ses « plats » (les preuves), un panel de 30 mathématiciens experts a fait office de juges. Pour être équitable, les juges ne savaient pas quelle IA avait préparé quel plat. Ils ont attribué à chaque solution une note :
- Essentiellement Impeccable : Un plat parfait, prêt à être servi.
- Révisions Mineures : Délicieux, mais nécessite une pincée de sel supplémentaire ou une meilleure garniture.
- Révisions Majeures : Le plat principal est là, mais la sauce est brûlée ou les ingrédients manquent. Cela nécessite beaucoup de travail.
- Rejeté : Le plat est immangeable.
Les Résultats : Un Bilan Mitigé
1. Les Moments « Wow » (Succès)
- L'Invité Surprise : Pour un problème impliquant des équations de fluides complexes (Problème 5), une IA n'a pas seulement copié une solution humaine ; elle a inventé une nouvelle façon de le résoudre. Les juges étaient si impressionnés qu'ils l'ont qualifiée d'« essentiellement impeccable ». C'était comme si un chef inventait une nouvelle technique de cuisine à laquelle aucun humain n'avait pensé auparavant.
- Les Copieurs : Pour un autre problème (Problème 6), deux IA ont réussi à le résoudre parfaitement. Elles ont suivi le chemin de la solution humaine, mais avec une telle précision mécanique que les juges ont déclaré : « C'est mathématiquement correct, même si le style d'écriture est un peu robotique. »
2. Les Problèmes d'« Hallucination » (Échecs)
- Les Citations Fictives : Un problème récurrent était que les IA citaient avec assurance des livres ou des articles qui n'existaient pas ou qui ne disaient pas ce que l'IA affirmait. C'était comme un chef disant : « Cette sauce est faite avec un ingrédient secret d'un célèbre chef français », mais quand on vérifie le livre, ce chef n'a jamais écrit à ce sujet.
- Le Plagiat : Dans un cas, une IA a résolu un problème de géométrie en copiant le travail précédent d'un mathématicien humain presque mot pour mot, utilisant les mêmes étiquettes et termes étranges, mais a oublié de citer sa source. Si un étudiant humain avait fait cela, il serait expulsé pour tricherie.
- Le Mauvais Tournant : Pour plusieurs problèmes, les IA ont tenté de prouver des choses qui étaient en réalité fausses, ou se sont retrouvées bloquées dans des boucles de non-sens. Une IA a tenté de résoudre un problème de géométrie en inventant un théorème qui n'existait pas, mentant essentiellement aux juges pour faire paraître sa preuve complète.
3. Le Coût de la Cuisine
Le rapport a également examiné le « prix » du repas.
- Certains systèmes d'IA étaient peu coûteux mais faisaient des erreurs.
- D'autres étaient incroyablement chers, coûtant des milliers de dollars de temps informatique pour produire une seule solution.
- Les solutions les plus réussies nécessitaient souvent le plus de « temps de réflexion » (tokens) et d'argent.
La Grande Conclusion
Le document conclut que l'IA devient très bonne pour les mathématiques de routine. Si un problème ressemble à quelque chose qu'elle a déjà vu, ou s'il suffit de suivre une recette connue, l'IA peut bien le faire.
Cependant, lorsqu'il s'agit de véritable créativité — inventer une idée totalement nouvelle, repérer un lien profond entre deux domaines sans rapport, ou éviter le piège de l'invention de faits — l'IA est encore en difficulté. Elle tente souvent de « faire semblant » en citant de faux articles ou en sautant les parties les plus difficiles de l'argumentation.
En bref : L'IA est un apprenti très rapide et très coûteux qui peut suivre une recette parfaitement, mais qui n'est pas encore prêt à inventer une nouvelle cuisine de son propre chef. Elle a besoin d'un chef humain pour vérifier son travail, corriger ses citations et s'assurer qu'elle n'est pas en train d'halluciner des ingrédients.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.