FormalTCS: Benchmarking End-to-End Frontier Formal Theoretical Computer Science Research of Large Language Models
L'article introduit FormalTCS, un benchmark validé par des experts utilisant la recherche de pointe en théorie de la complexité computationnelle (TCS) de 2025–2026 pour révéler que les modèles de langage de grande taille actuels éprouvent des difficultés significatives avec la recherche automatisée de bout en bout, principalement en raison de limitations sévères en matière d'autoformalisation et de la capacité à générer des affirmations mathématiques nouvelles et de haute qualité.
Article original placé dans le domaine public sous CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
L'informatique théorique est l'étude de la manière dont l'information est traitée et des limites fondamentales de ce qui peut être calculé. Elle est le socle de la technologie moderne, fournissant les règles mathématiques qui déterminent quels problèmes peuvent être résolus par des machines et avec quelle efficacité ils peuvent l'être. Pendant des décennies, ce domaine s'est appuyé sur des mathématiciens humains pour élaborer des définitions précises, construire des arguments logiques et prouver que leurs conclusions sont inébranlables. Récemment, un nouvel outil est apparu : les grands modèles de langage. Il s'agit de systèmes d'intelligence artificielle entraînés sur de vastes quantités de textes qui peuvent lire, écrire et raisonner sur des sujets complexes. À mesure que ces systèmes sont devenus plus puissants, des chercheurs ont commencé à se demander s'ils pouvaient faire plus que simplement répondre à des questions ou résumer du texte. Pourraient-ils réellement mener des recherches scientifiques de manière autonome, en découvrant de nouvelles vérités sur le calcul et en les prouvant avec la même rigueur qu'un expert humain ?
Une équipe de chercheurs de l'Institut de technologie de Harbin s'est donné pour mission de répondre à cette question en construisant un nouveau terrain d'essai appelé FORMALTCS. Ils voulaient aller au-delà des simples quiz ou des exercices de manuel pour voir si ces intelligences artificielles pouvaient gérer la réalité complexe et difficile de la recherche de pointe. Pour ce faire, ils ont rassemblé 175 problèmes de recherche réels provenant des conférences les plus prestigieuses du domaine, couvrant des sujets tels que les algorithmes, la complexité et la théorie de l'apprentissage automatique. Il ne s'agissait pas de problèmes inventés ; c'étaient les découvertes fondamentales réelles issues de documents acceptés en 2025 et 2026. Les chercheurs ont ensuite travaillé avec des experts humains pour traduire ces découvertes dans un format qu'un ordinateur pourrait vérifier, créant ainsi une norme rigoureuse pour mesurer l'intelligence artificielle.
Les résultats de cette expérience ont révélé une division marquée entre ce que ces modèles peuvent comprendre et ce qu'ils peuvent réellement faire. Lorsque les chercheurs ont demandé aux modèles de lire un résumé de haut niveau d'une découverte de recherche et d'en expliquer la logique en langage clair, les modèles ont plutôt bien performé. Ils pouvaient saisir la vue d'ensemble et décrire la stratégie d'une preuve avec une précision raisonnable. Cependant, dès que la tâche consistait à traduire ces idées dans un langage mathématique formel qu'un ordinateur pourrait vérifier, les modèles se sont heurtés à un mur. Ce processus, connu sous le nom d'autoformalisation, est l'étape où un chercheur humain transforme une idée vague en un ensemble précis de règles et de définitions. Dans cette étape critique, les meilleurs modèles d'intelligence artificielle n'ont réussi qu'environ 11,5 % du temps. En revanche, lorsque les chercheurs ont fourni aux modèles les définitions mathématiques précises pour travailler, les modèles ont été capables de construire la preuve finale environ 28,6 % du temps.
Cet écart suggère que l'obstacle principal pour l'intelligence artificielle dans ce domaine n'est pas la capacité à suivre un chemin logique une fois celui-ci tracé, mais la capacité à construire le chemin lui-même. Les modèles peinent à prendre une description en langage naturel d'un problème et à la transformer en les définitions spécifiques et non ambiguës requises pour qu'un ordinateur vérifie la solution. C'est comme si les modèles pouvaient lire une carte et comprendre la destination, mais qu'ils ne pouvaient pas dessiner la carte eux-mêmes. De plus, lorsque les chercheurs ont construit un système permettant aux modèles de générer leurs propres nouvelles idées de recherche à partir de zéro, les résultats étaient encore plus révélateurs. Sur 64 nouvelles affirmations générées par le système, seules six ont été jugées par des experts humains comme étant suffisamment novatrices et précieuses pour être poursuivies. Les autres étaient soit trop similaires aux travaux existants, manquaient de réelle importance, ou ne pouvaient tout simplement pas être prouvées.
L'étude conclut que, bien que ces systèmes d'intelligence artificielle deviennent meilleurs pour comprendre et discuter l'informatique théorique, ils sont encore loin de pouvoir mener des recherches indépendantes. Ils manquent du « goût » ou de l'intuition nécessaires pour identifier quelles nouvelles idées valent vraiment la peine d'être explorées, et ils peinent à la traduction précise des idées en règles formelles. Le chemin vers une découverte scientifique pleinement autonome dans ce domaine nécessite de résoudre deux problèmes distincts : améliorer la capacité de traduire les idées en un langage mathématique rigoureux, et développer un sens plus profond de ce qui rend une idée de recherche précieuse. Tant que ces obstacles ne seront pas franchis, le rôle de l'intelligence artificielle dans ce domaine restera celui d'un assistant puissant plutôt que celui d'un chercheur indépendant.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.