← Derniers articles
🤖 AI

CEDAR-GRPO: Process-Aware Reinforcement Learning for General Abductive Reasoning in LLMs

L'article présente CEDAR-GRPO, un cadre d'apprentissage par renforcement sensible au processus qui améliore le raisonnement abductif général dans les grands modèles de langage en combinant l'exactitude de la réponse finale avec des récompenses abductives, atteignant des gains de performance significatifs sur 11 tâches inédites par rapport aux modèles de base et à l'entraînement fondé uniquement sur l'exactitude.

Auteurs originaux : Moein Salimi, Danial Parnian, Shaygan Adim, Amirmohammad Ebrahiminasab, Nima Alighardashi, Parsa Gholami, Sahand Akramipour, Mahdi Jafari Siavoshani, Mohammad Hossein Rohban

Publié 2026-08-18
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Moein Salimi, Danial Parnian, Shaygan Adim, Amirmohammad Ebrahiminasab, Nima Alighardashi, Parsa Gholami, Sahand Akramipour, Mahdi Jafari Siavoshani, Mohammad Hossein Rohban

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Dans le vaste paysage de l'intelligence artificielle, les chercheurs tentent constamment d'apprendre aux machines à penser comme des humains, et non pas seulement à prédire le mot suivant dans une phrase. L'une des manières de penser les plus humaines est appelée le raisonnement abductif. Il s'agit du processus mental consistant à observer un ensemble d'indices ou d'observations et à remonter en arrière pour trouver l'explication la plus probable. C'est ainsi qu'un médecin détermine ce qui ne va pas chez un patient à partir de quelques symptômes, comment un détective reconstruit un crime à partir d'indices épars, ou comment un ingénieur diagnostique une machine qui s'est soudainement arrêtée de fonctionner. Pendant longtemps, les scientifiques ont eu du mal à amener les grands modèles de langage à bien accomplir cette tâche. Bien que ces modèles soient excellents pour restituer des faits ou suivre des règles logiques strictes, ils trébuchent souvent lorsqu'on leur demande de déduire des causes cachées à partir d'informations incomplètes. Ils ont tendance à deviner la bonne réponse pour de mauvaises raisons, ou ils inventent des faits qui semblent plausibles mais qui ne correspondent pas réellement aux preuves fournies.

Une équipe de chercheurs de l'Université de technologie de Sharif et de l'Université de Téhéran s'est donné pour mission de résoudre ce problème. Ils voulaient savoir s'ils pouvaient entraîner ces modèles d'IA à devenir meilleurs en raisonnement abductif d'une manière qui les aiderait à résoudre de nouveaux problèmes inédits, plutôt que de simplement mémoriser les énigmes spécifiques sur lesquelles ils ont été entraînés. Ils ont développé une nouvelle méthode d'entraînement appelée CEDAR-GRPO. Au lieu de simplement récompenser le modèle pour avoir trouvé la réponse finale, ils ont conçu un système qui récompense également le modèle pour la manière dont il y est parvenu. Le système vérifie deux choses spécifiques concernant le processus de raisonnement du modèle : premièrement, si le modèle a réellement examiné et expliqué chaque détail de l'évidence fournie, et deuxièmement, si le modèle a orienté son raisonnement dans la bonne direction, en partant des observations pour construire une conclusion, plutôt qu'en partant d'une conclusion pour tenter de faire correspondre l'évidence à celle-ci.

Pour tester cela, les chercheurs ont pris quatre modèles de langage différents en open-source et les ont entraînés sur un ensemble de tâches soigneusement mélangées. Ces tâches comprenaient tout, du choix de la meilleure explication pour une courte histoire à l'écriture de code expliquant un motif dans des données. Crucialement, ils n'ont pas seulement montré les réponses aux modèles ; ils ont utilisé une technique d'apprentissage par renforcement qui agissait comme un entraîneur, donnant aux modèles un retour sur leurs étapes de raisonnement. Les modèles ont appris qu'une réponse correcte ne suffisait pas s'ils avaient ignoré un détail clé ou si leur logique était inversée. Après cet entraînement, les chercheurs ont testé les modèles sur onze tâches complètement différentes qu'ils n'avaient jamais vues auparavant. Ces nouvelles tâches allaient du diagnostic de conditions médicales au débogage de code informatique, en passant par la résolution de mystères complexes et la compréhension d'histoires longues et compliquées.

Les résultats ont montré une amélioration claire sur toute la ligne. Les modèles entraînés avec la nouvelle méthode ont surpassé à la fois leurs versions originales et les modèles qui ont été entraînés uniquement pour obtenir la réponse correcte. En moyenne, la nouvelle méthode a amélioré la performance de 7,4 points de pourcentage par rapport aux modèles originaux et de 2,7 points par rapport aux modèles entraînés uniquement pour la justesse. Dans certains cas spécifiques, l'amélioration a atteint 30,8 points. Plus important encore, les chercheurs ont analysé le texte réel que les modèles écrivaient pendant qu'ils réfléchissaient. Ils ont constaté que les modèles entraînés se comportaient davantage comme des enquêteurs méticuleux. Ils étaient plus susceptibles d'explorer différentes possibilités avant de se fixer sur une réponse, d'exclure explicitement les fausses idées et d'admettre lorsqu'ils étaient incertains. Ils ont également montré une habitude beaucoup plus forte de lier leurs conclusions directement aux faits spécifiques qui leur ont été donnés, plutôt que de s'appuyer sur des suppositions vagues.

L'étude a également écarté plusieurs explications alternatives à ce succès. Les chercheurs ont prouvé que l'amélioration ne provenait pas simplement du fait que les modèles voyaient plus d'exemples ou d'un renforcement général des capacités de raisonnement. Lorsqu'ils ont entraîné les modèles sur une quantité similaire de données de raisonnement général qui ne se concentraient pas sur les tâches abductives, les modèles n'ont pas montré le même niveau d'amélioration sur les tests spécifiques. Cela suggère que la manière spécifique dont les modèles ont été récompensés pour leur processus de raisonnement était le facteur clé. Les conclusions indiquent que le raisonnement abductif peut être renforcé en tant que compétence générale qui se transfère à travers différents domaines, plutôt qu'en tant que tour de passe-passe étroit qui ne fonctionne que sur des types d'énigmes spécifiques. En apprenant aux modèles à respecter l'évidence et à suivre un chemin logique de l'observation vers l'explication, les chercheurs ont franchi une étape significative vers la création d'une intelligence artificielle capable de véritablement comprendre et d'expliquer le monde qui l'entoure.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →