Using Reinforcement Learning to Train Large Language Models to Explain Human Decisions
Cet article démontre que l'emploi de l'apprentissage par renforcement avec des récompenses basées sur les résultats pour affiner des grands modèles de langage préentraînés leur permet de servir de modèles cognitifs à double usage qui atteignent simultanément une forte précision prédictive et génèrent des explications en langage naturel interprétables pour les choix risqués humains.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
L'idée principale : Apprendre à l'IA à « penser à voix haute »
Imaginez que vous avez un étudiant super intelligent (un grand modèle de langage, ou LLM) qui est incroyablement doué pour deviner ce que vous allez faire ensuite. Si vous lui présentez un problème de mathématiques complexe, il peut généralement vous donner la bonne réponse. Mais, si vous lui demandez comment il est arrivé à cette réponse, il pourrait simplement dire : « Je le savais, c'est tout », ou donner une explication vague qui n'a pas vraiment de sens.
Dans le monde de la psychologie, les scientifiques recherchent des modèles qui ne se contentent pas de deviner la réponse (prédire le comportement humain), mais qui expliquent aussi pourquoi les gens font ces choix (révéler le mécanisme cognitif).
Cette publication pose la question suivante : Pouvons-nous apprendre à une IA non seulement à prédire les décisions humaines, mais aussi à « penser à voix haute » d'une manière qui explique réellement la psychologie humaine ?
L'expérience : Le jeu du « Choix Risqué »
Pour tester cela, les chercheurs ont utilisé un jeu psychologique classique appelé « choix risqué ». Imaginez qu'on vous propose deux options :
- Option A : Vous recevez 27 $ à coup sûr.
- Option B : Vous avez 90 % de chances de recevoir 25 $, mais 10 % de chances de recevoir 92 $.
La plupart des gens doivent choisir entre un pari sûr et un pari risqué. Les chercheurs disposaient d'un ensemble de données massif comprenant des milliers de choix réels faits par des humains. Ils voulaient entraîner une IA à regarder les options et à dire : « 70 % des gens choisiront l'option A, et 30 % choisiront l'option B ».
Les trois méthodes d'entraînement
Les chercheurs ont essayé trois façons différentes d'enseigner cette tâche à l'IA, comme trois styles de coaching différents :
- Le « Mémorisateur » (Entraînement standard) : Ils ont montré à l'IA des milliers d'exemples de questions et de bonnes réponses. L'IA a appris à copier le schéma. Elle est devenue douée pour deviner les pourcentages, mais elle n'a pas vraiment appris le pourquoi. C'était comme un étudiant qui aurait mémorisé le corrigé sans pouvoir expliquer les mathématiques.
- Le « Mémorisateur masqué » (Style Centaure) : C'est une version sophistiquée de la première méthode où l'IA est forcée de se concentrer uniquement sur les chiffres dans la réponse, en ignorant le reste du texte. Elle est également devenue douée pour deviner, mais ne générait toujours pas une bonne explication.
- Le « Coach avec un tableau de score » (Apprentissage par renforcement - RL) : C'est la star du spectacle. Ici, l'IA est autorisée à écrire une « Chaîne de pensée » (un processus de raisonnement étape par étape) avant de donner sa réponse finale.
- Le rebondissement : L'IA ne recevait pas seulement des points pour avoir raison. Elle recevait des points basés sur la proximité de sa prédiction finale avec ce que les humains réels ont réellement fait.
- Le résultat : Pour gagner des points, l'IA a réalisé qu'elle devait « penser » comme un psychologue. Elle a commencé à écrire des choses comme : « Les gens sont aversion au risque » ou « Ils calculent la valeur attendue ». En essayant de gagner le jeu (correspondre aux données humaines), elle a accidentellement appris à verbaliser les règles psychologiques que les humains suivent.
Les résultats : L'IA devient psychologue
Les chercheurs ont découvert que la méthode du « Coach avec un tableau de score » (RL) a changé la donne pour deux raisons :
- Elle prédisait bien : Elle était tout aussi douée pour deviner ce que les humains choisiraient que les autres méthodes.
- Elle expliquait bien : Les parties de « réflexion à voix haute » (la Chaîne de pensée) étaient en fait des explications psychologiques de haute qualité.
- L'analogie : Imaginez que les autres méthodes soient comme une application météo qui dit : « Il va pleuvoir ». La méthode RL est comme un météorologue qui dit : « Il va pleuvoir parce qu'un front froid entre en collision avec de l'air chaud, créant une basse pression ».
- L'IA a commencé à utiliser de vrais concepts psychologiques comme l'Aversion au risque (les gens détestent perdre), la Valeur attendue (faire le calcul des probabilités) et l'Effet de certitude (les gens adorent une victoire garantie).
La condition de « l'intelligence »
Il y avait cependant un bémol. Les chercheurs ont testé cette même méthode de « Coach » sur un modèle d'IA plus petit et plus faible.
- L'analogie : Imaginez essayer d'enseigner une stratégie complexe à un bambin plutôt qu'à un étudiant universitaire. Le bambin (le petit modèle) n'a pas réussi à comprendre les mathématiques ou la stratégie, même avec le coach. Il s'est simplement emmêlé les pinceaux et a donné de mauvaises réponses.
- La conclusion : La méthode du « Coach » n'a fonctionné que parce que l'IA de base était déjà assez intelligente pour comprendre les concepts. Si l'IA n'est pas assez intelligente pour comprendre la « Valeur attendue » dès le départ, vous ne pouvez pas l'entraîner à l'expliquer.
Le test du « Changement de forme »
Pour prouver que l'IA ne se contentait pas de réciter des phrases mémorisées, les chercheurs ont changé les règles du jeu. Au lieu d'utiliser des données humaines réelles, ils ont nourri l'IA de données générées par un robot qui ne se souciait que des mathématiques (Valeur attendue).
- Le résultat : L'IA a instantanément changé sa « pensée ». Elle a cessé de parler des peurs humaines et de l'aversion au risque pour parler purement de mathématiques et de logique.
- L'enseignement : Cela a prouvé que l'IA ne faisait pas que copier un script ; elle adaptait réellement son raisonnement pour correspondre aux données sur lesquelles elle était entraînée. Elle apprenait véritablement les règles du jeu spécifique auquel elle jouait.
Résumé
Cette publication montre que si vous entraînez une IA intelligente à prédire le comportement humain en utilisant un système de récompense (comme un score de jeu vidéo), elle commencera naturellement à « penser à voix haute » en utilisant les mêmes règles psychologiques que les humains. Cela transforme l'IA d'un simple devineur en un modèle capable d'expliquer pourquoi nous faisons ces choix. Cependant, cela ne fonctionne que si l'IA est déjà assez intelligente pour comprendre ces concepts en premier lieu.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.