Risk-Aware Preference Learning for Stochastic Outcomes
Cet article démontre que l'incorporation de la théorie de l'espérance cumulative pour modéliser la sensibilité humaine au risque améliore significativement la récupération de la fonction de récompense et réduit le regret dans l'apprentissage de préférences pour la navigation robotique stochastique par rapport aux hypothèses traditionnelles d'utilité attendue.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayiez d'apprendre à un robot comment se comporter comme un humain poli. Vous ne pouvez pas simplement écrire une longue liste de règles comme « ne frappe pas les gens » ou « marche vite », car la vie est désordonnée et pleine de surprises. Au lieu de cela, des scientifiques ont trouvé une astuce ingénieuse : montrer au robot deux manières différentes de se déplacer et demander à un humain : « Laquelle semble la meilleure ? » En faisant cela des milliers de fois, le robot peut apprendre une « fiche de score » cachée de ce que les humains valorisent réellement. C'est ce qu'on appelle l'apprentissage de récompense basé sur les préférences.
Cependant, une hypothèse délicate se cache en arrière-plan de la plupart de ces études. Elle suppose que les humains sont comme des calculateurs parfaits qui se contentent d'additionner les parties bonnes et mauvaises d'une situation, en les pondérant par leur probabilité de se produire. C'est ce qu'on appelle l'Utilité Espérée. Mais les vrais humains ne sont pas des calculateurs ; nous sommes émotifs. Nous nous inquiétons beaucoup trop pour les catastrophes rares (comme un accident de voiture) et nous détestons perdre des choses plus que nous n'aimons les gagner. Cet article pose une question simple : que se passe-t-il si nous enseignons à un robot en utilisant un modèle qui suppose que les humains sont des calculateurs parfaits, alors que les humains sont en réalité des décideurs émotifs et aversion au risque ?
Les chercheurs de l'Université du Colorado à Boulder ont décidé de tester cette idée dans un monde simulé où un robot doit naviguer à travers une foule de piétons. Dans ce monde, chaque mouvement que fait le robot n'est pas un chemin unique et garanti. Au lieu de cela, c'est comme lancer un dé : le robot pourrait glisser avec fluidité, ou il pourrait heurter quelqu'un, ou il pourrait rester coincé. Le résultat est un nuage de possibilités, pas une ligne droite.
L'équipe a mis en place une expérience numérique avec deux types d'« enseignants » (les humains dont le robot tente d'apprendre les préférences). Un enseignant était un « calculateur parfait » qui ne s'intéressait qu'au résultat moyen (l'Utilité Espérée). L'autre était des humains « sensibles au risque » qui utilisaient un modèle psychologique complexe appelé Théorie de l'Espérance Cumulative (TEC). Ce modèle tient compte du fait que les vraies personnes surestiment la probabilité d'événements rares et effrayants et ressentent la douleur d'une collision bien plus intensément que la joie d'un trajet fluide.
Les chercheurs ont ensuite entraîné deux types d'« étudiants » (les algorithmes d'apprentissage). Un étudiant supposait que l'enseignant était un calculateur parfait (l'apprenant EU), tandis que l'autre supposait que l'enseignant était un humain sensible au risque (l'apprenant TEC). Ils ont soumis aux deux étudiants des milliers de questions de type « quel chemin est le meilleur ? » générées par les enseignants et ont observé à quel point ils apprenaient bien la véritable fiche de score.
Voici ce qu'ils ont découvert lors de leurs simulations. Lorsque l'enseignant était un calculateur parfait, l'étudiant calculateur apprenait parfaitement, tandis que l'étudiant sensible au risque était un peu confus par la complexité supplémentaire. Mais lorsque l'enseignant était un humain sensible au risque, l'étudiant calculateur était nettement moins performant. Il tentait d'expliquer la peur de l'humain face aux collisions rares en déformant la fiche de score récupérée, faisant croire au robot que les collisions étaient juste « un peu mauvaises » au lieu d'être « catastrophiques », ce qui entraînait une récompense biaisée. Le robot apprenait une leçon moins précise.
En revanche, l'étudiant sensible au risque (l'apprenant TEC) était bien plus performant. Il a réalisé que l'humain ne valorisait pas seulement le résultat différemment, mais qu'il pondérait différemment l'incertitude. En séparant la « valeur » du résultat de la « peur » du risque, l'apprenant TEC a récupéré une fiche de score avec une erreur nettement inférieure à celle de l'étudiant calculateur.
L'article suggère que si nous voulons que les robots soient sûrs et alignés avec les valeurs humaines dans le monde réel — où les accidents rares sont effrayants et où les gens sont naturellement anxieux à ce sujet — nous ne pouvons pas simplement supposer que les humains sont des machines mathématiques logiques. Nous devons construire des robots qui comprennent la peur humaine et la sensibilité au risque, sinon ils pourraient apprendre à prendre des raccourcis dangereux parce qu'ils pensent que nous ne nous soucions pas du risque. Bien que ce résultat provienne de simulations informatiques et non encore de tests sur de vraies personnes avec de vrais robots, les preuves pointent vers un besoin clair : pour apprendre aux robots comment être sûrs, nous devons d'abord leur apprendre comment les humains ressentent réellement l'inconnu.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.