Risk-Aware Preference Learning for Stochastic Outcomes
Diese Arbeit zeigt, dass die Einbeziehung der kumulativen Prospect-Theorie zur Modellierung der menschlichen Risikosensitivität die Rekonstruktion der Belohnungsfunktion signifikant verbessert und das Bedauern bei der Präferenzlernprozessen für die stochastische Roboternavigation im Vergleich zu traditionellen Annahmen des Erwartungsnutzens reduziert.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie versuchen, einem Roboter beizubringen, wie sich ein höflicher Mensch verhält. Sie können nicht einfach eine lange Liste von Regeln schreiben wie „schlage niemanden“ oder „gehe schnell“, denn das Leben ist chaotisch und voller Überraschungen. Stattdessen haben Wissenschaftler einen klugen Trick gefunden: Man zeigt dem Roboter zwei verschiedene Arten der Bewegung und fragt einen Menschen: „Welche sieht besser aus?“ Indem man dies tausende Male tut, kann der Roboter eine verborgene „Bewertungskarte“ erlernen, die bestimmt, was Menschen tatsächlich wertschätzen. Dies nennt man präferenzbasiertes Belohnungslernen.
Es verbirgt sich jedoch eine knifflige Annahme im Hintergrund der meisten dieser Studien. Sie setzt voraus, dass Menschen wie perfekte Taschenrechner sind, die einfach die guten und schlechten Teile einer Situation zusammenzählen und sie nach ihrer Wahrscheinlichkeit gewichten. Dies wird als Erwartungsnutzen bezeichnet. Aber echte Menschen sind keine Taschenrechner; wir sind emotional. Wir machen uns viel zu viele Sorgen um seltene Katastrophen (wie einen Autounfall) und wir hassen es, Dinge zu verlieren, mehr als wir es lieben, Dinge zu gewinnen. Diese Arbeit stellt eine einfache Frage: Was passiert, wenn wir einen Roboter mit einem Modell lehren, das davon ausgeht, dass Menschen perfekte Taschenrechner sind, während die Menschen in Wirklichkeit risikoavers und emotional handelnde Entscheidungsträger sind?
Das Forscherteam der University of Colorado Boulder beschloss, diese Idee in einer simulierten Welt zu testen, in der ein Roboter durch eine Menge von Fußgängern navigieren muss. In dieser Welt ist jede Bewegung, die der Roboter macht, kein einzelner, garantierter Pfad. Stattdessen ist es wie ein Würfelwurf: Der Roboter könnte sanft gleiten, oder er könnte mit jemandem zusammenstoßen, oder er könnte stecken bleiben. Das Ergebnis ist eine Wolke von Möglichkeiten, keine gerade Linie.
Das Team richtete ein digitales Experiment mit zwei Arten von „Lehrern“ auf (den Menschen, deren Präferenzen der Roboter zu lernen versucht). Ein Lehrer war ein „perfekter Taschenrechner“, dem nur das durchschnittliche Ergebnis wichtig war (Erwartungsnutzen). Der andere Lehrer war ein „risikosensitiver“ Mensch, der ein komplexes psychologisches Modell namens Cumulative Prospect Theory (CPT) verwendete. Dieses Modell berücksichtigt, wie echte Menschen die Chance auf seltene, beängstigende Ereignisse überschätzen und den Schmerz einer Kollision viel schärfer empfinden als die Freude über einen reibungslosen Weg.
Die Forscher trainierten dann zwei Arten von „Schülern“ (den Lernalgorithmen). Ein Schüler ging davon aus, dass der Lehrer ein perfekter Taschenrechner sei (der EU-Lerner), während der andere Student davon ausging, dass der Lehrer ein risikosensitiver Mensch sei (der CPT-Lerner). Sie fütterten beide Studenten mit tausenden von „Welcher Pfad ist besser?“-Fragen, die von den Lehrern generiert wurden, und beobachteten, wie gut sie die wahre Bewertungskarte lernten.
Hier ist, was sie in ihren Simulationen herausfanden. Wenn der Lehrer ein perfekter Taschenrechner war, lernte der Taschenrechner-Student perfekt, während der risikosensitive Student durch die zusätzliche Komplexität etwas verwirrt wurde. Aber wenn der Lehrer ein risikosensitiver Mensch war, schnitt der Taschenrechner-Student deutlich schlechter ab. Er versuchte, die Angst des Menschen vor seltenen Unfällen zu erklären, indem er die gewonnene Bewertungskarte verzerrte, was den Roboter glauben ließ, Kollisionen seien nur „ein bisschen schlecht“ anstatt „katastrophal“, was zu einer verzerrten Belohnung führte. Der Robbot lernte eine weniger genaue Lektion.
Im Gegensatz dazu schnitt der risikosensitive Student (der CPT-Lerner) viel besser ab. Er erkannte, dass der Mensch nicht nur den Wert des Ergebnisses anders bewertete, sondern dass er die Unsicherheit anders gewichtete. Indem er den „Wert“ des Ergebnisses von der „Angst“ vor dem Risiko trennte, gewann der CPT-Lerner eine Bewertungskarte mit wesentlich geringerem Fehler zurück als der Taschenrechner-Student.
Die Arbeit legt nahe, dass wir – wenn wir wollen, dass Roboter in der realen Welt sicher und im Einklang mit menschlichen Werten agieren, wo seltene Unfälle beängstigend sind und Menschen von Natur aus ängstlich gegenüber ihnen sind – nicht einfach davon ausgehen können, dass Menschen logische Rechenmaschinen sind. Wir müssen Roboter bauen, die die menschliche Angst und Risikosensibilität verstehen, sonst könnten sie dazu neigen, gefährliche Abkürzungen zu nehmen, weil sie denken, dass uns das Risiko nichts ausmacht. Obwohl dieses Ergebnis aus Computersimulationen stammt und noch nicht durch echte Menschen an echten Robotern getestet wurde, deutet die Evidenz auf eine klare Notwendigkeit hin: Wenn wir Roboter lehren wollen, wie sie sicher sind, müssen wir zuerst lehren, wie Menschen sich angesichts des Unbekannten tatsächlich fühlen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.