← Neueste Arbeiten
🤖 machine learning

Policy Gradients for Cumulative Prospect Theory in Reinforcement Learning

Diese Arbeit leitet ein Policy-Gradient-Theorem für Cumulative Prospect Theory (CPT)-Zielsetzungen im Finite-Horizon Reinforcement Learning her und schlägt einen nachweislich konvergenten First-Order-Algorithmus unter Verwendung von Monte-Carlo-Ordnungsstatistiken vor, um nichtkonvexe risikosensitive Policies zu optimieren.

Ursprüngliche Autoren: Olivier Lepel, Anas Barakat

Veröffentlicht 2026-09-09
📖 8 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Olivier Lepel, Anas Barakat

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Menschen sind notorisch schlecht darin, Risiken zu berechnen. Wir wägen Wahrscheinlichkeiten nicht wie ein Mathematiker ab; stattdessen fühlen wir sie. Wir neigen dazu, eine kleine Chance auf einen schrecklichen Verlust weit mehr zu fürchten als eine große Chance auf einen moderaten. Gleichzeitig jagen wir oft einer winzigen Chance auf einen massiven Windfall hinterher, selbst wenn die Quoten gegen uns sprechen. Dies ist kein Fehler in unserer Software; es ist das, wie wir verdrahtet sind. Jahrzehntelang haben Ökonomen und Psychologen einen Rahmen namens Kumulative Prospect Theory verwendet, um diese Eigenheiten zu beschreiben. Er legt nahe, dass wir Ergebnisse nicht nach ihrem absoliven Wert beurteilen, sondern danach, wie sie sich zu einem persönlichen Referenzpunkt verhalten, und dass wir die Wahrscheinlichkeit von Ereignissen verzerren, indem wir seltene Katastrophen überschätzen und gewöhnliche unterschätzen.

Lange Zeit ignorierte das Feld der Künstlichen Intelligenz, insbesondere das Reinforcement Learning, diese menschlichen Eigenheiten. In diesem Bereich lernt ein Agent, Entscheidungen zu treffen, indem er mit einer Umgebung interagiert, um eine Belohnung zu maximieren. Der Standardansatz geht davon aus, dass der Agent vollkommen rational handelt, indem er den durchschnittlichen erwarteten Ausgang jedes möglichen Pfades berechnet und den wählt, der den höchsten Wert aufweist. Das funktioniert gut für Maschinen, aber es scheitert daran, wie Menschen sich tatsächlich in komplexen, unsicheren Situationen verhalten. Wenn wir versuchen, eine KI zu bauen, die mit Menschen zusammenarbeitet oder Entscheidungen für sie trifft, agiert ein rein rationaler Agent oft auf eine Weise, die für einen menschlichen Beobachter kalt, irrational oder schlichtweg falsch wirkt. Die Frage, die Forscher gestellt haben, ist, ob wir Maschinen lehren können, eher wie wir zu denken – nicht nur in ihren endgültigen Entscheidungen, sondern auch in der Art und Weise, wie sie Risiko und Belohnung wahrnehmen.

Ein Forschungsteam hat nun einen bedeutenden Schritt zur Beantwortung dieser Frage getan. Sie haben einen neuen mathematischen Rahmen entwickelt, der es Agenten der Künstlichen Intelligenz ermöglicht, ihr Verhalten basierend auf den Prinzipien der menschlichen Psychologie statt auf kalter Berechnung zu optimieren. In einer Reihe von Simulationen haben sie demonstriert, dass ein Agent, wenn man ihn lehrt, die Welt durch die Linse der Kumulativen Prospect Theory zu sehen, beginnt, dieselben nuancierten, manchmal widersprüchlichen Risikoverhaltensweisen zu zeigen, die auch Menschen zeigen. Die Forscher haben nicht nur eine Theorie vorgeschlagen; sie haben einen praktischen Algorithmus gebaut, der diese Verhaltensweisen lernen kann, und bewiesen, dass er mathematisch funktioniert, was einen Weg ebnet, damit KI in Hochrisikoumgebungen wie dem Finanzwesen, dem Gesundheitswesen oder dem Verkehrsmanagement mit menschlichen Präferenzen in Einklang gebracht werden kann.

Der Kern ihrer Arbeit ist eine neue Methode, um einem Agenten das Lernen beizubringen. Im traditionellen Reinforcement Learning versucht der Agent, die Summe der erwarteten Belohnungen zu maximieren. Die neue Methode ändert das Ziel. Anstatt zu fragen: „Was ist die durchschnittliche Belohnung?“, fragt sie: „Wie nimmt ein Mensch diesen Strom von Belohnungen wahr?“ Um dies zu erreichen, muss der Agent zuerst entscheiden, was im Verhältnis zu einem spezifischen Referenzpunkt als Gewinn und was als Verlust zählt. Ein Rückgang des Schmerzes von einem Niveau sieben auf fünf mag sich wie ein massiver Sieg anfühlen, wenn der Ausgangszustand des Patienten bei sieben liegt, aber wie eine geringfügige Verbesserung, wenn sein Ausgangszustand bei zwei liegt. Der Agent wendet dann eine spezielle Transformation auf diese Gewinne und Verluste an, wodurch sich der Schmerz eines Verlusts schwerer anfühlt als die Freude über einen gleichwertigen Gewinn. Schließlich verzerrt er die Wahrscheinlichkeiten, indem er das Gefühl verstärkt, dass seltene Ereignisse wahrscheinlicher sind, und gewöhnliche Ereignisse weniger wahrscheinlich erscheinen, genau wie ein menschlicher Geist.

Die Forscher standen vor einer erheblichen Hürde, um dies zum Laufen zu bringen. Die mathematische Landschaft, die durch diese menschenähnlichen Verzerrungen entsteht, ist unglaublich zerklüftet und komplex. Im Gegensatz zu den glatten, vorhersehbaren Hügeln der Standardoptimierung ist diese neue Landschaft voller scharfer Gipfel und tiefer Täler, was es einem Algorithmus erschwert, den besten Pfad zu finden, ohne stecken zu bleiben. Zudem konnten die Standardwerkzeuge, die KI lehren, ihre Entscheidungen zu verbessern, hier nicht angewendet werden, da die menschenähnliche Zielfunktion nicht den einfachen Regeln der Addition und Linearität folgt, auf denen die meisten Lernalgorithmen beruhen. Das Team musste einen völlig neuen Satz von Regeln ableiten, ein „Policy Gradient Theorem“, das als Kompass für den Agenten fungiert. Dieses neue Theorem bietet eine Möglichkeit zu berechnen, in welche Richtung der Agent sein Verhalten ändern sollte, um seine Leistung zu verbessern, selbst wenn diese Leistung durch einen komplexen, menschenähnlichen Standard gemessen wird.

Um diesen neuen Kompass zu testen, führten die Forscher eine Reihe von Experimenten durch. In einem einfachen Szenario platzierten sie einen Agenten in eine Situation, in der er zwischen einer sicheren, kleinen Belohnung und einer riskanten, großen Belohnung wählen musste. Ein standardmäßiger, rationaler Agent wählte immer die Option mit der höchsten durchschnittlichen Auszahlung, selbst wenn dies ein Wagnis bedeutete. Ein risikoscheuer Agent, der darauf ausgelegt war, Unsicherheit zu vermeiden, vermied das Wagnis konsequent. Aber der mit dem neuen menschenähnlichen Rahmen trainierte Agent zeigte etwas Interessanteres. Wenn die Wahl einen potenziellen Gewinn beinhaltete, agierte er vorsichtig und bevorzugte die sichere Option. Wenn jedoch das Szenario umgekehrt wurde und potenzielle Verluste im Spiel waren, wurde derselbe Agent plötzlich kühn und wählte die riskante Option, um einen sicheren Verlust zu vermeiden. Dieser Wechsel im Verhalten, bekannt als Reflexionseffekt, ist ein Kennzeichen menschlicher Entscheidungsfindung, das Standard-KI-Modelle nur schwer replizieren können. Der neue Algorithmus erfasste diese Nuance perfekt und nutzte dieselben internen Einstellungen für beide Szenarien.

Die Forscher verglichen ihre Methode auch mit bestehenden Ansätzen, die versuchten, Risiko zu modellieren. Sie fanden heraus, dass ältere Methoden, die auf Zeroth-Order-Schätzungen basierten (was im Wesentlichen bedeutet, die Richtung der Verbesserung durch kleine Änderungen und deren Auswirkungen zu erraten), Schwierigkeiten bekamen, sobald die Probleme komplexer wurden. Diese Methoden wurden ineffizient und langsam, wenn die Anzahl der Variablen zunahm. Im Gegensatz dazu skalierte der neue Algorithmus, der First-Order-Informationen nutzt, um die exakte Richtung der Verbesserung zu berechnen, viel besser. Er blieb effizient, selbst wenn die Komplexität der Umgebung wuchs, was darauf hindeutet, dass er auf reale Probleme mit vielen beweglichen Teilen, wie etwa der Steuerung eines Stromnetzes oder des Aktienhandels, angewendet werden kann.

Die Auswirkungen dieser Arbeit reichen über einfache Spiele hinaus. Die Forscher illustrierten, wie dieser Ansatz in kritischen Bereichen eingesetzt werden könnte. Im Gesundheitswesen beispielsweise könnte ein Arzt, der das chronische Schmerzmanagement eines Patienten steuert, eine sofortige Linderung gegen das Risiko einer Langzeitabhängigkeit abwägen müssen. Eine Standard-KI würde möglicherweise einfach den durchschnittlichen Schmerzwert minimieren und dabei potenziell die Angst des Patienten vor Entzugserscheinungen ignorieren. Ein menschenorientierter Agent hingegen könnte die Angst vor einem seltenen, aber katastrophalen Nebeneffekt stärker gewichten, was zu Behandlungsplänen führt, die sich sicherer und rücksichtsvoller gegenüber dem Patienten anfühlen. Ähnlich könnte ein Agent im Finanzwesen so abgestimmt werden, dass er die spezifische Risikotoleranz eines Anlegers widerspiegelt – nicht nur durch Anpassung einer einzelnen Zahl, sondern durch eine fundamentale Änderung der Wahrnehmung von Marktabstürzen oder Windfalls.

Die Studie klärte auch, was erforderlich ist, damit diese Agenten funktionieren. Die Forscher merkten an, dass für die Funktion des Algorithmus die menschlichen Präferenzen – wie sehr ein Mensch einen Verlust fürchtet oder wie er Wahrscheinlichkeiten verzerrt – im Voraus bekannt sein müssen. Diese werden nicht vom Agenten von Grund auf gelernt, sondern als Teil des Modells bereitgestellt, ähnlich wie die Regeln eines Spiels festgelegt werden. Dies ermöglicht es, das System auf spezifische Individuen oder Gruppen zuzuschneiden. Die Forscher zeigten, dass durch die Anpassung des Referenzpunkts oder der Sensitivität gegenüber Verlusten das Verhalten des Agenten drastisch verändert werden konnte, was beweist, dass das System flexibel genug ist, um ein breites Spektrum menschlicher Einstellungen abzubilden.

Obwohl die Ergebnisse vielversprechend sind, sind die Forscher vorsichtig darin, ihre Ergebnisse im Rahmen ihrer Simulationen einzuordnen. Sie haben bewiesen, dass der Algorithmus zu einer stabilen Lösung konvergiert und dass er optimale Strategien in komplexen, nicht-linearen Umgebungen finden kann. Sie haben durch Simulationen gezeigt, dass er ältere Methoden in Bezug auf Geschwindigkeit und Skalierbarkeit übertrifft. Sie haben jedoch noch nicht dieses System in einem echten, lebendigen Umfeld eingesetzt, in dem Menschenleben oder finanzielle Vermögenswerte unmittelbar gefährdet sind. Die Arbeit bleibt ein theoretischer und computergestützter Durchbruch – ein Beweis dafür, dass Maschinen gelehnt werden können, die unordentliche, irrationale Landschaft der menschlichen Risikowahrnehmung zu navigieren.

Der Weg nach vorn besteht darin, diese Modelle zu verfeinern und sie in vielfältigeren, realen Szenarien zu testen. Die Forscher schlagen vor, dass zukünftige Arbeiten darauf fokussieren könnten, menschliche Präferenzen direkt aus Daten zu lernen, anstatt sie vorzuprogrammieren, und die Theorie auf kontinuierliche Probleme mit unendlichem Zeithorizont auszuweiten. Sie sehen auch Potenzial darin, diesen Ansatz mit anderen Methoden des Lernens aus menschlichem Feedback zu kombinieren, um ein Hybridsystem zu schaffen, das sich an wechselnde Präferenzen anpassen kann. Für den Moment stellt diese Errungenschaft eine Brücke zwischen zwei Welten dar: der kalten Logik der Maschinenoptimierung und der warmen, oft widersprüchlichen Realität menschlicher Entscheidungsfindung. Sie bietet einen Weg, eine KI zu bauen, die nicht nur das beste Ergebnis berechnet, sondern versteht, was dieses Ergebnis für die Menschen bedeutet, denen sie dient.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →