Tackling Decision Processes with Non-Cumulative Objectives using Reinforcement Learning
Dieses Paper führt eine allgemeine Abbildung ein, die nicht-kumulative Markov-Entscheidungsprozesse (NCMDPs) in Standard-MDPs transformiert, wodurch die direkte Anwendung bestehender Reinforcement-Learning-Techniken zur Optimierung beliebiger Belohnungsfunktionen ermöglicht wird und eine verbesserte Leistung sowie Trainingseffizienz über verschiedene Aufgaben hinweg demonstriert wird.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
In der Welt der künstlichen Intelligenz gibt es ein leistungsstarkes Framework, das verwendet wird, um Maschinen beizubringen, wie sie Entscheidungen treffen. Stellen Sie sich einen Roboter vor, der das Laufen lernt, ein Computerprogramm, das ein Videospiel meistert, oder einen Handelsalgorithmus, der ein Aktienportfolio verwaltet. Diese Systeme arbeiten, indem sie eine Serie von Aktionen nacheinander als Reaktion auf ihre Umgebung ausführen. Mit jeder Bewegung erhält das System ein Signal, das oft als Belohnung (Reward) bezeichnet wird und ihm mitteilt, ob diese Aktion gut oder schlecht war. Jahrzehntelang war die Standardregel für den Erfolg in diesen Szenarien einfach: Maximiere die Gesamtsumme aller über die Zeit gesammelten Belohnungen. Wenn ein Roboter für jeden Schritt nach vorne einen kleinen Punkt erhält, ist das Ziel, bis zum Ende der Reise so viele Punkte wie möglich zu sammeln. Dieser Ansatz, bekannt als Markov-Entscheidungsprozess, war unglaublich erfolgreich und hat alles von Industrierobotern bis hin zu selbstfahrenden Autos geleitete.
Das wirkliche Leben ist jedoch oft komplizierter als eine einfache Abrechnungstabelle. Manchmal ist das wichtigste Ergebnis nicht die Gesamtmenge der guten Dinge, die passiert sind, sondern der schlimmste Moment, der auftrat, oder die Beständigkeit der Leistung über die Zeit. Betrachten Sie eine Raumsonde, die auf einem Planeten landet. Das Ziel ist nicht nur, sicher zu landen; es ist sicherzustellen, dass das Raumfahrzeug während des gesamten Abstiegs niemals eine gefährliche Geschwindigkeit überschreitet, ungeachtet dessen, wie sanft der Rest des Fluges verlief. In der Finanzwelt kümmert sich ein Investor vielleicht weniger um den Gesamtgewinn eines Jahres, sondern mehr darum, wie stark dieser Gewinn schwankte, und sucht nach einer stetigen Rendite statt nach einem riskanten Glücksspiel. Diese Szenarien beinhalten das, was Forscher als nicht-kumulative Ziele bezeichnen, bei denen das Endergebnis von einer spezifischen Funktion der gesamten Historie der Belohnungen abhängt, wie etwa dem Maximalwert, der erreicht wurde, oder dem Verhältnis von durchschnittlichem Gewinn zur Volatilität. Bis jetzt war es schwierig, künstliche Intelligenz beizubringen, diese komplexen, geschichtshängigen Ziele zu optimieren, da dies oft maßgeschneiderte Algorithmen erforderte, die schwer auf neue Probleme anwendbar waren.
Ein Team von Forschern des Max-Planck-Instituts für die Wissenschaft des Lichts und der Friedrich-Alexander-Universität Erlangen-Nürnberg hat eine allgemeine Lösung für dieses Problem entwickelt. Sie haben einen Weg gefunden, diese komplexen, nicht-kumulativen Herausforderungen in das Standardformat zu übersetzen, das bestehende, leistungsstarke Werkzeuge der künstlichen Intelligenz bereits zu lösen wissen. Anstatt einen neuen Typ von Lernalgorithmus von Grund auf neu zu erfinden, haben sie eine Brücke gebaut. Sie zeigten, dass durch eine leichte Änderung der Art und Weise, wie die Maschine ihre aktuelle Situation wahrnimmt und wie sie ihr unmittelbares Feedback berechnet, jedes komplexe Ziel in ein Standardproblem der „Summe der Belohnungen“ umgewandelt werden kann. Dies ermöglicht es Forschern, die derzeit leistungsfähigsten fertigen Lernsoftware-Lösungen direkt auf Probleme anzuwenden, die zuvor unerreichbar waren, ohne die Software selbst modifizieren zu müssen.
Der Kern ihrer Methode besteht darin, dem künstlichen Agenten ein wenig mehr Gedächtnis zu geben. In einem Standard-Setup muss ein Agent nur seinen aktuellen Zustand kennen, um eine Entscheidung zu treffen. Aber wenn das Ziel von der gesamten Historie der Belohnungen abhängt – wie etwa das Erinnern an die bisher erreichte Höchstgeschwindigkeit –, muss der Agent diese Information mit sich führen. Die Forscher schlugen ein System vor, bei dem der „Zustand“ des Agenten erweitert wird, um eine laufende Zusammenfassung der Vergangenheit zu enthalten, wie zum Beispiel die höchste oder niedrigste Belohnung, die bis zu diesem Moment gesehen wurde. Gleichzeitig passten sie die unmittelbare Belohnung an, die der Agent bei jedem Schritt erhält. Anstatt eine Belohnung zu erhalten, die einfach nur die aktuelle Aktion widerspiegelt, erhält der Agent einen berechneten Wert, der, wenn man ihn über die gesamte Reise aufsummiert, das komplexe Ziel perfekt rekonstruiert. Wenn das Ziel beispielsweise darin besteht, die maximale Geschwindigkeit zu minimieren, wird der Agent so belohnt, dass er nur dann bestraft wird, wenn er einen neuen Geschwindigkeitsrekord aufstellt, was effektiv das Problem des „Minimums der Maxima“ in eine Standard-Summe verwandelt.
Dieser Ansatz wurde über eine Vielzahl schwieriger Aufgaben hinweg getestet und bewies seine Vielseitigkeit. In einer Simulation eines Mondlanders trainierten die Forscher einen Agenten, eine Raumsonde zu landen, während er die maximale Geschwindigkeit strikt begrenzte. Sie verglichen ihre Methode mit einem Standardansatz, der versuchte, das Ziel durch das Hinzufügen einer Strafe am Ende des Fluges zu annähern. Die neue Methode, die das Geschwindigkeitslimit als kontinuierlichen Teil des Lernprozesses behandelte, fand ein viel besseres Gleichgewicht zwischen sicherem Landen und effizienter Bewegung. Im Bereich der Finanzen wandten sie die Technik auf die Portfolio-Optimierung an, bei der das Ziel darin besteht, die Sharpe-Ratio zu maximieren – ein Maß für die risikobereinigte Rendite, das den durchschnittlichen Gewinn durch die Volatilität dieser Gewinne teilt. Bisherige Methoden mussten sich auf grobe Annäherungen dieses Verhältnisses verlassen. Durch die Verwendung der neuen Abbildung konnten die Agenten lernen, das exakte Verhältnis direkt zu maximieren, was zu signifikant besseren Anlagestrategien während des Trainings führte.
Die Forscher untersuchten auch diskrete Optimierungsprobleme, wie zum Beispiel das Finden der effizientesten Anordnung von Quantengatter-Logiken oder die Vereinfachung komplexer Diagramme, die in der Quantenkomplexität verwendet werden. Bei diesen Aufgaben besteht das Ziel oft darin, den einzelnen besten Zustand zu finden, der während einer langen Suche erreicht wurde, anstatt die Summe aller entlang des Weges gemachten Verbesserungen. Hier ermöglichte die neue Methode den Agenten, mutiger zu explorieren. Da der Agent nicht für vorübergehende Rückschläge bestraft wurde, die notwendig waren, um später eine bessere Lösung zu erreichen, lernte er schneller und fand qualitativ hochwertigere Lösungen als Agenten, die mit Standard-Kumulationsbelohnungen trainiert wurden. In einem Experiment zur Quantenfehlerkorrektur verbesserte die neue Methode die Leistung um eine signifikante Spanne und fand bessere Lösungen in kürzerer Zeit.
Die Stärke dieser Arbeit liegt in ihrer Einfachheit und Allgemeingültigkeit. Die Forscher haben keinen neuen Lernalgorithmus geschaffen, sondern eine Übersetzungsschicht. Das bedeutet, dass jeder Experte in einem spezifischen Bereich, von der Robotik bis zum Finanzwesen, sein bestehendes Problem nehmen, diese Abbildung anwenden und sofort die leistungsfähigsten verfügbaren Reinforcement-Learning-Werkzeuge nutzen kann. Die Methode funktioniert sowohl in vorhersehbaren Umgebungen als auch in solchen, die voller zufälligem Rauschen sind, und sie bewältigt sowohl einfache als auch komplexe Ziele. Während die Forscher anmerkten, dass das erweiterte Gedächtnis des Agenten das Problem geringfügig vergrößern kann, sind moderne Deep-Learning-Techniken bestens gerüstet, um dies zu handhaben. Das Ergebnis ist ein einheitliches Framework, das die Barriere zwischen komplexen, realen Zielen und den hochentwickelten Werkzeugen der künstlichen Intelligenz entfernt und den Weg für Maschinen ebnet, Strategien zu erlernen, die zuvor zu schwierig zu definieren waren.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.