← Neueste Arbeiten
💻 computer science

A Reinforcement Learning Supervisor with Dynamic Performance-Metric Weighting for Cryptocurrency Portfolio Management

Dieses Paper schlägt ein Reinforcement-Learning-Supervisor-Framework vor, das mehrere Performance-Metriken dynamisch gewichtet, um die optimale Handelsstrategie aus einem heterogenen Satz von Agenten auszuwählen, und dabei im Vergleich zu einzelnen Agenten sowie festen Strategien überlegene risikobereinigte Renditen in nichtstationären Kryptowährungs-Märkten demonstriert.

Ursprüngliche Autoren: Hee-jae Kwon, Su-cheon Lee, Eun-Ji Lee, Se-hun Lee, Tae-Geol Woo, Kang-moon Park

Veröffentlicht 2026-09-16
📖 7 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Hee-jae Kwon, Su-cheon Lee, Eun-Ji Lee, Se-hun Lee, Tae-Geol Woo, Kang-moon Park

Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Investitionen in die Finanzmärkte sind ein ständiges Spiel der Anpassung. Die Regeln des Spiels ändern sich, wenn die Wirtschaft von einer boomenden Wachstumsphase zu einem langsamen, seitwärts gerichteten Drift oder einem plötzlichen, starken Rückgang übergeht. In diesen Umgebungen scheitert eine einzige Strategie, die während eines Booms perfekt funktioniert, oft kläglich, wenn sich der Markt dreht. Dies ist die Kernherausforderung des Portfoliomanagements: zu entscheiden, wie man Geld auf verschiedene Vermögenswerte aufteilt, wenn die Zukunft ungewiss ist und die Vergangenheit keine zuverlässige Landkarte darstellt. Jahrzehntelang haben sich Anleger auf mathematische Formeln verlassen, um Risiko und Rendite auszubalancieren, aber diese statischen Modelle haben oft Schwierigkeiten, wenn sich die Marktbedingungen schnell ändern. In jüngster Zeit haben sich Informatiker einer Art künstlicher Intelligenz zugewandt, dem sogenannten Reinforcement Learning (bestärkendes Lernen). Anstatt spezifische Regeln erlernt zu bekommen, lernen diese Computerprogramme durch Versuch und Irrtum, indem sie mit einem simulierten Markt interagieren, um herauszufinden, welche Aktionen zu den besten langfristigen Ergebnissen führen. Obwohl diese Programme lernen können zu handeln, bleiben sie oft in einer einzigen Denkweise stecken und sind nicht in der Lage, umzuschwenken, wenn sich das Marktregime ändert.

Ein Team von Forschern der Korea National University of Transportation hat einen neuen Weg vorgeschlagen, um dieses Problem zu lösen. Anstatt zu versuchen, einen perfekten Handelsroboter zu bauen, haben sie ein System geschaffen, das wie ein Supervisor agiert und ein Team von fünf verschiedenen Handelsrobotern verwaltet, die jeweils mit einer leicht unterschiedlichen Lernmethode trainiert wurden. Der Supervisor führt die Trades selbst nicht aus. Stattdessen beobachtet er, wie jeder Roboter in letzter Zeit performt hat, und entscheidet, welcher von ihnen in diesem Moment die Leitung übernimmt. Die Forscher testeten dieses System unter Verwendung echter Hochfrequenzdaten aus dem Kryptowährungsmarkt, einem Ort, der für seine extreme Volatilität und schnelle Veränderungen bekannt ist. Sie fanden heraus, dass dieses Supervisor-System jeden einzelnen Roboter sowie traditionelle Anlagestrategien konsistent übertraf, indem es dynamisch zu dem Agenten wechselte, der am besten zu den aktuellen Marktbedingungen passte.

Die Forscher begannen damit, ein Team aus fünf verschiedenen Agenten aufzubauen. Jeder Agent ist ein Computerprogramm, das darauf ausgelegt ist, Investitionsentscheidungen zu treffen, aber sie wurden unter Verwendung unterschiedlicher mathematischer Ansätze trainiert. Obwohl alle Agenten im selben Portfolio-Umfeld mit derselben Belohnungsfunktion trainiert wurden, führten ihre unterschiedlichen Lernmechanismen dazu, dass jeder Agent eine einzigartige „Persönlichkeit“ entwickelte. Einer könnte sehr aggressiv sein, hohe Gewinne anstreben, aber große Risiken eingehen, während ein anderer eher vorsichtig sein könnte und Stabilität über schnelle Zuwächse stellt. In einem stabilen Markt könnte der aggressive Agent glänzen. In einem turbulenten Markt könnte der vorsichtige der einzige sein, der überlebt. Das Problem ist, dass kein einzelner Agent immer und überall der Beste ist. Wenn ein Anleger sich nur für einen Agenten entscheidet und an ihm festhält, wird er wahrscheinlich leiden, wenn sich der Markt in eine Richtung dreht, die dieser Agent nicht mag.

Um dies zu lösen, führten die Forscher einen Supervisor-Agenten ein. Dieser Supervisor kennt nicht den internen Code der fünf Agenten, die er verwaltet. Stattdessen agiert er wie ein Trainer, der ein Spiel beobachtet und nur auf die Anzeigetafel schaut. Er verfolgt sieben verschiedene Leistungsmetriken für jeden Agenten, wie zum Beispiel, wie viel Gewinn sie gemacht haben, welches Risiko sie für diesen Gewinn eingegangen sind und den Anteil der Perioden mit positiven Renditen. Er betrachtet diese Zahlen über verschiedene Zeiträume hinweg, von den letzten Stunden bis zu den letzten Tagen. Die Aufgabe des Supervisors ist es, herauszufinden, welche dieser Metriken im Moment am wichtigsten ist. In einem ruhigen Markt könnte der Supervisor entscheiden, dass stetige, konsistente Gewinne das wichtigste Anzeichen für einen guten Agenten sind. In einem chaotischen Markt könnte er entscheiden, dass die Vermeidung großer Verluste das Einzige ist, was zählt.

Der Supervisor lernt dieses Gewichtungssystem durch seinen eigenen Trainingsprozess. Er beobachtet den Markt und die jüngere Historie der Agenten und lernt dann, Bedeutungswerte für die verschiedenen Leistungsmetriken zuzuweisen. Er wählt nicht einfach den Agenten mit dem höchsten jüngsten Gewinn aus. Stattdessen berechnet er einen Score für jeden Agenten, indem er dessen Leistungsdaten mit den vom Supervisor gelernten Bedeutungsgewichten für diesen spezifigen Moment kombelt. Der Agent mit dem höchsten Gesamtwert wird ausgewählt, um das Portfolio für die nächste Handelsperiode zu verwalten. Dies schafft ein System, das seine Entscheidungen ständig neu bewertet und sein Vertrauen von einem Agenten zum anderen verschiebt, während sich die Marktumgebung ändert.

Die Forscher testeten dieses System mit 30-Minuten-Preisdaten der Binance-Kryptobörse, die einen Zeitraum vom 1. Januar 2021 bis zum 31. Dezember 2025 abdeckten. Sie richteten zwei verschiedene Szenarien ein: eines mit vier populären Kryptowährungen und eines mit fünf, wobei ein fünfter Vermögenswert hinzugefügt wurde, um zu sehen, ob das System mit einer etwas größeren Gruppe von Investitionen umgehen kann. Sie verglichen ihr Supervisor-System mit den fünf einzelnen Agenten, einer einfachen Strategie des gleichmäßigen Kaufs und Haltens aller Vermögenswerte sowie mit mehreren traditionellen Anlagelösungen. Die Ergebnisse waren eindeutig. Das Supervisor-System generierte signifikant höhere Endportfolio-Werte als jeder der einzelnen Agenten oder die traditionellen Strategien. Im Vier-Asset-Szenario steigerte der Supervisor den Portfoliowert auf das 2,349-fache des Ausgangsbetrags, während der beste einzelne Agent nur 1,652 erreichte. Im Fünf-Asset-Szenario erreichte der Supervisor das 3,044-fache des Ausgangswerts, verglichen mit 2,554 für den besten einzelnen Agenten.

Entscheidend war, dass dieses zusätzliche Wachstum nicht auf Kosten eines höheren Risikos ging. Das Supervisor-System verzeichnete auch kleinere maximale Verluste, sogenannte Drawdowns, als die einzelnen Agenten. Dies deutet darauf hin, dass das System nicht nur größere Wetten abschloss, um höhere Renditen zu erzielen, sondern tatsächlich das Risiko besser verwaltete, indem es wusste, wann es zu einem sichereren Agenten wechseln musste. Die Forscher verglichen ihr System auch mit einer einfacheren Version, die nur eine feste Regel zum Wechseln der Agenten verwendete, wie zum Beispiel immer den Agenten mit dem höchsten jüngsten Gewinn zu wählen. Das Supervisor-System übertraf diese Single-Rule-Strategien bei weitem. Dies bewies, dass der Erfolg des Systems aus seiner Fähigkeit resultierte, mehrere Faktoren gleichzeitig zu gewichten, anstatt sich auf ein einziges, starres Kriterium zu verlassen.

Um genau zu verstehen, was das System zum Erfolg führte, führten die Forscher eine Reihe von Tests durch, bei denen sie Teile des Systems entfernten, um zu sehen, was geschah. Sie fanden heraus, dass das System alle sieben Leistungsmetriken und alle vier Zeitfenster benötigte, um optimal zu arbeiten. Das Entfernen der gewinnbezogenen Metriken beeinträchtigte die Fähigkeit des Systems, Vermögen aufzubauen, während das Entfernen der risikobezogenen Metriken seine Fähigkeit einschränkte, Verluste abzuwehren. Ebenso musste das System sowohl die kurzfristige als auch die langfristige Leistungshistorie berücksichtigen. Im Vier-Asset-Test war die langfristige Historie am wichtigsten, während im Fünf-Asset-Test die kurzfristige Historie entscheidender war. Diese Variation zeigte, dass das System keine feste Regel verwendete, sondern sich tatsächlich an die spezifischen Bedürfnisse des aktuellen Portfolios und der Marktbedingungen anpasste.

Die Studie kommt zu dem Schluss, dass die Verwaltung eines Portfolios nicht nur darin besteht, den einen besten Handelsalgorithmus zu finden. Es geht darum, eine Struktur zu schaffen, die das richtige Werkzeug für die jeweilige Aufgabe wählen kann, wenn sich die Aufgabe ändert. Durch den Einsatz eines Supervisors, der verschiedene Leistungssignale dynamisch gewichtet, kann das System die unvorhersehbare Natur der Kryptowährungsmärkte effektiver navigieren als jeder einzelne Agent oder eine statische Strategie. Die Forscher merken an, dass ihr aktuelles System einen spezifischen Satz von fünf Agenten und einen spezifischen Satz von Marktdaten verwendet. Zukünftige Arbeiten könnten dies erweitern, indem sie Agenten mit unterschiedlichen Risikoprofilen einbeziehen oder das System auf andere Arten von Vermögenswerten testen. Das Kernergebnis bleibt jedoch robust: Ein hierarchischer Ansatz, der lernt, Policies basierend auf einer flexiblen, mehrschichtigen Sicht auf die Performance auszuwählen, bietet einen leistungsstarken Weg, um mit der Unsicherheit der Finanzmärkte umzugehen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →