← Nieuwste papers
📈 economics

Bridging Behavioral Finance and Robust Agentic DRL: A novel computational framework for Portfolio Selection

Deze studie introduceert RPPO-MPT, een nieuw robuust reinforcement learning-framework dat perturbatiegebaseerde ruisonderdrukking integreert met Prospect Theory-geïnspireerde beloningsvorming om conventionele modellen te overtreffen bij de optimalisatie van aandelenportefeuilles door beter aan te sluiten bij de gedragspreferenties van beleggers onder marktonzekerheid.

Oorspronkelijke auteurs: Ehsan Ameri, Majid Mirzaee Ghazani, Donya Rahmani

Gepubliceerd 2026-06-26
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Ehsan Ameri, Majid Mirzaee Ghazani, Donya Rahmani

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je de kapitein bent van een schip dat door een zeer stormachtige oceaan vaart. De oceaan vertegenwoordigt de aandelenmarkt, en jouw schip is jouw beleggingsportefeuille.

Al een lange tijd gebruiken kapiteins (beleggers) twee belangrijke manieren om te sturen:

  1. De Oude Kaart (Traditionele Financiën): Deze gaat ervan uit dat de oceaan voorspelbaar is en dat zeelieden perfect logische robots zijn die alleen maar geven om de bestemming zo snel mogelijk te bereiken, ongeacht hoe eng de golven ook worden.
  2. De Nieuwe GPS (Standaard AI): Deze computers leren van eerdere stormen. Echter, de meeste AI-kapiteins handelen nog steeds als robots. Ze raken enthousiast door grote golven (winsten), maar raken net zo snel in paniek als mensen wanneer het water onstuimig wordt, waardoor ze beslissingen nemen die niet "juist" aanvoelen voor een echte menselijke belegger.

Dit artikel introduceert een nieuwe, super slimme AI-kapitein genaamd RPPO-MPT. Deze is ontworpen om de stormachtige oceaan beter te beheersen door drie specifiend trucs te combineren.

De Drie Trucs van de Nieuwe Kapitein

1. De "Wat Als?" Training (Robuustheid)
Stel je voor dat je traint voor een race. Een normale kapitein traint op een kalme dag. Als er tijdens de race plotseling een storm uitbreekt, kan de kapitein bevriezen.
De nieuwe kapitein traint echter in een simulator waar de computer opzettelijk nepploffen, windstoten en mist toevoegt aan de trainingsdata. De computer vraagt: "Wat als de wind 5% harder blaast? Wat als de stroming licht verandert?"
Door te trainen in deze "nep" chaotische omstandigheden, leert de kapitein om kalm te blijven en correct te sturen, zelfs wanneer de echte oceaan rommelig wordt. Dit wordt perturbatie-gebaseerd robuust leren genoemd. Het maakt de AI minder gevoelig voor ruis en minder geneigd tot paniekbeslissingen wanneer de markt heen en weer springt.

2. Het "Menselijk Hart" Beloningssysteem (Prospect Theory)
Standaard AI-kapiteins krijgen een "gouden ster" (beloning) voor elke dollar die ze verdienen. Maar echte mensen voelen niet zo.

  • De Angst: Het verliezen van $100 voelt veel erger dan de vreugde die het vinden van $100 geeft.
  • De Hoop: We raken enthousiast over winsten, maar we zijn doodsbang voor verliezen.
    De nieuwe kapitein is geprogrammeerd met een "Hoop-Angst" beloningssysteem. In plaats van alleen dollars te tellen, berekent het een score gebaseerd op hoe een mens zich zou voelen.
  • Als het schip geld verdient, krijgt het een "Hoop"-score (maar de opwinding groeit langzamer naarmate je rijker wordt).
  • Als het schip geld verliest, krijgt het een "Angst"-score (en de pijn wordt 2,25 keer vermenigvuldigd!).
    Dit leert de AI om van nature voorzichtiger te zijn met het verliezen van geld dan dat het gedreven is door het maken van winst, wat nabootst hoe echte mensen zich daadwerkelijk gedragen.

3. De Hybride Aanpak
Het artikel vergelijkt drie versies van de kapitein:

  • De Basiskapitein (PPO): Gebruikt de standaard AI GPS. Goed, maar kan geschokt worden door stormen.
  • De Stoere Kapitein (RPPO): Gebruikt de "Wat Als?" training. Zeer stabiel, maar begrijpt menselijke angst niet.
  • De Super Kapitein (RPPO-MPT): Gebruikt zowel de "Wat Als?" training EN het "Menselijk Hart" beloningssysteem.

De Race-resultaten

De auteurs hebben deze kapiteins getest met gegevens van 15 grote Amerikaanse bedrijven (zoals Apple en Amazon) over een lange periode (2010 tot 2025). Ze hebben de tijd in twee delen gesplitst: een "oefenperiode" (2010–2022) en een "echte race" periode (2022–2025).

Dit is wat er gebeurde:

  • De Basiskapitein deed het oké, maar werd soms geschokt door de wilde schommelingen van de markt.
  • De Stoere Kapitein was stabieler en ging goed om met de ruis.
  • De Super Kapitein (RPPO-MPT) won de race.

Waarom won de Super Kapitein?

  • Hogere Rendementen: Het maakte meer geld over een langere periode.
  • Betere Veiligheid: Het verloor minder geld tijdens de angstvallige delen van de race (lagere "drawdown").
  • Gelukkiger Belegger: Omdat het de "Hoop-Angst" balans begreep, leverde het resultaten die beter aanvoelden voor een menselijke belegger, wat een betere "utility"-score bood.

De Kern van het Verhaal

Dit artikel beweert dat door een AI te leren om te oefenen in nep-chaos (om veerkracht op te bouwen) en als een mens te denken (om angst en hoop te begrijpen), je een portefeuillebeheerder kunt creëren die zowel veiliger als winstgevender is dan standaard AI-modellen. Het overbrugt de kloof tussen koude, harde wiskunde en de rommelige, emotionele realiteit van hoe mensen daadwerkelijk beleggen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →