← Nieuwste papers
💻 computer science

OpenPM: Auditable Point-in-Time Evaluation for LLM Portfolio-Management Agents

Dit artikel introduceert OpenPM, een controleerbaar evaluatiekader voor momentopnames van LLM-portfoliobeheeragents dat strikte beschikbaarheids- en risicobeperkingen afdwingt om opgeblazen resultaten te voorkomen, waarbij wordt onthuld dat de kwaliteit van analisten en de kosten van personeelsverloop kritischer zijn dan de keuze van het constructiemodel bij het genereren van bescheiden rendementen.

Oorspronkelijke auteurs: Xinying Cai, Minghao Guo, Jiahe Liu, Jiaojiao Han, Bangwei Guo, Yitao Long, Yuxuan Chen, Bohan Wu, Dimitris N. Metaxas, Raymond Li

Gepubliceerd 2026-08-12
📖 1 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Xinying Cai, Minghao Guo, Jiahe Liu, Jiaojiao Han, Bangwei Guo, Yitao Long, Yuxuan Chen, Bohan Wu, Dimitris N. Metaxas, Raymond Li

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Technische Samenvatting: OpenPM – Controleerbare Point-in-Time Evaluatie voor LLM Portefeuillebeheer-agenten

1. Probleemstelling

Het paper behandelt drie kritieke tekortkomingen in de huidige evaluatie van Large Language Model (LLM) handelsagenten, die vaak leiden tot opgeblazen of niet-inzetbare resultaten:

  1. Informatielekkage: Agenten hebben vaak toegang tot data die op het beslismoment nog niet beschikbaar was (bijv. toekomstige observaties, event-gestempelde records in plaats van beschikbaarheids-gestempelde records), wat kunstmatige vaardigheid creëert.
  2. Optimistische Executie: Gerapporteerde rendementen negeren vaak handelskosten (spread, slippage, omloopsnelheid), wat bovengrenzen presenteert in plaats van realistische, inzetbare schattingen.
  3. Niet-afgedwongen Mandaten: Natuurlijke taal risicobeperkingen (bijv. "conservatief", "maximaal 20 namen") worden vaak behandeld als zachte voorkeuren voor post-hoc scoring, in plaats van harde beperkingen die tijdens de uitvoering van de portefeuille worden afgedwongen.

Bestaande benchmarks falen vaak in het gelijktijdig controleren van deze kwesties, met name door een gebrek aan point-in-time (PIT) datagating en strikte handhaving van mandaten.

2. Methodologie: Het OpenPM Framework

OpenPM is een controleerbaar, point-in-time evaluatieframework dat is ontworpen om geloofwaardige evaluatie te behandelen als een engineering-artefact.

Kernontwerpprincipes

  • Point-in-Time Data Omgeving: Het systeem dwingt een strikte "beschikbaarheidspoort" af. Een record komt pas in de staat van de agent bij beslistijd TT als de ts_available T\le T is. Dit onderscheidt tussen event-tijd en beschikbaarheidstijd (bijv. een kwartaalcijfer is pas beschikbaar na acceptatie door EDGAR). De omgeving dekt een S&P 500 universum met 5-minuten marktobservaties.
  • Mandat Handhaving: Mandaten in natuurlijke taal worden geparsed naar getypeerde beperkingen (bijv. maximale gewicht per naam, maximaal aantal namen). Cruciaal is dat deze worden afgedwongen door een deterministische in-loop criticus die de voorgestelde gewichten van de agent projecteert op de haalbare set vóór uitvoering, in plaats van de agent enkel post-hoc te scoren.
  • Kostenbewuste Executie: Rendementen worden berekend met zijde-bewuste half-spreads (kopen tegen de ask, verkopen tegen de bid) zonder marktimpact-modellering, wat een conservatieve maar realistische kostenbasis biedt.

De Tiered Allocator (Referentie-agent)

Het paper introduceert een referentie-agent architectuur om specifieke componenten van de handels-pipeline te isoleren:

  1. Mandate Compilatie: Converteert natuurlijke taal naar getypeerde beperkingen.
  2. Liquidity Gate: Filtert het universum tot verhandelbare namen (bijv. top 50 op basis van liquiditeit).
  3. Analyst Tier: Zes parallelle LLM-analisten scoren onafhankelijk kandidaten over getypeerde kanalen (technisch, regime, events, nieuws, 8-K items, 10-K/10-Q narratieven).
  4. Constructor: Een aparte LLM stelt portefeuillegewichten voor op basis van de geaggregeerde analisten-scores en spreads, maar zonder toegang tot ruwe prijzen of de samengestelde score.
  5. Deterministic Critic: Projecteert het voorstel van de constructor op de haalbare set (handhaving van long-only, naam-caps, liquiditeitslimieten).
  6. Fill Simulator: Voert transacties uit tegen de geciteerde zijden.

Experimentele Opstelling

  • Dataset: Een bevroren, content-hashed snapshot van de S&P 500 (508 namen) die actief was tussen 19 februari 2026 en 1 mei 2026. De evaluatieperiode is 2 maart 2026 tot 1 mei 2026 (44 handelsdagen).
  • Isolatiestrategie: Om de "constructor" capaciteit te isoleren, draaien de auteurs de analyst tier één keer om een "bevroren capture" van bewijslast te creëren. Dezezelfde bewijslast wordt vervolgens afgespeeld over verschillende constructor-modellen (gpt-5, Opus-4.7, DeepSeek-V3.2, Qwen3-Max, gpt-4o-mini) om te bepalen of de constructor waarde toevoegt onafhankelijk van de signaalkwaliteit.
  • Modi: Experimenten worden uitgevoerd in "once-then-hold" (één enkele herbalancering) en dagelijkse herbalanceringsmodi.

3. Belangrijkste Resultaten

Het paper rapporteert structurele bevindingen in plaats van absolute alpha-claims, waarbij wordt benadrukt dat de resultaten bovengrenzen zijn op een enkele bevroren window.

Constructor Capaciteit

  • Conditionele Winsten: Sterkere constructors (bijv. gpt-5, Opus-4.7) laten bescheiden, model-afhankelijke winsten zien ten opzien van equal-weighting (EW) van dezelfde kandidaat-pool, maar alleen wanneer de upstream analyst-signaal sterk is.
  • Analyst Dominantie: De kwaliteit van de analyst tier is de primaire drijfveer van prestaties. Wanneer de analyst capture zwak was (DeepSeek-V3.2), kon geen enkele constructor de EW-baseline van dezelfde pool verslaan. Wanneer de capture sterk was (gpt-5), versloeg de meeste constructors de EW.
  • Overlap: Sterke constructors herwegen grotendeels de EW-roster (75–78% overlap) in plaats van deze volledig te vervangen. Zwakkere constructors wijken aanzienlijk af en presteren minder goed.

Kosten en Omloopsnelheid

  • Omloopsnelheid is de Kostenfactor: Bij dagelijkse herbalancering wordt omloopsnelheid de dominante factor voor kosten. Modellen met een hoge omloopsnelheid (bijv. Qwen3-Max, gpt-4o-mini) zagen hun netto rendementen onder de SPY-benchmark zakken door de kostendruk, ondanks dat ze vergelijkbare bruto rendementen hadden als modellen met een lagere omloopsnelheid.
  • Discipline Maakt het Verschil: Het winnende patroon bestaat uit goed selecteren en spaarzaam handelen. Lage omloopsnelheid alleen is onvoldoende (gpt-5 had de laagste omloopsnelheid maar presteerde onder de SPY vanwege slechte selectie in dat specifieke regime).

Compliance en Auditing

  • Mandate Adherentie: Alle constructors hielden zich succesvol aan expliciete numerieke caps (bijv. 10% max gewicht) in hun ruwe voorstellen.
  • Noodzaak van de Critic: De deterministische criticus was essentieel voor het afdwingen van liquiditeitsbeperkingen (harde clips) die strikter waren dan het mandaat en onzichtbaar waren voor het model.
  • Contaminatie: Alle runs slaagden voor het contaminatie-certificaat, wat bevestigt dat er geen look-ahead lekkage is opgetreden.

4. Betekenis en Claims

Het paper positioneert OpenPM niet als een gevalideerde alpha-generator, maar als een diagnostisch instrument voor de LLM trading-community.

  • Engineering Artefact: Het herkadert evaluatie als een engineering-probleem dat strikte datacontracten, beschikbaarheidsgating en deterministische handhavingslagen vereist.
  • Eerlijkheid in Claims: De auteurs verklaren expliciet dat alle rendementen "bovengrenzen zijn op een enkele bevroren window zonder marktimpact, geen gevalideerde alpha". Het doel is om claims eerlijk te houden door elk gerapporteerd getal te koppelen aan de specifieke condities (data-fingerprint, kostenmodel, mandaat) die het produceerden.
  • Diagnostische Inzichten: Het framework onthult dat "constructie-vaardigheid" vaak een proxy is voor de "kwaliteit van het analyst-signaal". Het paper betoogt dat rekenkracht (compute) geprioriteerd moet worden voor de analyst tier, waarbij daarna de goedkoopst mogelijke inzetbare constructor wordt gebruikt.
  • Auditbaarheid: Door artefacten te genereren zoals contaminatie-certificaten, kosten-gevoeligheidscurves en beperking-nalevingsrapporten voor elke run, stelt OpenPM onderzoekers in staat om te verifiëren of resultaten het gevolg zijn van data-lekkage of optimistische aannames over de uitvoering.

Samenvattend demonstreert OpenPM dat hoewel LLM's onder specifieke omstandigheden portefeuilles kunnen construeren die eenvoudige baselines verslaan, hun prestaties zwaar afhankelijk zijn van de upstream signaalkwaliteit en gemakkelijk worden uitgehold door omloostskosten. Het framework biedt de nodige strengheid om echt talent te onderscheiden van evaluatie-artefacten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →