← Nieuwste papers
💰 quantitative finance

CLQT: A Closed-Loop, Cost-Aware, Strategy-Consistent Benchmark for Diagnostic Evaluation of LLM Portfolio-Management Agents

Het artikel introduceert CLQT, een closed-loop, kostenbewuste en strategie-consistente benchmark die de evaluatie van LLM-portfoliobeheeragenten verschuift van eenvoudige op rendement gebaseerde rangschikking naar een diagnostisch kader dat in staat is om specifieke redeneerfouten te isoleren en duurzame competenties te meten door middel van een verifieerbare, meerfasige handelscyclus.

Oorspronkelijke auteurs: Bo Qu, Mingguang Chen

Gepubliceerd 2026-06-30
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Bo Qu, Mingguang Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een team van robot-financieel adviseurs inhuurt om je geld te beheren. In het verleden testten mensen deze robots door ze eenvoudige vragen te stellen zoals: "Wat is de prijs van het aandeel Apple?" of door te kijken wie het meeste geld verdiende in een enkel kwartaal.

De auteurs van dit artikel stellen dat deze oude tests gebrekkig zijn. Ze zijn als het beoordelen van een chef-kok uitsluitend op hoeveel calorieën hun gerecht bevat, zonder de eter te laten proeven of te controleren of ze daadwerkelijk het recept hebben gevolgd. Een robot kan veel geld verdienen simpelweg omdat de markt die dag toevallig omhoog ging, niet omdat de robot echt slim is. Of het kan valsspelen door "vooruit te gluren" naar het nieuws van morgen.

Dit artikel introduceert CLQT, een nieuwe manier om AI-agenten te testen. Zie CLQT niet als een race om te zien wie wint, maar als een medisch diagnostisch hulpmiddel voor AI. In plaats van een robot een enkele score te geven (zoals "Goud Medaille"), geeft het de robot een gedetailleerd rapport met vijf specifieke vitale functies.

Hier is hoe CLQT werkt, met behulp van eenvoudige analogieën:

1. De "Niet Valsspelen" Regel (De Tijdspoort)

Stel je een test voor waarbij studenten de antwoordenlijst mogen inzien voordat het examen begint. Dat is wat veel oude tests met AI deden; ze lieten de AI per ongeluk gegevens uit de toekomst zien.
CLQT heeft een strikte "Tijdspoort" (Time Gate). Het is als een beveiliger die de klok controleert. De AI mag alleen informatie gebruiken die bestond voordat het een beslissing nam. Als de AI probeert vooruit te gluren naar de aandelenkoersen van morgen, faalt de test onmiddellijk. Dit zorgt ervoor dat de AI echt nadenkt, en niet alleen herinnert.

2. De Vijfdelige Gezondheidscontrole (Het Scoreformulier)

In plaats van te vragen "Hoeveel geld heb je verdiend?", stelt CLQT vijf diepere vragen. Het geeft de AI een score van 0 tot 100 op elk punt:

  • Coherentie (De "Verhalenverteller"-test): Komt de actie van de AI overeen met het eigen verhaal?
    • Analogie: Stel je voor dat een bestuurder zegt: "Ik ga langzaam rijden omdat het regent," maar dan vol gas geeft. CLQT controleert of de redenering van de AI overeenkomt met de werkelijke transacties. Het artikel vond dat veel AI's een geweldig verhaal vertellen, maar vervolgens iets totaal anders doen.
  • Acuïteit (De "Focus"-test): Kan de AI de ruis negeren?
    • Analogie: Stel je voor dat je probeert naar een vriend te luisteren in een luid, chaotisch stadion. Sommige AI's raken afgeleid door elke harde knal (willekeurige prijsschommelingen) en vergeten de belangrijke signalen (echte trends). CLQT meet of de AI in staat is om zich op de juiste zaken te concentreren.
  • Compositie (De "Kalmte"-test): Raakt de AI in paniek als het onrustig wordt?
    • Analogie: Wanneer de aandelenmarkt plotseling daalt, blijft een kalme belegger standvastig. Een paniekerige belegger verkoopt alles in een vlaag van paniek. CLQT controleert of de AI overreageert op kleine hobbels in de weg of gedisciplineerd blijft.
  • Discipline (De "Regelvolger"-test): Houdt de AI zich aan het plan?
    • Analogie: Als je een robot vertelt: "Koop alleen blauwe shirts," en hij koopt een rood shirt, dan ontbreekt het hem aan discipline. CLQT controleert of de AI zijn eigen regels en budgetlimieten respecteert zonder dat er een mens hoeft te schreeuwen.
  • Betrouwbaarheid (De "Uithoudings"-test): Voltooit de robot daadwerkelijk de taak?
    • Analogie: Sommige robots beginnen aan een taak, raken in de war, crashen of geven halverwege op. CLQT telt hoe vaak de AI een volledige cyclus van denken en handelen succesvol voltooit zonder vast te lopen.

3. Het "Twee Modus" Experiment

De onderzoekers testten de AI's in twee verschillende "persoonlijkheidsmodi":

  • Gestructureerde Modus: De AI handelt als een strikt comité. Het moet een stapsgewijze checklist volgen (zoals een piloot met een pre-flight checklist).
  • Autonome Modus: De AI krijgt volledige vrijheid om te doen wat hij denkt dat het beste is, zonder checklist.

De Verrassende Bevinding:
Het artikel ontdekte dat "vrijheid" een AI niet automatisch slimmer maakt.

  • Sommige AI's (zoals de genaamd DeepSeek) waren verschrikkelijk wanneer ze volledige vrijheid kregen, maar werden uitstekend wanneer ze werden gedwongen een checklist te volgen.
  • Andere AI's (zoals Claude) presteerden juist beter wanneer ze totale vrijheid hadden.
  • De Les: Je kunt niet simpelweg zeggen "AI is goed" of "AI is slecht". Je moet weten welke AI het beste werkt met welke stijl van management.

4. De "Echte Wereld" versus "Simulatie"

Het artikel draaide een simulatie voor een jaar en ook een "live" test voor twee weken met een echte broker (maar met fictief geld).

  • Het Resultaat: De "gezondheidscheck" werkte in beide gevallen perfect. Ondanks dat de AI de live data nog nooit eerder had gezien, kon de test nog steeds aangeven of de AI kalm, gefocust of betrouwbaar was.
  • De "Kloof": Het artikel vond een consistente kloof tussen wat de AI zei dat het zou doen en wat het daadwerkelijk deed. Zelfs in de live test kwamen de acties van de AI vaak niet overeen met de redenering. Dit suggereert dat de AI goed is in "praten met de pretentie" (talking the talk), maar soms moeite heeft met het "daadwerkelijke werk" (walking the walk).

5. Waarom dit ertoe doet (De "Kaart" versus de "Ranglijst")

De auteurs zeggen: "Stop met kijken naar de ranglijst."
Oude tests probeerden AI's te rangschikken van 1 tot 10. Dit artikel stelt dat dat nutteloos is omdat de markt verandert. Een AI die vandaag wint, kan morgen verliezen.

In plaats daarvan biedt CLQT een kaart van beperkingen.

  • Het vertelt je: "Deze AI is geweldig in het kalm blijven, maar slecht in het volgen van regels."
  • Het vertelt je: "Deze AI is slim, maar crasht als je hem niet genoeg tijd geeft om na te denken."

Samenvatting

CLQT is een nieuwe, rigoureuze manier om AI-investeerders te testen. Het voorkomt dat ze valsspelen, dwingt hen hun redenering uit te leggen en geeft hen een gedetailleerd rapport over hun persoonlijkheid en gewoonten. Het bewijst dat geld verdienen in een simulatie niet betekent dat een AI daadwerkelijk slim is; het kan ook gewoon geluk zijn. De echte waarde ligt niet in het vinden van de "winnaar", maar in het begrijpen van precies waar elke AI sterk is en waar hij waarschijnlijk zal falen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →