InvestPhilBench: A Multi-Layer Dynamic Benchmark for Evaluating Large Language Model Procedural Reasoning in Expert Investment Philosophy
Dit artikel introduceert InvestPhilBench, een meerlagige dynamische benchmark die is ontworpen om het vermogen van grote taalmodellen te evalueren om expert-beleggingsbeslissingskaders te reconstrueren en toe te passen, waarbij wordt onthuld dat hoewel samengestelde geautomatiseerde scores vaak vloeiende prosodie belonen, gespecialiseerde procedurele metrieken aanzienlijke tekortkomingen in redenering blootleggen, zelfs bij grensverleggende modellen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Idee: Kan AI "denken" als een Meesterbelegger?
Stel je voor dat je een zeer slimme, goed geïnformeerde assistent inhuurt om je te helpen je geld te beheren. Je vraagt hem om een bedrijf te analyseren met de specifieke methode van Warren Buffett.
- De Oude Manier: Je controleert of de assistent feiten weet over Buffett. Weet hij dat Buffett houdt van "economic moats" (economische slotgrachten)? Weet hij dat hij een hekel heeft aan luchtvaartmaatschappijen? Als hij zegt "Buffett houdt van slotgrachten", krijgt hij een voldoende.
- Het Nieuwe Probleem: Het paper stelt dat het weten van de feiten niet genoeg is. Een echte expert volgt een strikt besluitvormingsproces (een recept). Voor Buffett is de eerste stap altijd: "Valt dit bedrijf binnen mijn Circle of Competence (competentiegebied)?" Als het antwoord "Nee" is (bijv. het is een biotechbedrijf), stopt het proces onmiddellijk. De deal is dood. Er vindt geen verdere analyse meer plaats.
InvestPhilBench is een nieuwe test die ontworpen is om te zien of AI-assistenten daadwerkelijk deze strikte, stapsgewijze recepten kunnen volgen, of dat ze alleen slim klinken terwijl ze de belangrijkste stappen overslaan.
De "InvestPhilBench" Test: Een Hindernisbaan met 8 Lagen
De onderzoekers hebben een test gebouwd met 8 moeilijkheidsgraden, zoals een videogame met steeds moeilijkere levels:
- Levels 1–3 (De Factcheck): Kan de AI onthouden wie wat zei? (bijv. "Wie bedacht het concept 'Margin of Safety'?")
- Resultaat: De AI is hier erg goed in. Het is als een student die het tekstboek uit zijn hoofd heeft geleerd.
- Levels 4–5 (Reconstructie van het Recept): Kan de AI de checklist van de belegger in de juiste volgorde weer opbouwen?
- Resultaat: Hier wordt het lastig. De AI begint te struikelen.
- Levels 6–8 (Realistische Simulatie): Kan de AI een nieuw, vreemd investeringsscenario nemen en de specifieke regels van de belegger erop toepassen?
- Resultaat: Dit is het moeilijkste deel. De AI slaagt er vaak niet in om de logica correct toe te passen, zelfs als hij de regels wel kent.
De "Magie" versus de "Mechanica"
Het paper ontdekte een verrassende truc die de AI gebruikt om te bedriegen.
- De "Vloeiende Proza" Valstrik: Wanneer de AI antwoordt, schrijft hij prachtig. Het klinkt zelfverzekerd en professioneel. Als je alleen de laatste paragraaf leest, zou je kunnen denken dat hij een perfect werk heeft geleverd.
- De "Poort" Realiteit: De onderzoekers bouwden een speciale tool (genaamd BASP) om het antwoord te beoordelen. Ze ontdekten dat hoewel de AI hoge scores haalt voor "goed klinken", hij vaak de Kill Criteria (afwijzingscriteria) mist.
De "Kill Criterion" Analogie:
Stel je een uitsmijter bij een club voor.
- De fout van de AI: De uitsmijter laat iemand binnen omdat hij een coole jas draagt (het "vloeiende proza").
- De Realiteit: De uitsmijter had eerst het ID-bewijs moeten controleren. Als het ID zegt "Onder de 21", moet de persoon onmiddellijk worden weggestuurd, ongeacht hoe coole de jas ook is.
- De Bevinding van het Paper: De AI slaat de ID-controle (het "Kill Criterion") vaak over en laat de slechte investering binnen, simpelweg omdat de uitleg er goed uitzag.
De "Composite" versus de "Gate" Score
Het paper introduceert twee manieren om de AI te beoordelen:
- De Composite Score (De "Vloeiendheid" Score): Dit is als een docent die een student een 'A' geeft omdat het essay goed geschreven is, ook al klopt de wiskunde erin niet. De top AI-modellen halen hier zeer hoge scores (rond de 90%).
- De Gate Reconstruction Accuracy (De "Logica" Score): Dit is als een wiskundeleraar die elke stap van de berekening controleert. Wanneer de onderzoekers deze strengere test gebruikten, daalden de scores van de top AI-modellen aanzienlijk (tot ongeveer 57–77%).
De Kernboodschap: De AI wordt beter in het praten als een belegger, maar is nog steeds slecht in het denken als een belegger.
Het "Recept" versus het "Kookboek"
De onderzoekers testten drie manieren om de AI te helpen:
- Closed Book: De AI moet vertrouwen op zijn geheugen. (Hij worstelt hiermee).
- De "Oracle" (Het Volledige Kookboek): Ze gaven de AI het volledige regelboek van de belegger om te lezen terwijl hij antwoord geeft.
- Verrassing: Het geven van het hele boek maakte de AI in sommige gevallen juist slechter. Hij raakte in de war door de hoeveelheid informatie (zoals een chef die de hele encyclopedie probeert te lezen terwijl hij een biefstuk bakt).
- Targeted Retrieval (Het Spiekbriefje): Ze gaven de AI alleen de top 3 relevante regels.
- Resultaat: Dit werkte het beste. Het is also[f een chef een specifiek receptenkaartje geven in plaats van de hele bibliotheek.
De "Failure Modes" (Hoe de AI faalt)
De paper identificeerde zes specifieke manieren waarop de AI faalt, die ze pakkende namen gaven:
- De "Hallucinated Gate": De AI verzint een stap in het proces die niet bestaat (bijv. "Stap 4: Controleer de maanfase" wanneer de belegger dat nooit heeft gezegd).
- De "Time Traveler": De AI haalt datums door elkaar. Hij kan bijvoorbeeld zeggen dat Buffett in 2020 een hekel had aan luchtvaartmaatschappijen, terwijl hij ze in 2016 juist kocht en in 2020 verkocht. Hij vlakt de geschiedenis af tot één verwarrend verhaal.
- De "Voice Changer": De AI klinkt als een generieke financiële expert in plaats van de specifieke persoon. Hij kan de woorden van Ray Dalio gebruiken om de strategie van George Soros uit te leggen.
- De "Kill Criterion Omission": De meest voorkomende fout. De AI somt de regels op, maar vergeet de "Stop"-tekens. Hij blijft een slechte deal analyseren, zelfs nadat de eerste regel zei: "Afwijzen".
De Conclusie
InvestPhilBench is een nieuw instrument dat bewijst dat huidige AI-modellen uitstekend zijn in het reciteren van een beleggingsfilosofie, maar nog steeds moeite hebben met het toepassen ervan.
- Wat werkt: De AI kan je vertellen wat een belegger gelooft.
- Wat faalt: De AI kan vaak niet de strikte, opeenvolgende logica volgen van hoe die belegger een beslissing neemt, vooral wanneer dat inhoudt om "Nee" tegen een deal te zeggen.
Het paper concludeert dat totdat AI betrouwbaar in staat is om deze "kill criteria" en de stapsgewijze logica te volgen, we de AI niet volledig kunnen vertrouwen om zelfstandig complexe beleggingsbeslissingen te nemen. Het is een hulpmiddel voor onderzoek, maar het is nog geen vervanging voor de menselijke logica van een meesterbelegger.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.