FinDeepIndicator: Benchmarking Deep Research Agents in End-to-End Financial Indicator Construction
Dit artikel introduceert FinDeepIndicator, de eerste benchmark die is ontworpen om Deep Research-agenten te evalueren over de vier end-to-end fasen van de constructie van financiële indicatoren, waarbij wordt onthuld dat hoewel deze agenten standaard zoekopdrachten-uitgeruste LLM's overtreffen, ze nog steeds worstelen met betrouwbaarheid in gegevensretrieval en numerieke uitvoering binnen realistische financiële analysescenario's.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een detective bent die een mysterie probeert op te lossen, maar in plaats van alleen een getuige de vraag "Wat heeft u gezien?" te stellen, moet je het hele werk zelf doen. Je moet uitzoeken welke vraag je moet stellen, de getuige vinden in een drukke stad, naar hun verhaal luisteren, het opschrijven, de berekening maken om te zien of het verhaal klopt, en uiteindelijk aan de rechter het eindoordeel vertellen. Dit is de wereld van "Deep Research"-agenten. Dit zijn superintelligente computerprogramma's die zijn ontworpen om te handelen als menselijke onderzoekers: ze beantwoorden niet alleen vragen; ze gaan naar buiten, zoeken naar informatie, brengen het samen en lossen complexe problemen vanaf nul op. Maar hier zit de crux: alleen omdat een computer als een mens kan praten, betekent dat niet dat hij ook als een mens kan handelen. Hij kan de definitie van een woord perfect kennen, maar kan falen bij het vinden van het juiste boek in de bibliotheek of een fout maken bij het optellen van de pagina's.
In de wereld van de financiële sector is dit een grote zaak. Financiële indicatoren zijn als de scoreborden van de economie—cijfers die ons vertellen of een bedrijf gezond is, of de aandelenmarkt nerveus is, of het land groeit. Om deze cijfers te verkrijgen, kun je niet simpelweg gokken; je moet door jaren aan financiële rapporten graven, de exacte cijfers voor specifieke bedrijven vinden en de gegevens verwerken. Wetenschappers hebben deze "Deep Research"-agenten gebouwd om dit werk te doen, in de hoop dat ze menselijke analisten kunnen vervangen of helpen. Maar tot nu toe had niemand echt getest of deze agenten dit hele rommelige proces van begin tot eind daadwerkelijk konden afhandelen, of dat ze alleen maar goed waren in slim klinken terwijl ze halverwege stomme fouten maakten.
Maak kennis met FinDeepIndicator, een nieuwe "examen"-opstelling gecreëerd door een team van onderzoekers om deze digitale detectives te testen. Zie dit benchmark als een enorme hindernisbaan die specif으로 is ontworpen voor financiële agenten. In plaats van alleen te vragen: "Wat is de winst van Bedrijf X?", dwingt het examen de agent om vier verschillende dingen te doen: eerst de exacte wiskundige formule nodig te hebben (zoals weten dat "Winstmarge" betekent dat je winst deelt door de omzet); ten tweede naar buiten te gaan en de ruwe cijfers op het internet te vinden; derde daadwerkelijk de berekeningen uit te voeren om de tussenresultaten te krijgen; en tot slot het juiste uiteindelijke antwoord te geven. De onderzoekers hebben deze hindernisbaan gebouwd met 3.350 verschillende vragen die 234 verschillende soorten financiële scores beslaan, waarbij gegevens zijn verzameld van 800 echte bedrijven in zowel de VS als China over een periode van 10 jaar.
Toen ze de agenten door deze hindernisbaan lieten gaan, waren de resultaten een mix van "niet slecht" en "oh nee". De agenten waren verrassend goed in de eerste stap: het begrijpen van de regels. Ze konden de formules in meer dan 70% van de gevallen correct identificeren, wat aantoont dat ze echt begrijpen wat de financiële termen betekenen. Echter, op het moment dat ze naar buiten moesten gaan om de gegevens te vinden, viel alles uit elkaar. De nauwkeurigheid daalde als een baksteen. De agenten hadden moeite met het vinden van de juiste cijfers, waarbij ze vaak het verkeerde jaar, het verkeerde bedrijf pakten of een cruciaal stukje informatie volledig misten. Deze "gegevensverzameling"-stap bleek de grootste flessenhals te zijn, wat zorgde voor de grootste daling in prestaties.
Zelfs de slimste agenten, die hun zoekopdrachten beter konden plannen en hulpmiddelen beter konden gebruiken dan een eenvoudige zoekmachine, kregen het uiteindelijke antwoord slechts ongeveer 40% van de tijd goed. De onderzoekers ontdekten dat de agenten bijzonder slecht waren in "macro-economische" indicatoren (zoals inflatie of werkloosheidscijfers), waarbij de gegevens rommelig zijn en uit verschillende bronnen komen, en ze hadden nog meer moeite met "technische" indicatoren die complexe, voortschrijdende berekeningen vereisen. Interessant genoeg presteerden de agenten iets beter op Amerikaanse marktgegevens dan op Chinese marktgegevens, wat suggereert dat de manier waarop gegevens in verschillende landen worden georganiseerd en gerapporteerd een groot verschil maakt.
De kern van het verhaal is dat hoewel deze AI-agenten geweldig zijn in de theorie van de financiële wereld, ze nog steeds onhandig zijn in de praktijk van het opgraven van de feiten en het verwerken daarvan zonder fouten te maken. Het artikel suggereert dat als we willen dat deze agenten echt nuttig zijn in de echte wereld, we moeten stoppen met alleen te focussen op hoe goed ze kunnen chatten en moeten beginnen met het verbeteren van hun vermogen om betrouwbare gegevens te vinden en deze te verwerken zonder fouten te maken. Tot die tijd zijn ze als een briljante detective die de wet perfect kent, maar telkens verdwaalt op weg naar de plaats van het misdrijf.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.