FinAuditing: A Financial Taxonomy-Structured Multi-Document Benchmark for Evaluating LLMs
Dit paper introduceert FinAuditing, een nieuw benchmark voor het evalueren van grote taalmodellen op hun vermogen om semantische, structurele en numerieke inconsistenties te detecteren in gestructureerde financiële rapporten (XBRL) door middel van drie specifieke taken: financieel semantisch matching, relatietreksie en wiskundig redeneren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
FinAuditing: De Digitale Rekenmeester voor Financiële Rapporten
Stel je voor dat je een gigantische bibliotheek binnenstapt. Deze bibliotheek bevat niet gewoon boeken, maar de jaarverslagen van duizenden bedrijven. Elk verslag is een enorme, ingewikkelde puzzel bestaande uit duizenden pagina's, tabellen en getallen. Het doel? Controleren of de cijfers kloppen.
In het verleden deden mensen dit met pen en papier, maar tegenwoordig is dat onmogelijk. De hoeveelheid data is te groot. Dus hebben we geprobeerd slimme computers (kunstmatige intelligentie of AI) in te huren om dit werk te doen. Maar hier zit een addertje onder het gras: deze AI's zijn vaak geweldig in het lezen van nieuwsberichten of het schrijven van verhalen, maar ze struikelen over de strenge, logische regels van de boekhouding.
De auteurs van dit paper hebben een nieuwe test ontwikkeld, genaamd FINAUDITING, om te kijken of deze AI's echt geschikt zijn voor dit zware werk.
Hier is hoe het werkt, vertaald naar alledaagse taal:
1. Het Probleem: De "Verborgen" Foutjes
Stel je voor dat een bedrijf zegt: "We hebben 100 miljoen dollar aan contant geld." Maar als je alle kleine detailrapporten eronderdoor kruipt en die optelt, kom je maar uit op 95 miljoen. Dat is een fout.
Voor een mens is het al moeilijk om dit te vinden in een berg papierwerk. Voor een computer is het nog moeilijker, omdat de data niet als een simpel verhaal is opgebouwd, maar als een gigantisch, gestructureerd web. Het is alsof je een auto moet repareren, maar de instructies staan verspreid over tien verschillende handleidingen die allemaal op elkaar verwijzen. Als je één stukje mist, snap je de hele machine niet.
2. De Oplossing: FINAUDITING (De "Gymzaal" voor AI)
De onderzoekers hebben een nieuwe "gymzaal" gebouwd voor AI-modellen. In plaats van ze te laten oefenen met simpele vragen, gooien ze ze in de diepe wateren van echte, complexe financiële rapporten.
Ze hebben de test opgedeeld in drie specifieke sporten:
Sport 1: De Woordenschat-Check (FinSM)
- De analogie: Stel je voor dat je in een supermarkt bent. Jij vraagt om "melk", maar de AI noemt het "yoghurt" omdat het er qua vorm op lijkt. In de boekhouding mag dat niet. Er zijn strikte regels over hoe je dingen moet noemen.
- De taak: De AI moet controleren of een bedrijf de juiste "naam" (term) heeft gebruikt voor een bedrag. Gebruikten ze het juiste etiket voor hun winst, of hebben ze per ongeluk een verkeerd etiket geplakt? De AI's bleken hier vaak in te struikelen; ze kijken naar de oppervlakte, niet naar de strenge regels.
Sport 2: De Relatie-Check (FinRE)
- De analogie: Denk aan een familieboom. Een grootvader heeft een zoon, en die zoon heeft een dochter. Als je in de boom schrijft dat de dochter de grootvader is, is dat logisch onmogelijk.
- De taak: In financiële rapporten moeten getallen logisch met elkaar verbonden zijn. Als "Winst" een deel is van "Omzet", dan moet dat zo staan. De AI moet zien of de computer de "familiebanden" tussen de getallen correct heeft begrepen. Veel AI's verwarren deze hiërarchieën.
Sport 3: De Reken-Check (FinMR)
- De analogie: Dit is de klassieke "rekenles". Als je 5 appels hebt en je koopt er 3 bij, moet je er 8 hebben. Als het verslag zegt dat je er 7 hebt, is er iets mis.
- De taak: De AI moet niet alleen de getallen vinden, maar ze ook zelf optellen en aftrekken volgens de boekhoudregels. De test toont aan dat zelfs de slimste AI's hier vaak de fout in gaan. Ze kunnen de getallen vinden, maar ze vergeten ze correct op te tellen of ze maken rekenfouten in de complexe formules.
3. Wat Vonden Ze? (De Uitslag)
De onderzoekers hebben 13 van de slimste AI's ter wereld (zoals GPT-4, Llama en andere) deze test laten doen. Het nieuws is niet zo goed:
- Ze zijn nog niet klaar voor de echte wereld: Zelfs de allerbeste AI's haalden lage scores. Ze konden de "grote lijnen" wel zien, maar faalden bij de details.
- Groter is niet altijd beter: Een AI met meer "hersenen" (meer parameters) was niet per se beter. Soms maakten ze juist meer fouten omdat ze te veel op oppervlakkige gelijkenissen letten in plaats van op de strenge regels.
- Financiële AI's doen het niet veel beter: Zelfs AI's die speciaal zijn getraind op financiële teksten faalden bij deze strenge, gestructureerde testen.
4. Waarom is dit belangrijk?
Dit onderzoek is een wake-up call. Het zegt: "We kunnen AI nog niet blindelings vertrouwen om de boeken van grote bedrijven te controleren."
Als AI's deze fouten maken, kunnen bedrijven per ongeluk verkeerde cijfers publiceren. Dat kan leiden tot boetes, vertrouwenverlies en zelfs financiële crises.
De conclusie:
FINAUDITING is als een strenge examinator die zegt: "Jullie zijn slim, maar jullie moeten nog veel leren over logica, structuur en de strenge regels van de boekhouding voordat jullie als echte auditeurs kunnen werken." De onderzoekers maken hun test openbaar, zodat ontwikkelaars hun AI's kunnen blijven oefenen tot ze echt betrouwbaar zijn.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.