AuditFraudBench: Benchmarking Audit Judgment in Detecting Fraudulent Misstatements
Dit artikel introduceert AuditFraudBench, een nieuwe benchmark die is samengesteld uit authentieke regelgevende indieningen en handhavingsberichten om het vermogen van grote taalmodellen te evalueren om frauduleuze onjuistheden te detecteren door het identificeren van winstbrontoerekening, misleidende narratieven en fraudepatronen, wat onthult dat huidige modellen nog steeds worstelen met de complexe redenering die vereist is voor audit-oordeelsvorming.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een detective bent die een mysterie probeert op te lossen, maar de verdachte is geen crimineel in een donker steegje; het is een enorme corporatie die probeert haar financiële fouten te verbergen in een berg papierwerk.
Dit artikel introduceert een nieuwe "examen" genaamd AuditFraudBench. Het is ontworpen om te testen hoe goed Kunstmatige Intelligentie (AI) de rol van die detective kan spelen. Specifiek test het of AI kan ontdekken wanneer een bedrijf liegt over waarom het geld heeft verdiend, zelfs als de leugen heel overtuigend klinkt en aan alle regels voldoet.
Hier is de uitsplitsing van het artikel met eenvoudige analogieën:
1. Het Probleem: De "Beleefde Leugen"
Huidige AI-modellen zijn erg goed in wiskunde en het vinden van overduidelijke typefouten. Als een bedrijf zegt: "We hebben 1 miljoen dollar verdiend," maar de wiskunde zegt: "$100," dan vangt de AI dat op.
Maar echte fraude is sluتر. Het is als een student die een slecht cijfer krijgt maar tegen zijn ouders zegt: "Ik heb echt hard gestudeerd, maar de toets was oneerlijk," terwijl hij eigenlijk gewoon niet gestudeerd heeft. Het verhaal klinkt aannemelijk, de grammatica is perfect en de cijfers kloppen intern misschien zelfs wel. Het probleem is dat het verhaal de echte reden voor het slechte cijfer verbergt.
Het artikel stelt dat huidige AI slecht is in het herkennen van deze "aannemelijke leugens" in financiële rapporten. De AI kan de wiskunde doen, maar kan nog niet goed aanvoelen of de uitleg van de CEO een slimme vermomming is voor een fout.
2. De Oplossing: Het "Waarheid vs. Verhaal" Examen
De onderzoekers hebben een speciale testbank gebouwd met echte gevallen waarin de Amerikaanse overheid (de SEC) bedrijven heeft betrapt op liegen. Ze hebben het originele rapport (de leugen), het gecorrigeerde rapport (de waarheid) en de uitleg van de overheid over wat er werkelijk is gebeurd.
Ze hebben dit omgezet in een examen met drie delen voor AI:
Taak 1: De "Waarom"-detective (Profit Source Attribution)
- Het scenario: Een bedrijf zegt: "Onze winst is gestegen omdat we meer producten hebben verkocht!"
- De test: De AI moet naar de gecorrigeerde cijfers kijken en zeggen: "Nee, dat klopt niet. Je hebt niet meer producten verkocht; je hebt alleen verkopen geteld die je nog niet had gerealiseerd."
- Het doel: Kan de AI de echte drijfveer van het geld vinden, of gelooft de AI het verhaal van het bedrijf?
Taak 2: De "Spin"-herkenner (Misleading Narrative Detection)
- Het scenario: Een bedrijf schrijft een paragraaf waarin staat: "Onze zaken bloeien!"
- De test: De AI moet beslissen of deze paragraaf misleidend is. Zelfs als elk woord technisch gezien waar is, is het dan zo dat het de informatie verhult dat de "bloei" alleen plaatsvindt in één klein, stervend departement?
- Het doel: Kan de AI detecteren wanneer een bedrijf "spin" gebruikt om een slechte situatie er goed uit te laten zien?
Taak 3: Het "Crimineel Profiel" (Fraud Pattern Classification)
- Het scenario: De overheid zegt: "Dit bedrijf heeft kosten naar volgend jaar verschoven om er dit jaar beter uit te zien."
- De test: De AI moet deze truc categoriseren. Is het "Omzet timing"? Is het "Boekhoudfraude"? Is het "Verbergen van kosten"?
- Het doel: Kan de AI het type truc herkennen dat wordt gebruikt?
3. De Resultaten: De AI kwam vast te zitten
De onderzoekers hebben top AI-modellen (zoals GPT, DeepSeek en Qwen) getest op dit examen. Dit is wat ze vonden:
- Goed in wiskunde, slecht in verhalen: De AI-modellen waren verrassend goed in Taak 1. Ze konden vaak het juiste antwoord raden (bijv. "De uitleg is misleidend").
- Slecht in het uitleggen van het 'waarom': Echter, wanneer gevraagd werd om te uitleggen waarom de uitleg misleidend was, worstelde de AI. Het was alsof een student wel het juiste antwoord wist bij een meerkeuzevraag, maar niet kon laten zien hoe hij tot dat antwoord kwam. Ze konden de link tussen de cijfers en het verhaal niet leggen.
- De "Spin"-taak was het moeilijkst: Taak 2 (het herkennen van het misleidende verhaal) was het moeilijkst. Zelfs de slimste AI-modellen raakten in de war door subtiele trucs waarbij het bedrijf niet direct loog, maar simpelweg de engere delen wegliet.
- Groter is niet altijd beter: Interessant genoeg hielp het maken van de AI "slimmer" (door het model groter te maken) niet altijd. Een iets kleiner model deed soms net zo goed als een gigantisch model. Dit suggereert dat de AI specifieke training nodig heeft in boekhoudkundige logica, en niet alleen algemene intelligentie.
De Kernboodschap
Het artikel concludeert dat hoewel AI steeds beter wordt in het lezen van financiële rapporten, het nog niet klaar is om menselijke auditors te vervangen bij het opsporen van geraffineerde fraude. De AI kan de rekenkunde uitvoeren, maar heeft nog steeds moeite met het begrijpen van de intentie achter de woorden en de "spin" die wordt gebruikt om de waarheid te verbergen.
AuditFraudBench is slechts een nieuw hulpmiddel om te meten hoe ver AI nog moet gaan voordat het echt kan denken als een sceptische auditor.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.