← Nieuwste papers
🤖 AI

Finch: Benchmarking Finance & Accounting across Spreadsheet-Centric Enterprise Workflows

Dit paper introduceert FinWorkBench, een benchmark gebaseerd op authentieke, rommelige enterprise-gegevens van Enron en andere financiële instellingen, die aantoont dat zelfs de meest geavanceerde AI-systemen zoals GPT 5.1 Pro moeite hebben met het succesvol voltooien van complexe, multimodale financiële en boekhoudkundige workflows.

Oorspronkelijke auteurs: Haoyu Dong, Pengkun Zhang, Yan Gao, Xuanyu Dong, Yilin Cheng, Mingzhe Lu, Zikun Zhu, Adina Yakefu, Shuxin Zheng

Gepubliceerd 2026-04-07
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Haoyu Dong, Pengkun Zhang, Yan Gao, Xuanyu Dong, Yilin Cheng, Mingzhe Lu, Zikun Zhu, Adina Yakefu, Shuxin Zheng

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme, chaotische bibliotheek binnenstapt. De boeken zijn niet netjes op de planken, maar liggen overal verspreid: op de vloer, in dozen, sommige zijn open, andere dicht, en er zitten krantenknipsels, handgeschreven notities en foto's tussen. Dit is wat financieel en boekhoudkundig werk in de echte wereld vaak voelt.

Het papier dat je hierboven ziet, introduceert FINCH (ofwel FinWorkBench). Dit is een nieuwe "test" of "examen" voor kunstmatige intelligentie (AI), specifiek gericht op het zien of deze slimme computers echt klaar zijn om te werken als een echte boekhouder of financieel analist.

Hier is de uitleg, vertaald naar alledaags taalgebruik:

1. Het Probleem: De "Schoonmaak" vs. De "Rommel"

Tot nu toe hebben we AI getest op schone, nette tafels. Stel je voor dat je een robot vraagt om een rijtje getallen op te tellen. Dat is makkelijk. Maar in de echte wereld is het anders.

  • De echte wereld: Een financieel expert werkt met duizenden Excel-bestanden die met elkaar verbonden zijn, PDF-rapporten, foto's van handgeschreven notities, en e-mails waar mensen discussiëren over wat er moet gebeuren. Het is rommelig, vol foutjes, en soms zijn de formules in de Excel-rijen cryptisch als een geheime code.
  • De test: FINCH is gemaakt om precies die rommel na te bootsen. Het is geen test met schone tafels, maar een test in de modderige, drukke werkplaats van een echte bank of bedrijf.

2. Hoe hebben ze deze test gemaakt? (De "Detective-werk")

De onderzoekers hebben niet zomaar een test bedacht. Ze hebben gekeken naar de echte archieven van grote bedrijven (zoals het beroemde Enron-archief, maar dan van nu tot in de toekomst).

  • Ze hebben gekeken naar e-mails waar mensen zeiden: "Hé, pas die cijfers aan in het bestand van vorig jaar."
  • Ze hebben gekeken naar de versiegeschiedenis van Excel-bestanden: "Kijk, hier werd een rij verwijderd, en daar een nieuwe formule toegevoegd."
  • Vervolgens hebben echte mensen (experts met jarenlange ervaring) deze rommelige stukjes werk omgetoverd tot duidelijke opdrachten voor de AI. Het is alsof ze een detective zijn die uit een hoop losse bewijsstukken een compleet verhaal reconstrueert.

3. De Test: Wat moeten de AI's doen?

De AI's krijgen een opdracht die lijkt op het werk van een echte analist. Bijvoorbeeld:

  • "Haal de verkoopgegevens van 2023 uit dit PDF-rapport."
  • "Zet die gegevens over in dit Excel-bestand, maar pas de kleuren en lettertypes aan."
  • "Bereken de winst, maar gebruik de geheime formule die in een ander bestand staat."
  • "Maak een grafiek en schrijf een samenvatting."

Het is een lange keten van taken. Als je één stap fout doet (bijvoorbeeld een getal verkeerd overnemen), is de hele rest van het werk fout.

4. De Resultaten: De AI's zinken in het zand

De onderzoekers hebben de slimste AI's ter wereld (zoals de nieuwste versies van GPT, Claude en Gemini) deze test laten doen. Het resultaat? Ze zakken door de bodem.

  • Zelfs de allerbeste AI's slaagden maar in 38% van de gevallen.
  • Ze deden er gemiddeld 17 minuten over om één taak te doen, en faalden toch vaak.
  • Waarom?
    • De "Lange Keten": Als een taak uit meer dan twee stappen bestaat, raken de AI's in de war. Ze vergeten wat ze in stap 1 hebben gedaan, en stap 3 wordt daardoor fout.
    • De "Rommel": AI's houden van nette lijntjes. Als een Excel-tabel gekke opmaak heeft (samengevoegde cellen, rare kleuren), raken ze de weg kwijt.
    • De "Geheime Codes": Soms staat er in een kolom "Omzet", maar als je naar de formule kijkt, blijkt dat het eigenlijk "Kosten" is. De AI leest alleen de tekst, niet de onderliggende logica.

5. De Conclusie: We zijn nog niet klaar

De boodschap van dit papier is helder: AI is geweldig in het beantwoorden van vragen, maar nog niet goed in het uitvoeren van complex, rommelig kantoorwerk.

Het is alsof je een zeer intelligente student hebt die alle theorie uit zijn hoofd kent, maar als je hem in een drukke keuken zet om een complex diner te bereiden met beschadigde ingrediënten en een gebroken oven, maakt hij veel fouten.

Wat betekent dit voor de toekomst?
We moeten AI niet alleen leren "denken", maar ook leren omgaan met de chaos van de echte wereld. FINCH is de meetlat om te zien of AI's echt klaar zijn om onze boekhouders en analisten te vervangen. Op dit moment is het antwoord: "Nog niet helemaal, maar we weten nu precies waar ze nog moeten oefenen."

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →