← Nieuwste papers
💬 NLP

HiFi-KPI: A Dataset for Hierarchical KPI Extraction from Earnings Filings

Deze paper introduceert HiFi-KPI, een groot dataset met hiërarchisch georganiseerde KPI-labels voor iXBRL-earningsrapporten, en evalueert de prestaties van verschillende modellen bij het classificeren en extraheren van deze financiële indicatoren.

Oorspronkelijke auteurs: Rasmus Aavang, Giovanni Rizzi, Rasmus Bøggild, Alexandre Iolov, Mike Zhang, Johannes Bjerva

Gepubliceerd 2026-03-20
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Rasmus Aavang, Giovanni Rizzi, Rasmus Bøggild, Alexandre Iolov, Mike Zhang, Johannes Bjerva

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

HiFi-KPI: De "Google Translate" voor Financiële Rapporten

Stel je voor dat je door een enorme bibliotheek loopt, gevuld met de jaarverslagen van duizenden bedrijven. Elk verslag is geschreven in een heel specifiek, moeilijk leesbaar dialect. Sommige bedrijven gebruiken woorden die alleen zij begrijpen, andere gebruiken weer heel andere termen voor precies hetzelfde ding. Voor een mens is dit al lastig, maar voor een computer is het een nachtmerrie.

De auteurs van dit paper hebben een oplossing bedacht die ze HiFi-KPI noemen. Laten we uitleggen wat dit is, zonder de moeilijke vakjargon.

1. Het Probleem: De "Lego-Doos" zonder Instructies

Bedrijven moeten hun financiële cijfers indienen bij de overheid (in de VS bij de SEC) in een digitaal formaat genaamd iXBRL. Dit lijkt op een enorme doos met Lego-blokjes. Elk blokje heeft een label, zoals "Winst", "Omzet" of "Huurinkomsten".

Het probleem? De instructies zeggen dat je het meest specifieke blokje moet kiezen.

  • In plaats van gewoon "Omzet" te zeggen, moet een bedrijf zeggen: "Omzet uit verhuur van operating leases in de VS, exclusief belasting, voor het kwartaal eindigend 31 december."
  • Dat is één van de 198.000 unieke, super-specifieke labels die bestaan.

Voor een computer is dit een ramp. Als je een model traint om "Apple" te begrijpen, leert het dat specifieke label. Maar als je dat model naar "Tesla" stuurt, gebruikt Tesla misschien een heel ander, net zo specifiek label voor hetzelfde concept. Het model raakt in de war. Het is alsof je iemand leert lezen in het Nederlands, en dan plotseling vraagt of ze een tekst in het Fries kunnen begrijpen, terwijl ze precies dezelfde zinnen gebruiken maar dan met andere woorden.

2. De Oplossing: HiFi-KPI (De "Hoofd-Map")

De onderzoekers hebben een enorme database gebouwd met 1,65 miljoen zinnen uit deze rapporten. Maar het echte genie zit in hoe ze de data hebben georganiseerd.

Ze hebben twee "hoofd-mappen" (taxonomieën) gemaakt die als een familieboom werken:

  • De "Presentation" boom: Hoe ziet het eruit in het verslag? (Bijv. onder "Balans" of "Winst- en Verliesrekening").
  • De "Calculation" boom: Hoe hangen de cijfers samen? (Bijv. Winst = Omzet - Kosten).

De Creatieve Analogie: De Russische Pop
Stel je voor dat elk specifiek label een kleine Russische pop is.

  • De kleinste pop is: "Huurinkomsten van een specifieke machine in Californië in 2023".
  • Als je die pop openmaakt, zit er een iets grotere pop in: "Huurinkomsten in Californië".
  • Die opent weer naar: "Huurinkomsten".
  • En die opent naar: "Omzet".

HiFi-KPI helpt de computer om te zien dat deze kleine poppen allemaal in dezelfde grote familie zitten. Zo kan een computer leren dat "Huurinkomsten van machine X" en "Huurinkomsten van machine Y" eigenlijk hetzelfde zijn: Omzet.

3. Wat hebben ze gedaan?

Ze hebben drie dingen gedaan om dit bruikbaar te maken:

  1. De Grote Database (HiFi-KPI): Een enorme verzameling van alle rapporten, waarbij ze de specifieke labels koppelen aan hun "ouders" in de familieboom. Dit maakt het mogelijk om te zoeken op verschillende niveaus van detail.
  2. De "Lite" Versie (HiFi-KPI-Lite): Een klein, handmatig gecontroleerd stukje data. Hier hebben experts de labels vertaald naar vier simpele categorieën waar iedereen mee kan werken: Winst, EBIT (winst voor rente en belasting), EPS (winst per aandeel) en Omzet. Dit is als een "testvraag" om te zien of de slimme computers het echt snappen.
  3. Context toevoegen: Het is niet genoeg om te weten wat het getal is. Je moet ook weten wanneer het was en in welke valuta.
    • Voorbeeld: "$1 miljoen" is heel anders dan "€1 miljoen" of "1 miljoen Yen". En "voor het jaar 2023" is anders dan "voor het kwartaal Q1 2024". HiFi-KPI koppelt het getal automatisch aan de juiste datum en munteenheid.

4. Wat hebben ze getest?

Ze hebben gekeken of moderne AI-modellen dit kunnen:

  • Klassieke AI (Encoder-modellen): Deze zijn heel goed in het vinden van de juiste categorie (bijv. "Dit is Omzet"). Ze halen een score van boven de 90%. Ze zijn als een ervaren boekhouder die snel weet waar hij moet kijken.
  • Super-slimme AI (LLMs zoals ChatGPT-varianten): Deze zijn goed in het begrijpen van de tekst, maar hebben moeite met de exacte details. Ze kunnen soms de datum verkeerd lezen of denken dat "basis punten" een bedrag is in plaats van een percentage. Ze halen ongeveer 44% van de tijd het hele plaatje goed (getal, datum, valuta en naam).

5. Waarom is dit belangrijk?

Voor beleggers en analisten is dit een game-changer.

  • Nu: Mensen moeten handmatig door duizenden rapporten bladeren om te zien hoe een bedrijf presteert. Dat kost tijd en geld, en mensen maken fouten (zoals een verkeerde datum gebruiken).
  • Met HiFi-KPI: Computers kunnen automatisch alle rapporten scannen, de juiste cijfers eruit halen, ze vergelijken en zeggen: "Kijk, dit bedrijf verdient meer aan huur dan vorig jaar, maar hun kosten zijn ook gestegen."

Conclusie

Dit paper introduceert een nieuwe manier om de chaotische wereld van financiële rapporten te ordenen. Het is alsof ze een vertaalboek hebben geschreven voor de "Lego-blokjes" van de financiële wereld. Hierdoor kunnen computers niet alleen de cijfers lezen, maar ook begrijpen wat ze betekenen, wanneer ze zijn opgeteld en in welke valuta.

Het is een eerste, belangrijke stap naar een toekomst waarin we niet meer hoeven te raden wat de cijfers zeggen, maar waar we ze direct en betrouwbaar kunnen analyseren. En dat is goed nieuws voor iedereen die geld wil verdienen of bedrijven wil controleren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →