Effective Performance Measurement: Challenges and Opportunities in KPI Extraction from Earnings Calls
Dit artikel behandelt de uitdagingen bij het extraheren van Key Performance Indicators (KPI's) uit ongestructureerde transcripties van kwartaalcalls door nieuwe benchmarks te introduceren, de beperkingen van modellen die zijn getraind op gestructureerde SEC-documenten aan te tonen, en een door mensen geverifieerd, op LLM gebaseerd systeem voor te stellen dat 79,7% precisie bereikt voor open-ended informatiewinning.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Plaatje: Het "Formele Rapport" versus het "Kletsende Telefoongesprek"
Stel je voor dat je probeert te begrijpen hoe een bedrijf het doet. Je hebt twee belangrijke bronnen van informatie:
- De SEC-aangifte (Het Formele Rapport): Dit is als een ingevuld belastingformulier. Het is streng, volgt een rigide sjabloon, gebruikt specifieke vakjes en laat geen ruimte voor creativiteit. Als je een computer vraagt dit te lezen, is het alsof je een spreadsheet leest; het is makkelijk om de cijfers te vinden omdat ze altijd op dezelfde plek staan.
- De Verdienste-call (Het Kletsende Telefoongesprek): Dit is als een live radio-interview met de CEO en CFO van het bedrijf. Ze praten met beleggers, beantwoorden vragen, vertellen verhalen en corrigeren soms fouten onderweg. Er zijn geen vakjes, geen sjablonen en de taal is conversatieel. Een minuut praten ze over "omzet" en de volgende minuut maken ze een grapje over "recordgroei" of verduidelijken ze een rekenfout.
Het Probleem:
De onderzoekers ontdekten dat computers, hoewel ze geweldig zijn in het lezen van de "Formele Rapporten" (SEC-aangiften), verschrikkelijk slecht zijn in het begrijpen van de "Kletsende Telefoongesprekken" (Verdienste-calls). De computers raken in de war door de straattaal, het heen-en-weer en het gebrek aan structuur.
De Missie: Het Bouwen van een Beter Vertaler
Het team wilde zien of ze een systeem konden bouwen dat deze rommelige telefoongesprekken kon beluisteren en net zo goed als een menselijk expert de belangrijke cijfers (Key Performance Indicators, of KPI's) eruit kon halen.
Ze organiseerden een "wedstrijd" tussen twee soorten AI:
- De "Oude School" AI (Encoders): Deze zijn als bibliothecarissen die de strenge regels van de "Formele Rapporten" uit hun hoofd hebben geleerd. Ze probeerden diezelfde strenge regels toe te passen op de "Kletsende Telefoongesprekken".
- De "Nieuwe School" AI (Grote Taalmodellen of LLM's): Deze zijn als superslimme stagiairs die bijna alles op internet hebben gelezen. In plaats van een rigide regelboek te volgen, gebruiken ze "context" (de flow van het gesprek) om te raden wat de belangrijke cijfers zijn.
Het Experiment: De Drie Datastelsels
Om hun ideeën te testen, creëerden ze drie nieuwe "trainingsvelden" (datasets):
- SECB: Een test met de oude, strenge "Formele Rapporten" om te zien hoe goed de AI met de regels omgaat.
- ECB: Een enorme collectie "Kletsende Telefoongesprekken" (zonder labels).
- ECB-A: Een kleine, hoogwaardige steekproef van telefoongesprekken die zorgvuldig is gelabeld door een menselijk expert. Denk hierbij aan het "Antwoordenboekje" voor de test.
De Resultaten: Wie Won de Wedstrijd?
1. De "Oude School" Bibliothecarissen Faalden:
Toen de onderzoekers de AI probeerden te gebruiken die was getraind op de strenge "Formele Rapporten" om de "Kletsende Telefoongesprekken" te lezen, faalde het op erbarmelijke wijze.
- Analogie: Het is alsof je een metaaldetector probeert te gebruiken om een specifiek type vis in de oceaan te vinden. De metaaldetector is geweldig in het vinden van metaal op het strand (de formele rapporten), maar hij zoemt nutteloos als je hem onder water neemt (de telefoongesprekken). De AI kon niet omgaan met de verschuiving van rigide tekst naar rommelig gesprek.
2. De "Nieuwe School" Stagiairs Toonden Belofte:
De onderzoekers gebruikten vervolgens de superslimme LLM's (zoals Llama, Qwen en Gemini) met een speciale "prompt" (een set instructies) om te fungeren als de extractor.
- Het Goede Nieuws: Deze modellen waren veel beter in het begrijpen van de context. Ze konden uitzoeken dat "iPhone-omzet" in maart hetzelfde concept is als "iPhone-verkoop" in juni, zelfs als de woorden iets anders waren.
- Het Slechte Nieuws: Ze waren niet perfect. Hoewel ze de betekenis (semantisch begrip) zeer goed begrepen, hadden ze soms moeite met de exacte woordkeuze (exacte overeenkomst).
- Analogie: Stel je een student voor die een toets maakt. De "Oude School" AI haalde een 0% omdat het niet wist dat de vragen anders waren. De "Nieuwe School" AI haalde een hoog cijfer voor het essaygedeelte (het begreep het concept) maar verloor punten op het meerkeuzegedeelte omdat het het antwoord iets anders had gespeld dan de leraar verwachtte.
Het "Mens-in-de-Lus" Systeem
Omdat de AI niet perfect was, bouwden de onderzoekers een systeem dat de AI combineert met menselijke logica:
- Extractie: De AI luistert naar het gesprek en haalt cijfers en labels eruit.
- Clustering: Het systeem groepeert vergelijkbare antwoorden samen. (Bijvoorbeeld: Als de ene AI zegt "iPhone-verkoop" en de andere "iPhone-omzet", realiseert het systeem zich dat het om hetzelfde gaat en groepeert ze).
- Menselijke Controle: Ze lieten mensen de uiteindelijke resultaten controleren.
- Resultaat: Het systeem was 79,7% accuraat. Dit betekent dat van de 100 cijfers die het systeem haalde, ongeveer 80 correct waren.
Waarom Dit Belangrijk Is (Volgens het Artikel)
Het artikel belicht een specifiek, lastig moment in een echte verdienste-call (van een bedrijf genaamd Lyft).
- Het Scenario: Het bedrijf publiceerde een rapport met een verkeerd cijfer. De aandelenprijs schoot omhoog. Tijdens het telefoongesprek zei de CFO vervolgens: "Wacht, dat was een fout, het cijfer is eigenlijk lager." De aandelenprijs stortte direct in.
- De Les: Het "Kletsende Telefoongesprek" bevat de real-time waarheid die het "Formele Rapport" mist. Als een geautomatiseerd systeem het gesprek niet kan lezen, missen beleggers de meest kritieke informatie.
De Beperkingen (Wat het Artikel Toegaat)
- De "Gouden Standaard" is niet perfect: Omdat er zeer weinig experts zijn die deze gesprekken kunnen annoteren, hadden ze slechts één expert om de data te labelen. Dit betekent dat het "Antwoordenboekje" misschien dingen heeft gemist, waardoor de AI slechter lijkt dan hij eigenlijk is.
- Bedrijfsculturen Variëren: Sommige bedrijven (zoals JPMorgan) spreken zeer formeel, terwijl anderen zeer informeel zijn. Het systeem werkt beter bij sommige dan bij andere.
- Risico: Als dit systeem een fout maakt, kan dit ertoe leiden dat beleggers slechte financiële beslissingen nemen. Het artikel waarschuwt dat menselijk toezicht nog steeds noodzakelijk is.
Samenvatting in Eén Zin
Het artikel toont aan dat computers, hoewel ze geweldig zijn in het lezen van strenge financiële formulieren, moeite hebben met rommelige verdienste-calls, maar dat nieuwe "superslimme" AI-modellen steeds beter worden in het begrijpen van het gesprek, wat een veelbelovende (hoewel nog niet perfecte) manier biedt om bedrijfsprestaties in real-time te volgen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.