← Nieuwste papers
💬 NLP

Earnings25: A Comprehensive 500-Hour Speech Benchmark for Finance

Het artikel introduceert Earnings25, een uitgebreide benchmark van 500 uur bestaande uit volledige earnings calls en sectorgebalanceerde segmenten met uitgelijnde transcripties en gestructureerde metadata, ontworpen om reproduceerbare baselines te evalueren en vast te stellen voor automatische spraakherkenningssystemen op Engelstalige financiële earnings calls onder realistische omstandigheden.

Oorspronkelijke auteurs: Denglin Jiang, Haoran Zhou, Anshul Wadhawan, Brendan Fahy, Vinay Ramesh, David Weisberg, Dmitriy Derkachevskiy, Helen Sheehan, Srivas Prasad, Michele Franceschini

Gepubliceerd 2026-07-28
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Denglin Jiang, Haoran Zhou, Anshul Wadhawan, Brendan Fahy, Vinay Ramesh, David Weisberg, Dmitriy Derkachevskiy, Helen Sheehan, Srivas Prasad, Michele Franceschini

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren menselijke gesprekken te begrijpen. Je zou kunnen beginnen door hem heldere, langzame verhalen uit een boek te laten beluisteren. Maar het echte leven is rommelig. Mensen praten door elkaar heen, gebruiken straattaal, spreken met verschillende accenten en gooien er ingewikkelde woorden in die niet in verhalenboeken voorkomen. Dit is de wereld van Automatic Speech Recognition (ASR)—de technologie die gesproken woorden omzet in tekst. Hoewel deze robots steeds beter worden in het luisteren naar heldere stemmen, struikelen ze vaak wanneer het gesprek chaotisch, technisch of vol jargon wordt. De grote vraag voor wetenschappers is: Hoe weten we of een robot echt klaar is voor de echte wereld, of dat hij gewoon goed is in het voorlezen van scripts? Om dit te beantwoorden, hebben we een "eindexamen" nodig dat niet alleen een test van geheugen is, maar een test van overleven in een lawaaierige, complexe omgeving.

Hier komt een team van Bloomberg met een nieuwe, enorme uitdaging genaamd Earnings25. Denk aan financiële winstbesprekingen als de "Olympische Spelen" van de zakelijke spraak. Dit zijn telefoongesprekken van een uur waarin directeuren van bedrijven en financiële analisten praten over geld, aandelen en toekomstige plannen. Het is een perfecte storm van moeilijkheidsgraad: mensen spreken snel, gebruiken zware financiële jargon, praten door elkaar heen en schakelen tussen het voorlezen van voorbereide scripts en het beantwoorden van spontane, lastige vragen. De auteurs realiseerden zich dat bestaande tests leken op het oefenen voor een marathon door op een loopband in een stille sportschool te rennen; ze legden de heuvels, de wind of de menigte niet vast. Daarom hebben ze een nieuwe, supergedetailleerde benchmark gebouwd om te zien hoe goed huidige spraakherkenningsrobots de echte, rommelige chaos van de financiële wereld aankunnen.

De Grote Financiële Luisteruitdaging

Het artikel introduceert Earnings25, een enorme nieuwe dataset die is ontworpen als de ultieme stresstest voor spraakherkennings-AI. De auteurs hebben niet zomaar een paar willekeurige telefoongesprekken gepakt; ze hebben twee verschillende "arena's" gebouwd om de robots op verschillende manieren te testen.

De eerste arena is testset-full, een kolossale collectie van 498 uur aan volledige, ongeëditeerde winstbesprekingen van de S&P 500-bedrijven uit het vierde kwartaal van 2025. Stel je voor dat je bijna 500 uur achter elkaar naar financiële vergaderingen luistert zonder een pauze in te lassen. Deze set behoudt de volledige, natuurlijke stroom van het gesprek, inclusief de ongemakkelijke stiltes, de overlappende stemmen en de lange, kronkelende verhalen die in het echte leven voorkomen. Het is alsof je de robot een heel seizoen van een complexe tv-serie laat kijken, in plaats van slechts een paar fragmenten.

De tweede arena is testset-segmented, een meer gecureerde set van 46 uur bestaande uit 290 specifieke fragmenten audio. Hier speelden de onderzoekers een slim spel van "eerlijkheid". In de echte wereld praten sommige sectoren (zoals banken of oliebedrijven) veel vaker dan andere (zoals niche-productie). Als je alleen naar de meest voorkomende sectoren luistert, denk je misschien dat de robot geweldig is, maar kan hij falen wanneer hij iets zeldzaams hoort. Om dit op te lossen, koos het team precies één segment per sector uit meer dan 2.000 gesprekken, waardoor elke vorm van bedrijf—van "3D-printers" tot "windturbines"—een gelijkwaardige stem kreeg. Deze segmenten zijn kort, ongeveer 5 tot 10 minuten per stuk, wat ze perfect maakt om te testen hoe goed de robot met specifieële, lastige woordenschat omgaat zonder overweldigd te raken door uren aan inhoud.

Het Geheime Ingrediënt: Metadata en "Wie zei wat"

Wat Earnings25 echt bijzonder maakt, is niet alleen de audio; het is het "spiekbriefje" dat erbij zit. De meeste oude datasets gaven je alleen het geluid en de tekst. Earnings25 geeft je het geluid, de tekst en een gedetailleerde kaart van wie wat zei, wanneer en waarom.

De onderzoekers labelden elke spreker met hun rol: was het de operator die aan het begin de saaie regels voorlas? Was het de CEO die een gepolijste toespraak hield? Of was het een analist die een lastige, ongescripte vraag stelde? Ze labelden ook de sector en de structuur van het gesprek. Dit stelt wetenschappers in staat om vragen te stellen als: "Raakt de robot meer in de war wanneer de CEO praat, of wanneer de analist onderbreekt?" of "Faalt het vaker in de biotechsector dan in de bankensector?" Het verandert een simpele "hoeveel woorden heeft het goed gekregen?"-test in een diepgaand onderzoek naar waar en waarom de robot moeite heeft.

De Resultaten: Robots zijn Goed, Maar Niet Perfect

Het team heeft twee populaire spraakherkenningssystemen, Whisper en Parakeet-TDT, door de gehaktmolen gehaald. Ze hebben de robots geen speciale training gegeven op deze specifieke data; ze vroegen hen simpelweg te luisteren en te transcriberen, wat een real-world scenario simuleert waarbij de robot dingen ter plekke moet uitzoeken.

De resultaten lieten zien dat hoewel deze robots indrukwekkend zijn, ze nog een lange weg te gaan hebben. Op de enorme 498-uur set maakte het beste model (Parakeet-TDT) ongeveer 10,8% van de woorden fout. Op de kleinere, industrie-gebalanceerde set steeg de foutmarge licht naar 11,1%. Deze kleine stijging is eigenlijk een groot ding. Het suggereert dat wanneer je de robot dwingt om naar zeldzame, moeilijke sectoren te luisteren (de "long tail" van de zakenwereld), hij vaker struikelt.

Het artikel belicht een fascinerende ontdekking: geaggregeerde scores kunnen misleidend zijn. Als je alleen naar het gemiddelde foutpercentage kijelt, denk je misschien dat de robot het geweldig doet omdat hij goed is in de veelvoorkomende sectoren zoals bankwezen. Maar wanneer je kijkt naar specifieke, complexe velden zoals Biotech of Farmacie, schiet de foutmarge omhoog naar boven de 15%. Het is als een leerling die een voldoende haalt voor een wiskundetoets omdat hij de makkelijke vragen goed had, maar zakt voor het gevorderde calculusgedeelte. Het "gemiddelde" cijfer verbergt het feit dat ze nog steeds worstelen met de moeilijkste onderdelen.

Waarom Dit Belangrijk Is

De auteurs beweren voorzichtig niet dat ze het probleem hebben "opgelost". In plaats daarvan bieden ze een reproduceerbare benchmark—een gestandaardiseerde manier voor iedereen om vooruitgang te meten. Vóór Earnings25 was het moeilijk om te zeggen of een nieuwe spraak-AI daadwerkelijk beter was of gewoon geluk had met de data waarop hij werd getest. Nu hebben onderzoekers een duidelijk, eerlijk speelveld met rijke details om precies te begrijpen waar hun modellen falen.

Het artikel wijst ook op de eigen beperkingen. Earnings25 richt zich op Engelstalige gesprekken, voornamelijk van Amerikaanse bedrijven. Hoewel dit de test gecontroleerd en van hoge kwaliteit maakt, vangt het nog niet de volledere diversiteit van wereldwijde accenten en talen. De auteurs suggereren dat de volgende stap is om deze "financiële luisteruitdaging" uit te breiden naar meer landen en talen.

Kortom, Earnings25 is een gigantische, minutieus georganiseerde bibliotheek van financiële chaos. Het vertelt ons niet alleen of een robot kan horen; het vertelt ons of een robot de rommelige, jargonrijke, overlappende en belangrijke wereld van zaken kan begrijpen. En voor nu luisteren de robots wel, maar ze zijn nog steeds aan het leren hoe ze het gesprek kunnen bijhouden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →