Hierarchical Reranking for Scalable Financial RAG System
Dit artikel introduceert Hierarchical Reranker, een schaalbaar RAG-framework dat pre-retrieval optimalisatie, een tweestaps rankingsmechanisme en long-context management integreert om de retrievalprecisie en feitelijke consistentie voor complexe financiële documentanalyse aanzienlijk te verbeteren, zoals bewezen door de top performance in de ACM-ICAIF '24 FinanceRAG Challenge.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een detective bent die een mysterie probeert op te lossen, maar in plaats van een enkele plaats delict, krijg je een bibliotheek met miljoenen boeken aangeleverd, elk gevuld met duizenden pagina's aan kleine, verwarrende tekst en complexe grafieken. Dit is de dagelijkse realiteit voor financiële analisten die documenten moeten lezen zoals 10-K rapportages (enorme rapporten die bedrijven bij de overheid indienen) om specifieke cijfers of feiten te vinden. In de wereld van Kunstmatige Intelligentie is er een tool genaamd RAG (Retrieval-Augmented Generation) die fungeert als een superintelligente bibliothecaris. Deze leest niet alleen de boeken; het doorzoekt ze om precies de pagina's te vinden die je nodig hebt en schrijft vervolgens een samenvatting gebaseerd alleen op wat het heeft gevonden. Echter, standaard bibliothecarissen raken vaak overweldigd door de enorme omvang van deze financiële bibliotheken, raken in de war door de mix van woorden en cijfers, of verzinnen feiten wanneer de documenten te lang zijn. Dit paper pakt het probleem aan van hoe je een bibliothecaris bouwt die snel, accuraat en niet verdwaald raakt in de details wanneer de klus enorm groot wordt.
De auteurs van dit paper, Joohyun Lee en Sungwoo Hong, stellen een nieuw systeem voor genaamd de Hierarchical Reranker. Zie dit systeem als een twee-staps selectieproces voor een team van detectives. In plaats van één gigantische, dure en trage detective aan te nemen om elke pagina van een boek van 100.000 pagina's te lezen, gebruikt dit systeem een "klein-en-groot"-teamstrategie. Eerst scant een snelle, lichtgewicht detective (een klein AI-model) de hele bibliotheek en gooit de pagina's weg die overduidelijk irrelevant zijn, waardoor de stapel wordt teruggebracht tot de top 100 meest veelbelovende pagina's. Vervolgens kijkt een zeer bekwame, deskundige detective (een groot, krachtig AI-model) diepgaand en zorgvuldig naar slechts die 100 pagina's om de uiteindelijke top 20 te kiezen die echt antwoord geven op de vraag. Deze aanpak bespaart tijd en geld omdat de dure expert alleen het zware werk doet op de meest waarschijnlijke kandidaten, in plaats van energie te verspillen aan de hele bibliotheek.
Maar het vinden van de juiste pagina's is slechts de helft van de strijd. Het paper introduceert ook een slimme manier om de documenten te verwerken voordat de detectives zelfs maar beginnen met zoeken. Financiële documenten zijn rommelig; ze gebruiken afkortingen zoals "YoY" (Year-over-Year) of "EPS" (Earnings per Share), en ze mengen paragrafen tekst met enorme tabellen met cijfers. De eerste stap van het systeem is het "opschonen" van de zoekopdracht en de documenten. Het zet die verwarrende afkortingen om in volledige woorden, standaardiseert eenheden (zodat "1M" en "1.000.000" er hetzelfde uitzien) en, cruciaal, zet die rommelige tabellen om in een gestructureerd formaat genaamd JSON. Dit is alsof je een handgeschreven spreadsheet omzet in een digitale database, zodat de AI niet in de war raakt over welk getal bij welke categorie hoort. Door dit "voorafgaande opschonen" zorgt het systeem ervoor dat de AI de vraag en het bewijs perfect begrijpt voordat de zoektocht zelfs maar begint.
De derde grote truc die de auteurs gebruiken, is een strategie voor het omgaan met documenten die simpelweg te lang zijn om in één keer in het geheugen van de AI te passen. Hoewel moderne AI-modellen beweren enorme hoeveelheden tekst te kunnen lezen, bleek uit het paper dat wanneer de tekst een bepaald punt passeert (specifiek 64.000 tokens, wat een maatstaf is voor tekstlengte), de AI fouten begint te maken, vooral met cijfers. Om dit op te lossen, werkt het systeem als een chef die een enorm banket bereidt. In plaats van de hele maaltijd in één keer te eten, hakt het de lange documenten in twee kleinere, behapbare stukken. Het vraagt de AI om het eerste deel te analyseren en een conceptantwoord te schrijven, analyseert vervolgens het tweede deel en schrijft een ander conceptantwoord. Ten slotte combineert een "fusie"-stap deze twee concepten tot één definitief antwoord, waarbij gecontroleerd wordt of ze met elkaar overeenstemmen en eventuele conflicten worden opgelost. Dit zorgt ervoor dat zelfs als het document een enorm rapport van 100.000 pagina's is, de AI de draad van de feiten niet kwijtraakt.
Toen de onderzoekers hun systeem testten op verschillende beroemde financiële benchmarks (zoals FinQA en FinanceBench), waren de resultaten indrukwekkend. Het systeem behaalde een score van 0,7918 op een metriek genaamd NDCG@20, die meet hoe goed het systeem de juiste informatie bovenaan zijn lijst plaatst. Deze score was aanzienlijk beter dan systemen die geen gebruik maakten van hun speciale opschonings- en twee-staps rankingmethoden. Sterker nog, deze aanpak was zo effectief dat het het team hielp de tweede plaats te bemachtigen in de ACM-ICAIF '24 FinanceRAG Challenge, een wedstrijd die ontworpen is om te testen hoe goed AI met financiële gegevens kan omgaan. Het paper suggereert dat door deze drie innovaties te combineren — het opschonen van de data, het gebruik van een twee-staps detective-team en het slim opdelen van lange documenten — financiële instellingen nu AI-systemen kunnen bouwen die niet alleen slim zijn, maar ook betrouwbaar genoeg voor real-world taken zoals auditing en beleggingsanalyse, zonder dat de AI feiten verzint of verdwaalt in de ruis.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.