Comparing RAG and GraphRAG for Page-Level Retrieval Question Answering on a Math Textbook
Dit artikel evalueert RAG en GraphRAG voor vraagbeantwoording op paginaniveau in een wiskundeboek met behulp van een dataset van 477 items, waarbij wordt geconstateerd dat embedding-gebaseerde RAG (met name met voyage-3-large) de nauwkeurigheid van de retrieval en de kwaliteit van het antwoord aanzienlijk overtreft ten opzichte van GraphRAG, terwijl het tegelijkertijd efficiënter is, waarbij BM25 dient als een sterke baseline en RAG proportioneel grotere voordelen biedt voor zwakkere, kosteneffectieve lokale LLM's.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je probeert een lastig wiskundig probleem op te lossen, maar je brein is een beetje als een superintelligële robot die het hele internet heeft gelezen. De robot weet heel veel, maar soms verzint hij dingen of vergeet hij precies welke pagina in jouw specifieke tekstboek het antwoord bevat dat je nodig hebt. Dit is de wereld van "Large Language Models" (LLM's)—AI die kan chatten en problemen kan oplossen, maar soms verdwaalt in zijn eigen enorme kennis. Om dit op te lossen, hebben wetenschappers een truc uitgevonden die "Retrieval-Augmented Generation" (RAG) wordt genoemd. Zie RAG als het geven van een bibliotheekpas en een bibliothecaris aan de robot. In plaats van vanuit het geheugen te gokken, vraagt de robot aan de bibliothecaris: "Hé, welke pagina in dit specische boek gaat over dit onderwerp?" De bibliothecaris vindt de juiste pagina, overhandigt deze aan de robot, en de robot gebruikt deze verse informatie om je een correct antwoord te geven. Maar wat als de bibliothecaris te enthousiast is? Wat als ze het hele boek pakken, of zelfs de hele bibliotheek, alleen maar om één zin te vinden? Dat is waar een nieuwer, flitsender idee genaamd "GraphRAG" om de hoek komt kijken. Het probeert in kaart te brengen hoe elke gedachte met elke andere gedachte verbonden is, als een gigantisch spinnenweb van kennis, in de hoop het antwoord te vinden door de draden te volgen. De grote vraag voor studenten en docenten is: wanneer je een specifieke pagina in een wiskundeboek moet vinden om te studeren voor een toets, welke bibliothecaris is dan beter? Degene die snel de exacte pagina pakt, of degene die een gigantisch web van verbindingen bouwt?
Een team van onderzoekers van Carnegie Mellon University en The University of Hong Kong besloot deze twee bibliothecarissen aan de test te onderwerpen met behulp van een echt wiskundeboek voor bachelorstudenten. Ze creëerden een dataset van 477 vragen, elk gekoppeld aan een specifieke pagina in het boek, en vroegen verschillende AI-systemen om de juiste pagina te vinden en vervolgens de vraag te beantwoorden. Ze vergeleken vijf verschillende "embedding"-modellen (die als slimme zoekmachines werken die de betekenis van woorden begrijpen), een klassieke zoekmethode genaamd BM25 (die alleen naar overeenkomende woorden zoekt, zoals een zeer ouderwetse index), en het chique GraphRAG-systeem.
De resultaten waren een verrassing voor de tech-enthousiastelingen die van complexe webben houden. De onderzoekers ontdekten dat de eenvoudige, directe aanpak van embedding-gebaseerde RAG de duidelijke winnaar was voor het vinden van specifieke pagina's. Het beste model, genaamd "voyage-3-large", slaagde erin de juiste pagina in 99,4% van de gevallen te vinden wanneer het de top 10 resultaten mocht bekijken. Zelfs de klassieke, op woordmatching gebaseerde BM25-methode deed het erg goed en versloeg verschillende van de meer complexe neurale modellen. In tegenstelling hiertoe had GraphRAG moeite met precisie. Hoewel het goed was in het vinden van sommige relevante informatie, greep het vaak veel te veel context—ongeveer 47.000 woorden aan tekst vergeleken met de 3.700 woorden die de andere methoden gebruikten. Deze "informatie-overload" verwarde de AI, waardoor de uiteindelijke antwoorden iets slechter werden. De studie suggereert dat voor taken waarbij je een specifieke paginareferentie nodig hebt, zoals het studeren voor een wiskundetoets, de eenvoudige, gefocuste bibliothecaris veel beter is dan de bibliothecaris die probeert het hele universum aan verbindingen in kaart te brengen.
Het team onderzocht ook de fouten. Wanneer het beste AI-model de verkeerde pagina kreeg, was het meestal een "bijna-misser". Ongeveer 63% van de tijd pakte het een pagina uit hetzelfde hoofdstuk, slechts een paar pagina's verderop. Dit is eigenlijk nuttig! Als een student op zoek is naar een bewijs en de pagina met de stelling krijgt, leert hij nog steeds de juiste stof, alleen in een iets andere volgorde. Het is alsof een tutor zegt: "Je zoekt naar de oplossing, maar kijk eerst even op de pagina ervoor; die legt de regel uit die je nodig hebt."
Ten slotte testten de onderzoekers of deze bevindingen standhielden met goedkopere, open-source AI-modellen die geen dure cloudservers vereisen. Ze ontdekten dat hoewel deze kleinere modellen slechter waren in het zelfstandig beantwoorden van vragen, ze spectaculair verbeterden wanneer ze de juiste tekstboekpagina's kregen om te lezen. Het open-source model zag een sprong van 39% in kwaliteit met de hulp van retrieval, vergeleken met slechts 16% voor het krachtige commerciële model. Dit suggereert dat voor scholen of studenten die geen dure AI-diensten kunnen betalen, een eenvoudig systeem dat naar de juiste pagina in een boek wijst, een lokale, gratis AI-tutor verrassend effectief kan maken.
Uiteindelijk concludeert het artikel dat voor paginaniveau-retrieval in het onderwijs, minder vaak meer is. Het chique, complexe GraphRAG-systeem was niet het juiste instrument voor deze specifieke taak; het bracht te veel ruis en niet genoeg precisie met zich mee. In plaats daarvan is een recht evenredige zoekopdracht die de top paar pagina's vindt en de AI deze laat lezen de meest betrouwbare manier om een betrouwbare AI-tutor te bouwen die studenten daadwerkelijk kunnen gebruiken om te studeren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.