Train, Retrieve, or Both? A Four-Arm Head-to-Head for Correct Statutory Citation on the Ontario Residential Tenancies Act
Dit artikel presenteert een vierarmige evaluatie die aantoont dat een gefinetuned Qwen2.5-7B model gecombineerd met retrieval (SFT+RAG) de hoogste nauwkeurigheid bereikt bij het citeren van de Ontario Residential Tenancies Act terwijl hallucinaties worden geëlimineerd, waarmee zowel standalone fine-tuning als retrieval-only benaderingen wordt overtroffen zonder dat gespecialiseerde retrieval-modellen of grotere datasets vereist zijn.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je de exacte regel probeert te vinden in een enorm, 300 pagina tellend regelboek (de Ontario Residential Tenancies Act) die een antwoord geeft op een specifieke vraag, zoals: "Hoeveel kennisgeving moet een verhuurder geven voordat hij mijn appartement betreedt?"
Het doel is niet om een prachtig essay te schrijven; het is om met de vinger te wijzen naar de exacte pagina en het paragraafnummer (de citatie), zodat een gewone persoon het zelf kan opzoeken.
Dit artikel is een "smaaktest" om uit te zoeken wat de beste manier is om een computer hiervoor te trainen. De onderzoekers hebben een race opgezet tussen vier verschillende strategieën met behulp van een slim AI-model (een digitale hersenpan) om te zien welke de juiste regel vindt zonder dingen te verzinnen.
Hier is hoe de vier hardlopers in de race presteerden:
De Vier Hardlopers
Het "Rauwe Brein" (Base Model):
- De Analogie: Dit is als het vragen aan een zeer slimme student die het regelboek één keer heeft gelezen maar het niet uit het hoofd heeft geleerd. Ze proberen het paginanummer vanuit het geheugen te raden.
- Het Resultaat: Ze faalden volledig. Ze konden de juiste pagina niet vinden, en 81% van de tijd verzonnen ze een nep paginanummer dat niet bestond. Ze zijn te onbetrouwbaar voor deze klus.
De "Memoriseerder" (Fine-Tuning Only):
- De Analogie: Dit is dezelfde student, maar ze hebben wekenlang met flashcards geoefend van "Vraag → Paginanummer". Ze kennen het formaat en proberen de antwoorden te onthouden.
- Het Resultaat: Ze stopten met het verzinnen van nep pagina's, maar ze kregen de specifieke nummers nog steeds fout. Ze herinnerden zich de idee van de regel, maar haalden de exacte sectienummers door elkaar. Het is alsof je weet dat de regel over "lawaai" gaat, maar gokt dat het op pagina 50 staat in plaats van pagina 52.
De "Librarian" (Retrieval Only):
- De Analogie: Deze student probeert niets te onthouden. In plaats daarvan heeft deze student een supersnelle bibliothecaris die de boeken voor hen doorzoekt. De student mag alleen antwoorden op basis van de pagina's die de bibliothecaris hen overhandigt.
- Het Resultaat: Dit was een enorme verbetering. Omdat de student gedwongen wordt om de echte tekst te bekijken, verzinnen ze nooit nep paginanummers (0% hallucinaties). Echter, soms overhandigt de bibliothecaris een stapel van 10 pagina's en raakt de student in de war over welke het exacte juiste is.
Het "Super Team" (Hybride: Memoriseerder + Librarian):
- De Analogie: Dit is de student die zowel de flashcard-oefeningen heeft gedaan ÉN de bibliothecaris heeft. De oefeningen leerden hen om een betere beoordelaar te zijn wanneer de bibliothecaris hen een rommelige stapel pagina's overhandigt.
- Het Resultaat: Dit team won de race. Ze vonden het exacte paginanummer vaker dan wie dan ook. De "oefeningen" hielpen hen om de juiste pagina te kiezen uit de stapel van de bibliothecaris, zelfs wanneer de stapel groot was.
De Grote Verrassingen
- Groter is niet altijd beter: De onderzoekers probeerden een "super-bibliothecaris" (een complexere, duurdere zoektool) te gebruiken om de studenten te helpen. Het hielp niet. De eenvoudige, goedkope bibliothecaris werkte net zo goed. Dit is goed nieuws, want het betekent dat je geen dure, zware machines nodig hebt om dit probleem op te lossen.
- Meer studeren hielp niet: Ze probeerden de "Memoriseerder" meer flashcards te geven om te bestuderen. Dat maakte hen niet beter. De bottleneck was niet hoeveel ze studeerden; het was dat ze de bibliothecaris nodig hadden om de tekst te vinden in de eerste plaats.
- De "Zero Hallucination" Truc: De reden dat de "Librarian" en het "Super Team" nooit nep regels verzonnen, is door ontwerp. Het systeem heeft een veiligheidshek: als het paginanummer niet in het boek staat dat de bibliothecaris vasthoudt, weigert het systeem iets te zeggen. Het is een harde regel, geen geleerde vaardigheid.
Het Eindscorebord
Het "Super Team" (Hybride) kreeg de beste score, maar ze wonnen de gouden medaille nog niet.
- Het Doel: De onderzoekers wilden een score van 0,70 halen (het juiste antwoord 70% van de tijd goed hebben).
- De Realiteit: Ze haalden 0,48 (het ongeveer de helft van de tijd goed hebben).
Waarom kregen ze geen 100%?
- De Librarian miste het boek: Soms kon de bibliothecaris de juiste pagina helemaal niet vinden (ongeveer 11% van de tijd). Als de juiste pagina niet in de stapel zit, kan de student deze niet kiezen.
- Het "Kleine Lettertjes" probleem: De student vond vaak de juiste Sectie (Hoofdstuk), maar miste de specifieke Subsectie (paragraaf). Het is alsof je het juiste hoofdstuk vindt, maar de verkeerde paragraaf. Dit telt als een "half-goed" antwoord.
- Kleine Testgroep: De uiteindelijke test bevatte slechts 27 vragen. Het is alsof je een heel sportseizoen van een team beoordeelt op basis van één wedstrijd. De resultaten zijn veelbelovend, maar de steekproefgrootte is te klein om 100% zeker te zijn.
De Kern van het Verhaal
Als je wilt dat een computer mensen naar de juiste wet wijst:
- Doe het niet door het de computer simpelweg te laten onthouden (het zal fouten raden).
- Doe het niet door het de computer simpelweg te laten lezen (het zal in de war raken door te veel tekst).
- Doe het wel door een model te combineren dat getraind is om het formaat te begrijpen met een tool die de wet voor je opzoekt.
Deze aanpak is het meest nauwkeurig, het liegt nooit over waar een regel staat, en het werkt goed zonder dure, zware technologie. Het moet echter nog wel werk verzetten om van "goed" (48% nauwkeurigheid) naar "geweldig" (70% nauwkeurigheid) te gaan.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.