← Nieuwste papers
💬 NLP

Validate Your Authority: Benchmarking LLMs on Multi-Label Precedent Treatment Classification

Dit artikel introduceert een nieuw door experts geannoteerd dataset en een nieuwe Average Severity Error-metriek om Large Language Models te benchmarken voor multi-label classificatie van juridische precedentbehandeling, en onthult dat terwijl Gemini 2.5 Flash uitblinkt in hoog-niveau taken, GPT-5-mini beter presteert op complexe fijnmazige schema's.

Oorspronkelijke auteurs: M. Mikail Demir, M. Abdullah Canbaz

Gepubliceerd 2026-05-19
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: M. Mikail Demir, M. Abdullah Canbaz

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je het rechtssysteem voor als een gigantische, voortdurend groeiende bibliotheek van verhalen. In deze bibliotheek verwijst elk nieuw verhaal (een rechtszaak) vaak naar een oud verhaal (een precedent) om uit te leggen waarom een beslissing is genomen. De grote vraag voor advocaten is: "Is dat oude verhaal nog steeds een goede regel om te volgen, of is het geannuleerd, bekritiseerd of gewijzigd door een nieuwere verhaal?"

Als een advocaat een argument opbouwt op een oud verhaal dat is "geannuleerd" (overruled), is het alsof je probeert met een auto over een brug te rijden die jaren geleden onveilig is verklaard. Het is een gevaarlijke fout.

Het probleem: De menselijke bibliothecarissen zijn moe

Decennialang hebben grote bedrijven teams van menselijke "bibliothecarissen" (juridische redacteuren) in dienst gehad om deze nieuwe verhalen te lezen en kleine vlaggetjes aan de oude verhalen te bevestigen. Ze konden een rood vlaggetje plaatsen met de tekst "Overruled" of een geel vlaggetje met "Criticized".

Maar mensen maken fouten. Soms missen ze een vlaggetje, of ze plaatsen de verkeerde kleur erop. De auteurs van dit artikel vroegen zich af: Kan een super-slimme computer (een AI) deze vlaggen-taak beter en sneller uitvoeren dan mensen?

Het experiment: Een nieuwe test voor AI

De onderzoekers vroegen de AI niet zomaar om te raden; ze bouwden een strenge test.

  1. De dataset (Het testboek): Ze creëerden een speciale verzameling van 239 echte juridische verhalen. Ze gebruikten niet alleen de ruwe tekst; ze maakten het schoon en voegden de "correcte" antwoorden (de ground truth) toe, gebaseerd op menselijke expertanalyse. Het is als een antwoordensleutel van een leraar voor een zeer moeilijk examen.
  2. De uitdaging (De twee niveaus):
    • Niveau 1 (Het grote plaatje): Is het oude verhaal slecht? (bijvoorbeeld: "Wordt het bekritiseerd of beperkt?")
    • Niveau 2 (De kleine lettertjes): Hoe precies is het slecht? (bijvoorbeeld: "Is het overruled? Is het onderscheiden? Is het in twijfel getrokken?")
    • Analogie: Niveau 1 is als vragen: "Is dit voedsel bedorven?" Niveau 2 is vragen: "Is het schimmelig, verbrand of gewoon verlopen?"
  3. De deelnemers: Ze stelden verschillende top-tier AI-modellen (zoals Google's Gemini en OpenAI's GPT) tegen elkaar. Ze leerden de AI niet eerst de antwoorden (geen "koppelen"); ze gaven haar gewoon de vragen en vroegen haar om het met haar bestaande slimheid uit te zoeken.

De resultaten: Wie won?

De resultaten waren een beetje een verdeelde beslissing, alsof een sportwedstrijd waarbij het ene team de verdediging wint en het andere team de aanval:

  • De kampioen van het "grote plaatje": Gemini 2.5 Flash was het beste in de algemene vraag. Het had ongeveer 79% van de grote categorieën goed. Het was uitstekend in het zeggen: "Ja, dit oude verhaal is geen geldig recht meer."
  • De kampioen van de "kleine lettertjes": GPT-5-mini was het beste in de lastige, specifieke details. Het had ongeveer 68% van de specifieke labels goed. Het was beter in het onderscheid maken tussen "bekritiseerd" en "in twijfel getrokken".

De adder onder het gras: Zelfs de winnaars maakten fouten, vooral bij zeldzame, vreemde gevallen. De AI was uitstekend in het opsporen van veelvoorkomende problemen, maar had moeite met de zeldzame, complexe gevallen.

Het nieuwe scorebord: Waarom "nauwkeurigheid" niet genoeg is

De auteurs realiseerden zich dat het tellen van "juiste" en "verkeerde" antwoorden in het recht niet eerlijk is.

  • Analogie: Stel je een arts voor die een patiënt diagnoseert. Als de arts denkt dat een patiënt een verkoudheid heeft terwijl ze eigenlijk de griep hebben, is dat een fout. Maar als de arts denkt dat de patiënt een verkoudheid heeft terwijl ze eigenlijk een gebroken been hebben, is dat een ramp.

In deze juridische test is het verwarren van een "licht bekritiseerde" zaak met een "volledig geannuleerde" zaak een enorme fout. Het verwarren van twee vergelijkbare soorten kritiek is een kleine fout.

Dus bedachten de onderzoekers een nieuwe score genaamd "Average Severity Error". In plaats van alleen fouten te tellen, maten ze hoe erg de fout was.

  • De winnaar: Met deze nieuwe, strengere score was Gemini 2.5 Flash nog steeds de beste presteerder. Het maakte de minste gevaarlijke fouten.

De conclusie

Het artikel concludeert dat AI hoewel het steeds beter wordt in deze juridische "vlaggen"-taak, nog niet perfect is.

  • Het goede nieuws: AI kan het zware werk aan en de meeste problemen opsporen.
  • Het slechte nieuws: De juridische taal is zo subtiel dat zelfs de slimste AI's in de war raken door de kleine details. Ook was de testdata onbalans (er waren veel meer "slechte" verhalen dan "goede" verhalen), wat het moeilijker maakte voor de AI om de zeldzame gevallen te leren.

De kernboodschap: Dit artikel testte niet alleen AI; het gaf de juridische wereld een nieuwe, betere manier om te meten hoe goed AI het doet, en het bracht een nieuwe set "oefenexamens" (de dataset) uit zodat andere onderzoekers kunnen blijven proberen deze modellen te verbeteren. Het is een cruciale eerste stap naar het vertrouwen van AI bij juridische beslissingen met hoge inzet.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →