← Nieuwste papers
💬 NLP

BenGER: Benchmarking LLM Systems on Subsumption-Based Legal Reasoning in German Law

Het artikel introduceert BenGER, een uitgebreide benchmarkdataset voor het evalueren van LLM's op subsumptiegebaseerde juridische redenering in het Duitse recht, en toont aan dat gesloten vlaggenschipmodellen de prestaties leiden terwijl mens-AI-co-creatie aanzienlijk beter presteert dan ongesteund menselijk werk, alles gevalideerd via een robuust LLM-as-a-Judge-kader.

Oorspronkelijke auteurs: Sebastian Nagl, Ann-Kristin Mayrhofer, Martin Heidebach, Aleyna Koçak, Anne Zettelmeier, Elly Breu, Angelina Greiner, Sofija Milijas, Matthias Grabmair

Gepubliceerd 2026-05-28
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Sebastian Nagl, Ann-Kristin Mayrhofer, Martin Heidebach, Aleyna Koçak, Anne Zettelmeier, Elly Breu, Angelina Greiner, Sofija Milijas, Matthias Grabmair

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert aan te leren hoe je advocaat wordt. Maar niet zomaar een advocaat – één die gespecialiseerd is in het specifieke, rigide en sterk gestructureerde rechtssysteem van Duitsland. In dit systeem draait het bij het oplossen van een juridisch probleem niet om het raden van het juiste antwoord; het gaat om het volgen van een strikt recept dat "subsumptie" heet.

Denk er als volgt over: het is alsof je een taart bakt, waarbij het recept vereist dat je elk ingrediënt opschrijft, precies uitlegt waarom het bij het recept past, en vervolgens aantoont hoe het met de andere ingrediënten mengt, voordat je zelfs maar kunt zeggen: "De taart is klaar." Als je een stap overslaat of gewoon zegt "Het is een taart", dan faal je, zelfs als de taart lekker smaakt.

Dit paper, BenGER, is een enorme nieuwe test die is ontworpen om te zien of moderne AI (Large Language Models) dit strenge Duitse juridische recept daadwerkelijk kunnen volgen.

Hier is de uiteenzetting van wat ze deden, met gebruikmaking van eenvoudige analogieën:

1. De Testkeuken (De Dataset)

De onderzoekers bouwden een gigantische "testkeuken" genaamd BenGER. Deze bevat drie soorten uitdagingen:

  • De Grote Examens: 596 lange, complexe juridische zaken (zoals eindexamens voor rechtenstudenten) waarbij de AI een volledige, gestructureerde oplossing moet schrijven.
  • De Korte Quizzen: 531 korte vragen over juridische principes.
  • De "Benchathon" (Het Mens vs. AI Lab): Een speciale set van 15 nieuwe problemen waarbij ze de AI niet alleen vroegen ze op te lossen. Ze vroegen ook echte mensen om ze op twee manieren op te lossen:
    1. Solo: Mensen die alleen werkten met boeken en internet.
    2. Co-Creatie: Mensen die met een AI-assistent werkten om de oplossing te schrijven.

2. De Rechters (Hoe ze de antwoorden beoordeelden)

Het beoordelen van juridische essays is berucht lastig. Zelfs menselijke experts zijn het vaak niet met elkaar eens. Een professor kan een werk een "A" geven, terwijl een ander voor hetzelfde werk een "C" geeft.

Om dit op te lossen, vroegen de onderzoekers niet aan één persoon om de AI te beoordelen. Ze bouwden een "Robotrechter" (een LLM-as-a-Judge) die was getraind op een zeer specifiek beoordelingsformulier (een beoordelingschecklist).

  • Het Beoordelingsformulier: Stel je een scorebord voor met 10 categorieën, zoals "Heb je de juiste wet gevonden?", "Heb je de feiten gekoppeld aan de wet?" en "Is je tekst goed gestructureerd?"
  • De Validatie: Om ervoor te zorgen dat hun Robotrechter niet bevooroordeeld of gek was, vergeleken ze hun scores met een panel van drie echte menselijke experts die dezelfde antwoorden blind beoordeelden.
  • Het Resultaat: De Robotrechter was verrassend eerlijk. Toen ze een menselijke beoordelaar vervingen door de Robotrechter, veranderde de uiteindelijke groepsscore niet veel. De Robotrechter was net zo betrouwbaar als een menselijke expert.

3. De Resultaten (Wie won?)

Ze testten 12 verschillende AI-systemen, variërend van de krachtigste "Flagship"-modellen (de supercomputers van de AI-wereld) tot kleinere, snellere "Efficiency"-modellen.

  • De Kampioenen: De grote, gesloten-bron "Flagship"-modellen (zoals die van OpenAI, Anthropic en Google) kwamen bovenaan uit. Ze scoorden het hoogst en haalden vaak "slagingscijfers" die kunnen wedijveren met toprechtenstudenten.
  • De Outsiders: De open-source modellen (gratis te downloaden) deden het redelijk, maar bleven over het algemeen achter bij de grote commerciële modellen.
  • De Magische Combinatie: De meest verrassende bevinding ging over Mens-AI Co-creatie. Toen mensen AI mochten gebruiken om hen te helpen bij het schrijven van hun antwoorden, schoten hun scores omhoog. Ze deden niet alleen even goed als de AI; ze deden het beter dan mensen die alleen werkten, en ze versloegen zelfs de AI die alleen werkte. Het was alsof een menselijke chef-kok een high-tech mixer gebruikte om een taart te bakken die beter was dan wat de chef alleen of de machine alleen had kunnen maken.

4. De "Valkuilen" (Waarvoor het paper waarschuwt)

De auteurs zijn zeer eerlijk over de beperkingen:

  • Black Box: Ze testten de AI zoals deze aan het publiek wordt verkocht (via een API). Ze konden de "motor" onder de motorkap niet zien, dus ze weten niet precies waarom het ene model beter is dan het andere, alleen dat het wel beter is.
  • Het Recept is Specifiek: Deze test is strikt voor Duits Recht. De manier waarop Duitse advocaten denken (het "subsumptie"-recept) verschilt van hoe advocaten in de VS of het VK denken (die meer vertrouwen op eerdere zaken). Je kunt deze resultaten niet nemen en zeggen: "Deze AI zal een geweldige advocaat zijn in New York."
  • Risico op Memoriseren: Sommige testvragen kwamen uit openbare tijdschriften. Het is mogelijk dat de AI de antwoorden gewoon uit het internet had gememoriseerd in plaats van het probleem daadwerkelijk "te doordenken". De nieuwe "Benchathon"-vragen (die de AI nog niet eerder had gezien) toonden echter vergelijkbare resultaten, wat suggereert dat de AI de logica daadwerkelijk leert en niet gewoon cheat.

De Conclusie

Dit paper zegt: "We hebben een strenge, eerlijke test voor Duits juridisch redeneren gebouwd. De beste AI-modellen zijn nu zeer goed in het volgen van de regels, maar ze zijn nog niet perfect. Echter, wanneer mensen samenwerken met AI, worden ze super-advocaten en presteren ze beter dan zowel mensen als AI die alleen werken."

Ze bewezen ook dat een slimme Robotrechter deze essays bijna net zo betrouwbaar kan beoordelen als een zaal vol met menselijke professoren, wat in de toekomst kan helpen bij het opschalen van juridisch onderwijs en toetsing.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →