← Nieuwste papers
🤖 AI

Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks

Dit artikel introduceert Magis-Bench, een nieuw benchmark afgeleid van Braziliaanse rechterlijke examens dat 23 state-of-the-art LLM's evalueert op juridisch redeneren en schrijftaken op het niveau van een magistraat, en blootlegt dat zelfs de best presterende modellen moeite hebben om hoge scores te behalen bij het produceren van gemotiveerde rechterlijke beslissingen.

Oorspronkelijke auteurs: Ramon Pires, Thales Sales Almeida, Celio Larcher Junior, Giovana Bonás, Hugo Abonizio, Marcos Piau, Roseval Malaquias Junior, Thiago Laitz, Rodrigo Nogueira

Gepubliceerd 2026-05-12
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Ramon Pires, Thales Sales Almeida, Celio Larcher Junior, Giovana Bonás, Hugo Abonizio, Marcos Piau, Roseval Malaquias Junior, Thiago Laitz, Rodrigo Nogueira

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een competitie in de keuken voor met hoge inzet. Normaal gesproken vragen we bij het testen van AI om een gerecht te bereiden (een juridisch betoog of een contract te schrijven). Maar in een echt rechtssysteem is de belangrijkste taak niet alleen het bereiden; het is het zijn van de rechter die het gerecht proeft, beslist of het goed is, en uitlegt waarom het slaagt of faalt.

Dit artikel, Magis-Bench, gaat over het testen van AI op die "rechter"-rol.

Het Probleem: Kan AI een Rechter Zijn?

De meeste AI-tests op juridisch gebied vragen de computer om een advocaat te zijn: "Schrijf een verdediging voor deze cliënt." Maar een echte rechter moet iets moeilijker doen: luisteren naar beide kanten, eigen gevoelens negeren, strikte regels toepassen en een definitieve beslissing schrijven die bestand is tegen scrutiniteit.

De auteurs wilden weten: Kunnen huidige AI-modellen zich gedragen als een echte rechter?

De Test: Het "Vredegerechts"-examen

Om dit te testen, verzonnen de onderzoekers geen nepvragen. Ze pikten 74 echte vragen uit daadwerkelijke, zeer competitieve Braziliaanse examens die tussen 2023 en 2025 werden gebruikt om echte rechters aan te nemen.

Zie deze examens als het "Bar-examen" voor rechters. Ze omvatten:

  • Opstelvragen: "Hier is een rommelige juridische situatie; leg het recht uit."
  • Opdrachten voor het opstellen van stukken: "Hier zijn de feiten; schrijf de volledige, officiële vonnis van de rechtbank (het definitieve oordeel)."

Cruciaal is dat elke vraag werd geleverd met een officieel antwoordmodel (een beoordelingsrubric). Dit is als een leerkracht's beoordelingsformulier dat precies aangeeft hoeveel punten je krijgt voor het noemen van een specifieke wet of het volgen van een specifieke structuur.

De Methode: AI versus AI

Omdat het inhuren van 23 menselijke rechters om 74 opstellen te beoordelen voor 23 verschillende AI-modellen ongelooflijk duur en traag zou zijn, gebruikten de onderzoekers een slimme truc: Ze lieten AI AI beoordelen.

  1. De Deelnemers: Ze kozen 23 van de slimste beschikbare AI-modellen (van bedrijven zoals Google, OpenAI, Anthropic en anderen).
  2. De Rechters: Ze gebruikten vier andere, zeer krachtige AI-modellen om te fungeren als beoordelaars.
  3. De Regels: De "Rechter-AI's" wisten niet wie de antwoorden had geschreven. Ze keken alleen naar de vraag, het officiële antwoordmodel en het antwoord van de AI, en gaven vervolgens een score van 0 tot 10.

De Resultaten: De AI-"Rechters" Kwamen Overeen

Hier is wat er gebeurde:

  • De Rechters Kregen het Goed met Elkaar: De vier AI-rechters waren bijna perfect met elkaar eens (98,4% overeenstemming). Dit is als het hebben van vier foodcritici die het allemaal precies eens zijn over welk restaurant het beste is. Dit gaf de onderzoekers vertrouwen dat de scores eerlijk waren en niet zomaar willekeurig.
  • De Winnaars: De beste presteerders waren Google's Gemini-3-Pro-Preview (score: 6,97/10), gevolgd door Gemini-3-Flash en Claude-4.5-Opus.
  • De Realiteitscheck: Zelfs de "winnaar" haalde slechts 6,97 van de 10. Dat is minder dan 70%.

Wat Dit Betekent

Het artikel concludeert dat hoewel AI beter wordt in juridische taken, zich gedragen als een rechter nog steeds erg moeilijk voor hen is.

  • Het Kloof: Huidige AI-modellen zijn als studenten die het handboek kunnen opzeggen, maar moeite hebben om de regels toe te passen op een rommelige, real-life situatie met de nuance en autoriteit van een menselijke rechter.
  • De Benchmark: De onderzoekers hebben alle vragen, de antwoorden en de beoordelingscode vrijgegeven zodat andere wetenschappers deze modellen blijven testen en verbeteren.

Kortom: We vroegen AI om een echt rechtersexamen af te leggen. De slimsten haalden een "C" of een "B", wat bewijst dat hoewel ze slimmer worden, ze nog niet klaar zijn om menselijke rechters in de rechtszaal te vervangen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →