Testing Frontier LLMs on Indian Statutory Interpretation: The Indian Construction Canon Benchmarking (ICCB) -Pilot Benchmark
Dit artikel introduceert de ICCB-Pilot benchmark om frontier LLM's te evalueren op de interpretatie van Indiase wetgeving, waarbij wordt onthuld dat hoewel modellen vaak de juiste juridische uitkomsten kunnen voorspellen, ze er niet in slagen de onderliggende interpretatieleer correct te identificeren en toe te passen, wat suggereert dat hun redenering berust op oppervlakkige patroonherkenning in plaats van op een werkelijk jurisprudentieel begrip.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In de wereld van de wet is het lezen van een wet zelden zo eenvoudig als het lezen van een woordenboekdefinitie. Wanneer een rechter wordt geconfronteerd met een vage of ambigue wet, raadt hij niet simpelweg het antwoord; hij volgt een specifieke set mentale instrumenten die bekend staan als "canons of construction" (interpretatieleer). Dit zijn gevestigde vuistregels die bepalen hoe een tekst begrepen moet worden. Zo zou één regel kunnen zeggen dat als een wet bedoeld is om iemand te straffen, deze zeer strikt, woord voor woord, gelezen moet worden. Een andere regel zou kunnen zeggen dat als een wet is ontworpen om de armen te helpen, deze breed moet worden gelezen om zoveel mogelijk mensen in te sluiten. Deze instrumenten vormen het verschil tussen een rechter die simpelweg een eerdere zaak herinnert en een rechter die daadwerkelijk redeneert over een nieuw probleem. Nu kunstmatige intelligentiesystemen de rechtszalen en juridische kantoren beginnen binnen te dringen, rijst een cruciale vraag: begrijpen deze machines werkelijk hoe ze deze instrumenten moeten gebruiken, of zijn ze gewoon erg goed in het raden van het juiste antwoord op basis van patronen die ze eerder hebben gezien?
Een team onderzoekers van de Manipal Academy of Higher Education in India zette zich in om deze vraag te testen met behulp van de nieuwste generatie kunstmatige intelligentiemodellen. Ze creëerden een gespecialiseerde test, die ze een benchmark noemen, die volledig gericht is op hoe deze machines de Indiase wetten interpreteren. In plaats van de computers te vragen simpelweg de uitkomst van een zaak te voorspellen, vroegen de onderzoekers hen om hun denkproces uit te leggen. De test presenteerde de modellen veertig verschillende juridische scenario's afgeleid van echte Indiase rechtspraak. In elk scenario moest het model identificeren welke specifieke interpretatieregel gebruikt moest worden, die regel correct uitleggen en deze vervolgens toepassen op de feiten om tot een conclusie te komen. De onderzoekers evalueerden de modellen op vijf afzonderlijke aspecten: of ze de juiste regel kozen, of ze die regel accuraat beschreven volgens de Indiase juridische traditie, of ze deze correct op de feiten toepasten, of ze het juiste uiteindelijke antwoord bereikten, en hoe helder hun algehele redenering was.
De resultaten toonden een opvallend gat aan tussen wat de machines konden doen en hoe ze dat deden. De krachtigste geteste kunstmatige intelligentiemodellen waren verrassend goed in het krijgen van het juiste uiteindelijke antwoord. In veel gevallen kwamen ze tot dezelfde conclusie als een menselijke rechter zou hebben gedaan. Echter, wanneer de onderzoekers keken naar hoe de modellen daar kwamen, veranderde het beeld. De modellen faalden regelmatig in het correct identificeren van de specifieke juridische regel die ze gebruikten. Ze kwamen vaak tot de juiste uitkomst zonder te weten welk instrument ze moesten gebruiken, wat suggereert dat ze de situatie koppelden aan een bekend patroon in plaats van een logisch pad te volgen. Het is alsof een student een complexe wiskundige som correct kan oplossen, maar niet kan uitleggen welke formule hij heeft gebruikt of waarom deze werkte. De studie toonde aan dat wanneer de onderzoekers de modellen expliciet vertelden welke regel te gebruiken, de modellen veel beter werden in het benoemen van die regel, maar hun vermogen om deze uit te leggen of toe te passen niet significant verbeterde. Dit suggereert dat de modellen de kennis van deze juridische regels bezitten, maar moeite hebben om er op eigen kracht toegang toe te krijgen zonder een directe aanwijzing.
De onderzoekers observeerden ook dat de modellen anders reageerden afhankelijk van hoe de vraag werd gesteld. Wanneer ze werden achtergelaten om het probleem zelf uit te zoeken, aarzelden de modellen vaak of weigerden ze te antwoorden, met name het geteste open-source model. Echter, wanneer de onderzoekers hen een hint gaven over het type regel dat gebruikt moest worden, waren de modellen meer bereid om deel te nemen. Ondanks deze verbetering in bereidheid bleef het kernprobleem bestaan: de modellen waren nog steeds beter in het raden van de juiste uitkomst dan in het construeren van het juiste juridische argument. Eén model bereikte in het bijzonder consequent vaker de juiste uitkomst dan het de juridische beginselen correct identificeerde, maar maakte nog steeds aanzienlijke fouten in zijn uiteindelijke conclusies. Deze dissociatie tussen een correct antwoord en een correct redeneerproces is een belangrijke bevinding. Het impliceert dat als deze systemen in de praktijk worden ingezet op basis van enkel hun vermogen om uitkomsten te voorspellen, ze correcte antwoorden kunnen geven om de verkeerde redenen, wat gevaarlijk kan zijn in een systeem waar het redeneren zelf net zo belangrijk is als het resultaat.
De studie concludeert dat hoewel deze kunstmatige intelligentiesystemen krachtige hulpmiddelen zijn, ze de specifieke vorm van redeneren die vereist is voor juridische interpretatie nog niet beheersen. Ze lijken zwaar te vertrouwen op patroonherkenning in plaats van de stapsgewijze toepassing van juridische regels die menselijke rechters gebruiken. De onderzoekers benadrukken dat dit niet betekent dat de technologie nutteloos is, maar het betekent wel dat we deze systemen niet kunnen vertrouwen om als juristen te redeneren enkel omdat ze het juiste antwoord geven. De studie dient als een pilot, een kleinschalige test ontworpen om te bewijzen dat dit specifieke type evaluatie mogelijk en noodzakelijk is. Het team is van plan dit werk in de toekomst uit te breiden door meer modellen en een breder scala aan wetten te testen om te zien of deze patronen algemeen standhouden. Voor nu suggereren de bevindingen een duidelijke waarschuwing: in de complexe wereld van de wet is het krijgen van het juiste antwoord niet genoeg; de machine moet ook in staat zijn om zijn werk te verantwoorden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.