SteuerLLM: Local specialized large language model for German tax law analysis
Dit artikel introduceert SteuerLLM, een gespecialiseerd Duits belastingrechtmodel met 28 miljard parameters, en SteuerEx, de eerste open benchmark afgeleid van authentieke universiteitsexamens, waarmee wordt aangetoond dat domeinspecifieke adaptatie en synthetische datageneratie algemene modellen aanzienlijk overtreffen bij complexe juridische redeneertaken.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een zeer intelligente, erudiete student probeert te leren hoe hij een moeilijk, hoogstaand examen in het Duits belastingrecht moet halen. Het probleem is dat algemene "slimme" studenten (standaard Large Language Models) uitstekend zijn in het schrijven van essays of het voeren van gesprekken, maar vaak falen wanneer de regels rigide zijn, de terminologie nauwkeurig is en één verkeerd getal een heel antwoord kan verruïneren.
Dit artikel introduceert twee hoofdzaken om dit probleem op te lossen: een nieuw, zeer moeilijk examen en een nieuwe gespecialiseerde student die specifere is ontworpen om dit examen te halen.
1. Het Nieuwe Examen: "SteuerEx"
De onderzoekers hebben het eerste open benchmark genaamd SteuerEx gecreëerd. Zie dit als een "eindexamen" voor AI, maar in plaats van nepvragen gebruikt het 115 echte vragen uit werkelijke Duitse universiteitsexamens voor belastingrecht van de afgelopen tien jaar.
- Hoe het werkt: In een normaal examen krijg je misschien een simpel "Goed of Fout"-cijfer. Maar in het belastingrecht kan een student het juiste juridische concept begrijpen, maar een specifieke citatie missen, of de wiskunde correct uitvoeren maar de logica fout hebben.
- Het Beoordelingssysteem: De onderzoekers hebben elk antwoord opgedeeld in minuscule "bouwstenen" (beweringen). Een AI-beoordelaar (een tweede AI) controleert elke bouwsteen afzonderlijk. Als je de helft van de logica goed hebt, krijg je de helft van de punten. Dit bootst na hoe echte professoren nakijken: door gedeeltelijke punten te geven voor goede redenering, zelfs als het uiteindelijke antwoord niet perfect is.
- De Moeilijkheidsgraad: Het examen beslaat zes gebieden, zoals vennootschapsbelasting, inkomstenbelasting en btw. Het is ontworpen om meedogenloos eerlijk te zijn; de meeste algemene AI-modellen scoorden erg laag, wat bewijst dat belastingrecht een harde noot is om te kraken.
2. De Gespecialiseerde Student: "SteuerLLM"
Om dit examen aan te pakken, heeft het team SteuerLLM gebouwd. Stel je voor dat je een algemeen gespierd genie neemt (een AI met 24 miljard parameters) en het een specifieke "hersentransplantatie" of "extra zijwieltjes" geeft, specifiek voor het belastingrecht.
- De Trainingsmethode: Ze hebben het niet alleen een tekstboek gevoerd. Ze gebruikten een "Waterfontein"-methode. Ze namen een kleine set echte examenvragen en gebruikten een computerprogramma om automatisch duizenden nieuwe, realistische oefenvragen en antwoorden te generen op basis van echte Duitse wetten. Het is alsof je de student een enorme, eindeloze bibliotheek aan oefenopgaven geeft die exact lijken op het echte examen.
- De Architectuur: In plaats van het hele brein opnieuw te trainen (wat een AI ervoor kan zorgen dat het vergeet hoe het normale taal spreekt), voegden ze nieuwe lagen van "neuronen" toe die specif으로 voor het belastingrecht zijn. Dit is als het toevoegen van een gespecialiseerde rekenmachine en een juridisch woordenboek aan de rugzak van de student, zonder dat dit verandert hoe hij loopt of praat.
- Het Resultaat: Deze gespecialiseerde student, met 28 miljard parameters, versloeg bijna elk ander algemeen AI-model, inclusief sommige die 20 keer groter zijn (zoals de modellen met 671 miljard parameters). Het bewees dat voor het belastingrecht gespecialiseerde training belangrijker is dan brute omvang.
3. De Vergelijking: AI versus Echte Studenten
De onderzoekers vergeleken hun AI-student met echte menselijke studenten die deze examens maakten.
- De Kloof: De gemiddelde menselijke student scoort nog steeds veel hoger dan de AI. De AI is nog niet klaar om een belastingadviseur of een topstudent te vervangen.
- De Vooruitgang: Echter, de AI presteerde beter dan de slechtste menselijke studenten in verschillende categorieën. Het toonde aan dat het "deels correcte" juridische redeneringen kon produceren die punten zouden opleveren in een echt examen, in plaats van simpelweg dingen te verzinnen.
4. Het "Open" versus "Gesloten" Geheim
Het team heeft ook een versie van hun model uitgebracht genaamd Open-SteuerLLM. Deze versie is identiek aan de kampioen, behalve dat ze een klein deel van de private trainingsdata hebben verwijderd die ze niet publiekelijk konden delen.
- De Bevinding: De open versie presteerde bijna net zo goed als de gesloten versie. Dit suggereert dat de methode van het genereren van de trainingsdata (de "Waterfontein"-pipeline) het echte geheime ingrediënt was, en niet alleen de specifieke private documenten die ze gebruikten.
De Kernboodschap
Het artikel betoogt dat voor zeer gestructureerde, op regels gebaseerde velden zoals het belastingrecht, je niet een grotere, duurdere AI nodig hebt. Je hebt een kleinere, slimmere AI nodig die specifiek is getraind op de juiste soort data en wordt beoordeeld met de juiste mate van precisie. Ze hebben hun examen, hun trainingsdata en hun model aan het publiek beschikbaar gesteld, zodat anderen ervan kunnen leren en in de toekomst betere juridische AI kunnen bouwen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.