← Nieuwste papers
💬 NLP

Reasoning Before Translation: Enhancing Legal Machine Translation with Structured Reasoning

Dit artikel evalueert en vergelijkt diverse hertrainingsparadigma's, waaronder supervised fine-tuning en reinforcement learning met verifieerbare beloningen, voor het verbeteren van kleine taalmodellen in de Zwitserse juridische machinevertaling, waarbij wordt geconstateerd dat hoewel reinforcement learning superieur is aan fine-tuning en de kloof met frontier reasoning-modellen verkleint, het nog steeds tekortschiet in vergelijking met hun prestaties en een afnemend rendement oplevert naarmate de modelgrootte toeneemt.

Oorspronkelijke auteurs: Aixiu An, Michael Jungo, Eloi Eynard, Mark Drenhaus, Andreas Fischer, Jean Hennebert, Sébastien Rumley

Gepubliceerd 2026-07-22
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Aixiu An, Michael Jungo, Eloi Eynard, Mark Drenhaus, Andreas Fischer, Jean Hennebert, Sébastien Rumley

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren hoe hij een complex juridisch contract van de ene taal naar de andere moet vertalen. Dit is niet zoals het vertalen van een recept voor koekjes; het is meer als het vertalen van een regelboek voor een videogame met hoge inzet, waarbij elk enkel woord de regels van het spel verandert. In de wereld van Kunstmatige Intelligentie is dit het domein van Neural Machine Translation (NMT). Denk aan NMT als een superintelligent robotbrein dat miljoenen boeken heeft gelezen en heeft geleerd om het volgende woord in een zin te raden. Onlangs ontdekten wetenschappers dat als je deze robots een "denkstap" geeft voordat ze spreken — zoals hen vragen om even te pauzeren en over een probleem na te denken — ze veel beter worden in lastige taken. Dit is het tijdperk van Reasoning Models. Maar hier zit de crux: de grootste, slimste robots zijn ongelooflijk duur in gebruik, alsof je een stad probeert te voeden met één enkele batterij. Daarom vragen onderzoekers zich af: kunnen we kleinere, goedkopere robots net zo slim maken door hen te leren hoe ze moeten denken, in plaats van ze alleen maar meer geheugen te geven?

Dit artikel duikt in die exacte vraag, specifiek kijkend naar het Zwitserse rechtssysteem, wat een nachtmerrie is voor vertalers omdat het vier officiële talen heeft en wetten die op een zeer strikte, ingewikkelde manier zijn geschreven. De onderzoekers wilden zien of ze kleine, betaalbare AI-modellen konden verbeteren in hun juridische vertaalvaardigheden met behulp van twee verschillende trainingsmethoden: Supervised Fine-Tuning (SFT), wat lijkt op het laten zien van de juiste antwoorden en de stapsgewijze aantekeningen over hoe je daar komt aan een student, en Reinforcement Learning (RL), wat meer lijkt op een videogame waarin de robot punten krijgt voor goede vertalingen en punten verliest voor slechte vertalingen, lerend door middel van vallen en opstaan. Ze testten ook of het dwingen van de robot om "hardop na te denken" (het genereren van redeneerstappen) daadwerkelijk hielp, of dat het de arme creat alleen maar in verwarring bracht.

Het team zette een massaal experiment op met een dataset van 40.000 juridische zinnen. Eerst probeerden ze de "hardop nadenken"-methode door kleine modellen (zoals de Qwen3.5 4B, Qwen3.5 9B en Gemma 3 12B) te trainen om de redeneerstappen van een gigantische, superintelligente AI te kopiëren. Verrassend genoeg werkte dit niet zoals gehoopt. Sterker nog, voor de kleinste modellen maakte het dwingen om hun redeneerstappen uit te schrijven de vertalingen zelfs slechter dan wanneer ze alleen op de uiteindelijke antwoorden zouden zijn getraind. Het is alsof tegen een nerveuze student zeggen: "schrijf al je gedachten op voordat je antwoordt", waardoor de student overdenkt en de toets verpest.

Echter, toen ze overschakelden naar de "videogame"-aanpak met behulp van Reinforcement Learning (specifiek een methode genaamd GRPO), waren de resultaten fantastisch. Door de modellen te belonen voor hoogwaardige vertalingen en te straffen voor slechte vertalingen, leerden de kleine modellen de Zwitserse wetten met ongelooflijke precisie te vertalen. De beste presteerder, een model met 12 miljard parameters genaamd Gemma 3, werd zo goed dat de kwaliteit van de vertalingen bijna gelijk was aan die van de duurste, grensverleggende modellen die duizenden dollars kosten om te gebruiken, hoewel het nog steeds iets minder presteerde. De onderzoekers ontdekten dat het "beloningsgestuurde" leren consequent beter was dan de "kopieer-de-aantekeningen"-methode. Ze ontdekten ook dat naarmate de modellen groter werden, de extra boost van deze geavanceerde trainingsmethoden kleiner werd; de piepkleine modellen wonnen het meest, terwijl de grotere modellen slechts een beetje verbeterden.

Uiteindelijk suggereert het artikel dat hoewel de gigantische, dure AI-modellen nog steeds de kampioenen zijn, we ze niet noodzakelijkerwijs voor alles nodig hebben. Door slimme trainingstrucs zoals Reinforcement Learning te gebruiken, kunnen we kleine, open-source modellen maken die goedkoop in gebruik zijn en verrassend goed zijn in het afhandelen van complexe juridische vertalingen. De studie sluit expliciet de mogelijkheid uit dat het simpelweg kopiëren van "redeneerstappen" van een grote AI helpt; in plaats daarvan suggereert het dat het laten leren door middel van beloningen het geheime ingrediënt is. Hoewel de kleine modellen de reuzen niet helemaal versloegen, verkleinden ze de kloof aanzienlijk, wat bewijst dat met de juiste training een kleine robot een grote klus kan klaren in de wereld van de wet met hoge inzet.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →