← Nieuwste papers
💬 NLP

Towards Reliable Multilingual LLMs-as-a-Judge: An Empirical Study

Deze empirische studie onderzoekt strategieën voor het ontwikkelen van betrouwbare meertalige LLMs-as-a-judge voor talen met hoge, gemiddelde en lage beschikbaarheid van trainingsdata, waarbij wordt geconstateerd dat fijngefineerde kleinere modellen uitmunten met domeinspecifieke data terwijl grotere zero-shot modellen superieur zijn voor domeinoverstijgende scenario's, en waarbij wordt gewaarschuwd dat domeinoverstijgende fijnafstemming de prestaties kan verslechteren.

Oorspronkelijke auteurs: Irune Zubiaga, Aitor Soroa, Rodrigo Agerri

Gepubliceerd 2026-05-28
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Irune Zubiaga, Aitor Soroa, Rodrigo Agerri

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een gigantische, super slimme robotbibliothecaris hebt (een Large Language Model, of LLM) wiens taak het is om essays te beoordelen die door andere robots zijn geschreven. Normaal gesproken spreekt deze bibliothecaris alleen Engels. Maar nu moeten we hen ook essays beoordelen in het Spaans en het Baskisch (een unieke taal die in het Baskenland wordt gesproken).

Het artikel vraagt: Hoe leren we deze robotbibliothecaris om een eerlijke en accurate rechter te zijn in talen die hij niet van nature spreekt, vooral wanneer we niet veel 'voorbeeld-essays' hebben om hem mee te leren?

Hier is het verhaal van hun experiment, opgesplitst in eenvoudige concepten:

1. De Drie Talen (De Testonderwerpen)

De onderzoekers kozen drie talen om te testen, die verschillende niveaus van 'data-beschikbaarheid' vertegenwoordigen:

  • Engels: De 'High-Resource' taal. Het is als een bibliotheek met miljoenen boeken. De robot kent het goed.
  • Spaans: De 'Mid-Resource' taal. Het heeft een degelijke bibliotheek, maar niet zo groot als Engels.
  • Baskisch: De 'Low-Resource' taal. Het is als een klein dorpsbibliotheekje met zeer weinig boeken. De robot weet er van nature zeer weinig van.

2. Scenario A: Wanneer We Een 'Leraarsgids' Hebben (In-Domain Data)

Stel je voor dat je een stapel beoordeelde essays hebt met de commentaren en scores van de leraar (dit is de 'in-domain data'). Je wilt je robot trainen om nieuwe essays te beoordelen met behulp van deze gids.

De Grote Ontdekking: Houd de Beoordelingsrubriek in het Engels!
De onderzoekers probeerden twee manieren om het trainingsmateriaal te vertalen:

  • Methode 1 (Volledige Vertaling): Vertaal het essay, het antwoord van de student, en de beoordelingsrubriek van de leraar (de regels voor het scoren) naar het Spaans of Baskisch.
  • Methode 2 (Gedeeltelijke Vertaling): Vertaal het essay en het antwoord van de student, maar houd de beoordelingsrubriek en instructies in het Engels.

Het Resultaat: De robot presteerde veel beter wanneer de beoordelingsregels in het Engels bleven.

  • De Analogie: Denk aan de beoordelingsrubriek als het 'besturingssysteem' van de robot. Zelfs als de robot een verhaal in het Spaans leest, als de instructies over hoe je moet beoordelen in het Engels zijn, blijft het brein van de robot gefocust en consistent. Het vertalen van de regels naar een taal die de robot minder goed kent, verwarde het daadwerkelijk en maakte zijn beoordelingen slordig.

De Grootte Maakt Uit (Maar Minder Dan Je Denkt)
Ze testten kleine robots (8 miljard 'hersencellen' of parameters) en enorme robots (70 miljard).

  • Vinding: Wanneer je een goede leraarsgids hebt (trainingsdata), kan een kleine robot net zo goed werk leveren als een gigantische, dure robot. Je hebt niet het grootste model nodig als je goede data hebt om het te leren.
  • Bonus: Het trainen van de robot op een mix van alle drie de talen tegelijk (Meertalig) maakte het beter in het Spaans en Baskisch dan het trainen op slechts één taal per keer. Het is alsof het leren van drie talen samen je helpt de grammaticaregels van al die talen beter te begrijpen.

3. Scenario B: Wanneer We GEEN 'Leraarsgids' Hebben (Out-of-Domain Data)

Nu, stel je voor dat je een compleet nieuw type essay moet beoordelen (zoals een wetenschappelijk rapport in plaats van een verhaal) en je hebt geen voorbeeld essays om aan de robot te tonen. Je moet vertrouwen op de natuurlijke slimheid van de robot (Zero-Shot).

De Grote Ontdekking: 'Over-train' de Grote Robots Niet
De onderzoekers probeerden de robots te leren met data van andere onderwerpen (out-of-domain) om te zien of het hen zou helpen om de nieuwe essays te beoordelen.

  • Kleine Robots: Ze werden hierdoor eigenlijk een beetje beter. Ze hadden de hulp nodig.
  • Grote Robots (70B): Dit ging mis! Toen ze probeerden de gigantische robots te finetunen met niet-gerelateerde data, begonnen ze te hallucineren. Ze werden overmoedig en gaven iedereen een perfecte score van 5, zelfs als het essay slecht was.
  • De Analogie: Stel je een briljante professor (de grote robot) voor die alles al weet. Als je probeert hen basisregels voor een spel te leren dat ze niet spelen, kunnen ze verward raken en beginnen ze hun eigen rare regels te verzinnen, terwijl ze denken dat ze gelijk hebben. Ondertussen profiteert een slimme student (de kleine robot) daadwerkelijk van de extra oefening.

De Beste Strategie voor Nieuwe Onderwerpen:
Als je geen specifieke trainingsdata hebt, probeer dan de robot helemaal niet te finetunen. Laat de grote, slimme robot gewoon de essays beoordelen 'zoals ze zijn' (Zero-Shot). Dit is betrouwbaarder dan proberen het te dwingen te leren van niet-gerelateerde data.

4. De Samenvatting van Bevindingen

  • Voor talen die je goed kent (of waarvoor je data hebt): Gebruik een kleinere, goedkopere robot. Houd de beoordelingsinstructies in het Engels, zelfs als de essays in het Spaans of Baskisch zijn.
  • Voor talen die je slecht kent of waarvoor je geen data hebt: Probeer de robot niet te leren met willekeurige voorbeelden. Gebruik gewoon de grootste, slimste robot die je hebt en laat het natuurlijk beoordelen zonder extra training.
  • De 'Vertaalval': Het vertalen van de regels van het spel naar een low-resource taal maakt de robot vaak slechter, niet beter.

Wat Ze Niet Dedden

Het artikel beweert niet dat dit medische diagnoses, juridische oordelen of emotionele counseling zal oplossen. Het richt zich strikt op hoe je betere tools bouwt voor het automatisch beoordelen van tekst in verschillende talen. Ze merkten ook op dat hun 'trainingsdata' was gemaakt door andere AI-modellen, niet door mensen, wat een beperking is, maar het was de beste data beschikbaar voor talen zoals het Baskisch.

In het kort: Om een betrouwbare meertalige rechter te bouwen, moet je soms de moedertaal van de robot (Engels) spreken voor de instructies, en soms moet je de grote robots met rust laten en ze hun natuurlijke slimheid laten gebruiken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →