← Nieuwste papers
💬 NLP

Multilingual Prompt Localization for Agent-as-a-Judge: Language and Backbone Sensitivity in Requirement-Level Evaluation

Dit onderzoek toont aan dat de taalkeuze voor de beoordelingsprompt een cruciale variabele is in agente benchmarks, omdat deze de ranking van modellen kan omkeren en er geen enkele achtergrondmodel consistent in alle talen uitblinkt.

Oorspronkelijke auteurs: Alhasan Mahmood, Samir Abdaljalil, Hasan Kurban

Gepubliceerd 2026-04-07
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Alhasan Mahmood, Samir Abdaljalil, Hasan Kurban

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een groep van zes supersterke chefs (de "AI-modellen") hebt die allemaal proberen een ingewikkeld recept te koken. Om te zien wie de beste chef is, heb je een proefpersoon nodig die de gerechten proeft en een cijfer geeft. In de wereld van AI noemen we deze proefpersoon de "Judge" (de rechter).

Tot nu toe deden onderzoekers dit altijd in het Engels. Ze gaven de recepten in het Engels, en de proefpersoon beoordeelde ook in het Engels. Maar deze nieuwe studie vraagt zich af: Wat gebeurt er als we de proefpersoon een andere taal laten spreken?

Hier is wat de onderzoekers ontdekten, vertaald in een simpel verhaal:

1. De Taal Verandert de Winnaar

Stel je voor dat je een wedstrijd organiseert tussen twee topchefs: Chef GPT en Chef Gemini.

  • Als de proefpersoon Engels spreekt, is Chef GPT de onbetwiste winnaar. Hij krijgt de hoogste punten.
  • Maar als je de proefpersoon Arabisch of Hindi laat spreken, gebeurt er iets vreemds: Chef Gemini springt plotseling naar de eerste plaats en wint met overmacht! Chef GPT zakt juist weg.

De les: De taal waarin je de proefpersoon laat oordelen, bepaalt wie de winnaar is. Als je alleen in het Engels test, krijg je misschien een vals beeld van wie er echt het beste presteert in de rest van de wereld.

2. De "Kookboeken" en de "Proefpersonen"

De onderzoekers hebben dit getest met:

  • 55 verschillende kookopdrachten (van simpele salades tot complexe desserts, zoals het bouwen van AI-modellen).
  • 3 verschillende keukens (verschillende software die de chefs gebruiken).
  • 6 verschillende proefpersonen (verschillende AI-modellen als rechter).
  • 5 verschillende talen: Engels, Arabisch, Turks, Chinees en Hindi.

Ze lieten elke proefpersoon elke taak in elke taal beoordelen. Dat zijn bijna 5.000 proeven!

3. Het Gevaar van "Half-vertalen"

Een van de meest interessante ontdekkingen ging over hoe je de proefpersoon instructies geeft.

  • Scenario A: Je vertaalt het recept én de instructies voor de proefpersoon naar het Hindi.
  • Scenario B: Je vertaalt alleen het recept naar het Hindi, maar de instructies voor de proefpersoon blijven in het Engels.

Het resultaat? Bij Scenario B (alleen het recept vertalen) zakte de prestatie van de AI in het Hindi dramatisch in. Het was alsof je een Fransman vraagt om een Frans gerecht te beoordelen, maar je geeft hem de beoordelingscriteria in het Chinees. Hij begrijpt het wel, maar hij kan het niet goed toepassen.
Conclusie: Je moet niet alleen de taak vertalen, maar ook de "hoofd" van de rechter in die taal laten denken.

4. Waarom is dit belangrijk?

Vroeger dachten we dat AI-modellen overal even goed in waren, zolang ze maar in het Engels werden getest. Deze studie laat zien dat dit een grote misvatting is.

  • Geen enkele "Superchef" is overal de beste: De ene AI is geweldig in het Engels, maar de andere is superieur in het Arabisch.
  • Onzekerheid: Zelfs als we kijken naar dezelfde taak, zijn de proefpersonen het vaak niet eens met elkaar. Als de ene zegt "dit is goed", zegt de andere soms "nee, dit is slecht". Dit betekent dat we niet blindelings op één AI-rechter kunnen vertrouwen.

De Grootste Les voor de Toekomst

Als je wilt weten of een AI goed werkt voor mensen in India, Turkije of de Arabische wereld, kun je niet alleen kijken naar de Engelse testresultaten. Je moet de test doen in de taal van de gebruiker, en je moet weten dat de "winnaar" van vandaag misschien morgen een verliezer is als je de taal verandert.

Kortom: Taal is geen neutraal detail. Het is een krachtige knop die de resultaten van AI-tests volledig kan omdraaien. Als we AI eerlijk willen testen voor de hele wereld, moeten we stoppen met alleen in het Engels te oordelen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →