← Nieuwste papers
💬 NLP

Lost in Translation: Do LVLM Judges Generalize Across Languages?

Dit paper introduceert MM-JudgeBench, het eerste grote meerdimensionale benchmark voor het evalueren van meertalige LVLM-judges, en onthult dat bestaande modellen aanzienlijke prestatievariatie vertonen over verschillende talen, wat de noodzaak benadrukt van meertalige benchmarks voor betrouwbare automatische evaluatie.

Oorspronkelijke auteurs: Md Tahmid Rahman Laskar, Mohammed Saidul Islam, Mir Tafseer Nayeem, Amran Bhuiyan, Mizanur Rahman, Shafiq Joty, Enamul Hoque, Jimmy Huang

Gepubliceerd 2026-04-22
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Md Tahmid Rahman Laskar, Mohammed Saidul Islam, Mir Tafseer Nayeem, Amran Bhuiyan, Mizanur Rahman, Shafiq Joty, Enamul Hoque, Jimmy Huang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Titel: Verloren in Vertaling: Kunnen AI-Beoordelaars Alle Talen Even Goed?

Stel je voor dat je een gigantische, slimme robot hebt die foto's kan bekijken en vragen daarover kan beantwoorden. Dit is een LVLM (een model dat zowel kan zien als lezen). Maar hoe weten we of deze robot echt slim is, of dat hij gewoon geluk heeft?

Om dat te testen, gebruiken we een AI-rechter. Dit is een andere AI die naar het antwoord van de eerste robot kijkt en zegt: "Ja, dat is een goed antwoord" of "Nee, dat is onzin."

De onderzoekers van dit paper hebben een groot probleem ontdekt: Deze AI-rechters zijn geweldig in het Engels, maar vaak slecht in andere talen. Het is alsof je een meester-keukenchef hebt die perfecte pizza's maakt voor Italië, maar als je hem vraagt om sushi te maken voor Japan, hij in paniek raakt en alles verbrandt.

Hier is wat ze hebben gedaan om dit op te lossen, vertaald in een simpel verhaal:

1. De Nieuwe Testbaan: MM-JudgeBench

Vroeger werden deze AI-rechters alleen getest op Engelse foto's en Engelse vragen. Dat is net alsof je een auto test op een rechte weg in Nederland en dan denkt dat hij ook goed rijdt in de modderige bergen van Peru of de smalle straatjes van Tokio.

De onderzoekers hebben een nieuwe, enorme testbaan gebouwd genaamd MM-JudgeBench.

  • Het formaat: Het bevat meer dan 60.000 testcases.
  • De diversiteit: Het is niet alleen in het Engels, maar in 25 verschillende talen, variërend van grote talen zoals Frans en Chinees tot kleinere, minder bekende talen zoals Kazachs.
  • De inhoud: Het bevat twee soorten tests:
    1. Algemene foto's: Een hond op een bankje, een parkscène, etc.
    2. Grafieken en diagrammen: Het interpreteren van complexe图表 (zoals een weersvoorspelling of een financieel overzicht).

2. Het Experiment: De "Vertaal-En-Test" Methode

Om eerlijk te testen, hebben ze niet gewoon willekeurige foto's in het Frans of Spaans gezocht. Dat zou oneerlijk zijn omdat de foto's misschien anders zijn.

In plaats daarvan:

  1. Ze namen de perfecte Engelse testvragen.
  2. Ze gebruikten een super-slimme vertaal-AI (Gemini) om deze vragen en de mogelijke antwoorden naar de 25 talen te vertalen.
  3. Ze gaven deze vertaalde tests aan 22 verschillende AI-rechters (zowel dure, gesloten modellen van grote bedrijven als goedkopere, open-source modellen).

3. De Verbluffende Resultaten

Wat vonden ze? Het verhaal is niet zo rooskleurig als we hoopten.

  • De "Engelse" Blinde Vlek: Veel AI's die in het Engels 90% van de vragen goed beantwoorden, zakken in het Kazachs of het Hindi soms naar 40% of zelfs lager. Het is alsof een student die een 10 haalt voor wiskunde in het Nederlands, een 2 haalt als dezelfde wiskundige som in het Russisch wordt gesteld.
  • Groot is niet altijd beter: Je zou denken dat een gigantische AI (met 32 miljard "hersencellen") beter is dan een kleine. Maar dat bleek niet waar te zijn voor andere talen. Soms deed een kleinere, slim ontworpen AI (zoals Qwen3-VL) het beter dan een reuzenmodel.
  • De "Grote Drie" vs. De Rest: De dure, gesloten modellen (zoals GPT-5) deden het over het algemeen het beste en waren het meest stabiel. Maar zelfs zij maakten fouten. De goedkopere, open modellen waren vaak onvoorspelbaar: soms briljant, soms compleet in de war.
  • De "Grafiek"-Probleem: Het interpreteren van grafieken in andere talen bleek extra lastig. De AI's konden de cijfers zien, maar de tekst eromheen (in een andere taal) verwarde hen.

4. De "Bias" (Voorkeur) Probleem

De onderzoekers ontdekten ook dat de AI-rechters soms "slecht gedrag" vertoonden:

  • Positie-voorkeur: Soms koos de AI het eerste antwoord (A) niet omdat het goed was, maar gewoon omdat het eerst stond. In het Engels deed ze dit zelden, maar in andere talen gebeurde dit veel vaker.
  • Lengte-voorkeur: Soms dachten ze: "Hoe langer het antwoord, hoe beter," zelfs als het antwoord onzin was.

5. De Oplossing: Oefening Baart Kunst (Domain Adaptation)

Het goede nieuws? Ze hebben een oplossing gevonden. Ze hebben een AI (Qwen3-VL) getraind met een speciale dataset van 100.000 voorbeelden in meerdere talen.

  • Het resultaat: Na deze training verbeterde de AI enorm. Het was alsof je een student die slecht in wiskunde is, een paar maanden intensief laat studeren in het land waar de taal wordt gesproken. Plotseling kon hij de problemen oplossen.

Conclusie: Waarom is dit belangrijk?

Deze paper zegt eigenlijk: "Stop met vertrouwen op AI-rechters die alleen in het Engels zijn getest."

Als we AI-systemen wereldwijd willen gebruiken (bijvoorbeeld in ziekenhuizen, scholen of voor nieuwsberichten), moeten we zeker weten dat de "rechter" die de AI beoordeelt, ook echt begrijpt wat er in het Spaans, het Arabisch of het Swahili gebeurt. Anders beoordelen we de kwaliteit van onze technologie op basis van een onvolledig en vertekend beeld.

Kort samengevat: AI's zijn slimme polyglotten, maar hun "rechter" is vaak nog een een-talige toerist die verdwaalt zodra hij de grens oversteekt. We hebben een nieuwe kaart (MM-JudgeBench) nodig om hen de weg te wijzen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →