← Nieuwste papers
💬 NLP

P3B3: A Multi-Turn Conversational Benchmark for Measuring European and Brazilian Portuguese Variety Bias in LLMs

Het artikel introduceert P3B3, een door experts gecureerde benchmark en evaluatiekader dat een significante bias naar Braziliaans-Portugees boven Europees-Portugees onthult in huidige Large Language Models, wat de dringende behoefte aan een meer gebalanceerde meertalige representatie benadrukt.

Oorspronkelijke auteurs: Rafael Ferreira, Inês Vieira, Inês Calvo, James Furtado, Iago Paulo, Diogo Tavares, Diogo Glória-Silva, David Semedo, João Magalhães

Gepubliceerd 2026-06-16
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Rafael Ferreira, Inês Vieira, Inês Calvo, James Furtado, Iago Paulo, Diogo Tavares, Diogo Glória-Silva, David Semedo, João Magalhães

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een groep zeer intelligente, erudiete robots hebt (Large Language Models, of LLM's) die Portugees spreken. Het probleem is dat Portugees niet één enkele stem is; het is als een familie met twee zeer verschillende neven: Europees Portugees (gesproken in Portugal) en Braziliaans Portugees (gesproken in Brazilië).

Hoewel ze dezelfde familienaam delen, spreken ze anders. Ze gebruiken verschillende woorden voor dezelfde dingen (zoals "bus" vs. "autocarro"), praten anders met elkaar en hebben zelfs unieke manieren om hun zinnen te construeren.

Het Probleem: De "Braziliaanse Bias"

De onderzoekers in dit artikel merkten iets vreemds op. Omdat het internet overspoeld wordt met tekst uit Brazilië, hebben deze robots veel meer Braziliaans Portugees gelezen dan Europees Portugees. Het is also_f een student alleen tekstboeken uit één specifiek dialect heeft gelezen; wanneer die student probeert te spreken, klinkt hij per ongeluk als iemand uit die regio, zelfs als hij met iemand aan de andere kant van de oceaan praat.

Het team wilde weten: Hebben deze robots een favoriete neef? En als we hen vertellen: "Spreek als een Europeaan", kunnen ze dat dan echt?

De Oplossing: P3B3 (De "Accenttest")

Om uit te zoeken hoe het zat, creëerden de onderzoekers een speciale test genaamd P3B3. Zie dit als een "blind proeverij" voor taal.

  • De Opzet: Ze vroegen de robots niet simpelweg: "Wat is een bus?" (wat een specifiek antwoord zou kunnen triggeren). In plaats daarvan creëerden ze natuurlijke, meerlaagse gesprekken over alledaagse onderwerpen zoals transport en schoonheidsproducten.
  • De Truc: De vragen waren zo ontworpen dat ze "variëtaits-agnostisch" waren. Dit betekent dat de vragen geen hints gaven over welk accent gebruikt moest worden. Het was alsof je vroeg: "Hoe kom ik bij de winkel?" zonder te zeggen "in Lissabon" of "in São Paulo".
  • Het Doel: Ze wilden zien wat de robots van nature zouden zeggen. Zouden ze standaard het Braziliaanse accent gebruiken omdat ze dat het meest hebben gelezen? Of konden ze van koers veranderen als erom gevraagd werd?

Hoe Ze Het Maten

De onderzoekers gebruikten twee methoden om de antwoorden van de robots te beoordelen:

  1. De "Grammatica Politie" (Classifiers): Computerprogramma's die getraind zijn om specifieke woorden en grammaticaregels te herkennen die bij ofwel Portugal of Brazilië horen.
  2. De "Expert Rechter" (LLM-as-Judge): Ze gebruikten een superintelligente AI (Gemini) om de antwoorden te lezen en op te treden als een menselijke taalkundige, waarbij een score werd gegeven van 0 (Puur Braziliaans) tot 10 (Puur Europees), inclusief een uitleg over waarom (bijv. "Ze gebruikten het woord 'ônibus' in plaats van 'autocarro'").

Wat Ze Vonden

De resultaten waren een beetje als een realityshow waarin de kandidaten moeite hebben om hun ware afkomst te verbergen:

  • De Standaardmodus: Wanneer ze met rust gelaten werden (zonder instructies), spraken bijna alle robots van nature Braziliaans Portugees. Dit was hun "comfortzone". Zelfs robots die specifiek getraind waren om Europees te zijn (zoals AMALIA), waren de enigen die consequent het Europese accent vasthielden.
  • De "Schakeltest": Wanneer de onderzoekers de robots expliciet vertelden: "Spreek alsjeblieft Braziliaans", deden de meeste van hen het erg goed. Maar wanneer ze zeiden: "Spreek alsjeblieft Europees", werd het veel moeilijker. Veel robots hadden moeite om consistent te blijven. Ze begonnen Europees te spreken, maar vervielen na een paar zinnen per ongeluk weer in Braziliaanse woorden of grammatica.
  • Grootte Doet Er Toe: De nieuwere, grotere en krachtigere robots waren beter in staat om instructies op te volgen en van accent te wisselen dan de oudere, kleinere robots. Toch driften zelfs de beste modellen soms af naar hun Braziliaanse wortels tijdens langere gesprekken.

Het Grotere Plaatje

Het artikel concludeert dat hoewel deze AI-modellen beter worden, ze nog steeds een sterke "Braziliaanse bias" hebben vanwege de data waarop ze zijn getraind. Ze zijn als acteurs die geweldig zijn in het spelen van een Braziliaans personage, maar moeite hebben om gedurende een heel toneelstuk in hun rol als Europeaan te blijven, zelfs als de regisseur daarom vraagt.

De onderzoekers hebben deze test (P3B3) gebouwd zodat ontwikkelaars in de toekomst kunnen controleren of hun robots evenwichtiger en eerlijker worden naar alle Portugeessprekende gebruikers, om ervoor te zorgen dat een gebruiker in Lissabon dezelfde hoogwaardige, cultureel accurate ervaring krijgt als een gebruiker in Rio de Janeiro.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →