← Nieuwste papers
💬 NLP

PLURAL: A Global Dataset for Value Alignment

Het artikel introduceert PLURAL, een grootschalige dataset afgeleid van de Integrated Values Survey over 92 landen die synthetische voorkeurstriplets genereert om de afstemming van grote taalmodellen met diverse, niet-Westerse culturele waarden te verbeteren, waarbij significante verbeteringen worden aangetoond in zowel geautomatiseerde metrieken als menselijke evaluaties.

Oorspronkelijke auteurs: Dhruv Agarwal, Anya Shukla, Tanya Goyal, Aditya Vashistha

Gepubliceerd 2026-07-10
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Dhruv Agarwal, Anya Shukla, Tanya Goyal, Aditya Vashistha

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superintelligente robotchef hebt gebouwd die een miljoen verschillende recepten kan koken. Maar er is een addertje onder het gras: deze chef is bijna volledig getraind door een kleine groep mensen uit één specifieke buurt in het Westen. Als gevolg daarvan denkt de robot dat iedereen zijn eten wil geserveerd met een bijgerecht van westerse waarden, zelfs wanneer een klant uit Tokio, Mumbai of Rio om iets anders vraagt. De robot kan misschien vloeiend Japans of Portugees spreken, maar zijn "ziel" voelt nog steeds erg Amerikaans aan. Het is als een vloeiende maar vreemde gast die jouw taal perfect spreekt, maar jouw familietradities niet begrijpt.

Maak kennis met PLURAL, een nieuw project van onderzoekers van de Cornell University dat probeert dit culturele blinde vlek van de robot te verhelpen.

Het Grote Idee: Een Wereldwijde Smaaktest

De onderzoekers realiseerden zich dat om een robot te leren verschillende culturen te respecteren, ze niet zomaar willekeurige mensen op internet niet konden vragen wat zij lekker vinden. In plaats daarvan gingen ze naar de bron: een enorme, wetenschappelijk rigoureuze enquête genaamd de Integrated Values Survey (IVS). Deze enquête heeft meer dan 156.658 mensen in 92 verschillende landen gevraagd naar hun diepste overtuigingen—wat zij rechtvaardig, fout, belangrijk of belachelijk vinden.

Beschouw de IVS als een gigantische, wereldwijde "smaaktest" waarbij mensen uit alle hoeken van de wereld hun favoriete smaken van het leven beoordeelden. Maar hier is het probleem: je kunt een robot niet voeden met een spreadsheet van enquête-antwoorden. Robots hebben verhalen en gesprekken nodig, geen "Ja/Nee" selectievakjes.

De Magische Pipeline: Van Enquêtes naar Verhalen

Dus bouwde het team een twee-fasen "vertaalmachine" om die droge enquête-antwoorden te veranderen in 500.000 realistische scenario's voor gesprekken (ook wel "preference triplets" genoemd).

  1. Fase Eén (De Vertaler): Ze namen de echte enquête-antwoorden van een persoon—bijvoorbeeld een 66-jarige man uit Japan die waarde hecht aan familieplicht boven vrije tijd—en vroegen een AI om een echte levenssituatie te bedenken waarin die persoon voor een moeilijke keuze zou staan. De AI genereerde een prompt zoals: "Mijn vriend wil gaan golfen, maar mijn dochter heeft een oppas nodig. Wat doe ik?"
  2. Fase Twee (De Verhalenverteller): De AI schreef vervolgens twee reacties. Eén reactie (de "geprefereerde" reactie) weerspiegelde de werkelijke waarden van de Japanse man (het prioriteren van familieplicht). De andere reactie (de "niet-geprefereerde" reactie) weerspiegelde een ander, aannemelijk standpunt (het prioriteren van vrije tijd).

Dit deden ze voor 20 diverse landen, waardoor ze een enorme bibliotheek creëerden van "wat zou een echt persoon uit dit land daadwerkelijk zeggen?" scenario's. Ze zorgden er ook voor dat ze mensen uit de enquête kozen die de echte mix van leeftijden, geslachten en opleidingsniveaus in die landen vertegenwoordigden, zodat de data niet alleen over hetzelfde type persoon telkens weer ging.

Werkt het? De Resultaten van de Smaaktest

De onderzoekers vertrouwden niet alleen op hoop; ze zetten het op drie manieren op de proef:

  1. De "Is het Echt?" Check: Ze verifieerden dat de nieuwe verhalen de unieke smaak van elk land daadwerkelijk behielden. Ze ontdekten dat de data de duidelijke verschillen tussen bijvoorbeeld Brazilië en Japan nog steeds vasthield, en zelfs de variëteit aan meningen binnen elk land behield. Het was niet zomaar een verzameling stereotypen; het was een rijke, complexe reflectie van echte menselijke diversiteit.
  2. De Robottraining: Ze namen een standaard taalmodel en trainden dit op de nieuwe PLURAL-data. Ze testten de robot met een andere set culturele vragen (het GLOBE-framework) die de robot nog nooit eerder had gezien. Het resultaat? De robot die getraind was op PLURAL was 27,7% beter in het matchen van het culturele profiel van landen zoals India, vergeleken met andere sterke methoden. De robot raadde niet alleen; hij leerde de specifieke "vibe" van de doelcultuur.
  3. Het Menselijke Oordeel: Ze vroegen 176 echte mensen uit India, Brazilië en Japan om de antwoorden van zowel de nieuwe als de oude robot te lezen. De mensen kozen overweldigend de antwoorden van de met PLURAL getrainde robot als zijnde meer "typisch" voor hun eigen nationale waarden. Eén persoon noemde een reactie zelfs "typisch Indiaans", waarbij werd opgemerkt hoe het specifiek de manier vastlegde waarop families WhatsApp gebruiken om verbonden te blijven.

Wat het NIET is (De "Vloeiend maar Vreemd" Valstrik)

Het paper is zeer duidelijk over wat dit niet doet. Het spree�t zich uit tegen het idee dat het simpelweg laten spreken van een lokale taal (zoals Hindi of Arabisch) door een robot voldoende is. Eerdere pogingen creëerden "vloeiende maar vreemde" modellen die weliswaar in lokale talen konden chatten, maar nog steeds westerse waarden pushten. PLURAL laat zien dat je de robot moet trainen op de waarden zelf, niet alleen op de woorden.

Ook sluit het paper expliciet de mogelijkheid uit dat je een robot simpelweg cultureel bewust kunt maken door hem te instrueren: "Je bent uit Brazilië." Hoewel dat een klein beetje helpt, is het bij lange na niet zo effectief als het daadwerkelijk trainen van de robot op duizenden echte, op waarden gebaseerde voorbeelden.

Het Nadeel: De Robot Wordt een Beetje "Samengedrukt"

Dit is het deel waar de onderzoekers eerlijk zijn over de beperkingen. Hoewel de robot veel beter werd in het begrijpen van verschillende culturen, leek het trainingsproces de verschillen een beetje te "samendrukken".

Stel je de culturele profielen van verschillende landen voor als punten die verspreid liggen over een groot veld. De echte landen liggen ver uit elkaar. Na de training bewogen de "culturele punten" van de robot wel de juiste kant op, maar ze eindigden geclusterd dichter bij elkaar dan de echte landen dat zijn. De robot ving ongeveer 18% van de oorspronkelijke diversiteit op. De onderzoekers suggereren dat dit niet komt door de data, maar omdat de huidige trainingsmethoden (een techniek genaamd DPO) de zaken te veel afvlakken. Het is als een foto-filter die ervoor zorgt dat iedereen er een beetje meer hetzelfde uitziet, ook al zijn ze nog steeds duidelijk verschillend.

De Kern van het Verhaal

PLURAL is een enorme, open bibliotheek van 500.000 waarde-gerichte verhalen, gebaseerd op echte enquêtes uit 20 landen (en klaar om uitgebreid te worden naar 92). Het bewijst dat we robots kunnen leren om een breder scala aan menselijke waarden te respecteren, waardoor ze weg bewegen van een enkel westers perspectief. Het is een belangrijke stap naar een toekomst waarin onze digitale assistenten niet alleen onze taal spreken, maar ook echt ons hart en onze cultuur begrijpen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →