EvalMORAAL: Interpretable Chain-of-Thought and LLM-as-Judge Evaluation for Moral Alignment in Large Language Models
EvalMORAAL is een transparant, interpreteerbaar kader dat morele uitlijning evalueert in 20 grote taalmodellen aan de hand van wereldwijde surveygegevens, waarbij sterke over het algemeen correlaties worden blootgelegd maar ook een significante uitlijningstussenruimte van 0,21 punt tussen westerse en niet-westerse regio's.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een gigantische, superintelligente bibliotheek met boeken voor die een robot heeft gelezen om te leren spreken. Deze robot, een Large Language Model (LLM), is buitengewoon bekwaam in het schrijven van verhalen, het beantwoorden van vragen en het oplossen van raadsels. Maar er is een addertje onder het gras: de robot heeft voornamelijk geleerd uit boeken die in het Engels zijn geschreven, grotendeels door mensen in westerse landen (zoals de VS en Europa).
Stel je nu voor dat je deze robot een vraag stelt over wat "goed" of "slecht" is in een cultuur waarover hij weinig heeft geleerd, zoals in delen van Afrika of Azië. Zal de robot een antwoord geven dat past bij die cultuur, of zal hij gewoon het antwoord geven dat hij heeft geleerd uit zijn westerse boeken?
Dit is precies wat het paper EvalMORAAL onderzoekt. De onderzoekers bouwden een "morele test" om te zien hoe goed 20 verschillende AI-robots de morele waarden van mensen over de hele wereld begrijpen.
Hier is hoe ze dit deden, uitgelegd met enkele eenvoudige analogieën:
1. De Test: Een Wereldwijde "Morele Enquête"
De onderzoekers stelden de robots niet zomaar willekeurige vragen. Ze gebruikten twee enorme, real-world enquêtes (de World Values Survey en de PEW Global Attitudes Survey) waarin echte mensen in 64 landen werden gevraagd naar 23 verschillende morele thema's.
- De Thema's: Dingen als "Is het oké om belasting te ontduiken?" "Is homoseksualiteit acceptabel?" of "Is het oké om geweld te gebruiken om een probleem op te lossen?"
- Het Doel: Ze wilden zien of de antwoorden van de AI overeenkwamen met het gemiddelde antwoord van de echte mensen in dat specifieke land.
2. De Methode: Twee Manieren om te Vragen, Eén "Rechter"
Om de beste resultaten te krijgen, vroegen de onderzoekers de AI niet zomaar een simpel "Ja" of "Nee". Ze gebruikten een drieledige strategie:
- De "Verborgen" Score (Log-kansen): Stel je voor dat je de AI vraagt een zin af te maken zoals: "In Japan is homoseksualiteit..." De AI moet kiezen tussen "acceptabel" of "niet acceptabel". De onderzoekers keken hoe zeker de AI was in zijn keuze op basis van zijn interne wiskunde. Dit is als kijken hoe snel de hand van een student beweegt wanneer hij het antwoord opschrijft; het toont hun ingewandsgewaarheid.
- De "Denk"-Score (Chain-of-Thought): Dit is de grote innovatie. In plaats van alleen een antwoord te geven, vroegen de onderzoekers de AI eerst om hardop na te denken.
- Stap 1: "Wat zijn de sociale normen in dit land?"
- Stap 2: "Redeneer stap voor stap: Is dit hier oké?"
- Stap 3: "Geef een score van -1 (nooit oké) tot +1 (altijd oké)."
- Het Resultaat: Deze "denk"-stap werkte veel beter. Het was alsof je de AI een moment gaf om "culturele bril" op te doen voordat hij antwoordde, in plaats van gewoon te gokken.
- De "Peer Review" (LLM als Rechter): Om ervoor te zorgen dat de AI niet zomaar dingen verzon, lieten ze de 20 verschillende robots elkaars "denk"-stappen beoordelen. Als de redenering van Robot A vreemd of bevooroordeeld klonk, zou Robot B dit markeren. Dit hielp de onderzoekers 348 specifieke gevallen te vinden waarin de robots sterk van mening verschilden.
3. De Resultaten: Goed Nieuws, Slecht Nieuws
De studie vond enkele zeer duidelijke patronen:
- De "Top Tier" wordt Beter: De slimste modellen (zoals Claude-3-Opus en GPT-4o) doen het verrassend goed. Wanneer ze worden gevraagd naar morele kwesties in westerse landen, komen hun antwoorden bijna perfect overeen met echte menselijke enquêtes (ongeveer 90% correlatie). Het is als een student die hard heeft gestudeerd en een A haalde op de toets.
- De "Regionale Kloof" is Echt: Dit is de belangrijkste bevinding. De robots zijn geweldig in het begrijpen van westerse waarden (zoals in de VS of Europa), maar ze worstelen aanzienlijk met niet-westerse waarden (zoals in het Midden-Oosten, Zuid-Azië of Afrika).
- De Analogie: Stel je een vertaler voor die vloeiend Frans en Spaans spreekt, maar slechts een paar woorden Swahili kent. Als je hen vraagt een complex Swahili-gedicht te vertalen, raden ze misschien de betekenis, maar zullen ze het waarschijnlijk verkeerd hebben. Het paper vond een kloof van 21 punten tussen hoe goed de AI westerse culturen begreep versus niet-westerse culturen.
- Geweld is Moeilijk: De robots worstelden het meest met thema's die geweld betreffen (zoals terrorisme of huiselijk geweld). Dit zijn de vragen waar culturele context het belangrijkst is, en waar de "westerse voorkeur" van de AI het sterkst naar voren kwam.
4. Waarom Dit Belangrijk Is
Het paper concludeert dat hoewel AI grote vooruitgang boekt, het in veel delen van de wereld nog steeds "cultureel blind" is.
- Het Probleem: Als we deze AI-robots gebruiken om beslissingen te nemen (zoals het modereren van sociale media of het geven van juridisch advies) in niet-westerse landen, kunnen ze legitieme lokale stemmen het zwijgen opleggen of lokale gebruiken verkeerd begrijpen, omdat ze westerse regels toepassen op niet-westerse situaties.
- De Oplossing: De onderzoekers suggereren dat we niet kunnen vertrouwen op één "wereldwijde" AI. We moeten controleren hoe deze modellen presteren in specifieke regio's, de "denk"-methode (Chain-of-Thought) gebruiken om ze te verbeteren, en ze misschien trainen met meer diverse data, zodat ze niet klinken alsof ze uit één specifieke wijk komen.
Kortom: Het paper bouwde een spiegel om ons te laten zien dat onze AI-robots momenteel zeer goed zijn in het weerspiegelen van westerse waarden, maar nog steeds leren hoe ze de wereld door de ogen van de rest van de wereld moeten zien.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.