Are Language Models Sensitive to Morally Irrelevant Distractors?
Dit onderzoek toont aan dat taalmodellen, net als mensen, gevoelig zijn voor moreel irrelevante omgevingsfactoren, waarbij de toevoeging van dergelijke afleiders de morele oordelen van de modellen met meer dan 30% kan beïnvloeden.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Zijn AI-modellen eigenlijk wel 'karaktervast'?
Stel je voor dat je een rechter bent. Je moet beslissen of iemand een boete moet krijgen voor te hard rijden. Maar net voordat je je vonnis uitspreekt, ruikt er iemand in de rechtszaal een heerlijk versgebakken kaneelbroodje. Of er staat plotseling een irritante, luidruchtige grasmaaier buiten te loeien.
Zou dat de manier waarop je oordeelt beïnvloeden? Voor een mens is het antwoord: ja. Als we in een goede bui zijn (door dat heerlijke broodje), zijn we vaak milder. Als we geïrriteerd zijn (door dat lawaai), zijn we sneller streng of zelfs onredelijk. In de psychologie noemen we dit het "situationisme": onze moraal is niet een vast blok beton, maar eerder een klei die van vorm verandert door de omgeving.
Wat hebben onderzoekers ontdekt over AI?
Wetenschappers wilden weten of grote taalmodellen (zoals ChatGPT) ook zo "gevoelig" zijn. Ze gaven de AI morele dilemma's (bijvoorbeeld: "Mag je liegen om iemands gevoelens te sparen?"), maar ze voegden daar ook "morele afleiders" aan toe. Dit zijn dingen die totaal niets met de vraag te maken hebben, zoals een plaatje van een vuilnisbelt of een tekstje over een nare geur.
De resultaten: De AI is een emotionele kameleon
De onderzoekers ontdekten dat AI-modellen verrassend veel lijken op die menselijke rechter met het kaneelbroodje:
- De "Slechte Buien"-factor: Als de AI een negatieve afleider kreeg (zoals een plaatje van afval of een tekst over een nare geur), werd hij plotseling een stuk minder sociaal en minder ethisch. In sommige gevallen veranderde de morele keuze van de AI wel met 30%! De AI werd opeens een stuk "strenge" of zelfs "onethische" rechter, puur door de omgeving.
- De "Lekker in je vel"-factor: Kreeg de AI een positieve afleider (zoals een mooi landschap of een tekst over een picknick)? Dan werd hij juist milder en vriendelijker.
- Geen stabiel kompas: We dachten vaak dat AI een soort vaststaand moreel kompas heeft dat we kunnen programmeren. Dit onderzoek laat zien dat het kompas van de AI alle kanten op zwiept zodra de "lucht" in de kamer verandert.
Waarom is dit belangrijk? (De metafoor van de zelfrijdende auto)
Je kunt het vergelijken met een zelfrijdende auto. We testen die auto op een perfecte, zonovergoten weg. De auto rijdt perfect en volgt alle regels. Maar wat als de auto plotseling een sensor krijgt die "gevoel" heeft voor de kleur van de lucht? Als de auto besluit dat hij bij een donkere, stormachtige lucht opeens "agressiever" moet rijden, dan hebben we een groot probleem.
Als we AI inzetten in gevoelige beroepen — zoals in de psychologie, het onderwijs of de rechtspraak — moeten we er niet vanuit gaan dat de AI altijd dezelfde waarden hanteert. De context (de sfeer, de emotie, de omgeving) kan de AI onbedoeld "sturen" naar een minder ethisch gedrag.
De conclusie: De verantwoordelijkheid ligt bij de maker
De onderzoekers zeggen eigenlijk: we kunnen de AI niet behandelen als een mens met een eigen "ziel" of "karakter". In plaats daarvan moeten we de makers van de AI waarschuwen.
Het is niet de taak van de AI om "een goed mens" te worden, maar het is de taak van de ontwikkelaar om ervoor te zorgen dat de AI niet in de war raakt van een "geur van vuilnis" of een "plaatje van een storm". We moeten de AI niet alleen leren wat goed en kwaad is, maar hem ook leren om die morele regels vast te houden, zelfs als de omgeving hem probeert af te leiden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.