← Nieuwste papers
💬 NLP

CLASH: Evaluating Language Models on Judging High-Stakes Dilemmas from Multiple Perspectives

Het artikel introduceert CLASH, een dataset van dilemma's met hoge inzet met diverse perspectieven van personages, om te onthullen dat zelfs geavanceerde taalmodellen worstelen met waardegebaseerde besluitvorming, waarbij ze specifieke foutpatronen vertonen zoals vroege toezegging en een beperkt begrip van verschuivingen in waarden, ondanks redelijke voorspellingen van psychologisch ongemak.

Oorspronkelijke auteurs: Ayoung Lee, Ryan Sungmo Kwon, Peter Railton, Lu Wang

Gepubliceerd 2026-06-05
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ayoung Lee, Ryan Sungmo Kwon, Peter Railton, Lu Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren hoe hij moeilijke levenskeuzes moet maken. De meeste eerdere tests vroegen de robot eenvoudige vragen zoals: "Is het oké om door rood te lopen als je te laat bent voor je werk?" Maar in de echte wereld zijn de moeilijkste keuzes niet simpel; het zijn situaties met hoge inzet waarbij elke optie iemand pijn doet en waarden botsen als twee stormen die tegen elkaar opvallen.

Dit artikel introduceert CLASH (Character perspective-based LLM Assessments in Situations with High-stakes), een nieuwe "examen"-methode ontworpen om te zien of AI complexe, onder druk staande situaties kan aan.

Hier is een overzicht van wat ze hebben gedaan en wat ze hebben gevonden, met behulp van eenvoudige analogieën:

1. Het Examen: CLASH

Beschouw eerdere AI-tests als een meerkeuzequiz met korte, heldere zinnen. CLASH is meer als een dramaserie.

  • De Verhalen: In plaats van oneliners bevat de dataset 345 lange, gedetailleerde verhalen over situaties van leven of dood of levensveranderende gebeurtenissen (zoals een arts die een beslissing neemt over een behandeling, of een bankbediende die een kostbare fout maakt).
  • De Karakters: Voor elk verhaal moet de AI antwoorden vanuit het perspectief van verschillende "karakters". Sommige karakters geven alleen om veiligheid; anderen geven alleen om rechtvaardigheid. Sommige karakters veranderen halverwege het verhaal van mening.
  • Het Doel: Het examen vraagt: "Als jij Karakter A was, zou je dit doen? Zou je je er slecht bij voelen? Is je mening veranderd van gisteren naar vandaag?"

2. De Grote Bevindingen: Waar de AI struikelt

De onderzoekers hebben 14 verschillende AI-modellen getest (inclusclusief de nieuwste, slimste modellen zoals GPT-5 en Claude-4) op dit examen. Dit is wat er gebeurde:

A. Het "Niet Kunnen Beslissen" Probleem (Ambivalentie)

  • De Metafoor: Stel je voor dat je voor twee deuren staat. De ene leidt naar een beloning, de andere naar een valstrik. Een mens zou kunnen zeggen: "Ik ben verdeeld, ik kan niet kiezen."
  • De Resultaten: De AI-modellen zijn erg slecht in het toegeven dat ze verdeeld zijn. Zelfs de slimste modellen dwongen een "Ja" of "Nee" antwoord, zelfs wanneer de situatie duidelijk om een "Misschien" vroeg. Ze vonden het moeilijk om te zeggen: "Ik weet het niet," zelfs toen het juiste antwoord "Ik ben in conflict" was. Sterker nog, het beste model kreeg dit slechts ongeveer 51% van de tijd goed.

B. Het "Gevoel in de Buik" Probleem (Ongemak)

  • De Metafoor: Soms weet je wat je zou moeten doen, maar voelt het niet goed in je onderbuik. Zoals een ouder die een vriend moet ontslaan om het bedrijf te redden.
  • De Resultaten: De AI is eigenlijk best goed in het herkennen wanneer een karakter zich ongemakkelijk zou moeten voelen. Als het verhaal zegt: "Karakter A hecht waarde aan eerlijkheid, maar moet liegen," raadt de AI correct: "Ja, Karakter A voelt zich hier slecht bij."

C. Het "Geheugen" Probleem (Waardeverschuivingen)

  • De Metafoor: Stel je een karakter voor dat van pizza houdt, maar dan buikpijn krijgt en nu besluit dat hij een hekel heeft aan pizza.
  • De Resultaten: De AI-modellen zijn erg slecht in het bijwerken van hun "geest". Wanneer een verhaal zegt: "Karakter A hechtte vroeger waarde aan X, maar hecht nu waarde aan Y," vergeet de AI de verandering vaak en antwoordt op basis van de oude overtuiging. Het is als een student die vorig jaar voor een test heeft gestudeerd, maar is vergeten dat hij dit jaar een nieuw vak heeft geleerd! De nauwkeurigheid daalde met bijna 43 punten wanneer waarden verschoven!

3. Hoe de AI "Denkt" (Redeneringsketens)

De onderzoekers keken in de "hersenen" van de AI om te zien hoe deze problemen werden opgelost.

  • De Oude Truc: In wiskunde of schaken gebruiken slimme AI's een strategie genaamd "backtracking" (het controleren van hun werk, terugkijken naar de regels). Dit werkt geweldig voor wiskunde.
  • De Nieuwe Fout: Bij morele dilemma's hielp dit backtracking niet. In plaats daarvan ontwikkelde de AI twee slechte gewoonten:
    1. Vroegtijdige Toezegging: De AI kiest te snel een kant, zoals een rechter die de hamer laat vallen voordat het hele verhaal is gehoord.
    2. Overmatige Toezegging: Zodra de AI een kant heeft gekozen, houdt hij er koppig aan vast en negeert hij bewijs dat suggereert dat de andere kant misschien gelijk heeft. Het is als een advocaat die weigert naar het tegenargument te luisteren zodra hij aan zijn pleidooi is begonnen.

4. De "Stuur" Test

De onderzoekers testten ook hoe gemakkelijk ze de AI konden "sturen" naar een specifieke waarde (zoals Veiligheid versus Zelfrespect).

  • De Bevinding: Als een AI al heel veel van "Veiligheid" houdt, is het erg moeilijk om hem "Zelfrespect" te laten kiezen in plaats daarvan. Hoe meer de AI van nature één waarde verkiest, hoe moeilijker het is om hem naar het tegenovergestelde te sturen.
  • De Perspectief-truc: De AI luisterde beter wanneer er werd gevraagd: "Wat zou Karakter A doen?" (derde persoon) in plaats van "Wat zou jij doen?" (eerste persoon). Echter, voor de waarde "Veiligheid" luisterde de AI eigenlijk beter wanneer er in de eerste persoon werd gevragen, waarschijnlijk omdat veiligheid een diepgeworteld instinct is voor het model.

Samenvatting

Het artikel concludeert dat hoewel AI slimmer wordt in wiskunde en spellen, het nog steeds erg onhandig is in het navigeren door de chaotische, emotionele en veranderende wereld van menselijke waarden. Het heeft moeite om toe te geven dat het verward is, het vergeet wanneer mensen van mening veranderen, en het komt vaak vast te zitten in zijn eigen koppige logica.

Belangrijke Opmerking: De auteurs benadrukken dat dit een diagnostisch hulpmiddel is. Ze zeggen niet dat deze AI-modellen klaar zijn om artsen of rechters te zijn. Sterker nog, ze waarschuwen dat een hoge score op deze test niet betekent dat een AI veilig is voor gebruik in het echte leven; het betekent alleen dat we nu een betere manier hebben om te zien waar de AI faalt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →