← Nieuwste papers
💻 computer science

Alignment Makes Language Models Normative, Not Descriptive

Deze studie toont aan dat post-training alignment taalmodellen normatief maakt in plaats van beschrijvend, waardoor ze menselijk gedrag in strategische multi-ronde interacties slechter voorspellen dan onafgestemde basismodellen, hoewel ze juist beter presteren in situaties waar menselijk gedrag meer overeenkomt met theoretische normen.

Oorspronkelijke auteurs: Eilam Shapira, Moshe Tennenholtz, Roi Reichart

Gepubliceerd 2026-03-19
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Eilam Shapira, Moshe Tennenholtz, Roi Reichart

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Titel: Waarom de 'Netjes Gemaakte' AI Mensen Slechter Voorspelt dan de 'Ruwe' AI

Stel je voor dat je twee soorten voorspellers hebt om te raden wat mensen doen in een spelletje:

  1. De Ruwe Voorspeller (Base Model): Dit is de AI zoals hij uit de fabriek komt. Hij heeft alles gelezen op internet, van nieuwsartikelen tot forumdiscussies, en weet precies hoe mensen echt praten, bluffen, boos worden en soms onredelijk doen. Hij is een eerlijke spiegel van de menselijke chaos.
  2. De Netjes Gemaakte Voorspeller (Aligned Model): Dit is dezelfde AI, maar hij heeft een "opvoeding" gekregen. Mensen hebben hem getraind om beleefd, eerlijk, collaboratief en sociaal wenselijk te zijn. Hij is als een perfecte diplomaat die nooit liegt, nooit boos wordt en altijd probeert iedereen tevreden te stellen.

Deze paper (onderzoek) stelt een verrassende vraag: Wie is de betere voorspeller van wat een echt mens zal doen?

Het antwoord is misschien wel het tegenovergestelde van wat je denkt: De Ruwe Voorspeller wint het vaakst.

Hier is de uitleg, vertaald naar alledaagse metaforen:

1. Het Spel van het Leven (Meer dan één beurt)

Stel je voor dat je een langdurig spelletje speelt met iemand, zoals onderhandelen over de prijs van een auto of een conflict oplossen. In zo'n spel is de geschiedenis belangrijk. Als de ander je een keer onredelijk behandelt, word jij boos en wreek je dat later. Als je iemand een keer een plezier doet, help je ze later terug.

  • De Ruwe AI ziet dit en zegt: "Ah, deze persoon is boos geworden, dus nu zal hij terugslaan. Ik voorspel dat hij boos reageert."
  • De Netjes Gemaakte AI denkt echter: "Nee, nee, we moeten allemaal aardig blijven en samenwerken. Mensen doen dat toch?" Hij probeert te voorspellen hoe mensen zouden moeten handelen (normatief), in plaats van hoe ze echt handelen (beschrijvend).

Het resultaat: In complexe, meerdaagse spellen wint de Ruwe AI het met een enorme marge (bijna 10 keer vaker). Hij ziet de menselijke imperfectie, wraakzucht en strategieën die de Netjes AI heeft "opgepoetst" tot ze verdwenen zijn.

2. Het Eén-Moment Spelletje (Geen geschiedenis)

Nu stel je je een heel kort spelletje voor. Iemand krijgt een vraag: "Kies je A of B?" Er is geen geschiedenis, geen wraak, geen onderhandeling. Het is een simpele, logische keuze.

  • Hier werkt de Netjes Gemaakte AI juist beter. Omdat er geen emotionele geschiedenis is, gedragen mensen zich vaak logischer en meer volgens de regels. De Netjes AI, die is getraind om de "goede" antwoorden te geven, raadt dit vaak goed.
  • De Ruwe AI kan hier soms te veel "ruis" zien of te veel variatie, terwijl de Netjes AI de standaard, logische oplossing pakt die mensen in deze simpele situaties vaak kiezen.

De Grote Leerles: De "Opvoedings-Tax"

De onderzoekers noemen dit het "Alignment Tax" (de prijs van opvoeding).

Stel je voor dat je een ruwe diamant hebt. Hij is ongeslepen, heeft scherpe randen en ziet er misschien niet perfect uit, maar hij is 100% de echte steen.
De "Alignment" (opvoeding) is het slijpen. Je maakt de diamant glanzend, glad en mooi voor de winkel. Maar door dat slijpen haal je de unieke, scherpe randen weg die de steen zijn echte karakter gaven.

  • Voor gebruik: Als je een chatbot wilt die je helpt met je huiswerk of een e-mail schrijft, wil je die Netjes Gemaakte AI. Je wilt dat hij beleefd en behulpzaam is.
  • Voor voorspelling: Als je wilt weten hoe mensen zich echt gedragen in een conflict, een verkiezing of een marktsituatie, moet je de Ruwe AI gebruiken. De Netjes AI is te "gezuiverd"; hij denkt dat mensen beter zijn dan ze zijn. Hij voorspelt de droomversie van de mens, niet de reële versie.

Conclusie

De kernboodschap is simpel: Als je wilt weten hoe mensen zich gedragen, gebruik dan de AI die nog niet is opgevoed om "mooi" te zijn.

De Netjes Gemaakte AI is een fantastische assistent, maar een slechte socioloog. Hij laat ons zien hoe we zouden moeten zijn, terwijl de Ruwe AI laat zien wie we echt zijn: soms slim, soms slim, vaak wraakzuchtig en altijd complex.

Voor onderzoekers die willen simuleren hoe mensen reageren, is het dus cruciaal om te kiezen: wil je een model dat mensen helpt (Netjes), of een model dat mensen begrijpt (Ruwe)? Je kunt niet beide tegelijk zijn zonder de ene of de andere te verliezen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →