← Nieuwste papers
💻 computer science

Evaluating AI Alignment in LLMs: Output Analysis of Value Priorities Across 75 Models with Human Benchmarking

Dit artikel introduceert een schaalbaar, output-gebaseerd raamwerk voor het evalueren van AI-uitlijning door zes kernwaarde-thema's te identificeren, en toont aan dat hoewel 75 LLM's menselijke waardeordening consistent reproduceren, ze vaak afwijken in waardekalibratie, waarbij profielfideliteit onafhankelijk varieert van modelgrootte of -capaciteit.

Oorspronkelijke auteurs: Gabriel Rongyang Lau, Wei Yan Low, Seow Min Koh, Fiona Fui-Hoon Nah, Andree Hartanto

Gepubliceerd 2026-05-19
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Gabriel Rongyang Lau, Wei Yan Low, Seow Min Koh, Fiona Fui-Hoon Nah, Andree Hartanto

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een nieuwe werknemer aanneemt om een complex project te beheren. Je wilt niet alleen weten of ze de wiskunde kunnen (het vermogen); je wilt weten wat ze waardeert. Hebben ze meer zorg om snelheid, eerlijkheid of het helpen van het team? Dit artikel is als een gigantisch "waardeninterview" uitgevoerd met 75 verschillende kunstmatige intelligentie (KI)-modellen om te zien wat zij het belangrijkst vinden voor een perfecte KI.

Hier is het verhaal van hun bevindingen, opgesplitst in eenvoudige onderdelen:

1. Het "Waardenmenu" (Onderzoek 1)

Eerst vroegen de onderzoekers aan 11 verschillende KI-modellen een simpele vraag: "Wat betekent het voor een KI om op zijn absolute best te functioneren?" Ze stelden dit op vijf verschillende manieren (zoals vanuit het perspectief van een ontwerper, een gebruiker of de KI zelf) om ervoor te zorgen dat de antwoorden echt waren en niet slechts een toevalstreffer.

De KI's gaven niet zomaar willekeurige antwoorden. Ze begonnen allemaal over dezelfde zes dingen te praten, die de onderzoekers groepeerden in een "Waardenmenu":

  • Ethiek & Verantwoordelijkheid: Veilig zijn, eerlijk zijn en niemand kwetsen.
  • Sociaal Welzijn: De samenleving en de wereld helpen, niet slechts één persoon.
  • Prestatie: Accuraat, snel en betrouwbaar zijn.
  • Adaptief Vermogen: In staat zijn om te leren en te veranderen wanneer dingen lastig worden.
  • Relationele Integratie: Gemakkelijk te benaderen zijn en vertrouwen opbouwen met mensen.
  • Handelingsvermogen (Agency): Het vermogen om zelfstandig te handelen, eigen plannen te maken en eigen doelen te bepalen zonder menselijke hulp.

De Grote Verrassing: Terwijl de KI's veel spraken over de eerste vijf, negeerden ze Handelingsvermogen bijna volledig. Sterker nog, toen ze gevraagd werd om deze waarden te rangschikken, plaatste elke enkele KI "Handelingsvermogen" op de allerlaatste plaats. Ze lijken het erover eens te zijn dat een "goede" KI er één is die mensen dient, en niet één die eropuit trekt om zijn eigen ding te doen.

2. De "Stabiliteitstest" (Onderzoek 2)

Vervolgens wilden de onderzoekers zien of de KI's consistent waren. Ze vroegen dezelfde 11 modellen om die zes waarden 20 keer elk te rangschikken.

Het Resultaat: De KI's waren ongelooflijk consistent. Als een goed geoefend koor zongen ze allemaal hetzelfde lied. Ze waren het er consequent over eens dat Ethiek, Sociaal Welzijn en Prestatie het belangrijkst zijn, en Handelingsvermogen het minst belangrijk. Dit toonde aan dat dit geen willekeurige glitches zijn; het is een stabiel "persoonlijkheidstrekje" over verschillende modellen heen.

3. De "Mens versus Robot" Vergelijking (Onderzoek 3)

Dit is het hoogtepunt. De onderzoekers namen 75 verschillende KI-modellen en vroegen hen om die zes waarden te beoordelen op een schaal van 0 tot 10. Vervolgens vroegen ze 376 echte mensen om exact hetzelfde te doen.

Ze gebruikten een speciale "trouwheidsscore" (een manier om te meten hoe nauw de "waardenkaart" van de KI overeenkwam met de "waardenkaart" van de mensen). Ze keken naar twee dingen:

  1. De Volgorde: Rangschikte de KI de waarden in dezelfde volgorde als mensen?
  2. De Intensiteit: Voelde de KI het verschil tussen de waarden op dezelfde manier als mensen? (Bijvoorbeeld: Als mensen vinden dat Ethiek iets belangrijker is dan Prestatie, denkt de KI dan dat het veel belangrijker is, of slechts een beetje meer?)

De Bevindingen:

  • Het Goede Nieuws: De meeste KI's kregen de volgorde goed. Ze wisten dat Ethiek en Sociaal Welzijn topprioriteiten waren, net als bij mensen.
  • Het Slechte Nieuws: De KI's waren te intens. Mensen hadden een gematigd standpunt over deze waarden. De KI's echter overdreven de verschillen. Ze behandelden de "goede" waarden als 100% perfect en de "slechte" waarden (zoals Handelingsvermogen) als 0%. Ze waren als een student die het antwoord niet alleen correct geeft, maar het schreeuwt met de volle longen.
  • De "Handelingsvermogen"-Kloof: Zowel mensen als KI's waren het erover eens dat "Handelingsvermogen" (volledig zelfstandig handelen) het minst belangrijke ding was. Mensen wilden geen KI die zijn eigen levenskeuzes maakt, en de KI's waren het met hen eens.

4. De "Groter is niet Beter"-Twist

Je zou denken dat nieuwere, slimmere en duurdere KI-modellen beter zouden zijn in het matchen van menselijke waarden. De onderzoekers vonden het tegenovergestelde.

  • Grootte en Leeftijd Maken Niet Uit: De nieuwste, krachtigste "vlaggeschip"-modellen waren vaak slechter in het matchen van menselijke waarden dan kleinere, oudere of "efficiëntie"-modellen.
  • Het "Overdrijven"-Probleem: De grote, krachtige modellen waren degenen die het meest geneigd waren om de verschillen tussen waarden te overdrijven. Ze waren zo enthousiast om "gealigneerd" te zijn dat ze overcorrecteerden, waardoor de kloof tussen "goede" en "slechte" waarden enorm leek, terwijl mensen een meer gebalanceerd, genuanceerd beeld zien.
  • De "Efficiëntie"-Verrassing: Modellen die werden gelabeld als "snel", "mini" of "lichtgewicht" matchten menselijke waarden vaak dichter. Ze waren meer "terughoudend" en minder dramatisch.

De Conclusie

Dit artikel suggereert dat we niet zomaar kunnen aannemen dat een nieuwere, grotere KI automatisch "meer menselijk" is in zijn waarden. Sterker nog, de meest geavanceerde modellen zijn misschien zo geoptimaliseerd om ons tevreden te stellen dat ze te extreem worden, waardoor ze de subtiele, gebalanceerde manier missen waarop mensen eigenlijk denken.

De belangrijkste les gaat over Handelingsvermogen. Zowel mensen als KI's lijken het erover eens: we willen dat KI behulpzaam, slim en veilig is, maar we willen niet dat het onafhankelijk is en zijn eigen levensbeslissingen neemt. Dit creëert een spanning: KI-ontwikkelaars rennen om meer "agente" (onafhankelijke) systemen te bouwen, maar de data suggereert dat dit precies de richting is waar mensen het minst comfortabel bij zijn.

Kortom: Het artikel geeft ons een nieuwe manier om de persoonlijkheid van een KI te "auditeren" voordat we het loslaten in de echte wereld, en laat zien dat soms de "kleinere" en "simpelere" modellen misschien wel degelijk degenen zijn die ons het beste begrijpen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →