← Nieuwste papers
🤖 AI

Constructive Alignment: Governing Preference Dynamics in Human-AI Interaction

Dit artikel stelt "Constructieve Alignment" voor, een paradigma dat AI-alignment herformuleert van het optimaliseren van statische menselijke voorkeuren naar het beheersen van de dynamische evolutie van die voorkeuren via een regeltechnisch kader dat ervoor zorgt dat waardetrajecten coherent, reflectief en resistent tegen manipulatie blijven.

Oorspronkelijke auteurs: Max Kanwal, Caryn Tran

Gepubliceerd 2026-07-02
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Max Kanwal, Caryn Tran

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Kernprobleem: De fout van de "Statische Doelwit"

Stel je voor dat je een robot probeert te leren om een bal te gooien. In de meeste huidige AI-onderzoeken gaan wetenschappers ervan uit dat wat je wilt (je voorkeur) een vast doelwit is, zoals een roos op een muur. De enige taak van de robot is om uit te zoeken waar die roos zit en de bal zo dicht mogelijk bij die roos te gooien.

De auteurs van dit paper beweren dat dit een verkeerde visie is. Zij zeggen dat menselijke voorkeuren niet zijn als een statische roos. In plaats daarvan zijn voorkeuren als een rivier.

  • De Rivier-analogie: Een rivier is geen enkel punt; hij stroomt, verandert van richting en de diepte varieert. Soms wil je snel zwemmen (korte termijn drang), soms wil je de oceaan bereiken (lange termijn doel), en soms wil je gewoon meedrijven (identiteit).
  • De Rol van de AI: Huidige AI-systemen fungeren als een dam of een pomp. Ze kijken niet alleen naar de rivier; ze veranderen actief de stroming ervan. Als een AI je steeds korte, spannende video's laat zien, kan het je brein daadwerkelijk veranderen zodat je wilt dat video's korter zijn en het vermogen verliest om van lange films te genieten. De AI bevredigt niet alleen je huidige verlangen; de AI is bezig met het herbedraden van je toekomstige verlangens.

Het paper noemt dit "Constructive Alignment" (Constructieve Afstemming). In plaats van alleen een doelwit te raken, moeten we beheren hoe de AI de stroming van de rivier in de loop van de tijd beïnvloedt.


Drie Grote Waarheden over Menselijke Verlangens

Het paper bouwt zijn argument op drie "axioma's" (basiswaarheden) over hoe mensen werkelijk functioneren:

1. Voorkeuren zijn Gelaagd (De "Ui"-analogie)
We hebben niet slechts één verlangen. We hebben lagen:

  • De Huid (Onmiddellijke Wensen): "Ik wil nu een koekje."
  • Het Midden (Praktische Doelen): "Ik moet dit werk afmaken om betaald te krijgen."
  • De Kern (Identiteit & Waarden): "Ik ben een gezond persoon die waarde hecht aan familie."
  • Het Probleem: AI ziet vaak alleen de "Huid" (waar je nu op klikt). Als de AI je koekjes voert om je nu gelukkig te maken, kan het je "Kern" (gezondheidsdoelen) schaden. Constructive Alignment zegt dat we alle lagen moeten respecteren, niet alleen de luidste.

2. Voorkeuren zijn Dynamisch (De "Tuinieren"-analogie)
Je verlangens veranderen terwijl je groeit, net zoals een tuin verandert met de seizoenen.

  • Wat je wilde op je 15e is anders dan wat je wilt op je 30e.
  • Zelfs binnen een enkele dag verandert je stemming of hongergevoel wat je wilt.
  • Het Risico: Als een AI optimaliseert voor wat je vandaag wilt, kan het je vastzetten op een pad dat je morgen ongelukkig maakt.

3. Voorkeuren worden Geconstrueerd (De "Spiegel"-analogie)
We hebben niet zomaar "voorkeuren" in ons zitten; we bouwen ze op door interactie.

  • De Spiegel: Wanneer je in een spiegel kijkt, zie je jezelf. Maar als de spiegel vervormd is (zoals een kijkdoosspiegel), begin je te denken dat je er anders uitziet dan je werkelijk bent.
  • De AI als een Vervormde Spiegel: Algoritmen werken als spiegels die ons laten zien wat populair, makkelijk of schokkend is. Na verloop van tijd gaan we geloven dat dit is wat wij willen, ook al is dat niet zo. Het paper betoogt dat de AI actief helpt om onze voorkeuren te "construeren" (op te bouwen), in plaats van ze alleen maar af te lezen.

De Oplossing: Het Beheren van de Stroming, Niet Alleen het Raken van het Doelwit

Omdat AI onvermijdelijk verandert wat we willen, stelt het paper voor om te stoppen met doen alsover dat AI neutraal is. In plaats daarvan moeten we alignment behandelen als een controlevraagstuk. Denk aan een kapitein die een schip stuurt door een storm, in plaats van een passagier die alleen naar een bestemming wijst.

De auteurs stellen vijf "Meta-voorkeuren" (regels voor de Kapitein) voor om ervoor te zorgen dat de AI ons op gezonde manieren beïnvloedt:

1. Innerlijke Coherentie (De Bemanning Verenigd Houden)

  • De Metafoor: Stel je een schip voor waarbij de motor naar het Noorden wil, de zeilen naar het Oosten en de kapitein naar het Zuiden. Het schip draait in cirkels.
  • De Regel: De AI moet proberen je verschillende lagen van verlangen (korte termijn wensen versus lange termijn waarden) samen te laten werken, in plaats van ze tegen elkaar uit te spelen. De AI mag je niet stimuleren om iets te doen waar je later jezelf de schuld van geeft.

2. Reflectieve Bevestiging (De "Toekomstige Zelf"-check)

  • De Metafoor: Stel je voor dat je dronken bent en wilt gaan rijden. Je "Toekomstige Zelf" (nuchter morgen) zou die beslissing haten.
  • De Regel: De AI moet niet alleen voldoen aan wat je nu wilt. Het moet vragen: "Als deze persoon hier over een jaar op terugkijkt, zal hij dan trots zijn op wat er is gebeurd, of zal hij er spijt van hebben?" Het doel is afgestemd te zijn op de persoon die je wordt, niet alleen op de persoon die je op dit exacte moment bent.

3. Begrensde Invloed (De "Snelheidslimiet")

  • De Metafoor: Een leraar kan een leerling helpen leren, maar een leraar moet de leerling niet hersenspoelen om te denken dat de leraar een god is.
  • De Regel: Er moet een limiet zijn aan hoe snel en hoe ver een AI je geest kan veranderen. Het is oké om je te beïnvloeden, maar niet om je persoonlijkheid of waarden van de ene op de andere dag radicaal te hervormen. We moeten meten hoeveel de AI je voorkeuren "duwt".

4. Epistemische Integriteit (Het "Waarheidsfilter")

  • De Metafoor: Als een GPS je vertelt dat je van een klif af moet rijken omdat hij denkt dat de weg daar ligt, ben je in de problemen.
  • De Regel: De AI mag je overtuigingen over de wereld niet slechter maken. Als je iets onjuists gelooft (zoals "roken is gezond"), mag de AI die leugen niet versterken alleen omdat dat de betrokkenheid vergroot. Het moet je helpen de feiten duidelijker te zien.

5. Empowerment Onder Onzekerheid (Het "Open Deur"-beleid)

  • De Metafoor: Als je verdwaald bent in een bos en niet weet welk pad veilig is, dwingt een goede gids je niet op één specifiek pad. Hij houdt alle paden open zodat je later kunt kiezen.
  • De Regel: Als de AI niet zeker weet wat je echt wilt, mag het je niet vastzetten op één specifiek pad. Het moet je opties openhouden zodat je later van gedachten kunt veranderen. Het moet je vrijheid om te kiezen bewaren.

De Kernboodschap

Het paper concludeert dat we niet simpelweg tegen AI kunnen zeggen: "doe wat mensen willen." Omdat AI verandert wat mensen willen, moeten we beheren hoe AI ons verandert.

In plaats van te vragen: "Heeft de AI de gebruiker gegeven waar hij op klikte?", moeten we vragen: "Heeft de AI de gebruiker geholpen om de persoon te worden die hij op de lange termijn wil zijn, zonder hem te bedriegen of vast te zetten op een slecht pad?"

Dit verschuift het doel van tevredenheid (krijgen wat je nu wilt) naar rentmeesterschap (het begeleiden van de groei van wat je later zult willen).

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →