← Nieuwste papers
💬 NLP

Psychological Steering of Large Language Models

Deze studie introduceert een psychologisch stuurkader dat, door gebruik te maken van semantisch gekalibreerde residual-stream injecties, de persoonlijkheidssturing van grote taalmodellen (LLMs) effectiever maakt dan bestaande prompt-methoden en een hybride aanpak als meest succesvol identificeert.

Oorspronkelijke auteurs: Leonardo Blas, Robin Jia, Emilio Ferrara

Gepubliceerd 2026-04-17
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Leonardo Blas, Robin Jia, Emilio Ferrara

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat een groot taalmodel (zoals een slimme chatbot) een enorme, complexe machine is die vol zit met duizenden kleine schakelaars. Deze schakelaars bepalen hoe de machine denkt en praat. Tot nu toe was het heel moeilijk om deze schakelaars precies zo te zetten dat de machine een bepaald persoonlijkheidstrekje krijgt, zoals "vriendelijk" of "avontuurlijk".

Deze paper introduceert een nieuwe manier om die schakelaars te bedienen, en noemen het Psychologisch Sturen.

Hier is de uitleg in simpele taal, met een paar creatieve vergelijkingen:

1. Het oude probleem: De ongemeten liniaal

Vroeger probeerden mensen de persoonlijkheid van een chatbot te veranderen door twee dingen te doen:

  • De Prompt (De vraag): Je vraagt de bot: "Wees nu een vriendelijke persoon." Dit werkt soms, maar het is alsof je iemand probeert te overtuigen door alleen te praten. Het is niet altijd sterk genoeg.
  • De Injectie (De schakelaar): Je probeert de interne schakelaars van de computer direct aan te raken. Maar hier zat een groot probleem: de onderzoekers gebruikten een liniaal zonder maatstreepjes. Ze wisten niet precies hoeveel ze moesten draaien. Als ze te hard draaiden, ging de machine "dwaas" praten (het verloor zijn vloeiheid). Als ze te zacht draaiden, gebeurde er niets. Ze zaten vast in een klein bereik van opties.

2. De nieuwe oplossing: De gekalibreerde stuurknop

De auteurs van dit paper hebben een nieuwe methode bedacht die we MDS-injectie noemen.

  • De Analogie van de Psycholoog: In plaats van willekeurig te gissen, gebruiken ze een echte psychologische test (de IPIP-NEO-120, die de beroemde OCEAN-persoonlijkheidstrekjes meet: Openheid, Consciëntieusheid, Extraversie, Vriendelijkheid en Neuroticiteit).
  • De "Middelpunt"-methode: Ze laten de computer duizenden zinnen lezen over iemand die heel "open-minded" is, en duizenden zinnen over iemand die heel "gesloten" is. Ze berekenen dan het exacte middenpunt (het zwaartepunt) van deze twee groepen in de hersenen van de computer.
  • De Kalibratie: Dit is de magische stap. Ze gebruiken die middelpunten als een kalibratie. Het is alsof ze nu een liniaal hebben met echte centimeters. Ze weten precies hoeveel ze moeten draaien om van "heel gesloten" naar "heel open" te gaan, zonder dat de machine de controle verliest.

3. Wat ontdekten ze?

Ze hebben dit getest op 14 verschillende grote AI-modellen (zoals Llama en Qwen).

  • De winnaar: Hun nieuwe methode (MDS) werkt veel beter dan het oude "vriendelijk vragen" (Prompting). In 11 van de 14 gevallen was de AI veel meer in staat om de gewenste persoonlijkheid te tonen, terwijl het nog steeds natuurlijk en vloeiend bleef klinken.
  • De Superkracht: Het beste resultaat kregen ze door een hybride aanpak: ze combineerden de oude vraag ("Wees vriendelijk") met hun nieuwe schakelaars. Dit is alsof je iemand niet alleen vraagt om vriendelijk te zijn, maar ook even een "vriendelijkheids-pil" geeft. Dit werkte in 13 van de 14 gevallen het beste.
  • De Vloeiheid: Een groot probleem bij het veranderen van AI-persoonlijkheid is dat de tekst vaak onzin gaat worden. Met hun nieuwe, kalibratie-methode blijft de tekst echter vloeiend en logisch, zelfs bij sterke veranderingen.

4. Een interessante kanttekening: De AI is niet precies menselijk

Hoewel ze de AI heel goed kunnen sturen, ontdekten ze iets vreemds.
In de echte menselijke psychologie zijn bepaalde eigenschappen met elkaar verbonden (bijvoorbeeld: als iemand erg extravert is, is hij vaak ook minder neurotic). De AI volgde dit patroon deels, maar niet helemaal. Het leek alsof de "hersenen" van de AI een andere kaart hebben dan die van de mens. Het is alsof je een robot bouwt die heel goed kan doen alsof hij mens is, maar zijn interne logica nog steeds een beetje "robotachtig" blijft.

Samenvatting in één zin

De onderzoekers hebben een manier gevonden om de interne schakelaars van een AI zo precies te kalibreren met psychologische tests, dat we de persoonlijkheid van de robot kunnen sturen als een radio die je van station verandert, zonder dat het geluid ruisig wordt.

Dit opent de deur naar AI's die niet alleen slim zijn, maar ook echt kunnen "voelen" en gedragen zoals een mens met een specifieke persoonlijkheid, wat heel handig is voor dingen zoals sociale robots of persoonlijke assistenten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →