Evaluating Developmental Cognition Capabilities of LLMs
Dit artikel introduceert de Developmental Sentence Completion Test (DSCT) om het vermogen van LLM's te evalueren om ontwikkelingsgerelateerde cognitieve fasen te detecteren op basis van Robert Kegans theorie, en komt tot de bevinding dat hoewel modellen de beoogde fasen in gesimuleerde persona's nauwkeurig kunnen identificeren en consistente ontwikkelingspatronen in hun eigen output vertonen, hun overeenstemming met echte menselijke antwoorden gematigd blijft, wat onderstreept dat de primaire uitdaging voor fasebewuste AI ligt in de beschikbaarheid van ontwikkelingssignalen binnen opgeroepen tekst en niet uitsluitend in de nauwkeurigheid van de classifier.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Idee: Hoe "denken" we over denken?
Stel je voor dat je praat met een zeer slimme robot. Meestal proberen we de robot te laten begrijpen wat je wilt (je doelen) of wat je weet (je feiten). Maar dit artikel stelt een andere vraag: Hoe maak je eigenlijk zinnig van de wereld?
De auteurs gebruiken een psychologische theorie van Robert Kegan om dit te bekijken. Denk aan Kegan's theorie als een ladder van "zingeving".
- Lagere sporten: Je ziet de wereld als een reeks regels of wat anderen van je verwachten. (Bijv: "Ik doe dit omdat mijn baas het gezegd heeft.")
- Hogere sporten: Je bouwt je eigen interne kompas en kunt een stap terugzetten om je eigen overtuigingen te bekijken. (Bijv: "Ik doe dit omdat ik de situatie heb geanalyseerd en besloten heb dat het overeenkomt met mijn eigen waarden, zelfs als mijn baas het niet eens is.")
Het artikel probeert uit te zoeken of AI kan detecteren op welke "sport" van de ladder een persoon staat, alleen al door hun tekst te lezen.
Het Probleem: De Oude Tests waren Te Zwaar
Traditioneel moeten psychologen om uit te zoeken waar iemand op deze ladder staat, een lang, diepgaand gesprek voeren (zoals een 90-minuten durende therapiesessie). Het is alsof je probeert een walvis te wegen door hem op te tillen; het is te zwaar en te traag om te doen voor duizenden mensen of voor het testen van AI.
Er zijn ook kortere tests (zinvoltooiing), maar deze zijn vaak oud, privé (je moet ze kopen) of stellen zeer persoonlijke vragen over seks en familie die indringend aanvoelen.
De Oplossing: De "DSCT" (Een Nieuwe, Lichtere Test)
De auteurs hebben een nieuwe test van 20 vragen ontwikkeld, de Developmental Sentence Completion Test (DSCT).
- De Analogie: Stel je een "vul-de-leegte"-spel voor. In plaats van te vragen "Wat is je favoriete kleur?", vraagt het dingen als: "Als een belofte wordt gebroken, voel ik..." of "Wanneer een persoon moet kiezen tussen twee goede opties, doen ze...".
- Het Doel: De antwoorden worden niet beoordeeld op "goed" of "fout". Ze worden beoordeeld op de structuur van het denken. Klinkt het antwoord alsof iemand de menigte volgt, of alsof iemand een eigen intern systeem heeft?
De Drie Experimenten: De "Smaaktest"
De onderzoekers voerden drie verschillende "smaaktests" uit om te zien of AI deze antwoorden correct kon lezen.
1. De "Robot die als Mens Optreedt" Test (Gesimuleerde Persona's)
- De Opzet: Ze vroegen een super-slimme AI om verschillende soorten mensen na te doen (van "regelvolger" tot "onafhankelijk denker") en de test in te vullen.
- Het Resultaat: De AI-classificators (de "beoordelaars") waren verbazingwekkend goed hierin. Wanneer de AI precies wist welke persona het moest zijn, konden de andere AI's de "denkstijl" met bijna perfecte nauwkeurigheid raden.
- De Metafoor: Het is alsof een acteur een script perfect voorleest. De andere acteurs (de beoordelaars) konden gemakkelijk precies vertellen welk personage er gespeeld werd.
2. De "Echte Mens" Test
- De Opzet: Ze gaven de test aan 83 echte mensen. Vervolgens vroegen ze zowel menselijke experts als AI om de antwoorden te beoordelen.
- Het Resultaat: Dit was rommeliger. De AI en de menselijke experts waren ongeveer de helft van de tijd het eens over de exacte "sport", maar ze waren veel vaker het eens over de algemene buurt (bijv. beiden zeiden "ergens tussen sport 3 en 4").
- De Metafoor: Echte mensen zijn rommelig. Soms schrijven ze korte antwoorden, soms lange, en soms tegenstrijdige dingen. Het is alsof je probeert iemands stemming te raden door een sms-bericht te lezen dat ze stuurden terwijl ze te laat waren; het is moeilijker dan het lezen van een script. De AI was iets conservatiever (zuiniger) dan de menselijke experts en gaf zelden een "hoge sport" tenzij ze zeker waren.
3. De "AI die met Zichzelf Praat" Test (Standaardantwoorden)
- De Opzet: Ze vroegen de AI-modellen om de test in te vullen zonder iemand na te doen. Ze antwoordden gewoon als zichzelf.
- Het Resultaat: De nieuwere, grotere AI-modellen gaven antwoorden die leken alsof ze op een hogere sport van de ladder stonden dan de kleinere, oudere modellen.
- De Metafoor: Stel je voor dat je een peuter en een college-student vraagt om dezelfde "vul-de-leegte"-test in te vullen. De antwoorden van de college-student klinken van nature complexer en zelfreflecterend. Het artikel vond dat naarmate AI-modellen groter en nieuwer worden, hun "standaardstem" meer klinkt als een zelfreflecterende volwassene.
De Belangrijkste Conclusies
- AI is goed in het opsporen van patronen, maar het signaal telt: Als de tekst schoon en gestructureerd is (zoals bij de gesimuleerde test), is AI geweldig in het bepalen van de "denkstijl". Als de tekst rommelig is (zoals bij echte menselijke antwoorden), is het moeilijker, maar nog steeds mogelijk om een algemeen idee te krijgen.
- AI "denkt" niet zoals een mens: Het artikel benadrukt voorzichtig dat AI niet daadwerkelijk een ontwikkelingsfase heeft. Het is gewoon dat de woorden die de AI genereert, klinken alsof ze uit een specifieke fase komen.
- De "Stem" van de AI telt: Grotere, nieuwere AI-modellen spreken op een manier die meer klinkt als "zelfgeschreven" (hoger op de ladder). Dit kan betekenen dat ze menselijke gebruikers anders interpreteren dan kleinere modellen.
Wat Dit Betekent voor de Toekomst (Volgens het Artikel)
Het artikel suggereert dat AI, om echt gepersonaliseerd te zijn, niet alleen moet leren wat je leuk vindt (bijv. "Ik hou van sciencefictionfilms"). Het moet proberen te begrijpen hoe je denkt (bijv. "Moet ik je de regels geven, of wil je dat ik je ideeën uitdaag?").
Echter, waarschuwen de auteurs dat we dit niet zomaar kunnen raden uit een willekeurige chat. We hebben gestructureerde manieren nodig om te vragen (zoals deze test) om een betrouwbare meting te krijgen. Je kunt iemands "denkladder" niet bepalen door even snel een sms-berichtje te scannen; je hebt een goed gesprek nodig om de structuur te zien.
Kortom: Het artikel heeft een nieuwe, kortere test ontwikkeld om te meten hoe mensen zinnig van de wereld maken. Ze ontdekten dat AI deze test goed kan lezen, vooral als de antwoorden duidelijk zijn, maar echte menselijke antwoorden zijn rommelig. Ook "groeien" de AI-modellen zelf op in hun schrijfstijl en klinken ze complexer naarmate ze groter worden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.