← Nieuwste papers
💻 computer science

HEART-Bench: Do LLM Agents Exhibit Human-like Psychology?

Dit artikel introduceert HEART-Bench, een nieuw benchmarkontwerp om te evalueren of LLM-agenten coherent menselijk psychologisch functioneren kunnen simuleren door hun vermogen te toetsen om consistente gedragskeuzes te maken op basis van de Big Five-persoonlijkheidstrekken en uitgebreide autobiografische herinneringen in 64 uiteenlopende scenario's.

Oorspronkelijke auteurs: Weihan Peng, Chenxu Zhang, Qianao Wang, Yuling Shi, Heng Lian, Qihong Mao, Jiahao Pang, Chunliang Feng, Bowen Li, Xiaodong Gu

Gepubliceerd 2026-05-29
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Weihan Peng, Chenxu Zhang, Qianao Wang, Yuling Shi, Heng Lian, Qihong Mao, Jiahao Pang, Chunliang Feng, Bowen Li, Xiaodong Gu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot hebt gebouwd die gedichten kan schrijven, wiskundeproblemen kan oplossen en een vakantieprogramma kan plannen. Het is ongelooflijk slim in taken. Maar als je het vraagt: "Hoe zou jij je voelen als je beste vriend je verraadde?" of "Wat zou je doen als je zag dat iemand onrechtvaardig werd behandeld?", antwoordt het dan als een mens met een hart, of als een rekenmachine die de meest logische reactie spitst?

Het paper HEART-BENCH stelt precies deze vraag: Hebben AI-agenten eigenlijk een "persoonlijkheid" die echt aanvoelt, of doen ze alleen maar alsof?

Hier is een eenvoudige uitleg van wat de onderzoekers deden, met behulp van alledaagse analogieën.

1. Het probleem: De "lege pak" AI

Op dit moment testen de meeste AI-tests of een robot feiten kan onthouden of een gesprek kan voeren. Het is als het testen van een mannequin om te zien of hij rechtop kan staan. Maar een echt mens is niet zomaar een lijst met feiten; we worden gevormd door ons verleden, onze stemmingen en onze kernwaarden.

De auteurs betogen dat huidige AI lijkt op een acteur die een script heeft uit zijn hoofd geleerd, maar het leven van het personage niet heeft geleefd. Ze kunnen de juiste woorden zeggen, maar ze voelen niet wat het personage zou moeten voelen.

2. De oplossing: "Digitale mensen" bouwen met achtergronden

Om dit te testen, gaven de onderzoekers de AI niet zomaar een naam en een baan. Ze bouwden 11 verschillende "Digitale Mensen" (alsof je 11 verschillende acteurs voor een toneelstuk creëert).

  • Het blauwdruk (Big Five): Elk personage was gebaseerd op een strikt psychologisch raamwerk genaamd de "Big Five" (Openheid, Gewetensvolheid, Extraversie, Vriendelijkheid, Neuroticisme). Denk hierbij aan hun DNA. Een personage kan extreem verlegen en georganiseerd zijn; een ander kan chaotisch en zeer sociaal zijn.
  • Het levensverhaal (1.000 herinneringen): Dit is het magische ingrediënt. In plaats van alleen een biografie kreeg elk personage 1.000 gedetailleerde herinneringen van de kindertijd tot 50 jaar.
    • Analogie: Stel je voor dat je een biografie schrijft voor een personage. Je zegt niet zomaar "Hij was verdrietig." Je schrijft een verhaal van 2.000 tekens over de specifieke dag dat hij zijn ijsje liet vallen, de geur van de regen, het geluid van de stem van zijn moeder, en hoe dat moment hem jarenlang bang maakte voor falen.
    • De AI kreeg deze 1.000 "levensmomenten" voor elk van de 11 personages.

3. De test: Het "Wat zou jij doen?"-spel

Zodra de personages waren gebouwd, creëerden de onderzoekers 64 verschillende levensscenario's (zoals een kies-je-avontuur-boek). Deze scenario's dekten alles, van een ruzie op het werk tot een familiediner of een moreel dilemma.

  • De opzet: Ze namen een specifiek personage (bijvoorbeeld het verlegen, georganiseerde) en plaatsten hen in een specifieke situatie (bijvoorbeeld: "Je buurman klaagt over lawaai, maar je weet dat hij liegt").
  • De vraag: De AI moest de beste reactie kiezen uit vier opties.
    • Optie A: Op hen schreeuwen.
    • Optie B: Stilletjes alleen een formeel rapport indienen.
    • Optie C: Proberen een grapje te maken om de spanning te doorbreken.
    • Optie D: Ze volledig negeren.

De valstrik: Alle vier de opties lijken misschien op "iets doen", maar slechts één past bij de specifieke persoonlijkheid en levensgeschiedenis van dat personage. De test ging niet over "goed" zijn; het ging over consistent zijn.

4. De resultaten: De "Uncanny Valley" van persoonlijkheid

De onderzoekers testten 12 van 's werelds slimste AI-modellen (waaronder GPT, Claude, Gemini en anderen) op dit spel.

  • De score: Zelfs de beste AI (Gemini-3.1-Pro) kreeg slechts ongeveer 63% correct. De meeste anderen scoorden onder de 40%.
  • Wat dit betekent: De AI worstelt nog steeds om het personage te "begrijpen". Het kiest vaak de reactie die beleefd of logisch klinkt, maar faalt om de reactie te kiezen die een verlegen, getraumatiseerd of overdreven angstig persoon daadwerkelijk zou kiezen op basis van hun 1.000 herinneringen.
  • Het geheugenprobleem: Interessant genoeg hielp het geven van complexere geheugensystemen aan de AI niet veel. De bottleneck was niet dat de AI de herinneringen vergat; het was dat de AI niet kon redeneren met ze om een menselijke beslissing te nemen. Het is alsof je een bibliotheek met boeken hebt, maar niet weet hoe je een verhaal ermee moet schrijven.

5. De conclusie

HEART-BENCH is een nieuwe liniaal voor het meten van "emotionele intelligentie" in AI.

  • Vroeger: We vroegen: "Kan de AI onthouden wat ik 10 minuten geleden zei?"
  • Nu: We vragen: "Onthoudt de AI wie het is, en handelt het als die persoon als het moeilijk wordt?"

Het paper concludeert dat hoewel AI beter wordt in praten, het nog zeer ver verwijderd is van het hebben van een consistent, menselijk-achtige ziel. Het is als een zeer goede nabootser die nog niet heeft geleerd hoe het echt iemand anders is.

Kortom: We bouwden 11 digitale mensen met volledige levensgeschiedenissen, goooiden hen in 64 moeilijke situaties, en ontdekten dat zelfs de slimste AI's nog grotendeels gokken hoe die mensen zouden reageren, in plaats van hen echt te begrijpen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →