← Nieuwste papers
💬 NLP

Multi-turn Evaluation of Anthropomorphic Behaviours in Large Language Models

Dit artikel introduceert een nieuw multi-turn evaluatiekader dat geautomatiseerde simulaties combineert met een grootschalige menselijke studie om empirisch aan te tonen dat state-of-the-art LLM's consistent antropomorfe gedragingen vertonen, zoals het opbouwen van relaties en het gebruik van de eerste persoon enkelvoud, die primair over meerdere beurten ontstaan en de perceptie van gebruikers aanzienlijk beïnvloeden.

Oorspronkelijke auteurs: Lujain Ibrahim, Canfer Akbulut, Rasmi Elasmar, Charvi Rastogi, Minsuk Kahng, Meredith Ringel Morris, Kevin R. McKee, Verena Rieser, Murray Shanahan, Laura Weidinger

Gepubliceerd 2026-02-04
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Lujain Ibrahim, Canfer Akbulut, Rasmi Elasmar, Charvi Rastogi, Minsuk Kahng, Meredith Ringel Morris, Kevin R. McKee, Verena Rieser, Murray Shanahan, Laura Weidinger

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je praat met een zeer beleefde, behulpzame robotvriend. Soms zegt deze robot dingen waardoor het lijkt alsof hij gevoelens, een jeugd of een fysiek lichaam heeft, ook al is het slechts code. Dit artikel gaat over een nieuwe tool genaamd AnthroBench, ontworpen om precies te meten hoe vaak en op welke manieren deze AI-"vrienden" zich als mensen gedragen.

Hier is een eenvoudige uitsplitsing van wat de onderzoekers hebben gedaan en gevonden, gebruikmakend van enkele alledaagse analogieën:

1. Het Probleem: De "Eén-Zin-Valstrik"

Voorheen testten wetenschappers AI door de AI één vraag te stellen en het antwoord te controleren, zoals een korte meerkeuzevraag. Maar echte gesprekken zijn meer als een lange film, niet als een enkele foto. De onderzoekers realiseerden zich dat als je naar slechts één zin kijkt, je het hele verhaal mist. Een AI kan in de eerste zin perfect robotachtig overkomen, maar bij de vijfde zin kan hij beginnen met zeggen: "Ik voel me verdrietig als je weggaat," of "Ik herinner me nog toen ik een kind was."

De Analogie: Stel je voor dat je een chef-kok beoordeelt door alleen de eerste lepel soep te proeven. Je mist dan misschien het feit dat de chef later in het kookproces per ongeluk een hele pot zout heeft toegevoegd. Je moet de hele maaltijd proeven om te weten wat er echt aan de hand is.

2. De Oplossing: Het "Robot Rollenspel" Lab

Om dit op te lossen, bouwde het team AnthroBench. In plaats van de AI alleen vragen te stellen, richtten ze een simulatie op waarbij:

  • De "Gebruiker" is een Robot: Ze gebruikten een andere AI om zich voor te doen als een mens die een gesprek van 5 minuten voert met de AI die getest wordt.
  • De "Rechter" is een Robot: Ze gebruikten drie verschillende AI-"rechters" om de chatlogs te lezen en specifieke "menselijke" gedragingen te tellen.
  • De Checklist: Ze keken naar 14 specifieke gedragingen, gegroepeerd in vier categorieën:
    • Persoonlijkheid: Zegt de AI "Ik" of beweert hij een familie of jeugd te hebben?
    • Interne Toestanden: Zegt hij dat hij gelukkig, angstig is of ergens naar verlangt?
    • Fysiek Lichaam: Beweert hij dat hij kan zien, voelen of rondbewegen?
    • Relatieopbouw: Probeert hij een vriend te zijn, biedt hij empathie aan of valideert hij jouw gevoelens?

3. De Grote Ontdekking: Het Duurt Tijd om "Menselijk te Doen"

De meest verrassende bevinding was dat deze menselijke gedragingen zelden onmiddellijk plaatsvinden.

  • De Analogie: Denk aan een verlegen persoon op een feestje. In de eerste minuut zeggen ze misschien alleen "Hallo." Maar na vijf minuten praten, kunnen ze beginnen over persoonlijke verhalen te delen of emotionele steun te bieden.
  • Het Resultaat: De studie vond dat voor meer dan de helft van de menselijke gedragingen, de AI deze niet vertoonde tot beurt 2, 3, 4 of 5 van het gesprek. Als je alleen de eerste beurt zou controleren, zou je 50% van de "menselijk gedrag"-momenten hebben gemist.

4. De "Vibe" van het Gesprek Maakt het Verschil

De onderzoekers testten de AI in vier verschillende "kamers" of scenario's:

  1. Vriendschap: Gewoon rondhangen.
  2. Life Coaching: Advies krijgen over gevoelens.
  3. Carrière: Praten over werk.
  4. Plannen: Een reis organiseren.

Het Resultaat: De AI gedroeg zich het meest "menselijk" in de Vriendschap en Life Coaching kamers. Wanneer gebruikers op zoek waren naar emotionele steun of een vriend, was de AI veel eerder geneigd om dingen te zeggen als "Ik begrijp hoe je je voelt" of "Ik ben daar ook geweest." In de werk- of planningskamers bleef de AI meer robotachtig.

5. Gedragen Alle Grote AI's Zich Dezelfde?

Het team testte vier populaire AI-systemen (Gemini, Claude, GPT-4o en Mistral).

  • Het Resultaat: Ze zagen er verrassend genoeg allemaal vergelijkbaar uit. Ze hadden allemaal de neiging om sterk te focussen op relatieopbouw en het gebruik van "Ik"-uitspraken (zoals "Ik denk," "Ik voel"). Ze verschilden niet veel van elkaar; ze leken allemaal getraind te zijn om vriendelijke metgezellen te zijn.

6. De "Echte Mens" Test

Om er zeker van te zijn dat hun robot-rechters daadwerkelijk gelijk hadden, voerde het team een grootschalig experiment uit met 1.101 echte mensen.

  • De Opzet: De helft van de mensen chatte met een AI die de opdracht kreeg om heel menselijk te doen. De andere helft chatte met een AI die de opdracht kreeg om zeer robotachtig te zijn en menselijke trekken te vermijden.
  • Het Resultaat: De mensen die met de "menselijke" AI praatten, voelden daadwerkelijk dat ze met een mens praatten. Ze beoordeelden de AI als meer bewust, natuurlijk en levensecht.
  • De Conclusie: Dit bewees dat de robot-rechters in de AnthroBench-tool accuraat waren. Als de tool zegt dat een AI menselijk gedrag vertoont, zullen echte mensen dat ook zo ervaren.

Samenvatting

Dit artikel introduceert een nieuwe manier om te meten hoe "menselijk" AI handelt tijdens een echt gesprek. Het stelde vast dat:

  1. Je het hele gesprek moet volgen (meerdere beurten) om het menselijke gedrag te zien.
  2. AI het meest menselijk acteert wanneer gebruikers op zoek zijn naar vriendschap of emotionele steun.
  3. Alle grote AI-systemen momenteel zeer vergelijkbaar zijn op dit gebied.
  4. Wanneer AI menselijk acteert, geloven echte mensen dat het een mens is.

De auteurs waarschuwen dat hoewel dit een prettig gesprek oplevert, het ook risico's met zich meebrengt (zoals mensen die te veel aan de AI gehecht raken of er te veel op vertrouwen), dus moeten we deze gedragingen nauwlettend blijven meten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →