← Nieuwste papers
🤖 AI

Humans' ALMANAC: A Human Collaboration Dataset of Action-Level Mental Model Annotations for Agent Collaboration

Het artikel introduceert ALMANAC, een dataset van 2.987 actieniveau-mentale modelannotaties afgeleid van menselijke dyadische samenwerking op de Map Task, ontworpen om de kloof te overbruggen in het trainen en evalueren van het vermogen van LLM-agenten om uitgelijnde mentale modellen te behouden en menselijk collaboratief gedrag te simuleren.

Oorspronkelijke auteurs: Jiaju Chen, Yuxuan Lu, Jiayi Su, Chaoran Chen, Songlin Xiao, Zheng Zhang, Yun Wang, Yunyao Li, Jian Zhao, Tongshuang Wu, Toby Jia-Jun Li, Dakuo Wang, Bingsheng Yao

Gepubliceerd 2026-06-05
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jiaju Chen, Yuxuan Lu, Jiayi Su, Chaoran Chen, Songlin Xiao, Zheng Zhang, Yun Wang, Yunyao Li, Jian Zhao, Tongshuang Wu, Toby Jia-Jun Li, Dakuo Wang, Bingsheng Yao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je met een vriend een schatkaart probeert te tekenen, maar jullie bevinden je in verschillende kamers. Jullie kunnen alleen met elkaar communiceren via een tekstchat. Eén persoon (de Gids) heeft de originele kaart met het juiste pad erop getekend. De andere persoon (de Volger) heeft een lege kaart met alleen de oriëntatiepunten (zoals een berg of een brug), maar zonder het pad.

Om te slagen, moeten ze samenwerken: de Gids beschrijft het pad, en de Volger probeert het te tekenen.

Dit is de kern van een nieuw onderzoeksproject genaamd ALMANAC. Hieronder volgt een eenvoudige uitleg van wat de onderzoekers hebben gedaan en waarom dit belangrijk is, gebruikmakend van alledaagse analogieën.

1. Het Problek: Robots zijn goed in "doen", maar slecht in "samen denken"

Huidige AI-agenten (zoals geavanceerde chatbots) zijn erg goed in het opvolgen van opdrachten. Als je zegt: "Boek een vlucht," dan doen ze dat. Maar echte menselijke samenwerking gaat niet alleen over het opvolgen van opdrachten; het gaat over mentale afstemming (mental alignment).

Denk aan een menselijk team als een jazzband. Ze lezen niet alleen bladmuziek; ze luisteren constant naar elkaar, raden wat de andere muzikant over een moment gaat spelen, en passen hun eigen ritme in realtime aan. Ze hebben een "gedeeld mentaal model".

  • Zelfredenering: "Waarom speel ik deze noot?"
  • Partnerintentie: "Wat probeert mijn bandgenoot te doen?"
  • Teamdoel: "Zijn we nog steeds een jazznummer aan het spelen, of zijn we per ongeluk bij rock uitgekomen?"

Het artikel stelt dat de huidige AI als een robot is die alleen weet hoe hij zijn eigen instrument perfect moet bespelen, maar geen idee heeft wat de rest van de band aan het doen is. Bestaande datasets registreren alleen wat mensen zeiden en wat ze deden, maar ze missen het waarom in hun hoofd.

2. De Oplossing: ALMANAC (De "Gedachtenlezende" Dataset)

De onderzoekers hebben een nieuwe dataset gebouwd genaamd ALMANAC om dit op te lossen. Ze namen de "Kaart Taak" zoals hierboven beschreven en voegden daar een speciale laag van observatie aan toe.

Hoe ze de gegevens hebben verzameld:

  1. Het Spel: 50 mensen speelden de Kaart Taak in paren (25 paren in totaal).
  2. De "Checkpoints": Telkens wanneer het paar 25%, 50% en 75% van de taak had voltooid, werd het spel kort gepauzeerd. De spelers moesten snel in een microfoon spreken en antwoord geven op: "Wat denk je dat ons doel op dit moment is?" "Wat denk je dat je partner probeert te doen?" en "Waarom deed je dat net?"
  3. De Herhaling: Na het spel bekeken de spelers een replay van hun eigen acties. Voor elke enkele beweging die ze maakten (een lijn trekken, een fout uitgummen, een bericht sturen), moesten ze hun mentale staat opnieuw labelen.

Het Resultaat:
Ze kwamen uit op 2.987 specifieke acties, en voor elke actie hebben ze een registratie van:

  • De uitgevoerde actie (bijv. "Lijn getrokken").
  • Het Teamdoel (bijv. "We proberen de brug met de berg te verbinden").
  • De Partnerintentie (bijv. "Ik denk dat mijn partner in de war is over de richting").
  • De Zelfredenering (bijv. "Ik heb deze lijn getrokken omdat ik dacht dat de berg links lag").
  • Een Rationale (een vrije uitleg van hun denkproces).

3. Het Experiment: Kan AI "Gedachtenlezen"?

De onderzoekers testten zes verschillende AI-modellen (inclusief grote modellen zoals GPT-5.5 en Claude) om te zien of ze deze nieuwe dataset konden gebruiken om te handelen als een menselijke collaborator. Ze gaven de AI twee taken:

  1. Voorspel de volgende zet: "Op basis van wat er tot nu toe is gebeurd, wat zal de mens nu doen?"
  2. Voorspel de mentale staat: "Op basis van wat er tot nu toe is gebeurd, wat denkt de mens op dit moment?"

De Bevindingen:

  • Het "Wat" is makkelijk, het "Waarom" is moeilijk: De AI-modellen waren redelijk goed in het voorspellen van de volgende actie (bijv. "De mens zal waarschijnlijk een lijn trekken").
  • De "Geest" is lastig: De modellen hadden moeite met het voorspellen van de interne gedachten (de mentale modellen). Ze konden het gedeelde doel (bijv. "We bouwen een brug") redelijk goed raden, maar ze waren slecht in het raden van de persoonlijke, individuele redenering van de mens (bijv. "Ik teken dit omdat ik nerveus ben").
  • De Rol maakt uit:
    • Gidsen (die instructies geven) waren mentaal moeilijker voor de AI te voorspellen, omdat hun gedachten complexe ruimtelijke planning bevatten die niet altijd hardop wordt uitgesproken.
    • Volgers (die tekenen) waren mentaal makkelijker te voorspellen, omdat hun gedachten direct worden gevormd door de expliciete instructies van de Gids.
  • Training helpt: Wanneer ze een kleiner AI-model "onderrichtten" (fine-tuning) met deze specifieke dataset, werd het veel beter in het simuleren van menselijk gedrag en haalde het bijna het niveau van de grote, dure modellen.

4. De Kernboodschap

Het artikel concludeert dat om AI ware samenwerkingspartners te maken, we ze niet alleen moeten trainen op het voltooien van taken. We moeten ze trainen op hoe mensen denken terwijl ze samenwerken.

ALMANAC is de eerste dataset die menselijke acties koppelt aan deze "actieniveau mentale modellen". Het laat zien dat hoewel AI beter wordt in het simuleren van menselijk gedrag, het nog steeds worstelt met het begrijpen van de onzichtbare, interne redenering die menselijke samenwerking effectief maakt. De dataset biedt de "stutters" die nodig zijn om AI te leren hoe het zijn mentale model kan afstemmen op dat van een mens, in plaats van alleen maar blindelings orders op te volgen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →