← Nieuwste papers
🤖 AI

Evaluating Theory of Mind and Internal Beliefs in LLM-Based Multi-Agent Systems

Dit onderzoek introduceert en evalueert een nieuwe multi-agent architectie die Theory of Mind, BDI-achtige interne overtuigingen en symbolische solvers integreert om de samenwerkende intelligentie van LLM-systemen te verbeteren, waarbij wordt vastgesteld dat de prestaties afhankelijk zijn van een complexe wisselwerking tussen de specifieke LLM-vaardigheden en de cognitieve mechanismen.

Oorspronkelijke auteurs: Adam Kostka, Jarosław A. Chudziak

Gepubliceerd 2026-03-03
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Adam Kostka, Jarosław A. Chudziak

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Titel: Hoe AI-agenten samenwerken: Een proef met hersenen, buikgevoel en een logische check

Stel je voor dat je een groep vrienden hebt die een heel moeilijk puzzelspel moeten spelen. Ze moeten samen zorgen dat een stad gezond blijft door voedsel, medicijnen en veiligheid te verdelen. Maar er is een probleem: ze kunnen niet alles zien, en ze moeten beslissingen nemen zonder elkaar constant te kunnen bellen.

De auteurs van dit paper, Adam en Jarosław, hebben gekeken of we deze 'virtuele vrienden' (die in feite slimme computerprogramma's zijn, genaamd LLM's) slimmer kunnen maken door hen twee extra vaardigheden te geven:

  1. Theory of Mind (ToM): Het vermogen om te denken: "Wat denkt mijn vriendje nu? Wat gaat hij doen?"
  2. Interne Overtuigingen (Internal Beliefs): Een intern notitieboekje waar ze hun eigen gedachten en feiten in schrijven, gevolgd door een strenge logische check om te zien of hun verhaal klopt.

Hier is hoe het werkt, vertaald in alledaagse taal:

1. Het Spel: De Hulpverleners in de Stad

Stel je een stad voor met vier wijken. Er zijn drie hulpverleners:

  • De Voedsel-agent (brengt eten).
  • De Medische agent (brengt medicijnen).
  • De Veiligheids-agent (brengt beveiliging).

Elke wijk heeft al deze drie dingen nodig. Als een wijk te weinig van één ding heeft, wordt de 'gezondheid' van die wijk slechter. De agenten moeten samenwerken om te voorkomen dat de wijken ziek worden. Ze kunnen zich verplaatsen en voorraden afgeven, maar ze moeten dit doen zonder te botsen en zonder dat ze elkaar in de weg zitten.

2. De Drie Manieren van Denken

De onderzoekers hebben gekeken hoe goed deze agenten presteerden in vier verschillende scenario's:

  • De Basis (Geen extra hersenen): De agenten doen gewoon wat ze zien. Ze reageren op de situatie, maar denken niet na over wat anderen doen en ze hebben geen intern notitieboekje. Dit is als een speler die blindelings zijn weg volgt.
  • Alleen 'Theory of Mind' (ToM): De agenten proberen te raden wat de anderen van plan zijn. "Ah, de medische agent gaat naar wijk 2, dus ik moet naar wijk 3 gaan." Dit is als een voetballer die kijkt waar zijn teamgenoot naartoe rent om de bal te spelen.
  • Alleen 'Interne Overtuigingen' (IB) + Logische Check: De agenten schrijven hun eigen plannen op in een notitieboekje en laten een strenge 'rekenmeester' (een logische computer) controleren of hun plannen logisch kloppen. "Ik heb 10 medicijnen, maar ik beweeg naar een wijk die 20 nodig heeft... Wacht, dat kan niet, ik heb niet genoeg!" Dit voorkomt dat ze onzin doen.
  • De Supercombinatie (ToM + IB): De agenten doen beide dingen. Ze raden wat anderen doen, schrijven hun eigen plannen op, en laten die plannen controleren voordat ze iets doen.

3. Wat Vonden Ze? (De Verassing)

Je zou denken: "Hoe meer slimme hulpmiddelen, hoe beter het spel!" Maar de werkelijkheid is ingewikkelder, net als bij mensen.

  • Niet elke 'hersen' past bij elke 'hoofd':
    De onderzoekers gebruikten verschillende modellen (zoals ChatGPT-4o, ChatGPT-3.5, en Llama).

    • De slimmere modellen (zoals ChatGPT-4o) waren al zo goed dat ze het spel bijna perfect speelden, zelfs zonder de extra hulpmiddelen. De extra hulpmiddelen hielpen hen, maar maakten ze niet veel beter.
    • De minder sterke modellen (zoals ChatGPT-3.5 of Llama) hadden soms baat bij de extra hulpmiddelen, maar soms werd het juist erger.
  • Het "Te veel aan gedachten"-probleem:
    Voor de minder sterke modellen was het soms te veel van het goede. Als je een klein kind vraagt om te denken wat een ander denkt én om een logisch verslag te schrijven, raakt het kind in de war. Hetzelfde gebeurde met de AI. Ze maakten meer fouten omdat ze te veel tijd besteedden aan het "denken" in plaats van het "doen".

    • Analogie: Het is alsof je iemand vraagt om een auto te besturen terwijl je hem tegelijkertijd vraagt om de route te plotten, de verkeersborden te analyseren en een dagboek te schrijven over wat de andere bestuurders doen. Soms crasht de auto omdat de bestuurder te veel nadenkt.
  • De Logische Check is een reddingsboei, maar geen wondermiddel:
    De logische check (de rekenmeester) hielp om stomme fouten te voorkomen (zoals "ik heb geen medicijnen, maar ik geef ze wel weg"). Maar als de AI al in de war was door het "Theory of Mind" gedeelte, hielp de check niet altijd genoeg om de boel te redden.

4. De Grote Les

De belangrijkste boodschap van dit paper is: Het is niet zo simpel als "meer slimheid = beter resultaat".

Het hangt er helemaal van af welke AI je gebruikt:

  • Heb je een heel slim model? Dan kun je de extra hulpmiddelen gebruiken om het nog iets beter te maken.
  • Heb je een minder krachtig model? Dan kunnen die extra hulpmiddelen juist verwarrend werken en de prestaties verslechteren.

Conclusie in Eén Zin

Om een team van AI-agenten goed te laten samenwerken, moet je niet zomaar "slimme hersenen" toevoegen; je moet precies weten welk type hersenen je hebt en welke hulpmiddelen daar het beste bij passen, anders maak je ze alleen maar in de war.

Dit onderzoek helpt ons te begrijpen hoe we in de toekomst betere AI-systemen kunnen bouwen voor echte problemen, zoals het verdelen van hulpgoederen tijdens een ramp of het plannen van complexe projecten, zodat de robots niet in de war raken, maar juist perfect samenwerken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →