← Nieuwste papers
🤖 AI

OmniToM: Benchmarking Theory of Mind in LLMs via Explicit Belief Modeling

Het artikel introduceert OmniToM, een nieuwe benchmark die de Theory of Mind-vaardigheden van grote taalmodellen evalueert door expliciete, multidimensionale modellering van de geloofsstructuren van acteurs te vereisen in plaats van uitsluitend te vertrouwen op de prestaties bij het beantwoorden van vragen, en onthult dat huidige modellen worstelen met de specifieke redenering die nodig is om narratieve feiten om te zetten in accurate representaties van mentale toestanden.

Oorspronkelijke auteurs: Adam Bawatneh, Sagar Sapkota, Amrit Singh Bedi, Santu Karmaker, Mubarak Shah

Gepubliceerd 2026-05-27
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Adam Bawatneh, Sagar Sapkota, Amrit Singh Bedi, Santu Karmaker, Mubarak Shah

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een goocheltruc bekijkt. De goochelaar laat een bal uit een doos verdwijnen en verschijnt deze opnieuw in een mand. Een standaardtest voor een AI (een groot taalmodel) zou simpelweg vragen: "Waar is de bal?" Als de AI antwoordt "De mand", krijgt het een gouden ster.

Maar hier zit het probleem: de AI heeft misschien het juiste antwoord geraden zonder het verhaal echt te begrijpen. Het weet misschien niet wie de bal zag bewegen, wie dat niet deed, of wat elke persoon denkt dat er gebeurt. Het is als een student die het antwoordboekje heeft uit het hoofd geleerd, maar de wiskunde niet begrijpt.

OmniToM is een nieuw "examen" dat is ontworpen om AI te voorkomen dat het cheat door te gokken. In plaats van alleen het eindantwoord te vragen, dwingt het de AI om haar werk te tonen door een gedetailleerde "mentale kaart" te bouwen van de gedachten van elk personage.

Hier is hoe het artikel dit uitlegt, met behulp van eenvoudige analogieën:

1. Het probleem: De "Black Box" van denken

Huidige tests zijn als het beoordelen van een student uitsluitend op basis van het eindcijfer voor een essay. Als het essay goed is, weet je niet of de student echt de gevoelens van de personages heeft begrepen of gewoon ingewikkelde woorden heeft gebruikt om slim te klinken.

  • De bewering van het artikel: Bestaande tests (genaamd "Endpoint QA") controleren alleen het eindantwoord. Ze kunnen niet zien of de AI echt bijhoudt wie wat weet, wie liegt of wie zich vergist.

2. De oplossing: De "Mentale Kaart" (OmniToM)

De onderzoekers hebben een nieuwe benchmark gebouwd genaamd OmniToM. In plaats van te vragen "Waar is de bal?", vragen ze de AI om een kaart te tekenen van het brein van iedereen.

Stel je het voor als een regisseursscenario voor een film. Een regisseur geeft niet alleen om het plot; ze geven om wat elke acteur op elk moment gelooft.

  • De taak: De AI moet een verhaal lezen en een lijst schrijven met "geloofsproposities". Dit zijn kleine, simpele zinnen zoals: "Bob denkt dat de bal in de doos ligt" of "Alice weet dat de bal in de mand ligt."

3. Het tweestaps-examen

OmniToM test de AI in twee distincte fasen, zoals een interview in twee delen:

Fase 1: De Detective (Geloofsextractie)

  • De taak: De AI leest het verhaal en moet elke gedachte vinden die door elk personage wordt gehouden.
  • De uitdaging: Het is niet genoeg om te zeggen "Bob is verdrietig". De AI moet uitzoeken waarom Bob verdrietig is, gebaseerd op wat Bob zag, hoorde of zich herinnerde.
  • Het resultaat: Het artikel vond dat AI's goed zijn in het vinden van feiten (bijvoorbeeld: "De bal ligt in de mand"), maar dat ze moeite hebben om die feiten aan het juiste brein van een persoon toe te wijzen. Ze vergeten vaak dat Bob niet zag dat de bal bewoog, dus zou hij niet moeten weten dat hij in de mand ligt.

Fase 2: De Bibliothecaris (Geloofslabeling)

  • De taak: Zodra de AI de gedachten heeft opgesomd, moet ze ze labelen met een zeven-dimensionale "streepjescode".
  • De analogie: Stel je een bibliothecaris voor die boeken organiseert. Ze leggen ze niet zomaar op een plank; ze labelen ze met:
    • Orde: Is dit een simpele gedachte ("Ik heb honger") of een complexe ("Ik denk dat jij denkt dat ik honger heb")?
    • Waarheid: Is deze gedachte echt waar, of vergist het personage zich?
    • Toegang: Heeft het personage dit zien gebeuren, of heeft het alleen maar geraden?
    • Bron: Heeft het dit van iemand gehoord, zich er iets van herinnerd, of het zich verbeeld?
  • Het resultaat: De AI is verrassend goed in simpele labels (zoals "Is dit waar?"), maar slecht in de "Toegang"-labels. Het heeft moeite om te onthouden wie toegang had tot welke informatie.

4. De grote ontdekking: De "Informatieflesnek"

De belangrijkste bevinding van het artikel is dat huidige AI-modellen een specifiek "blinde vlek" hebben.

  • De metafoor: Stel je een groep mensen in een kamer voor. Iemand verlaat de kamer en een ander persoon verplaatst een geheim object. De AI kan de kamer perfect beschrijven. Maar wanneer wordt gevraagd: "Wat denkt de persoon die vertrok dat er in de kamer ligt?", raakt de AI in de war.
  • De bewering: De AI faalt niet omdat het het verhaal niet kan lezen, maar omdat het niet kan bijhouden wie wat weet. Het heeft moeite om te scheiden tussen "wat er echt gebeurt" en "wat een specifiek personage denkt dat er gebeurt".

5. Hoe ze het hebben gebouwd

Om deze test te maken, namen de onderzoekers 895 bestaande verhalen en lieten ze mensen (en slimme AI-helpers) meer dan 22.000 specifieke gedachten labelen.

  • Het proces: Ze gebruikten een "gekalibreerd" systeem. Mensen controleerden een kleine batch om de AI te leren hoe ze dingen correct moesten labelen, hierna hielp de AI bij het labelen van de rest, waarbij mensen het werk dubbelcheckten. Dit zorgde ervoor dat de "gouden standaard" antwoorden accuraat waren.

Samenvatting

OmniToM is een nieuwe manier om AI te testen die het verhindert om alleen het juiste antwoord te raden. Het dwingt de AI om een gedetailleerde kaart te bouwen van de gedachten, overtuigingen en kennis van iedereen. Het artikel toont aan dat hoewel AI beter wordt in lezen, het nog steeds moeite heeft om het complexe sociale spel van "wie wat weet" te begrijpen, wat het hart is van menselijke sociale intelligentie.

Opmerking over beperkingen: Het artikel stelt expliciet dat deze test alleen geldt voor tekstgebaseerde verhalen. Het beweert niet dat AI echte sociale situaties, emoties in face-to-face interacties of complexe real-life scenario's kan begrijpen. Het is strikt een hulpmiddel om te meten hoe goed een AI overtuigingen in geschreven verhalen bijhoudt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →