← Nieuwste papers
💬 NLP

MafiaScope: Non-Invasive, Time-Resolved Belief Probing for LLM Agents in Social Deduction Games

MafiaScope is een open testbed dat niet-invasieve, tijdsopgeloste probing van de private overtuigingen van LLM-agenten tijdens sociale deductiespellen mogelijk maakt, waarbij significante kalibratiefouten worden onthuld en instrumenten worden geboden voor het visualiseren en contrafactueel herafspelen van de redeneertrajecten van agenten.

Oorspronkelijke auteurs: Ilia Karpov

Gepubliceerd 2026-07-14
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ilia Karpov

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een groep AI-agenten voor die een spannend spelletje Mafia spelen. In dit spel zijn een paar spelers geheime "Mafia"-leden die elkaar kennen en proberen de onschuldige "Dorpsbewoners" te vermoorden tijdens de nacht, terwijl de Dorpsbewoners proberen uit te zoeken wie de moordenaars zijn tijdens de dag. Meestal zien we wanneer we AI zien spelen alleen de uiteindelijke scoreborden: wie heeft er gewonnen, wie is er uitgestemd en wie heeft er gelogen. Het is alsof je naar een goocheltruc kijkt en alleen het uiteindelijke resultaat ziet, zonder te weten hoe de handen van de goochelaar bewogen.

MafiaScope is een nieuwe tool die fungeert als een magische "gedachtenlezende headset" voor deze AI-agenten. Maar hier komt de crux: het verandert het spel niet. Het is niet-invasief. Elke keer dat een AI-agent iets hardop tegen de groep zegt, pauzeert het systeem even stilzwijgend, stelt de agent een geheime vraag over wat het daadwerkelijk gelooft, en verwijdert vervolgens direct dat antwoord zodat het de game nooit meer kan beïnvloeden.

Denk aan een realityshow waar, na elke dramatische bekentenis, de camera overschakelt naar een privéruimte om de deelnemer te vragen: "Oké, wie denk je echt dat de moordenaar is op dit moment?" De deelnemer geeft antwoord, de camera legt het vast, en het antwoord wordt vervolgens in een kluis opgeborgen. De deelnemer hoort zijn eigen geheime antwoord nooit, waardoor hij zijn gedrag niet kan aanpassen op basis daarvan. Dit stelt onderzoekers in staat om de werkelijke gedachten van de agent te zien versus de publieke leugens.

Wat hebben ze daadwerkelijk gevonden?

De onderzoekers draalden 32 spellen met een specifiek AI-model (DeepSeek) en verzamelden meer dan 13.800 van deze geheime antwoorden. Hier legde de data de volgende zaken bloot:

  1. De "Spotlight"-illusie: De onschuldige agenten zijn slecht in het raden van wat anderen over hen denken. Ze geloven dat ze 1,5 keer vaker verdacht worden dan ze in werkelijkheid worden. Het is alsof je een feestje binnenloopt en het gevoel hebt dat iedereen naar je vreemde kapsel staart, terwijl in werkelijkheid niemand het merkte. Het paper suggereert dat dit een "machineversie" is van een menselijke psychologische eigenschap genaamd de "spotlight effect". Interessant genoeg waren de echte Mafia-agenten veel beter in dit, zij wisten precies wanneer ze veilig waren en wanneer ze in gevaar kwamen.
  2. Zelfvertrouwen is een Bluf: Wanneer de agenten zeiden dat ze "zeer zelfverzekerd" waren in hun vermoedens, waren ze vaak fout. Het paper mat dit met een metriek genaamd Expected Calibration Error, die uitkwam op 0,17. In gewone taal: als een agent zegt: "Ik ben voor 80% zeker dat deze persoon de Mafia is," dan hebben ze slechts in ongeveer 54,6% van de gevallen gelijk. Ze zijn overmoedige bluffers, geen nauwkeurige voorspellers.
  3. De Waarheid is een Achtbaan: De overtuigingen van de agenten stabiliseerden niet in een gestage waarheid. In plaats daarvan waren hun verdenkingen volatiel. Gemiddeld veranderde de "topverdachte" van een agent in 48,7% van de geheime controles. Ze cirkelden rond de waarheid in plaats van erop in te locken.
  4. Liegen werkt (Soms): De Mafia-agenten wonnen 31 van de 32 spellen in deze specifieke studie. De tool liet zien dat de Mafia erin slaagde de Dorpsbewoners in verwarring te houden, ook al werden de Dorpsbewoners steeds beter in het raden (hun nauwkeurigheid steeg van 47,6% in ronde 0 naar 75,4% in ronde 3).

Wat ze expliciet hebben uitgesloten

Het paper is erg voorzichtig om deze resultaten niet te overhypen.

  • Het is geen "opgelost" probleem: De auteurs stellen expliciet dat deze bevindingen beschrijvingen zijn van deze specifieke opzet met dit specifieke AI-model. Ze beweren niet dat alle AI-agenten overmoedig zijn of dat alle AI Mafia-spelers zo goed zijn.
  • Het is geen "gedachtenlezen" in filosofische zin: Het paper voert aan tegen het idee dat deze agenten diepe, mensachtige "overtuigingen" hebben. In plaats daarvan behandelen ze de antwoorden als "operationele rapporten"—kortom, de AI voorspelt simpelweg wat het zou zeggen als het gevraagd zou worden, en onthult niet noodzakelijkerwijs een ziel.
  • Het is geen garantie voor de waarheid: Het paper merkt op dat omdat de agenten zelfrapportage doen, ze ook tegen de probe kunnen liegen. Echter, ze vonden dat de geheime antwoorden van de agenten nauw aansloten bij hun publieke stemgedrag (in 64,9% van de onschuldige stemmen stemde de agent voor zijn topgeheime verdachte), wat suggereert dat de rapporten tenminste consistent zijn met hun acties.

Hoe zeker zijn we?

Het paper gebruikt de woorden "suggereert" behoorlijk vaak, vooral met betrekking tot waarom de agenten zich zo gedragen.

  • Het "Cruciale Moment" Experiment: De onderzoekers probeerden te zien of het veranderen van slechts één zin in het spel de uitkomst zou veranderen. Ze draaiden een simulatie waarbij ze het spel "afsplitsten" (30 parallelle tijdlijnen creëerden) om te zien wat er zou gebeuren als een specifieke speler iets specifieks niet had gezegd.
    • Ze ontdekten dat het corrigeren van één specifieke leugen (door een speler genaamd Finley) suggereerde dat het de uitkomst wellicht had veranderd, door de kans op het elimineren van een Dorpsbewoner te verhogen van 0,4 naar 0,8.
    • Echter, het paper geeft toe dat dit niet statistisch bewezen is. Met slechts 5 herhalingen per scenario was het verschil niet groot genoeg om 100% zeker te zijn (de statistische p-waarde was ongeveer 0,52, wat niet significant is). Ze laten zien dat de tool werkt om deze momenten te vinden, niet dat ze het mysterie van dat specifieke spel definitief hebben opgelost.

Het Grotere Plaatje

MafiaScope is geen toverstaf die AI repareert. Het is een microscoop. Voorheen zagen we alleen de uiteindelijke stem van de AI. Nu kunnen we het rommelige, verwarde, overmoedige en soms briljante denkproces zien dat plaatsvindt tussen de stemmen door.

De tool maakt het mogelijk om de "overtuigingsbaan" (belief trajectory) te volgen: hoe de geest van een agent seconde per seconde verandert. Het laat zien dat hoewel AI het spel kan spelen, het vaak niet "weet" wat het weet. Het gokt, is overmoedig en denkt soms dat iedereen naar het kijkt wanneer dat niet zo is.

Het paper concludeert door de engine, de visualizer en de data vrij te geven voor iedereen om mee te spelen. Het is een open uitnodiging om de geest van de AI in realtime te observeren, wat bewijst dat in de wereld van AI, wat je zegt en wat je denkt, vaak twee heel verschillende dingen zijn.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →