← Nieuwste papers
📈 economics

Strategic Behavior of Large Language Models: Game Structure vs. Contextual Framing

Dit artikel evalueert de strategische besluitvormingscapaciteiten van GPT-3.5, GPT-4 en LLaMa-2 over vier speltheoretische scenario's, waarbij wordt onthuld dat hoewel GPT-3.5 zeer gevoelig is voor contextuele inkadering maar een gebrek heeft aan abstract redeneren, zowel GPT-4 als LLaMa-2 zich aanpassen aan spelstructuren, waarbij LLaMa-2 een superieur begrip van onderliggende mechanismen vertoont, wat de uiteenlopende bekwaamheden en huidige beperkingen van de modellen in complexe strategische taken benadrukt.

Oorspronkelijke auteurs: Nunzio Lorè, Babak Heydari

Gepubliceerd 2026-07-15
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Nunzio Lorè, Babak Heydari

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin computers niet alleen vragen beantwoorden, maar ook spelletjes met ons spelen. Dit gaat niet over videogames met explosies en hoge scores, maar over de onzichtbare, belangrijke spelletjes die we elke dag spelen: beslissen of we een geheim delen, de rekening splitsen of een vreemde vertrouwen. Wetenschappers noemen dit vakgebied "Speltheorie", wat in feite de wiskunde is van hoe wij keuzes maken wanneer ons succes afhangt van wat iemand anders besluit te doen. Een kernidee hierbij is het "sociale dilemma", een lastige situatie waarin het egoïstische doen op het moment juist goed voelt, maar als iedereen het doet, iedereen verliest. Al een tijdje vragen we ons af of Kunstmatige Intelligentie (AI) echt als een mens kan "denken" in zulke situaties. Kan een computer begrijpen dat het soms het slimste is om aardig te zijn, of zal het altijd gewoon proberen te winnen tegen elke prijs? Deze vraag is belangrijk omdat naarmate AI slimmer wordt, we ze grote beslissingen kunnen laten nemen, zoals het onderhandelen over zakelijke deals of zelfs het helpen oplossen van wereldwijde problemen. Als ze de regels van het spel niet begrijpen, kunnen ze onbedoeld chaos veroorzaken.

In dit onderzoek hebben onderzoekers drie verschillende AI-"hersenen" op de proef gesteld: GPT-3.5, GPT-4 en LLaMa-2. Ze vroegen de AI niet alleen om te chatten; ze dwongen hen om vier klassieke strategische spellen te spelen, variërend van het beroemde "Prisoner's Dilemma" (waarbij twee verdachten moeten beslissen of ze elkaar verraden) tot de "Stag Hunt" (waarbij je moet beslissen of je samen op een grote prijs jaagt of alleen op een kleine). Om het interessant te maken, gaven de onderzoekers de AI niet alleen de regels, maar kleedden ze de spellen in verschillende "kostuums" of verhalen aan. Soms kreeg de AI te horen dat het een CEO was in een boardroom, andere keren een diplomaat op een topontmoeting, en soms gewoon een vriend die met een maat rondhangt. Het doel was om te zien of de AI anders zou spelen afhankelijk van de wiskunde van het spel, of dat het simpelweg zou handelen op basis van het verhaal dat eraan werd gegeven.

De resultaten waren een beetje alsof je naar drie verschillende studenten keek die dezelfde lastige toets maken. De eerste student, GPT-3.5, werd verrassend genoeg sterk beïnvloed door het verhaal. Als het spel werd omschreven als een gesprek tussen vrienden, was deze AI veel eerder geneigd om samen te werken. Maar als het verhaal over zaken of competitie ging, werd deze AI erg wantrouwig en koos vaak voor "defectie" (of speelde egoïstisch), zelfs wanneer de wiskunde zei dat het moest samenwerken. Het lijkt erop dat GPT-3.5 erg gevoelig is voor de "vibe" van de situatie, maar moeite heeft met de werkelijke logica van het spel. Het is als een kind dat zijn snoepjes wel deelt als je zegt dat het een "deelfeestje" is, maar ze verstopt als je zegt dat het een "competitie" is, zonder te beseffen dat de regels van het spel eigenlijk niet zijn veranderd.

De tweede student, GPT-4, was veel serieuzer. Het besteedde veel aandacht aan de wiskunde van het spel zelf. Het leek te beseffen dat sommige spellen "win-win" zijn (waarbij iedereen moet samenwerken) en andere "listige vallen" (waarbij je voorzichtig moet zijn). Echter, GPT-4 had een blinde vlek: het had de neiging om de wereld in zwart-wit te zien. Het zou spellen in groepen verdelen van "hoog risico" en "laag risico", waarbij de subtiele verschillen tussen hen werden gemist. Het zou bijvoorbeeld twee zeer verschillende spellen kunnen behandelen alsof ze hetzelfde zijn. Ook al was het slim wat betreft de wiskunde, het werd nog te vriendelijk wanneer het verhaal over "vrienden" ging, waarbij het soms de spelregels negeerde om maar aardig te zijn.

De derde student, LLaMa-2, was de meest interessante mix. Het was beter dan GPT-4 in het herkennen van de kleine verschillen tussen de spellen, en begreep dat het ene spel een andere strategie vereist dan het andere. Het was echter ook het meest gemakkelijk afleidbaar door het verhaal. Het veranderde zijn strategie op basis van of het met een "baas" of een "vriend" praatte, soms zelfs sterker dan de spelregels vereisten. Het is als een schaker die alle zetten perfect kent, maar steeds wordt afgeleid door wie er aan de overkant van de tafel zit.

De onderzoekers draaiden deze simulaties 300 keer voor elke combinatie van spel en verhaal om er zeker van te zijn dat de resultaten echt waren en geen toevalstreffer. Ze kwamen tot de conclusie dat hoewel deze AI-modellen beter worden in denken, geen van hen een perfecte strateeg is. Ze raken allemaal in de war door de "kaders" van het verhaal, en ze spelen niet altijd de mathematisch perfecte zet. De studie suggereert dat als we deze AI's vertrouwen voor complexe strategische taken, we voorzichtig moeten zijn. Ze zijn geen kille, logische robots; ze worden beïnvloed door de woorden die we gebruiken om de situatie te beschrijven, net als mensen dat doen. Totdat ze het verhaal van de strategie kunnen scheiden, willen we ze misschien liever niet in de meest kritieke besluitvormingskamers hebben.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →