← Nieuwste papers
💰 quantitative finance

Measuring Behavior Portability in Large Language Models

Dit artikel introduceert een formeel kader om gedragsportabiliteit in grote taalmodellen te meten en demonstreert door middel van gecontroleerde experimenten dat hun besluitvormingsgedrag, ondanks dat het structureel equivalent is, niet betrouwbaar overdraagbaar is naar verschillende beslissingsomgevingen vanwege een significante gevoeligheid voor de oppervlakkige presentatie.

Oorspronkelijke auteurs: Tianjia Dong, Nadav Kunievsky, James A. Evans

Gepubliceerd 2026-06-23
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Tianjia Dong, Nadav Kunievsky, James A. Evans

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer intelligente, hooggetrainde besluitvormer hebt (een AI) die zich gedraagt als een professionele chef-kok. Je wilt weten of deze chef dezelfde heerlijke maaltijd kan bereiden, ongeacht of je hem vraagt het in een chique Franse keuken te koken, in een rustiek Italiaans bistro of in een moderne Amerikaanse diner.

Het artikel "Measuring Behavior Portability in Large Language Models" stelt een eenvoudige maar cruciale vraag: Kan een AI op precies dezelfde manier een beslissing nemen als de situatie anders wordt beschreven, zelfs als de wiskunde en de beloningen identiek zijn?

De auteurs noemen dit "Gedragsportabiliteit" (Behavioral Portability).

Hier is een overzicht van hun bevindingen met behulp van eenvoudige analogieën:

1. Het kernprobleem: De "Framing"-valstrik

Stel je voor dat je een spel speelt waarbij je een pizza moet verdelen.

  • Scenario A: Je krijgt te horen: "Je hebt een pizza. Geef een deel aan je vriend."
  • Scenario B: Je krijgt te horen: "Je hebt een pizza. Je vriend heeft honger en verdient een deel."

Wiskundig gezien zijn de regels identiek. De "opbrengst" (hoeveel pizza je krijgt) is hetzelfde. Maar de woorden die de situatie beschrijven, zijn verschillend.

De onderzoekers testten of Large Language Models (LLM's) consistent gedrag vertonen bij deze verschillende formuleringen. Ze kwamen tot de conclusie dat de modellen niet portabel zijn. Net zoals een chef die een perfect biefstuk bereidt in een Franse keuken, maar het in een Italiaanse keuken laat aanbranden, verandert de AI zijn gedrag op basis van de "smaak" van de tekst, zelfs wanneer de "ingrediënten" (de wiskunde) hetzelfde zijn.

2. Het experiment: Zeven economische spellen

Om dit te testen, stelden de onderzoekers de AI niet bloot aan willekeurige vragen. Ze lieten de AI zeven klassieke economische spellen spelen (zoals het "Dictator Game", "Trust Game" en "Lottery Choice"). Dit zijn vergelijkbaar met gestandaardiseerde rijtests voor besluitvorming.

  • De opzet: Ze maakten tientallen verschillende "versies" van elk spel. In de ene versie gaat het spel misschien over het delen van geld met een "collega". In een andere versie gaat het over het verdelen van een "bonus" met een "partner".
  • De twist: De getallen, de regels en de potentiële beloningen waren exact hetzelfde. Alleen het verhaal rondom de cijfers veranderde.
  • De test: Ze leerden de AI hoe het spel gespeeld moest worden met de "Franse keuken"-verhalen. Daarna vroegen ze de AI om hetzelfde spel te spelen met de "Italiaanse bistro"-verhalen.

3. De resultaten: De AI raakt in de war van het verhaal

De resultaten waren verrassend en zorgwekkend voor iedereen die vertrouwt op AI voor consistente beslissingen:

  • De AI is fragiel: Wanneer het verhaal veranderde, veranderden de beslissingen van de AI aanzienlijk. Een model dat leerde om "eerlijk" te zijn in één verhaal, kon in een wiskundig identiek verhaal "egoïstisch" worden, simpelweg omdat de woorden anders waren.
  • De "Portabiliteit"-score: De onderzoekers maten hoeveel het gedrag van de AI verschoof. Ze ontdekten dat voor sociale spellen (zoals delen of vertrouwen) het gedrag van de AI erg instabiel was. Het was als een kompas dat wild ronddraait afhankelijk van de windrichting, terwijl de Poolster zelf niet is bewogen.
  • De uitzondering (Loterijen): De AI was veel stabieler wanneer de taak puur over getallen en risico ging (zoals het kiezen tussen twee loterijen). Het lijkt erop dat de AI wiskunde beter aankan dan sociale verhalen.

4. Helpt "hardop denken"? (Chain-of-Thought)

De onderzoekers probeerden een veelgebruikte truc: de AI vragen om "stap voor stap na te denken" voordat hij antwoord geeft (dit wordt "Chain-of-Thought" of CoT genoemd).

  • De hoop: Misschien als de AI zijn redenering uitlegt, zal hij de afleidende verhalen negeren en zich op de wiskunde concentreren.
  • De realiteit: Het hielp soms, maar niet altijd. In sommige spellen maakte hardop denken de AI consistenter. In andere (zoals het Ultimatum game) maakte het de AI juist gevoeliger voor de specifieke formulering van het verhaal. Het is als een student die, wanneer hij gevraagd wordt zijn werk uit te leggen, soms zijn fout beseft, maar op andere momenten juist afgeleid raakt door zijn eigen uitleg en een nieuwe fout maakt.

5. De "Redeneer"-modellen

Ze testten ook een nieuwer, "slimmer" model (DeepSeek-R1) dat specifiek is ontworpen voor complexe redenering.

  • Het resultaat: Dit model was beter in het negeren van het verhaal en het focussen op de wiskunde. Het was meer "portabel". Echter, het was niet perfect. Zelfs het slimste model vertoonde enige instabiliteit wanneer het verhaal veranderde.

De kernconclusie

Het artikel concludeert dat je er niet vanuit kunt gaan dat het gedrag van een AI hetzelfde blijft, alleen omdat de wiskunde hetzelfde is.

Als je een AI traint om eerlijke beslissingen te nemen in een specifieke reeks prompts, kun je er niet automatisch op vertrouwen dat de AI diezelfde eerlijke beslissingen neemt wanneer je het probleem op een iets andere manier beschrijft. De AI is momenteel te gevoelig voor de "smaak" van de tekst.

Kortom: De AI is als een reiziger die de kaart perfect kent, maar verdwaalt als je de bestemming in een andere taal beschrijft. Totdat we dit oplossen, kunnen we deze modellen niet volledig vertrouwen om consistente beslissingen te nemen in de echte wereld, waar problemen zel

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →